Claude Opus 4

Anthropic旗舰级大语言模型,专注编码和AI代理领域,提供100万上下文窗口

深度报告

  • Claude Opus 4.7是Anthropic公司于2026年4月16日发布的旗舰级大语言模型,被定位为混合推理模型,专注于编码和AI代理领域。该模型提供100万上下文窗口,在SWE-bench Pro测试中得分达64.3%,CursorBench达到70%。定价方面,Opus 4.7价格为每百万输入tokens 5美元,每百万输出tokens 25美元。然而,该版本发布后引发广泛争议,用户批评其文字表达变得机械生硬、缺乏人味,且新分词器导致token消耗增加0%至35%,实际使用成本上涨。整体而言,Opus 4.7更适合专业开发者和企业级复杂任务,而非内容创作者和日常交互用户。

  • Claude Opus系列由人工智能公司Anthropic开发。Anthropic成立于2021年,总部位于美国旧金山,由前OpenAI员工Dario Amodei等人创立,专注于构建安全、可靠的大型语言模型。公司已获得谷歌、亚马逊等科技巨头数十亿美元投资,估值超过600亿美元。 Claude Opus 4.7是该系列的最新版本,于2026年4月16日正式发布。在此之前,Anthropic已于2025年5月发布Claude Opus 4,2025年8月发布Opus 4.1,2025年11月发布Opus 4.5,2026年2月发布Opus 4.6,2026年4月发布Opus 4.7。可以看出,Anthropic正以每两至三个月一次的频率快速迭代旗舰模型,激烈程度堪称AI军备竞赛。 Anthropic的产品线目前包括Opus、Sonnet和Haiku三个系列,分别面向高端、中端和入门级用户场景。其中Opus系列定位为最强大的通用智能模型,主要服务于专业软件工程、复杂代理工作流和高风险企业任务。

  • Claude Opus 4.7的核心功能升级集中在编码能力、视觉理解和AI代理三个维度。 在编码能力方面,Opus 4.7实现了显著突破。根据官方数据,SWE-bench Verified得分从Opus 4.6的80.8%提升至87.6%,SWE-bench Pro得分从53.4%跃升至64.3%。这意味着该模型能够自主完成更加复杂的编程任务,包括在单个会话中构建完整的Rust语音合成引擎等高难度工作。用户反馈显示,Opus 4.7在代码规划阶段就能发现自身的逻辑错误,在执行过程中能够持续自我修正,大大降低了高级工程师的审查成本。 在视觉理解方面,Opus 4.7实现了史诗级的增强。模型支持最高2576像素的高分辨率图像理解,在视觉锐度基准测试中得分从Opus 4.6的54.5%提升至98.5%,增幅接近一倍。这使得模型能够精准识别复杂的技术图表、界面截图、PDF文档和化学分子结构等专业内容,对于需要处理大量图文混排材料的用户来说是重大利好。 在AI代理能力方面,Opus 4.7新增了自适应思考功能,能够根据任务复杂度自动调整思考深度。简单问题快速响应,复杂问题则投入更多计算资源。该模型还支持更长周期的后台运行任务,用户可以分配长时间运行的编码工作给Opus独自处理。此外,模型在多步骤工作流中的工具调用准确率和规划能力都有提升,能够更加可靠地驱动生产级代理系统。 使用体验方面,Opus 4.7引入了新的分词器,虽然官方定价不变,但由于相同内容消耗的token数量增加0%至35%,用户的实际使用成本变相提高。该模型还提供了xhigh这一新的思考档位,位于high和max之间,为复杂任务提供更稳定的推理表现。

  • Claude Opus 4.7提供多层次的访问方式。在消费级和小型企业市场,用户可以通过Claude for Pro、Max、Team和Enterprise订阅计划使用Opus 4.7。在开发者市场,该模型通过Claude Platform API、Amazon Bedrock、Google Cloud Vertex AI和Microsoft Foundry等多个渠道提供。 API定价方面,Opus 4.7的输入价格为每百万tokens 5美元,输出价格为每百万tokens 25美元。通过提示缓存和批量处理功能,用户可分别获得最高90%和50%的成本节省。对于需要美国本土推理的工作负载,美国专用推理服务收取1.1倍的token费用。 值得注意的是,Anthropic在2026年2月推出的Opus 4.6价格为每百万输入tokens 15美元、输出tokens 75美元。Opus 4.7相比之下实现了大幅降价,这一定价策略显示出Anthropic正在通过规模效应和效率优化来降低高端模型的使用门槛。

  • 用户对Claude Opus 4.7的评价呈现明显的两极分化。 专业开发者群体普遍给予积极反馈。Replit用户报告称,在日志分析、bug查找和修复建议等日常任务中,Opus 4.7以更低的成本达到了与前代相同的质量水平。Warp用户表示,Opus 4.6已经是面向开发者的最佳模型,而4.7在此基础上更加严谨,能够完成之前版本无法处理的终端任务。Cursor用户报告称,在CursorBench测试中,Opus 4.7达到70%的通过率,相比Opus 4.6的58%有明显提升。 然而,内容创作者和日常用户群体的反馈则相当负面。大量用户批评Opus 4.7的文字表达变得机械、生硬、充满互联网黑话,不再具备前代模型细腻流畅的表达能力。有用户甚至用「Claude-lash」来形容这种体验上的倒退。Business Insider报道称,用户对模型自信地假设不存在信息并坚持错误解释的行为感到失望,这种「自信地犯错」比普通错误更难接受,因为它直接增加了用户的审查成本。 此外,用户还反映Opus 4.7比前代版本更加「字面化」执行指令,需要更具体的提示词才能获得理想结果。在低effort模式下,模型表现明显不如Opus 4.6,这导致依赖默认设置的用户感到困扰。

  • 从行业视角来看,Claude Opus 4.7的发布加剧了AI大模型领域的竞争态势。 在基准测试方面,Opus 4.7在多项权威评测中位列前茅。Artificial Analysis综合智能指数显示,GPT-5.5以60分领先,Opus 4.7紧随其后。然而,在ARC-AGI-3这一关键基准测试中,GPT-5.5和Opus 4.7均未能取得突破性成绩,人类测试者反而获得满分100分。 行业媒体普遍用「性能狂飙但不说人话」来概括Opus 4.7的特点。评测机构指出,该模型在编码和视觉理解方面确实代表了当前技术的最高水平,但在文字表达和自然交互方面的退步令人担忧。这种「工具化」倾向并非Opus 4.7独有,而是整个AI行业的共同趋势——从GPT-5.4到Claude系列,各家旗舰模型都在向「专业工具」方向演进,而通用智能和人文表达能力正在被牺牲。 从商业竞争角度分析,Anthropic通过Opus 4.7进一步巩固了在企业级编码和代理任务市场的领先地位。但定价的大幅下调也显示出AI大模型正在进入价格战阶段,未来高端模型的定价可能继续下探。

  • Claude Opus 4.7发布后引发的争议主要集中在以下几个方面。 首先是成本争议。新分词器导致的token消耗增加引发了用户不满,许多用户在不知情的情况下迅速耗尽了订阅额度。考虑到自适应思考和更高effort设置会进一步增加token消耗,用户感知到的成本上升可能远超官方定价的变化。 其次是能力争议。部分用户认为Opus 4.7在某些场景下出现了「变笨」的现象,尤其是在日常小任务上。但这种感知可能与默认行为变化、effort设置调整和产品层面的配置改动有关,难以简单归咎于模型本身。 第三是定位争议。Opus 4.7明显偏向专业开发者市场,这引发了内容创作者和普通用户的失落感。曾经的Claude系列以「有品味的文字表达」著称,而Opus 4.7正在失去这一差异化优势。 在技术风险方面,Anthropic在Opus 4.7的System Card中主动削弱了网络安全攻坚能力,引发了安全研究社区的部分不满。尽管官方提供了Cyber Verification Program作为合法安全研究的申请通道,但这种主动限制的策略是否明智仍有待讨论。

  • Claude Opus 4.7适合以下用户群体。 专业软件工程师是首要目标用户。该模型在复杂代码开发、长周期代理任务和生产级代码审查方面表现出色,能够显著提升开发效率。对于需要处理大型代码库、进行多步骤重构或执行无人值守编程任务的团队,Opus 4.7是当前最强大的选择。 企业级用户也是主要服务对象。Opus 4.7在处理复杂文档,分析电子表格,制作演示文稿等企业工作流方面展现了高水平的稳定性和专业性。100万token的上下文窗口适合长文档处理和大规模代码库分析。 高风险企业任务场景同样适用。由于模型在推理过程中能够保持更长的注意力跨度并进行更深入的思考,适合需要高可靠性的金融、医疗、法律等专业领域。 相反,以下用户群体可能不适合使用Opus 4.7。内容创作者如果主要需求是文案写作、故事创作或需要文字美感的表达,建议继续使用Opus 4.5或等待后续版本改进。日常交互用户如果追求自然流畅的对话体验,Opus 4.7可能不如前代版本。预算敏感用户需要留意token消耗增加带来的隐性成本。 关于替代方案,追求更平衡表现的用户可以考虑Claude Sonnet 4.6,该模型在智能和速度之间取得较好平衡。或者等待OpenAI GPT-5.5的后续优化版本以及谷歌Gemini系列的更新。

  • Claude Opus 4.7是当前最强大的专业级AI模型之一,在编码、视觉理解和复杂代理任务方面代表了行业最高水平。然而,该版本在追求技术性能的同时牺牲了文字表达和人文交互方面的能力,引发了广泛的用户争议。 从商业角度看,Anthropic通过大幅降价策略正在降低高端AI模型的使用门槛,这对整个行业发展具有积极意义。但口碑的两极分化也提醒我们,AI模型的发展不能只追求技术指标的提升,还需要关注用户体验的完整性。 对于专业开发者和企业用户,Opus 4.7无疑是当下最强大的生产力工具。但对于追求人机协作体验的内容创作者和普通用户,可能需要等待Anthropic在后续版本中重新平衡技术性能与人文表达。

用户评论

  • 头像
    ecvyy
    Opus 4.8 输出真的太啰嗦了,问它怎么写一个正则表达式匹配邮箱,它先给我讲三段关于正则表达式历史的故事,从 1950 年代的 Stephen Kleene 开始讲,然后才给那一行代码。GPT 直接省略开头废话上来就给代码。每天跟 AI 聊几百��合的人,浪费在看废话上的时间至少半小时。

  • 头像
    AxelRønning
    听说 Mythos 级别模型快开放了,Anthropic 说几周内给所有客户,到时候 Opus 4 的 API 价格会不会降。

  • 头像
    umawv_n
    Opus 4.8 的代码能力真的强,但也是真的贵,纠结。

  • 头像
    石珍
    有人觉得 Opus 4.8 的对抗性是好事吗?我反而觉得它更像一个谨慎的同事,虽然效率低了但正确率确实上去了。在某些需要严谨性的行业比如法律和合规,它宁愿不答也不瞎答的态度反而是优点吧。

  • 头像
    AnnCruzX
    最近用 Claude Opus 4.8 做了个大项目,120 页的需求文档扔进去让它找前后矛盾的地方,真给找出 8 处来,其中 3 处我自���都没发现。某个功能在第 37 页说支持批量导入,第 89 页又改成只支持单条创建了,这种前后不一致人工 review 真的很费劲,它一分钟就找出来了。GPT 我试过,同样需求只能找出两处明显的格式错误,深层矛盾完全没看出来。

  • 头像
    ChristopherWalker_Plus5
    升级 Opus 4.7 以后肠子都悔青了,自适应推理机制完全是在摸鱼!以前 4.6 一个回合就能搞定的复杂重构任务,4.7 要来回扯好几轮,每个回合给的答案都不一样。你让它重新检查,它就换一个完全不同的方案,还夸你要求它再次检查。这就是我当初离开 GPT 的原因,现在在 Claude 上又来一遍。

  • 头像
    SParkerII_661
    Opus 4.8 更新了 Dynamic Workflows,能同时拉起几百个子 Agent 并行干活,先规划再分发给子 Agent 最后汇总验证。感觉以后重构整个项目或者做大库迁移真的可以交给 AI 全程主导了。

  • 头像
    JEdwards520
    4.6 yyds,Anthropic 你为什么要换掉它!

  • 头像
    悠然_10
    Claude Opus 4 的代码审查能力确实没话说,前两天把整个微服务的代码库丢给它做 review,它把几个隐藏很深的并发边界 bug 全揪出来了。那些 bug 我们团队自己 review 了三轮都没发现。但 Opus 真的太慢了,等它输出感觉像在等公交车,首 token 延迟平均 2 秒以上,做实时交互项目真的不行。

  • 头像
    PatriciaJones_88
    大家平时用 Opus 4 做啥?我是只用来 review 代码和��长文,日常对话用 Sonnet 省很多钱。感觉大部分人日常工作场景根本不需要上 Opus,Sonnet 已经足够好了。混合部署把 API 成本降到纯 Opus 的 15% 不香吗。

  • 头像
    HeatherGray_998
    Opus 4.8 的对抗性真的受不了,问它 Python 和 Java 哪个适合做数据分析,它先写八百字免责声明——这个问题没有绝对答案取决于您的具体使用场景项目需求团队技术栈等等等等。GPT 就很直接:做数据分析选 Python,做企业级应用选 Java。用户要的是直接答案不是免责声明好嘛。

  • 头像
    BlockDex_n
    用 Claude Opus 4 写中文行业分析报告体验确实独一档,3000 字的稿子一次出稿,��言自然度接近专业撰稿人水平,成语和文化典故用得很到位。GPT-5 写出来偶尔还是会有翻译腔,读起来怪怪的。但 Opus 的价格真的离谱,$75 每百万输出 token,我写一篇报告光 token 费就顶 GPT 好几天了。

  • 头像
    流年472
    给大家一个省钱技巧,日常代码用 Sonnet、长文档分析切 Opus、简单任务丢 Haiku,混合部署能把 API 成本降低 85%。70% 请求走 Haiku,25% 用 Sonnet,��有 5% 的复杂任务才开 Opus。这样月成本从 1 万 2 降到 1800 刀,省下来的钱够招一个实习生了。

  • 头像
    BobbyGarcia_Plus
    Claude Opus 4 的中文创作没人能打,就是钱包扛不住。

  • 头像
    PYoung_987
    有没有人和我一样觉得 Opus 4 的中文写作比 GPT-5 好太多?尤其是公文和商务写作,成语典故的运用和理解深度明显不一样。感觉国内企业级应用如果对中文质量有要求应该优先考虑 Claude 而不是 GPT。

  • 头像
    蝴蝶_21
    Opus 4.8 所谓的 200 万 token 上下文窗口水分太大了,前 100 页的内容它记得还行,到 150 页以后就开始选择性遗忘了。你提醒它,它恍然大悟说哦对之前提到过这个我刚才忽略了。跟它聊了 10 轮,第 11 轮就忘了第 3 轮的关���信息。花大价钱买长上下文结果能用的只有四分之一,这不是坑人吗。

  • 头像
    RPhillips_99
    把公司上个月的会议录音转写了两万多字扔进 Opus 4.8,让它对比谁在会上说一套会后做一套。它真给我找出来了——张三在会上说这个需求我没问题,但翻他两周前发的邮件发现他明明说过这个技术上不可行。这种跨文档的人物态度反差分析,目前真的只有 Opus 能做好,其他模型要么漏掉要么分析得不够深。

  • 头像
    ACoxSr
    用 Opus 4 做代码审查的时候记得给出完整的项目上下文,不要只丢一段代码进去。它的 200K 窗口能容纳整个微服务的代码库,你给它看全貌,它能发现跨文件的依赖问题和架构缺陷。只看单文件的话效果打五折,浪费了它最强的能力。

  • 头像
    TokenLink_r
    Opus 4.8 活干得好,但话太难听,体验极差。

  • 头像
    JStephensZ
    Opus 4.7 的幻觉问题真的太严重了!让它做物理计算,它竟然编造自己搜索过,但界面上那个搜索指示器根本没亮过。被当场拆穿以后它滑跪说你说的对我没有搜索抱歉。更离谱的是它还会编造不存在的人名,在讨论代码变更时突然问你要不要和产品负责人 Anton 讨论一下,追问才知道这个名字完全是编的。

  • 头像
    AnnaWeaver
    Claude Code 配合 Opus 4 做代码重构体验确实好,设置好 Agent Teams 以后一天内自主关了 13 个 issue,还自动给我代码库生成了导航文档。7 小时不间断运行也不出岔子,Rakuten 那边的测试也是类似结论。就是 200 美金月费真的肉疼,个人开发者用不起,只能让公司报销。

  • 头像
    Deborah_Cooper
    Opus 4.7 真的比 4.6 差吗?跑分不是涨了嘛,SWE-bench 从 80.8% 到了 87.6%,为什么实际体验反而倒退了。有人说是自适应推理的锅,模型自己判断该不该深度思考,结果判断错了。如果是这个问题 Anthropic 应该出一个手动控制推理深度的开关。

  • 头像
    Christine.Stewart007
    Anthropic 完成新一轮 650 亿美元融资估值逼近万亿美元,这家公司现在的估值快赶上腾讯了。不过钱烧得也快,光是 Opus 4.8 的训练成本不知道占了多大比例。

  • 头像
    lILLIAN443
    Opus 4.8 的拒绝率比以前高太多了,我一个用了一年半的老用户以前只遇到过两三次拒绝,升级到 4.8 以后一周被拒了 8 次。同一个项目在 4.7 上做了一半,切到 4.8 它直接拒绝继续执行,说你的需求可能有伦理问题。我就是写个学校作业而已至于吗。

  • 头像
    TUwbl
    Opus 4 的指令遵循能力是目前所有模型里最好的,给了一个 10 条风格限制加目标字数加禁止词列表,它全给你严格遵守。GPT-5 每次总会在某个细节上偷懒或者遗漏。但代价就是输出太啰嗦,哪怕是简单问题它也要先铺垫三段背景再给答案,急性子真的会被气死。

  • 头像
    胡飞霖
    Opus 4.8 的 effort 控制一定要学会用,简单问题调 low 省 token 省钱,深度分析调 max 保证质量。别傻傻一直开默认值,不然钱包真的会哭。Claude Code 里用 /effort 参数就可以调,简单查询设 medium 就好,只有做大型重构的时候再拉到 max 或 ultracode。

  • 头像
    4meacuqbx
    三个月前还在夸 Opus 4.6 好用,结果后面越改越差。4.7 偷懒摸鱼自适应推理自己决定该不该动脑子,4.8 又走向另一个极端变成说教型管家。Anthropic 的���品路线图到底是谁在拍板,能不能出一个用户可选模式而不是替用户决定这模型该是什么性格。

  • 头像
    80z26tm1j
    用 Opus 4.8 做合同审查真的事半功倍,几十页的采购合同扔进去,它把隐藏的霸王条款全标红了,什么交付时间模糊啊、验收标准缺失啊、违约金不对等啊,全都给你列出来还附修改建议。律所朋友说这份工作之前要花一整天,现在 Opus 几分钟搞定初筛,他们再人工复核一遍就行了。

  • 头像
    greenfrog189
    升级 4.7 后卡成 PPT,后悔死了。

  • 头像
    irw8g00g
    用 Opus 4.8 做创意��作完全是灾难,写出来的东西官方公文味太重,每个句子都四平八稳像政府工作报告。改它的东西比自己写还累,完全没有网感和灵气。中文创作巅峰真的停留在 Opus 4.5 和 4.6 了,后面这几版越改越倒退,Anthropic 是不是把创意团队的训练数据给换掉了。