Claude Opus 4.7

Anthropic发布的旗舰大语言模型,在高级软件工程和视觉理解方面实现显著提升

深度报告

  • Claude Opus 4.7 是 Anthropic 于2026年4月16日发布的旗舰大语言模型,在高级软件工程、视觉理解和指令遵循方面实现显著提升。该模型支持更高分辨率图像处理(最高2576像素),定价与 Opus 4.6 保持一致(输入$5/百万tokens,输出$25/百万tokens)。然而,发布后用户评价两极分化,部分用户反馈模型出现性能倒退,主要体现在输出tokens增加和响应变得冗长。

  • Claude Opus 4.7 由 AI 领域明星公司 Anthropic 于2026年4月16日发布。新版本距上一次模型升级仅间隔两个月,与该公司此前的更新节奏保持一致。Anthropic 同时在研发更为强大的 Mythos「神话」模型,该模型目前仅供一小撮顶级机构先行试用,寻找应对「AI网络浩劫」的破解之道,短期内恐无缘公开市场。 Anthropic 表示,Claude Opus 4.7 与 Mythos 存在全方位的能力差距。Opus 4.7 是面向开发者和编程爱好者的高阶模型,主打高端软件开发能力。

  • 高级软件工程能力:Opus 4.7 在高级软件工程领域实现了显著进步。在复杂编码任务、长时间运行的多步骤工作流中表现尤为出色。新版本更善于严格遵循指令,能够在输出前验证自己的答案是否正确,处理需要深入推理的困难编码任务时更加得心应手。 在专业评测中,Opus 4.7 在 GDPval-AA 测试中展现领先第二名79分的优势,幻觉率下降25个百分点至36%。这种改进得益于模型更倾向于承认知识盲区而非编造答案。长文本处理能力也获得提升,在100万token上下文的 MRCR v2 测试中,新版本展现出更强的信息检索准确性。 增强的视觉能力:新版本在视觉能力上提升显著,支持更高分辨率图像处理,最高可达2576像素(约375万像素),相比前代提升超过3倍。这使得模型能够更准确地理解化学结构、复杂技术图表等内容,在界面设计、数据可视化等任务中展现更高品味。 指令遵循与安全性:Opus 4.7 在指令遵循方面有了显著提升,就像一只训练有素的工作犬,能够更精准地执行命令。模型内置网络安全防护机制,能够自动检测和阻止恶意网络安全请求,同时支持漏洞研究、渗透测试、红队演练等合法网络安全工作。 与前代版本对比:相比 Opus 4.6,新版本的主要改进包括:视觉分辨率提升3倍以上、指令遵循一致性增强、长任务稳定性提高、专业输出品味提升。

  • Claude Opus 4.7 的定价与 Opus 4.6 保持一致,每百万输入 tokens 收费5美元,每百万输出 tokens 收费25美元。定价相同意味着用户可以以同样成本获得新版本的能力提升。 不过,有用户反馈新版本产生更多输出 tokens,在较高努力级别下会产生更多冗长回复,实际使用成本可能高于前代。用户迁移时需要注意提示词可能需要调整,因为新版本的指令遵循能力更强,原来为早期模型设计的提示可能产生不同结果。 可用平台:Anthropic API(模型ID:claude-opus-4-7)、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry、Claude Pro / Max / Team / Enterprise 订阅方案

  • 部分专业评测对 Opus 4.7 给出积极评价。在权威基准测试中,Opus 4.7 展现出的优势显著,跑分表现领先。视觉能力提升获得认可,在生成更高质量的界面、幻灯片等方面得到赞赏。幻觉率的下降被认为是重要改进,模型更倾向于承认知识盲区而非编造答案。 然而,发布后用户评价出现两极分化。在 Reddit 的 ClaudeAI 社区和 Hacker News 上,大量用户反馈 Opus 4.7 出现性能严重倒退,主要问题包括: 输出冗长:新版本变得非常「线嗦」,回复中添加大量无用解释,导致 token 消耗大幅增加 幻觉问题:虽然官方声称幻觉率下降,但用户反馈在计算密集型任务时充满不易察觉的危险幻觉 懒惰倾向:用户反映模型变得更加「懒惰」,不愿意深入思考复杂问题 价格感受:虽然定价未变,但因输出 token 增加,用户感觉「涨价了50%」 大量老用户呼吁 Anthropic 「还我4.6」,这表明新版本的实际体验与官方宣传存在落差。

  • Anthropic 最近几个月原本处在一段少见的高光期,Claude Code 和 Claude Cowork 的能力提升明显拉高了外界对 Anthropic 工程能力的评价。Claude 一直是用户心中「最会写」的模型之一,甚至在与美国国防部相关争议引发关注后,Claude 一度冲上 App Store 下载榜首。 然而,Opus 4.7 的发布让外界对 Anthropic 的评价出现分歧。一方面,官方基准测试数据确实亮眼;另一方面,用户实际体验与跑分存在明显差距,这种「跑分冠军」与「用户翻车」的反差值得深思。

  • 营销与实际差距:官方宣传的三大升级在实测中遭到质疑,用户反馈与官方承诺存在落差 幻觉问题:尽管基准测试显示幻觉率下降,但用户在实际使用中仍遇到不易察觉的错误信息 成本问题:虽然单位定价未变,但输出 token 增加导致实际使用成本上升 版本回退需求:大量用户希望能够回退到 Opus 4.6,反映出对新版本性能的认可度不足

  • 适合谁:需要处理复杂长时间运行任务的开发者,对视觉理解有高要求的多模态应用场景,需要严格指令遵循的企业级应用,法律文档分析、生命科学专利工作流等专业领域。 不适合谁:追求简洁高效回复的重度用户,对成本敏感的项目,期望获得与 Opus 4.6 类似体验的老用户。 替代方案:如果对 Opus 4.7 不满意,可以考虑使用 Opus 4.6 或等待后续版本更新。Anthropic 的 Sonnet 模型也是性价比不错的选择。

  • Claude Opus 4.7 在技术指标上实现了显著提升,官方跑分表现亮眼,但实际用户体验与官方宣传存在明显落差。用户评价两极分化明显,部分用户甚至怀念前代版本。对于企业用户,建议先进行小规模测试再决定是否迁移。对于个人开发者,可以根据具体使用场景选择合适的模型版本。

用户评论

  • 头像
    Amber.LongX
    用了一周 Opus 4.7,代码能力确实强了,但输出太长了,一张口就是一大段话,看得累死了。

  • 头像
    CarlHarris_2024241
    快把 4.6 还给我!4.7 太懒了,根本不愿意深入思考复杂问题,给个任务就糊弄。

  • 头像
    EdvinRøise
    实测幻觉比 4.6 还严重,做数学计算时一堆不易察觉的错误,警惕啊。

  • 头像
    RalphHart_Plus
    价格没变但输出 token 翻了快一倍,实际成本涨了 50%,套路太深了。

  • 头像
    Andrea_MooreSr77
    编程能力是真强,SWEBench Pro 从 53.4% 干到 64.3%,超越 GPT-5.4 了。

  • 头像
    MIste
    视觉能力确实提升了 3 倍,看图更准了,这波没得说。

  • 头像
    EMkin
    指令遵循太准了,我让它跳过某一步它居然照做了,换以前早自动给我补上了。

  • 头像
    Eugene_Baker_2022
    cybersecurity 功能好评,自动拦截恶意请求,安全团队狂喜。

  • 头像
    PDiazIII
    用 Opus 4.7 跑了个大项目,一下午吃了 100 刀的 token,心疼。

  • 头像
    Jean821
    生成代码质量确实高,但能不能不要每次都吧啦吧啦解释一大堆。

  • 头像
    PDiaz_7715
    100 万 token 上下文的 MRCR v2 测试表现更强了,长文本处理确实有提升。

  • 头像
    Douglas839_m
    幻觉率下降到这个程度已经很牛了,至少它会承认自己不懂。

  • 头像
    Aaron.HallZ
    视觉分辨率提到 2576 像素,看技术图表终于清楚了,感动。

  • 头像
    GAbak
    4.7 发布了,评分看上去很猛,实际用起来emmm...你们懂的。

  • 头像
    DorothyYoung007
    和 Mythos 差距还是太大了,Mythos 才是亲儿子,4.7 喝汤。

  • 头像
    JacobPerez_77
    太香了!编程能力直接上了一个档次,这波升级血赚。

  • 头像
    xMircoFreitas_dev
    测试了一下,GDPval-AA 领先第二名 79 分,强得一批。

  • 头像
    WhaleAlertHall
    Opus 4.7 yyds!新模型太强了,复杂任务处理得心应手。

  • 头像
    DrNurdanAkgül_88
    发布当天就上手了,整体满意,就是 token 消耗比 4.6 猛。