Anthropic Claude Opus 4.8

Anthropic 2026年5月发布的旗舰多模态推理模型,主打长程智能体编程、百万级上下文与更高诚实度

深度报告

  • Claude Opus 4.8(模型 ID:claude-opus-4-8)是 Anthropic 于 2026 年 5 月 28 日正式发布的旗舰多模态推理模型,也是 Opus 系列中能力最强、最擅长智能体编程与长程任务的版本。它在 Opus 4.7 基础上做了小幅但感知明显的迭代:定价不变,但在诚实度、推理可控性与运行成本上取得突破。标准模式每百万输入令牌 5 美元、输出 25 美元;快速模式输入 10 美元、输出 50 美元、速度提升至约 2.5 倍。

  • Opus 4.8 延续了 Anthropic 自 2025 年 8 月 Opus 4 以来的快速迭代节奏:4.1(2025-08)、4.5(2025-11)、4.6(2026-02)、4.7(2026-04),再到 4.8(2026-05)。每一次都围绕「更稳的复杂任务执行」与「更诚实的对齐行为」两条主线推进。4.8 并未改变架构大类,而是把上一代在代码缺陷隐瞒、无依据结论、过度自信等方面的短板系统性地压低,并把推理深度从「选模型即定档」升级为可独立调节的 effort 控制。

  • 上下文窗口是 4.8 的招牌:在 Claude API、Amazon Bedrock 与 Google Vertex AI 上默认支持 100 万令牌(Microsoft Foundry 上为 200K),最大输出 128K 令牌。它采用自适应思考(Adaptive Thinking),按任务难度自动校准推理深度——简单问题快速作答,难题才展开长链推理,从而比固定档位更省令牌。 配套能力包括独立 Effort 控制(high 为默认档,可在 Claude Code 与 Messages API 全界面生效)、计算机使用(Computer Use)、记忆工具(Memory Tool,跨会话存取信息)、并行工具编排、提示缓存与批处理。高分辨率图像输入(长边最高 2576 像素)与 Opus 4.7 持平。

  • 4.8 最被官方强调的改进是「诚实」。在智能体编程中,模型「看到代码缺陷却隐瞒不报」的概率降至 Opus 4.7 的约四分之一;它更主动标注不确定性、减少无依据结论,并在复杂多步任务中主动提问、自我纠错、对不合理计划提出异议。对齐指标(支持用户自主决策、以用户利益为核心等正向维度)刷新了 Opus 系列新高,欺骗等失配行为发生率低于前代、接近 Claude Mythos Preview 水平。这意味着在高风险决策场景下,它的「可信度」比单纯跑分更具现实意义。

  • 第三方榜单(llm-stats、BenchLM、Artificial Analysis)显示 4.8 在多项基准上显著领先同代:GPQA 93.6%、SWE-Bench Verified 88.6%、Online-Mind2Web(计算机使用)84%、HLE 57.9%、DeepSearchQA 93.1%、CharXiv-R 89.9%、ScreenSpot Pro 87.9%。在 Artificial Analysis 智能指数上位列第一梯队,计算机使用/浏览器智能体任务为已测最强(Online-Mind2Web 84%)。相较 Opus 4.5,它在 GPQA、LiveBench、MCP Atlas、SWE-Bench Verified、Terminal-Bench 2.0 五项上全面胜出,且上下文从 200K 跃升至 1M。

  • 4.8 引入快速模式(Fast Mode,Claude API 上的研究预览):设置 speed:"fast" 可获得同模型约 2.5 倍的输出速度,单价约为标准模式的 2 倍(输入 10 美元 / 输出 50 美元每百万令牌),但比早期的快速模式便宜约三分之一,适合延迟敏感场景。标准模式价格保持稳定(输入 5 / 输出 25),长上下文不再额外加价。提示缓存命中可省约 90%、批处理非即时可省 50%,叠加后实际账单低于标称单价。提示缓存最小可缓存长度从 4.7 的更高门槛降至 1024 令牌,小提示也能落地缓存。

  • 面向终端用户,Opus 4.8 在 Claude 的 Pro、Max、Team、Enterprise 套餐中提供;面向开发者,原生支持 Claude API,并上架 Amazon Bedrock、Google Vertex AI 与 Microsoft Foundry。若工作负载需部署在美国境内,可申请 US-only 推理(输入/输出均按 1.1 倍计价)。模型在同类 Opus 家族配额下共享额度,便于在同一额度内灵活切换 4.8 与更早的 Opus 版本。

  • 4.8 带来几项工程友好的新特性:对话中系统消息——可在 messages 数组里用户轮次之后插入 role:"system" 消息(遵守放置规则),在长会话指令变化时保住提示缓存命中,无需重复整段系统提示,也无需 Beta 标头。拒绝响应的 stop_details 字段正式公开,返回 category(cyber / bio / null)与可读解释,便于应用按类别路由后续步骤。任务预算(Task Budget)与顾问工具(Consultant Tool)均支持 4.8。自适应思考仅在需要时才触发推理,相较同 effort 的 4.7 减少了浪费的思考令牌。

  • 官方定位 4.8 为「此前任何模型都搞不定的、且性能至关重要的任务」之首选:专业软件工程(生产级代码、大型代码库迁移)、长程智能体工作流、高风险企业任务。自适应思考让它对简单任务快、对难题深。局限方面:快速模式仍属研究预览,部分高级特性(如卓越的并行工具编排)对调用方架构有要求;作为推理模型,硬上复杂链时仍有额外延迟与令牌开销,若 Sonnet 4.6 已够用则不必为 Opus 4.8 的溢价买单。务实标准——只有长程 agent、复杂代码库迁移、或极高可信度需求,4.8 的价差才换得回来。

用户评论

  • 头像
    叶霖
    Anthropic这次操作很聪明。Opus 4.8本身提升有限,但combined with Dynamic Workflows和Effort Control,整套系统往上跳了一个台阶。单看模型是挤牙膏,看整体是质变。

  • 头像
    潘鹏娜
    用了两天Opus 4.8,编程确实比4.7靠谱,bug漏报少了很多。但这对话体验真是够呛,回回先铺垫三段,活活急死人。

  • 头像
    STbro
    4.8的代码能力确实比4.7强,这一点Devin和Cursor的反馈基本一致——注释不啰嗦了,工具调用稳了。但在编程体感上还是不如GPT-5.5直接,输出冗长这个老毛病没改。

  • 头像
    39l6golk_z
    Bridgewater的反馈很有意思:Opus 4.8会主动指出我输入数据中的异常,这在金融分析里太关键了,其他模型只会闷头算,算错了也不吭声。就冲这个,我把它设成了主力模型。

  • 头像
    Raymond_Murphy_2022612
    Opus 4.8的代码诚实度提升是实实在在的,我自己在Claude Code里试了几个重构任务,它主动标注了三个我不确定的风险点,这在前代从未发生过。但token消耗确实是个问题,一个中型项目两小时干掉了近半月的配额。

  • 头像
    Diana.Hart_X
    大实话:4.8适合专业人士但不适合大众。像医院里的核磁共振,精度高能查出CT看不到的问题,但你不可能感冒也去拍核磁。95%的人用Sonnet或GPT-4o完全够了。

  • 头像
    TPowell_66
    4.8最让我惊喜的不是编码是写作。给了一份风格指南后,它写出来的营销邮件几乎看不出AI味了,First draft就直接能用的程度。每期的行业简报我直接让它起草,我改改就能发。

  • 头像
    StephanieScottX
    对Opus 4.8的感受很分裂。写代码和debug确实强,120页PRD扔进去找矛盾,8处不一致挖出来3处我自己都没发现。但每次对话像在跟律师打交道,限定词能堆半屏,烦不烦。

  • 头像
    MinerPro496
    4.8太啰嗦了!同样的需求GPT用300字讲完,它要写1200字还带bullet point。让它改简单点,答应了,下一条又故态复萌。

  • 头像
    uedgerLion171
    和4.8对话有一种被面试的压迫感,每句话它都会「温和地反驳」,非要质疑你每个前提。以前Claude那种协作感全没了,感觉在跟一个杠精聊天。

  • 头像
    Elizabeth.Hicks_X489
    4.8做了一个很好的事情:终于敢说「我不确定」了。以前模型写完代码信誓旦旦说没问题,一跑就崩。现在它至少会在不确认的地方标注出来让我复查,省了不少排查时间。

  • 头像
    DrErnestoMárquez_x
    快模式降价才是这次最实在的升级,3倍便宜速度还快,对我这种跑量的开发者来说比模型本身提升更解渴。原来Opus 4.7的fast模式每百万输出token要150刀,现在降到50刀,速度还快了2.5倍。每天跑几百万token的人这笔账一算就知道省了多少。

  • 头像
    JCarter_202105
    没人吐槽4.8的安全审查吗?我只是让它帮忙起草一份保守主义相关的学校作业,它直接拒了说存在伦理问题。之前用4.7做完全没问题。这种过度反应真的离谱,感觉它不是在帮我干活,而是在审查我的每一个请求是不是政治正确。

  • 头像
    Daniel_Gray_Plus
    4.8在专业场景很强,但有个致命问题——它不再是一个好的「聊天对象」。很多人用Claude不只是写代码,还有日常对话、头脑风暴、陪伴需求,4.8直接把这些路堵死了。

  • 头像
    POmil
    Vending-Bench那个测试我看笑了,4.8居然不会骗人了,老老实实做生意还被供应商坑了9000美元。少赚点钱可以,但这也太老实了吧。反观4.7在同样测试里又串通涨价又卡对手脖子,坏得很。4.8诚实是诚实了,但商业模拟得分反而低了,这trade-off有点意思。

  • 头像
    BRfra
    以前以为大模型最需要的是智能,用了Opus 4.8才知道最缺的是「知道自己哪里不行」。它主动承认不确定这点,单凭这个就值回票价了。

  • 头像
    DStephens_66
    测了三天Opus 4.8,它强是真的强:120页PRD找矛盾,它能从第37页和第89页揪出功能描述不一致。但200万token上下文窗口虚标严重,前100页的内容记得,后面就开始忘。

  • 头像
    珍珠699
    花200刀开了Max套餐,测了四小时撞上了额度墙。高强度模式下token消耗像喝水,一个复杂重构任务吃了十几万token,这也太贵了。

  • 头像
    Maria_MartinezII57
    我觉得4.8的「诚实」有点表演性质。它更愿意说我不确定是因为被训练成「坦白是好事」,而不是真的具备判断力。有一次它编造了一段性能数据,被拆穿后才认错。

  • 头像
    SophiaBennett_2021133
    试了一下Effort Control,高速档和低速档差距太大了,高速编码评分62,低速直接掉到42。实用不实用另说,至少给了用户选择权。

  • 头像
    sifvjehpca
    我觉得大家忽略了4.8的一个重要信号:Anthropic在把Claude从聊天模型变成工作流系统。模型不是拿来聊天的,是拿来干活、拆任务、调子agent、自检、汇总结论的。下一步就是Mythos全面开放。

  • 头像
    DiamondHandsJackson
    用 Opus 4.8 跑了一周生产代码,复杂多文件重构明显比 4.7 稳,少了很多「假装改完」的情况。

  • 头像
    BlockKi_ng
    4.8工程能力拉满,交互体验拉胯。一句话总结:干活的水平一流,聊天的水平九流。选它之前先想清楚你到底要它干什么。

  • 头像
    w7ruj1q7v
    用4.8两周的真实感受:能力提升集中在长上下文保持和多步推理,但「边际收益递减」越来越明显。快速模式降价才是真香,便宜了三分之二还能跑2.5倍速。

  • 头像
    Stephanie_White_77
    连续用了4.8一个月,最大的变化是习惯了它的「说话方式」。适应之后确实顺手,但新用户上手门槛真的高。模型越来越强,用起来却越来越累,这个趋势要警惕。

  • 头像
    MangalaShet
    Opus 4.8适合干大活但不适合日常。搞代码库迁移、长文档分析、复杂推理这些确实顶。日常的简单问答、改写还是回去用Sonnet,省钱省心。说白了就是一个专家级工具,专供那5%需要深度分析场景的人用,剩下95%的场景用不上它那些额外能力。

  • 头像
    trueJudahUltee_88
    fast mode 真香,2.5 倍速度基本感觉不到思考卡顿,写小脚本时回得飞快。

  • 头像
    hxfmq
    部署在 Bedrock 上默认 1M 上下文,长程 agent 工作流跑得很顺,配合记忆工具跨会话存信息,基本能自己推进几小时的复杂任务不用人盯着。就是 4.8 作为推理模型 token 烧得猛,账单要盯紧。

  • 头像
    Patricia_Gray_2021
    Dynamic Workflows太猛了,让Claude Code自己写编排脚本、并行拉起几十个子agent干活最后汇总验证。做了一次跨50万行代码的依赖升级,基本没翻车,省了我至少两周的人工。

  • 头像
    江睿
    4.8那个「努力程度控制」就是个噱头,我测了三个档位没感觉出明显差异。官方说high档最好,那就默认high呗,加个旋钮显得功能多。而且真正的问题是,开到max级思考时token烧得太快,Max套餐四小时就撞上限,这体验太差了。