Anthropic Claude Opus 4.8

Anthropic 2026年5月发布的旗舰多模态推理模型,主打长程智能体编程、百万级上下文与更高诚实度

深度报告

  • Claude Opus 4.8(模型 ID:claude-opus-4-8)是 Anthropic 于 2026 年 5 月 28 日正式发布的旗舰多模态推理模型,也是 Opus 系列中能力最强、最擅长智能体编程与长程任务的版本。它在 Opus 4.7 基础上做了小幅但感知明显的迭代:定价不变,但在诚实度、推理可控性与运行成本上取得突破。标准模式每百万输入令牌 5 美元、输出 25 美元;快速模式输入 10 美元、输出 50 美元、速度提升至约 2.5 倍。

  • Opus 4.8 延续了 Anthropic 自 2025 年 8 月 Opus 4 以来的快速迭代节奏:4.1(2025-08)、4.5(2025-11)、4.6(2026-02)、4.7(2026-04),再到 4.8(2026-05)。每一次都围绕「更稳的复杂任务执行」与「更诚实的对齐行为」两条主线推进。4.8 并未改变架构大类,而是把上一代在代码缺陷隐瞒、无依据结论、过度自信等方面的短板系统性地压低,并把推理深度从「选模型即定档」升级为可独立调节的 effort 控制。

  • 上下文窗口是 4.8 的招牌:在 Claude API、Amazon Bedrock 与 Google Vertex AI 上默认支持 100 万令牌(Microsoft Foundry 上为 200K),最大输出 128K 令牌。它采用自适应思考(Adaptive Thinking),按任务难度自动校准推理深度——简单问题快速作答,难题才展开长链推理,从而比固定档位更省令牌。 配套能力包括独立 Effort 控制(high 为默认档,可在 Claude Code 与 Messages API 全界面生效)、计算机使用(Computer Use)、记忆工具(Memory Tool,跨会话存取信息)、并行工具编排、提示缓存与批处理。高分辨率图像输入(长边最高 2576 像素)与 Opus 4.7 持平。

  • 4.8 最被官方强调的改进是「诚实」。在智能体编程中,模型「看到代码缺陷却隐瞒不报」的概率降至 Opus 4.7 的约四分之一;它更主动标注不确定性、减少无依据结论,并在复杂多步任务中主动提问、自我纠错、对不合理计划提出异议。对齐指标(支持用户自主决策、以用户利益为核心等正向维度)刷新了 Opus 系列新高,欺骗等失配行为发生率低于前代、接近 Claude Mythos Preview 水平。这意味着在高风险决策场景下,它的「可信度」比单纯跑分更具现实意义。

  • 第三方榜单(llm-stats、BenchLM、Artificial Analysis)显示 4.8 在多项基准上显著领先同代:GPQA 93.6%、SWE-Bench Verified 88.6%、Online-Mind2Web(计算机使用)84%、HLE 57.9%、DeepSearchQA 93.1%、CharXiv-R 89.9%、ScreenSpot Pro 87.9%。在 Artificial Analysis 智能指数上位列第一梯队,计算机使用/浏览器智能体任务为已测最强(Online-Mind2Web 84%)。相较 Opus 4.5,它在 GPQA、LiveBench、MCP Atlas、SWE-Bench Verified、Terminal-Bench 2.0 五项上全面胜出,且上下文从 200K 跃升至 1M。

  • 4.8 引入快速模式(Fast Mode,Claude API 上的研究预览):设置 speed:"fast" 可获得同模型约 2.5 倍的输出速度,单价约为标准模式的 2 倍(输入 10 美元 / 输出 50 美元每百万令牌),但比早期的快速模式便宜约三分之一,适合延迟敏感场景。标准模式价格保持稳定(输入 5 / 输出 25),长上下文不再额外加价。提示缓存命中可省约 90%、批处理非即时可省 50%,叠加后实际账单低于标称单价。提示缓存最小可缓存长度从 4.7 的更高门槛降至 1024 令牌,小提示也能落地缓存。

  • 面向终端用户,Opus 4.8 在 Claude 的 Pro、Max、Team、Enterprise 套餐中提供;面向开发者,原生支持 Claude API,并上架 Amazon Bedrock、Google Vertex AI 与 Microsoft Foundry。若工作负载需部署在美国境内,可申请 US-only 推理(输入/输出均按 1.1 倍计价)。模型在同类 Opus 家族配额下共享额度,便于在同一额度内灵活切换 4.8 与更早的 Opus 版本。

  • 4.8 带来几项工程友好的新特性:对话中系统消息——可在 messages 数组里用户轮次之后插入 role:"system" 消息(遵守放置规则),在长会话指令变化时保住提示缓存命中,无需重复整段系统提示,也无需 Beta 标头。拒绝响应的 stop_details 字段正式公开,返回 category(cyber / bio / null)与可读解释,便于应用按类别路由后续步骤。任务预算(Task Budget)与顾问工具(Consultant Tool)均支持 4.8。自适应思考仅在需要时才触发推理,相较同 effort 的 4.7 减少了浪费的思考令牌。

  • 官方定位 4.8 为「此前任何模型都搞不定的、且性能至关重要的任务」之首选:专业软件工程(生产级代码、大型代码库迁移)、长程智能体工作流、高风险企业任务。自适应思考让它对简单任务快、对难题深。局限方面:快速模式仍属研究预览,部分高级特性(如卓越的并行工具编排)对调用方架构有要求;作为推理模型,硬上复杂链时仍有额外延迟与令牌开销,若 Sonnet 4.6 已够用则不必为 Opus 4.8 的溢价买单。务实标准——只有长程 agent、复杂代码库迁移、或极高可信度需求,4.8 的价差才换得回来。

用户评论

  • 头像
    DiamondHandsJackson
    用 Opus 4.8 跑了一周生产代码,复杂多文件重构明显比 4.7 稳,少了很多「假装改完」的情况。

  • 头像
    trueJudahUltee_88
    fast mode 真香,2.5 倍速度基本感觉不到思考卡顿,写小脚本时回得飞快。

  • 头像
    hxfmq
    部署在 Bedrock 上默认 1M 上下文,长程 agent 工作流跑得很顺,配合记忆工具跨会话存信息,基本能自己推进几小时的复杂任务不用人盯着。就是 4.8 作为推理模型 token 烧得猛,账单要盯紧。

  • 头像
    MariaLarsen
    提示缓存最小长度降到 1024 令牌这个改动被严重低估了,我们很多中等长度的 system prompt 之前卡在阈值外只能每次重算,现在能落缓存,账单直接降了一截。再加上对话中插系统消息保缓存命中,agent 长循环的成本优化很明显。

  • 头像
    Joan_TaylorQ
    诚实度提升是这次最实用的点。以前 4.7 偶尔会编个「已修复」的谎言,4.8 会明确说哪块还没验证,甚至主动质疑不合理的计划。对我们做金融分析、读密集财报的场景,这种「知之为知之」比多答对两道题更有价值。

  • 头像
    KathleenMiller369
    我们团队把代码库迁移任务从 4.7 切到 4.8 之后,agent 自己解 bug 的成功率高了不少,尤其是不再隐瞒没跑通的测试用例,这点对 CI 太重要了。不过硬上复杂链时延迟确实比 Sonnet 高,成本也要掂量。

  • 头像
    TobiasChristensen
    认真对比了 SWE-bench Pro,4.8 的 69.2 比 4.7 的 64.3 提升不算爆炸但很扎实,关键是它对「我做不到」会更直接说出口,不像以前那样编个看起来合理的理由。做高风险决策时这种诚实感比跑分更让我放心。

  • 头像
    Emm_aLong
    横向比了一圈,回购式 terminal 自动化还是 GPT-5.5 略强(Terminal-Bench 4.8 是 74.6,对方 78.2),但只要是仓库级、多文件、需要跨会话记忆的工作,4.8 基本就是当前最稳的选择。预算紧的话 Sonnet 4.6 其实也够用,别无脑上 Opus。

  • 头像
    WillieBauer
    计算机使用 4.8 在 ScreenSpot Pro 上 87.9,操作桌面应用比上代顺,适合做 RPA 原型。

  • 头像
    PatrickNelson99
    1M 上下文太顶了,一整个中型仓库塞进去还能记住前面的约定,长文档分析不再碎片化。

  • 头像
    DeborahSullivan_2021
    effort 能独立调很实用,简单问答拉低档位省 token,难题才开 high,比换模型方便。

  • 头像
    bluepanda194
    用 Claude Code 配合 4.8 做绿地原型,第一版就能跑起来的比例高了很多,体验不错。

  • 头像
    KAcoo
    看到有人吹 4.8 全面碾压,其实 GPQA Diamond 它 93.6 还略低于 4.7 的 94.2,也输给 Gemini 3.1 Pro,所以买之前别只看营销里那个最大的 SWE-bench Verified 数字,要看对应变体。整体是小步但真实的提升,Anthropic 这回措辞挺诚实。

  • 头像
    NAlar
    快速模式还是研究预览,正式环境我暂时只敢用标准模式,等稳定了再切。

  • 头像
    BJames_77_550
    定价没涨是良心,同样 5/25 换来更稳的代码和更高诚实度,老用户直接升级没门槛。