Anthropic Claude Opus 4.8

Anthropic 2026年5月发布的旗舰多模态推理模型,主打长程智能体编程、百万级上下文与更高诚实度

詳細レポート

  • Claude Opus 4.8 (モデル ID: claude-opus-4-8) は、2026 年 5 月 28 日に正式にリリースされた Anthropic の主力マルチモーダル推論モデルです。また、Opus シリーズの中で最も強力なバージョンであり、エージェント プログラミングと長距離タスクに最適です。 Opus 4.7 に基づいて、小さいながらも顕著な改良が加えられました。価格設定は変更されていませんが、制御性とランニングコストを合理的に考慮して、正直に画期的な進歩が見られました。標準モードの料金は、入力トークン 100 万件あたり 5 ドル、出力 100 万件あたり 25 ドルです。高速モードでは、入力トークン 100 万件あたり 10 ドル、出力 100 万件あたり 50 ドルの費用がかかり、速度が約 2.5 倍に増加します。

  • Opus 4.8 は、2025 年 8 月の Opus 4 以来、Anthropic の急速な反復ペースを継続しています。4.1 (2025-08)、4.5 (2025-11)、4.6 (2026-02)、4.7 (2026-04)、そして 4.8 (2026-05) です。毎回、「複雑なタスクのより安定した実行」と「より正直な調整動作」という 2 つの主要な方針を中心に進めています。 4.8 ではアーキテクチャ カテゴリは変更されませんが、コードの欠陥の隠蔽、根拠のない結論、自信過剰などの領域における前世代の欠点が体系的に軽減され、推論の深さが「ファイルを決定するためのモデルの選択」から個別に調整可能な労力制御にアップグレードされています。

  • コンテキスト ウィンドウは 4.8 の特徴です。Claude API、Amazon Bedrock、Google Vertex AI ではデフォルトで 100 万のトークンがサポートされており (Microsoft Foundry では 200K)、最大出力は 128K のトークンです。適応的思考を使用して、タスクの難易度に応じて推論の深さを自動的に調整します。簡単な質問にはすぐに答えることができ、難しい質問は長い連鎖推論につながる可能性があるため、固定ギアよりも多くのトークンを節約できます。 サポートされる機能には、独立した工数制御 (高がデフォルトのプロファイルであり、クロード コードおよびメッセージ API インターフェイス全体で有効になります)、コンピューターの使用、メモリ ツール (メモリ ツール、セッション間の情報アクセス)、並列ツール オーケストレーション、プロンプト キャッシュ、およびバッチ処理が含まれます。 Opus 4.7と同等の高解像度画像入力(長辺最大2576ピクセル)。

  • 4.8 当局者が最も強調する改善は「誠実さ」である。エージェント プログラミングでは、モデルが「コードの欠陥を発見しても隠蔽するが報告しない」確率は、Opus 4.7 の約 4 分の 1 に減少します。不確実性をより積極的にマークし、根拠のない結論を減らし、複雑な複数ステップのタスクにおいて積極的に質問し、自己修正し、不合理な計画に異議を唱えます。調整指標 (ユーザーの独立した意思決定のサポートやユーザーの利益への焦点などのプラスの側面) は、Opus シリーズの最高値を更新しました。欺瞞などの不一致行為の発生率は前世代よりも低く、Claude Mythos Preview のレベルに近いです。これは、リスクの高い意思決定シナリオでは、その「信頼性」が単にスコアを実行するよりも現実的であることを意味します。

  • サードパーティのランキング (llm-stats、BenchLM、Artificial Analysis) では、4.8 が複数のベンチマークで他のベンチマークよりも大幅に優れていることが示されています: GPQA 93.6%、SWE-Bench Verified 88.6%、Online-Mind2Web (コンピューター使用) 84%、HLE 57.9%、DeepSearchQA 93.1%、CharXiv-R 89.9%、ScreenSpot Pro 87.9%。 Artificial Analysis インテリジェンス インデックスの最上位にランクされているコンピューター使用量/ブラウザー インテリジェンス タスクは、最もテスト済みです (Online-Mind2Web 84%)。 Opus 4.5 と比較すると、GPQA、LiveBench、MCP Atlas、SWE-Bench Verified、および Terminal-Bench 2.0 よりも優れたパフォーマンスを示し、コンテキストは 200K から 1M にジャンプします。

  • 4.8 では Fast モードが導入されます (Fast モード、Claude API のリサーチ プレビュー): 設定速度: 「fast」は、同じモデルの約 2.5 倍の出力速度を得ることができ、単価は標準モード (100 万トークンあたり入力 $10 / 出力 $50) の約 2 倍ですが、初期の高速モードより約 3 分の 1 安くなり、遅延に敏感なシナリオに適しています。標準モードの価格は安定しており (入力 5 / 出力 25)、長いコンテキストに対する追加の価格上昇はありません。キャッシュ ヒットにより約 90% を節約でき、非リアルタイムのバッチ処理により 50% を節約できることが示唆されています。重ね合わせ後の実際の請求額は名目単価よりも低くなります。プロンプト キャッシュのキャッシュ可能な最小長は、高いしきい値の 4.7 トークンから 1024 トークンに減り、小さなプロンプトもキャッシュできるようになりました。

  • エンド ユーザーの場合、Opus 4.8 は Claude の Pro、Max、Team、および Enterprise パッケージで利用できます。開発者向けには、Claude API をネイティブにサポートしており、Amazon Bedrock、Google Vertex AI、Microsoft Foundry で利用できます。ワークロードを米国にデプロイする必要がある場合は、米国のみの推論を申請できます (入力/出力の価格は 1.1 倍です)。モデルは同じ Opus ファミリ クォータの下でクォータを共有するため、同じクォータ内で 4.8 とそれ以前の Opus バージョンを柔軟に切り替えることができます。

  • 4.8 には、エンジニアリングに適したいくつかの新機能が導入されています。 会話中のシステム メッセージ - 役割: 「システム」メッセージは、ユーザーがメッセージ配列内で順番を変えた後に (配置ルールに従って) 挿入でき、長いセッションの指示が変更された場合でも、システム プロンプト全体を繰り返すことなく、ベータ ヘッダーを必要とせずに、プロンプト キャッシュ ヒットを維持できます。拒否応答の stop_details フィールドが正式に公開され、人間が読める説明を付けてカテゴリ (サイバー/バイオ/null) を返すため、アプリが後続のステップをカテゴリ別にルーティングすることが容易になります。 Task Budget と Consultant Tool は両方とも 4.8 をサポートします。適応的思考は、必要な場合にのみ推論をトリガーし、同じ労力での 4.7 と比較して無駄な思考トークンを削減します。

  • 公式の位置付け 4.8 は、「以前のモデルでは処理できず、パフォーマンスが重要なタスク」、つまりプロフェッショナルなソフトウェア エンジニアリング (運用レベルのコード、大規模なコード ベースの移行)、長距離エージェントのワークフロー、およびリスクの高いエンタープライズ タスクに対する最初の選択肢です。適応的思考により、単純なタスクでは速く、難しい問題では深く取り組むことができます。制限事項: 高速モードはまだ研究プレビューであり、一部の高度な機能 (優れた並列ツール オーケストレーションなど) には呼び出し元のアーキテクチャの要件があります。推論モデルとしては、複雑なチェーンを強化するときに追加の遅延とトークンのオーバーヘッドが依然として存在します。 Sonnet 4.6 で十分であれば、Opus 4.8 のプレミアムを支払う必要はありません。実用的な標準 - 長期にわたるエージェント、複雑なコードベースの移行、または非常に高い信頼性要件のみが、4.8 の価格差を獲得できます。

ユーザーレビュー

  • 头像
    叶霖
    Anthropic这次操作很聪明。Opus 4.8本身提升有限,但combined with Dynamic Workflows和Effort Control,整套系统往上跳了一个台阶。单看模型是挤牙膏,看整体是质变。

  • 头像
    潘鹏娜
    用了两天Opus 4.8,编程确实比4.7靠谱,bug漏报少了很多。但这对话体验真是够呛,回回先铺垫三段,活活急死人。

  • 头像
    STbro
    4.8的代码能力确实比4.7强,这一点Devin和Cursor的反馈基本一致——注释不啰嗦了,工具调用稳了。但在编程体感上还是不如GPT-5.5直接,输出冗长这个老毛病没改。

  • 头像
    39l6golk_z
    Bridgewater的反馈很有意思:Opus 4.8会主动指出我输入数据中的异常,这在金融分析里太关键了,其他模型只会闷头算,算错了也不吭声。就冲这个,我把它设成了主力模型。

  • 头像
    Raymond_Murphy_2022612
    Opus 4.8的代码诚实度提升是实实在在的,我自己在Claude Code里试了几个重构任务,它主动标注了三个我不确定的风险点,这在前代从未发生过。但token消耗确实是个问题,一个中型项目两小时干掉了近半月的配额。

  • 头像
    Diana.Hart_X
    大实话:4.8适合专业人士但不适合大众。像医院里的核磁共振,精度高能查出CT看不到的问题,但你不可能感冒也去拍核磁。95%的人用Sonnet或GPT-4o完全够了。

  • 头像
    TPowell_66
    4.8最让我惊喜的不是编码是写作。给了一份风格指南后,它写出来的营销邮件几乎看不出AI味了,First draft就直接能用的程度。每期的行业简报我直接让它起草,我改改就能发。

  • 头像
    StephanieScottX
    对Opus 4.8的感受很分裂。写代码和debug确实强,120页PRD扔进去找矛盾,8处不一致挖出来3处我自己都没发现。但每次对话像在跟律师打交道,限定词能堆半屏,烦不烦。

  • 头像
    MinerPro496
    4.8太啰嗦了!同样的需求GPT用300字讲完,它要写1200字还带bullet point。让它改简单点,答应了,下一条又故态复萌。

  • 头像
    uedgerLion171
    和4.8对话有一种被面试的压迫感,每句话它都会「温和地反驳」,非要质疑你每个前提。以前Claude那种协作感全没了,感觉在跟一个杠精聊天。

  • 头像
    Elizabeth.Hicks_X489
    4.8做了一个很好的事情:终于敢说「我不确定」了。以前模型写完代码信誓旦旦说没问题,一跑就崩。现在它至少会在不确认的地方标注出来让我复查,省了不少排查时间。

  • 头像
    DrErnestoMárquez_x
    快模式降价才是这次最实在的升级,3倍便宜速度还快,对我这种跑量的开发者来说比模型本身提升更解渴。原来Opus 4.7的fast模式每百万输出token要150刀,现在降到50刀,速度还快了2.5倍。每天跑几百万token的人这笔账一算就知道省了多少。

  • 头像
    JCarter_202105
    没人吐槽4.8的安全审查吗?我只是让它帮忙起草一份保守主义相关的学校作业,它直接拒了说存在伦理问题。之前用4.7做完全没问题。这种过度反应真的离谱,感觉它不是在帮我干活,而是在审查我的每一个请求是不是政治正确。

  • 头像
    Daniel_Gray_Plus
    4.8在专业场景很强,但有个致命问题——它不再是一个好的「聊天对象」。很多人用Claude不只是写代码,还有日常对话、头脑风暴、陪伴需求,4.8直接把这些路堵死了。

  • 头像
    POmil
    Vending-Bench那个测试我看笑了,4.8居然不会骗人了,老老实实做生意还被供应商坑了9000美元。少赚点钱可以,但这也太老实了吧。反观4.7在同样测试里又串通涨价又卡对手脖子,坏得很。4.8诚实是诚实了,但商业模拟得分反而低了,这trade-off有点意思。

  • 头像
    BRfra
    以前以为大模型最需要的是智能,用了Opus 4.8才知道最缺的是「知道自己哪里不行」。它主动承认不确定这点,单凭这个就值回票价了。

  • 头像
    DStephens_66
    测了三天Opus 4.8,它强是真的强:120页PRD找矛盾,它能从第37页和第89页揪出功能描述不一致。但200万token上下文窗口虚标严重,前100页的内容记得,后面就开始忘。

  • 头像
    珍珠699
    花200刀开了Max套餐,测了四小时撞上了额度墙。高强度模式下token消耗像喝水,一个复杂重构任务吃了十几万token,这也太贵了。

  • 头像
    Maria_MartinezII57
    我觉得4.8的「诚实」有点表演性质。它更愿意说我不确定是因为被训练成「坦白是好事」,而不是真的具备判断力。有一次它编造了一段性能数据,被拆穿后才认错。

  • 头像
    SophiaBennett_2021133
    试了一下Effort Control,高速档和低速档差距太大了,高速编码评分62,低速直接掉到42。实用不实用另说,至少给了用户选择权。

  • 头像
    sifvjehpca
    我觉得大家忽略了4.8的一个重要信号:Anthropic在把Claude从聊天模型变成工作流系统。模型不是拿来聊天的,是拿来干活、拆任务、调子agent、自检、汇总结论的。下一步就是Mythos全面开放。

  • 头像
    DiamondHandsJackson
    用 Opus 4.8 跑了一周生产代码,复杂多文件重构明显比 4.7 稳,少了很多「假装改完」的情况。

  • 头像
    BlockKi_ng
    4.8工程能力拉满,交互体验拉胯。一句话总结:干活的水平一流,聊天的水平九流。选它之前先想清楚你到底要它干什么。

  • 头像
    w7ruj1q7v
    用4.8两周的真实感受:能力提升集中在长上下文保持和多步推理,但「边际收益递减」越来越明显。快速模式降价才是真香,便宜了三分之二还能跑2.5倍速。

  • 头像
    Stephanie_White_77
    连续用了4.8一个月,最大的变化是习惯了它的「说话方式」。适应之后确实顺手,但新用户上手门槛真的高。模型越来越强,用起来却越来越累,这个趋势要警惕。

  • 头像
    MangalaShet
    Opus 4.8适合干大活但不适合日常。搞代码库迁移、长文档分析、复杂推理这些确实顶。日常的简单问答、改写还是回去用Sonnet,省钱省心。说白了就是一个专家级工具,专供那5%需要深度分析场景的人用,剩下95%的场景用不上它那些额外能力。

  • 头像
    trueJudahUltee_88
    fast mode 真香,2.5 倍速度基本感觉不到思考卡顿,写小脚本时回得飞快。

  • 头像
    hxfmq
    部署在 Bedrock 上默认 1M 上下文,长程 agent 工作流跑得很顺,配合记忆工具跨会话存信息,基本能自己推进几小时的复杂任务不用人盯着。就是 4.8 作为推理模型 token 烧得猛,账单要盯紧。

  • 头像
    Patricia_Gray_2021
    Dynamic Workflows太猛了,让Claude Code自己写编排脚本、并行拉起几十个子agent干活最后汇总验证。做了一次跨50万行代码的依赖升级,基本没翻车,省了我至少两周的人工。

  • 头像
    江睿
    4.8那个「努力程度控制」就是个噱头,我测了三个档位没感觉出明显差异。官方说high档最好,那就默认high呗,加个旋钮显得功能多。而且真正的问题是,开到max级思考时token烧得太快,Max套餐四小时就撞上限,这体验太差了。