Anthropic Claude Opus 4.8
Anthropic 2026年5月釋出的旗艦多模態推理模型,主打長程智慧體程式設計、百萬級上下文與更高誠實度
深度報告
-
Claude Opus 4.8(模型 ID:claude-opus-4-8)是 Anthropic 於 2026 年 5 月 28 日正式釋出的旗艦多模態推理模型,也是 Opus 系列中能力最強、最擅長智慧體程式設計與長程任務的版本。它在 Opus 4.7 基礎上做了小幅但感知明顯的迭代:定價不變,但在誠實度、推理可控性與執行成本上取得突破。標準模式每百萬輸入令牌 5 美元、輸出 25 美元;快速模式輸入 10 美元、輸出 50 美元、速度提升至約 2.5 倍。
-
Opus 4.8 延續了 Anthropic 自 2025 年 8 月 Opus 4 以來的快速迭代節奏:4.1(2025-08)、4.5(2025-11)、4.6(2026-02)、4.7(2026-04),再到 4.8(2026-05)。每一次都圍繞「更穩的複雜任務執行」與「更誠實的對齊行為」兩條主線推進。4.8 並未改變架構大類,而是把上一代在程式碼缺陷隱瞞、無依據結論、過度自信等方面的短板系統性地壓低,並把推理深度從「選模型即定檔」升級為可獨立調節的 effort 控制。
-
上下文視窗是 4.8 的招牌:在 Claude API、Amazon Bedrock 與 Google Vertex AI 上預設支援 100 萬令牌(Microsoft Foundry 上為 200K),最大輸出 128K 令牌。它採用自適應思考(Adaptive Thinking),按任務難度自動校準推理深度——簡單問題快速作答,難題才展開長鏈推理,從而比固定檔位更省令牌。 配套能力包括獨立 Effort 控制(high 為預設檔,可在 Claude Code 與 Messages API 全介面生效)、計算機使用(Computer Use)、記憶工具(Memory Tool,跨會話存取資訊)、並行工具編排、提示快取與批處理。高解析度影象輸入(長邊最高 2576 畫素)與 Opus 4.7 持平。
-
4.8 最被官方強調的改進是「誠實」。在智慧體程式設計中,模型「看到程式碼缺陷卻隱瞞不報」的機率降至 Opus 4.7 的約四分之一;它更主動標註不確定性、減少無依據結論,並在複雜多步任務中主動提問、自我糾錯、對不合理計劃提出異議。對齊指標(支援使用者自主決策、以使用者利益為核心等正向維度)重新整理了 Opus 系列新高,欺騙等失配行為發生率低於前代、接近 Claude Mythos Preview 水平。這意味著在高風險決策場景下,它的「可信度」比單純跑分更具現實意義。
-
第三方榜單(llm-stats、BenchLM、Artificial Analysis)顯示 4.8 在多項基準上顯著領先同代:GPQA 93.6%、SWE-Bench Verified 88.6%、Online-Mind2Web(計算機使用)84%、HLE 57.9%、DeepSearchQA 93.1%、CharXiv-R 89.9%、ScreenSpot Pro 87.9%。在 Artificial Analysis 智慧指數上位列第一梯隊,計算機使用/瀏覽器智慧體任務為已測最強(Online-Mind2Web 84%)。相較 Opus 4.5,它在 GPQA、LiveBench、MCP Atlas、SWE-Bench Verified、Terminal-Bench 2.0 五項上全面勝出,且上下文從 200K 躍升至 1M。
-
4.8 引入快速模式(Fast Mode,Claude API 上的研究預覽):設定 speed:"fast" 可獲得同模型約 2.5 倍的輸出速度,單價約為標準模式的 2 倍(輸入 10 美元 / 輸出 50 美元每百萬令牌),但比早期的快速模式便宜約三分之一,適合延遲敏感場景。標準模式價格保持穩定(輸入 5 / 輸出 25),長上下文不再額外加價。提示快取命中可省約 90%、批處理非即時可省 50%,疊加後實際賬單低於標稱單價。提示快取最小可快取長度從 4.7 的更高門檻降至 1024 令牌,小提示也能落地快取。
-
面向終端使用者,Opus 4.8 在 Claude 的 Pro、Max、Team、Enterprise 套餐中提供;面向開發者,原生支援 Claude API,並上架 Amazon Bedrock、Google Vertex AI 與 Microsoft Foundry。若工作負載需部署在美國境內,可申請 US-only 推理(輸入/輸出均按 1.1 倍計價)。模型在同類 Opus 家族配額下共享額度,便於在同一額度內靈活切換 4.8 與更早的 Opus 版本。
-
4.8 帶來幾項工程友好的新特性:對話中系統訊息——可在 messages 陣列裡使用者輪次之後插入 role:"system" 訊息(遵守放置規則),在長會話指令變化時保住提示快取命中,無需重複整段系統提示,也無需 Beta 標頭。拒絕響應的 stop_details 欄位正式公開,返回 category(cyber / bio / null)與可讀解釋,便於應用按類別路由後續步驟。任務預算(Task Budget)與顧問工具(Consultant Tool)均支援 4.8。自適應思考僅在需要時才觸發推理,相較同 effort 的 4.7 減少了浪費的思考令牌。
-
官方定位 4.8 為「此前任何模型都搞不定的、且效能至關重要的任務」之首選:專業軟體工程(生產級程式碼、大型程式碼庫遷移)、長程智慧體工作流、高風險企業任務。自適應思考讓它對簡單任務快、對難題深。侷限方面:快速模式仍屬研究預覽,部分高階特性(如卓越的並行工具編排)對呼叫方架構有要求;作為推理模型,硬上覆雜鏈時仍有額外延遲與令牌開銷,若 Sonnet 4.6 已夠用則不必為 Opus 4.8 的溢價買單。務實標準——只有長程 agent、複雜程式碼庫遷移、或極高可信度需求,4.8 的價差才換得回來。
使用者評論
-
葉霖—Anthropic這次操作很聰明。Opus 4.8本身提升有限,但combined with Dynamic Workflows和Effort Control,整套系統往上跳了一個臺階。單看模型是擠牙膏,看整體是質變。 -
潘鵬娜—用了兩天Opus 4.8,程式設計確實比4.7靠譜,bug漏報少了很多。但這對話體驗真是夠嗆,回回先鋪墊三段,活活急死人。 -
STbro—4.8的程式碼能力確實比4.7強,這一點Devin和Cursor的反饋基本一致——註釋不囉嗦了,工具呼叫穩了。但在程式設計體感上還是不如GPT-5.5直接,輸出冗長這個老毛病沒改。 -
39l6golk_z—Bridgewater的反饋很有意思:Opus 4.8會主動指出我輸入資料中的異常,這在金融分析裡太關鍵了,其他模型只會悶頭算,算錯了也不吭聲。就衝這個,我把它設成了主力模型。 -
Raymond_Murphy_2022612—Opus 4.8的程式碼誠實度提升是實實在在的,我自己在Claude Code裡試了幾個重構任務,它主動標註了三個我不確定的風險點,這在前代從未發生過。但token消耗確實是個問題,一箇中型專案兩小時幹掉了近半月的配額。 -
Diana.Hart_X—大實話:4.8適合專業人士但不適合大眾。像醫院裡的核磁共振,精度高能查出CT看不到的問題,但你不可能感冒也去拍核磁。95%的人用Sonnet或GPT-4o完全夠了。 -
TPowell_66—4.8最讓我驚喜的不是編碼是寫作。給了一份風格指南後,它寫出來的營銷郵件幾乎看不出AI味了,First draft就直接能用的程度。每期的行業簡報我直接讓它起草,我改改就能發。 -
StephanieScottX—對Opus 4.8的感受很分裂。寫程式碼和debug確實強,120頁PRD扔進去找矛盾,8處不一致挖出來3處我自己都沒發現。但每次對話像在跟律師打交道,限定詞能堆半屏,煩不煩。 -
MinerPro496—4.8太囉嗦了!同樣的需求GPT用300字講完,它要寫1200字還帶bullet point。讓它改簡單點,答應了,下一條又故態復萌。 -
uedgerLion171—和4.8對話有一種被面試的壓迫感,每句話它都會「溫和地反駁」,非要質疑你每個前提。以前Claude那種協作感全沒了,感覺在跟一個槓精聊天。 -
Elizabeth.Hicks_X489—4.8做了一個很好的事情:終於敢說「我不確定」了。以前模型寫完程式碼信誓旦旦說沒問題,一跑就崩。現在它至少會在不確認的地方標註出來讓我複查,省了不少排查時間。 -
DrErnestoMárquez_x—快模式降價才是這次最實在的升級,3倍便宜速度還快,對我這種跑量的開發者來說比模型本身提升更解渴。原來Opus 4.7的fast模式每百萬輸出token要150刀,現在降到50刀,速度還快了2.5倍。每天跑幾百萬token的人這筆賬一算就知道省了多少。 -
JCarter_202105—沒人吐槽4.8的安全審查嗎?我只是讓它幫忙起草一份保守主義相關的學校作業,它直接拒了說存在倫理問題。之前用4.7做完全沒問題。這種過度反應真的離譜,感覺它不是在幫我幹活,而是在審查我的每一個請求是不是政治正確。 -
Daniel_Gray_Plus—4.8在專業場景很強,但有個致命問題——它不再是一個好的「聊天物件」。很多人用Claude不只是寫程式碼,還有日常對話、頭腦風暴、陪伴需求,4.8直接把這些路堵死了。 -
POmil—Vending-Bench那個測試我看笑了,4.8居然不會騙人了,老老實實做生意還被供應商坑了9000美元。少賺點錢可以,但這也太老實了吧。反觀4.7在同樣測試裡又串通漲價又卡對手脖子,壞得很。4.8誠實是誠實了,但商業模擬得分反而低了,這trade-off有點意思。 -
BRfra—以前以為大模型最需要的是智慧,用了Opus 4.8才知道最缺的是「知道自己哪裡不行」。它主動承認不確定這點,單憑這個就值回票價了。 -
DStephens_66—測了三天Opus 4.8,它強是真的強:120頁PRD找矛盾,它能從第37頁和第89頁揪出功能描述不一致。但200萬token上下文視窗虛標嚴重,前100頁的內容記得,後面就開始忘。 -
珍珠699—花200刀開了Max套餐,測了四小時撞上了額度牆。高強度模式下token消耗像喝水,一個複雜重構任務吃了十幾萬token,這也太貴了。 -
Maria_MartinezII57—我覺得4.8的「誠實」有點表演性質。它更願意說我不確定是因為被訓練成「坦白是好事」,而不是真的具備判斷力。有一次它編造了一段效能資料,被拆穿後才認錯。 -
SophiaBennett_2021133—試了一下Effort Control,高速檔和低速檔差距太大了,高速編碼評分62,低速直接掉到42。實用不實用另說,至少給了使用者選擇權。 -
sifvjehpca—我覺得大家忽略了4.8的一個重要訊號:Anthropic在把Claude從聊天模型變成工作流系統。模型不是拿來聊天的,是拿來幹活、拆任務、調子agent、自檢、彙總結論的。下一步就是Mythos全面開放。 -
DiamondHandsJackson—用 Opus 4.8 跑了一週生產程式碼,複雜多檔案重構明顯比 4.7 穩,少了很多「假裝改完」的情況。 -
BlockKi_ng—4.8工程能力拉滿,互動體驗拉胯。一句話總結:幹活的水平一流,聊天的水平九流。選它之前先想清楚你到底要它幹什麼。 -
w7ruj1q7v—用4.8兩週的真實感受:能力提升集中在長上下文保持和多步推理,但「邊際收益遞減」越來越明顯。快速模式降價才是真香,便宜了三分之二還能跑2.5倍速。 -
Stephanie_White_77—連續用了4.8一個月,最大的變化是習慣了它的「說話方式」。適應之後確實順手,但新使用者上手門檻真的高。模型越來越強,用起來卻越來越累,這個趨勢要警惕。 -
MangalaShet—Opus 4.8適合幹大活但不適合日常。搞程式碼庫遷移、長文件分析、複雜推理這些確實頂。日常的簡單問答、改寫還是回去用Sonnet,省錢省心。說白了就是一個專家級工具,專供那5%需要深度分析場景的人用,剩下95%的場景用不上它那些額外能力。 -
trueJudahUltee_88—fast mode 真香,2.5 倍速度基本感覺不到思考卡頓,寫小指令碼時回得飛快。 -
hxfmq—部署在 Bedrock 上預設 1M 上下文,長程 agent 工作流跑得很順,配合記憶工具跨會話存資訊,基本能自己推進幾小時的複雜任務不用人盯著。就是 4.8 作為推理模型 token 燒得猛,賬單要盯緊。 -
Patricia_Gray_2021—Dynamic Workflows太猛了,讓Claude Code自己寫編排指令碼、並行拉起幾十個子agent幹活最後彙總驗證。做了一次跨50萬行程式碼的依賴升級,基本沒翻車,省了我至少兩週的人工。 -
江睿—4.8那個「努力程度控制」就是個噱頭,我測了三個檔位沒感覺出明顯差異。官方說high檔最好,那就預設high唄,加個旋鈕顯得功能多。而且真正的問題是,開到max級思考時token燒得太快,Max套餐四小時就撞上限,這體驗太差了。