Claude Opus 4.7
Anthropic釋出的旗艦大語言模型,在高階軟體工程和視覺理解方面實現顯著提升
深度報告
-
Claude Opus 4.7 是 Anthropic 於2026年4月16日釋出的旗艦大語言模型,在高階軟體工程、視覺理解和指令遵循方面實現顯著提升。該模型支援更高解析度影象處理(最高2576畫素),定價與 Opus 4.6 保持一致(輸入$5/百萬tokens,輸出$25/百萬tokens)。然而,釋出後使用者評價兩極分化,部分使用者反饋模型出現效能倒退,主要體現在輸出tokens增加和響應變得冗長。
-
Claude Opus 4.7 由 AI 領域明星公司 Anthropic 於2026年4月16日釋出。新版本距上一次模型升級僅間隔兩個月,與該公司此前的更新節奏保持一致。Anthropic 同時在研發更為強大的 Mythos「神話」模型,該模型目前僅供一小撮頂級機構先行試用,尋找應對「AI網路浩劫」的破解之道,短期內恐無緣公開市場。 Anthropic 表示,Claude Opus 4.7 與 Mythos 存在全方位的能力差距。Opus 4.7 是面向開發者和程式設計愛好者的高階模型,主打高階軟體開發能力。
-
高階軟體工程能力:Opus 4.7 在高階軟體工程領域實現了顯著進步。在複雜編碼任務、長時間執行的多步驟工作流中表現尤為出色。新版本更善於嚴格遵循指令,能夠在輸出前驗證自己的答案是否正確,處理需要深入推理的困難編碼任務時更加得心應手。 在專業評測中,Opus 4.7 在 GDPval-AA 測試中展現領先第二名79分的優勢,幻覺率下降25個百分點至36%。這種改進得益於模型更傾向於承認知識盲區而非編造答案。長文字處理能力也獲得提升,在100萬token上下文的 MRCR v2 測試中,新版本展現出更強的資訊檢索準確性。 增強的視覺能力:新版本在視覺能力上提升顯著,支援更高解析度影象處理,最高可達2576畫素(約375萬畫素),相比前代提升超過3倍。這使得模型能夠更準確地理解化學結構、複雜技術圖表等內容,在介面設計、資料視覺化等任務中展現更高品味。 指令遵循與安全性:Opus 4.7 在指令遵循方面有了顯著提升,就像一隻訓練有素的工作犬,能夠更精準地執行命令。模型內建網路安全防護機制,能夠自動檢測和阻止惡意網路安全請求,同時支援漏洞研究、滲透測試、紅隊演練等合法網路安全工作。 與前代版本對比:相比 Opus 4.6,新版本的主要改進包括:視覺解析度提升3倍以上、指令遵循一致性增強、長任務穩定性提高、專業輸出品味提升。
-
Claude Opus 4.7 的定價與 Opus 4.6 保持一致,每百萬輸入 tokens 收費5美元,每百萬輸出 tokens 收費25美元。定價相同意味著使用者可以以同樣成本獲得新版本的能力提升。 不過,有使用者反饋新版本產生更多輸出 tokens,在較高努力級別下會產生更多冗長回覆,實際使用成本可能高於前代。使用者遷移時需要注意提示詞可能需要調整,因為新版本的指令遵循能力更強,原來為早期模型設計的提示可能產生不同結果。 可用平臺:Anthropic API(模型ID:claude-opus-4-7)、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry、Claude Pro / Max / Team / Enterprise 訂閱方案
-
部分專業評測對 Opus 4.7 給出積極評價。在權威基準測試中,Opus 4.7 展現出的優勢顯著,跑分表現領先。視覺能力提升獲得認可,在生成更高質量的介面、幻燈片等方面得到讚賞。幻覺率的下降被認為是重要改進,模型更傾向於承認知識盲區而非編造答案。 然而,釋出後使用者評價出現兩極分化。在 Reddit 的 ClaudeAI 社群和 Hacker News 上,大量使用者反饋 Opus 4.7 出現效能嚴重倒退,主要問題包括: 輸出冗長:新版本變得非常「線嗦」,回覆中新增大量無用解釋,導致 token 消耗大幅增加 幻覺問題:雖然官方聲稱幻覺率下降,但使用者反饋在計算密集型任務時充滿不易察覺的危險幻覺 懶惰傾向:使用者反映模型變得更加「懶惰」,不願意深入思考複雜問題 價格感受:雖然定價未變,但因輸出 token 增加,使用者感覺「漲價了50%」 大量老使用者呼籲 Anthropic 「還我4.6」,這表明新版本的實際體驗與官方宣傳存在落差。
-
Anthropic 最近幾個月原本處在一段少見的高光期,Claude Code 和 Claude Cowork 的能力提升明顯拉高了外界對 Anthropic 工程能力的評價。Claude 一直是使用者心中「最會寫」的模型之一,甚至在與美國國防部相關爭議引發關注後,Claude 一度衝上 App Store 下載榜首。 然而,Opus 4.7 的釋出讓外界對 Anthropic 的評價出現分歧。一方面,官方基準測試資料確實亮眼;另一方面,使用者實際體驗與跑分存在明顯差距,這種「跑分冠軍」與「使用者翻車」的反差值得深思。
-
營銷與實際差距:官方宣傳的三大升級在實測中遭到質疑,使用者反饋與官方承諾存在落差 幻覺問題:儘管基準測試顯示幻覺率下降,但使用者在實際使用中仍遇到不易察覺的錯誤資訊 成本問題:雖然單位定價未變,但輸出 token 增加導致實際使用成本上升 版本回退需求:大量使用者希望能夠回退到 Opus 4.6,反映出對新版本效能的認可度不足
-
適合誰:需要處理複雜長時間執行任務的開發者,對視覺理解有高要求的多模態應用場景,需要嚴格指令遵循的企業級應用,法律文件分析、生命科學專利工作流等專業領域。 不適合誰:追求簡潔高效回覆的重度使用者,對成本敏感的專案,期望獲得與 Opus 4.6 類似體驗的老使用者。 替代方案:如果對 Opus 4.7 不滿意,可以考慮使用 Opus 4.6 或等待後續版本更新。Anthropic 的 Sonnet 模型也是價效比不錯的選擇。
-
Claude Opus 4.7 在技術指標上實現了顯著提升,官方跑分表現亮眼,但實際使用者體驗與官方宣傳存在明顯落差。使用者評價兩極分化明顯,部分使用者甚至懷念前代版本。對於企業使用者,建議先進行小規模測試再決定是否遷移。對於個人開發者,可以根據具體使用場景選擇合適的模型版本。
使用者評論
-
Amber.LongX—用了一週 Opus 4.7,程式碼能力確實強了,但輸出太長了,一張口就是一大段話,看得累死了。 -
CarlHarris_2024241—快把 4.6 還給我!4.7 太懶了,根本不願意深入思考複雜問題,給個任務就糊弄。 -
EdvinRøise—實測幻覺比 4.6 還嚴重,做數學計算時一堆不易察覺的錯誤,警惕啊。 -
RalphHart_Plus—價格沒變但輸出 token 翻了快一倍,實際成本漲了 50%,套路太深了。 -
Andrea_MooreSr77—程式設計能力是真強,SWEBench Pro 從 53.4% 幹到 64.3%,超越 GPT-5.4 了。 -
MIste—視覺能力確實提升了 3 倍,看圖更準了,這波沒得說。 -
EMkin—指令遵循太準了,我讓它跳過某一步它居然照做了,換以前早自動給我補上了。 -
Eugene_Baker_2022—cybersecurity 功能好評,自動攔截惡意請求,安全團隊狂喜。 -
PDiazIII—用 Opus 4.7 跑了個大專案,一下午吃了 100 刀的 token,心疼。 -
Jean821—生成程式碼質量確實高,但能不能不要每次都吧啦吧啦解釋一大堆。 -
PDiaz_7715—100 萬 token 上下文的 MRCR v2 測試表現更強了,長文字處理確實有提升。 -
Douglas839_m—幻覺率下降到這個程度已經很牛了,至少它會承認自己不懂。 -
Aaron.HallZ—視覺解析度提到 2576 畫素,看技術圖表終於清楚了,感動。 -
GAbak—4.7 釋出了,評分看上去很猛,實際用起來emmm...你們懂的。 -
DorothyYoung007—和 Mythos 差距還是太大了,Mythos 才是親兒子,4.7 喝湯。 -
JacobPerez_77—太香了!程式設計能力直接上了一個檔次,這波升級血賺。 -
xMircoFreitas_dev—測試了一下,GDPval-AA 領先第二名 79 分,強得一批。 -
WhaleAlertHall—Opus 4.7 yyds!新模型太強了,複雜任務處理得心應手。 -
DrNurdanAkgül_88—釋出當天就上手了,整體滿意,就是 token 消耗比 4.6 猛。