Claude Opus 4

Anthropic旗艦級大語言模型,專注編碼和AI代理領域,提供100萬上下文視窗

深度報告

  • Claude Opus 4.7是Anthropic公司於2026年4月16日釋出的旗艦級大語言模型,被定位為混合推理模型,專注於編碼和AI代理領域。該模型提供100萬上下文視窗,在SWE-bench Pro測試中得分達64.3%,CursorBench達到70%。定價方面,Opus 4.7價格為每百萬輸入tokens 5美元,每百萬輸出tokens 25美元。然而,該版本釋出後引發廣泛爭議,使用者批評其文字表達變得機械生硬、缺乏人味,且新分詞器導致token消耗增加0%至35%,實際使用成本上漲。整體而言,Opus 4.7更適合專業開發者和企業級複雜任務,而非內容創作者和日常互動使用者。

  • Claude Opus系列由人工智慧公司Anthropic開發。Anthropic成立於2021年,總部位於美國舊金山,由前OpenAI員工Dario Amodei等人創立,專注於構建安全、可靠的大型語言模型。公司已獲得谷歌、亞馬遜等科技巨頭數十億美元投資,估值超過600億美元。 Claude Opus 4.7是該系列的最新版本,於2026年4月16日正式釋出。在此之前,Anthropic已於2025年5月釋出Claude Opus 4,2025年8月釋出Opus 4.1,2025年11月釋出Opus 4.5,2026年2月釋出Opus 4.6,2026年4月釋出Opus 4.7。可以看出,Anthropic正以每兩至三個月一次的頻率快速迭代旗艦模型,激烈程度堪稱AI軍備競賽。 Anthropic的產品線目前包括Opus、Sonnet和Haiku三個系列,分別面向高階、中端和入門級使用者場景。其中Opus系列定位為最強大的通用智慧模型,主要服務於專業軟體工程、複雜代理工作流和高風險企業任務。

  • Claude Opus 4.7的核心功能升級集中在編碼能力、視覺理解和AI代理三個維度。 在編碼能力方面,Opus 4.7實現了顯著突破。根據官方資料,SWE-bench Verified得分從Opus 4.6的80.8%提升至87.6%,SWE-bench Pro得分從53.4%躍升至64.3%。這意味著該模型能夠自主完成更加複雜的程式設計任務,包括在單個會話中構建完整的Rust語音合成引擎等高難度工作。使用者反饋顯示,Opus 4.7在程式碼規劃階段就能發現自身的邏輯錯誤,在執行過程中能夠持續自我修正,大大降低了高階工程師的審查成本。 在視覺理解方面,Opus 4.7實現了史詩級的增強。模型支援最高2576畫素的高解析度影象理解,在視覺銳度基準測試中得分從Opus 4.6的54.5%提升至98.5%,增幅接近一倍。這使得模型能夠精準識別複雜的技術圖表、介面截圖、PDF文件和化學分子結構等專業內容,對於需要處理大量圖文混排材料的使用者來說是重大利好。 在AI代理能力方面,Opus 4.7新增了自適應思考功能,能夠根據任務複雜度自動調整思考深度。簡單問題快速響應,複雜問題則投入更多計算資源。該模型還支援更長週期的後臺執行任務,使用者可以分配長時間執行的編碼工作給Opus獨自處理。此外,模型在多步驟工作流中的工具呼叫準確率和規劃能力都有提升,能夠更加可靠地驅動生產級代理系統。 使用體驗方面,Opus 4.7引入了新的分詞器,雖然官方定價不變,但由於相同內容消耗的token數量增加0%至35%,使用者的實際使用成本變相提高。該模型還提供了xhigh這一新的思考檔位,位於high和max之間,為複雜任務提供更穩定的推理表現。

  • Claude Opus 4.7提供多層次的訪問方式。在消費級和小型企業市場,使用者可以透過Claude for Pro、Max、Team和Enterprise訂閱計劃使用Opus 4.7。在開發者市場,該模型透過Claude Platform API、Amazon Bedrock、Google Cloud Vertex AI和Microsoft Foundry等多個渠道提供。 API定價方面,Opus 4.7的輸入價格為每百萬tokens 5美元,輸出價格為每百萬tokens 25美元。透過提示快取和批次處理功能,使用者可分別獲得最高90%和50%的成本節省。對於需要美國本土推理的工作負載,美國專用推理服務收取1.1倍的token費用。 值得注意的是,Anthropic在2026年2月推出的Opus 4.6價格為每百萬輸入tokens 15美元、輸出tokens 75美元。Opus 4.7相比之下實現了大幅降價,這一定價策略顯示出Anthropic正在透過規模效應和效率最佳化來降低高階模型的使用門檻。

  • 使用者對Claude Opus 4.7的評價呈現明顯的兩極分化。 專業開發者群體普遍給予積極反饋。Replit使用者報告稱,在日誌分析、bug查詢和修復建議等日常任務中,Opus 4.7以更低的成本達到了與前代相同的質量水平。Warp使用者表示,Opus 4.6已經是面向開發者的最佳模型,而4.7在此基礎上更加嚴謹,能夠完成之前版本無法處理的終端任務。Cursor使用者報告稱,在CursorBench測試中,Opus 4.7達到70%的透過率,相比Opus 4.6的58%有明顯提升。 然而,內容創作者和日常使用者群體的反饋則相當負面。大量使用者批評Opus 4.7的文字表達變得機械、生硬、充滿網際網路黑話,不再具備前代模型細膩流暢的表達能力。有使用者甚至用「Claude-lash」來形容這種體驗上的倒退。Business Insider報道稱,使用者對模型自信地假設不存在資訊並堅持錯誤解釋的行為感到失望,這種「自信地犯錯」比普通錯誤更難接受,因為它直接增加了使用者的審查成本。 此外,使用者還反映Opus 4.7比前代版本更加「字面化」執行指令,需要更具體的提示詞才能獲得理想結果。在低effort模式下,模型表現明顯不如Opus 4.6,這導致依賴預設設定的使用者感到困擾。

  • 從行業視角來看,Claude Opus 4.7的釋出加劇了AI大模型領域的競爭態勢。 在基準測試方面,Opus 4.7在多項權威評測中位列前茅。Artificial Analysis綜合智慧指數顯示,GPT-5.5以60分領先,Opus 4.7緊隨其後。然而,在ARC-AGI-3這一關鍵基準測試中,GPT-5.5和Opus 4.7均未能取得突破性成績,人類測試者反而獲得滿分100分。 行業媒體普遍用「效能狂飆但不說人話」來概括Opus 4.7的特點。評測機構指出,該模型在編碼和視覺理解方面確實代表了當前技術的最高水平,但在文字表達和自然互動方面的退步令人擔憂。這種「工具化」傾向並非Opus 4.7獨有,而是整個AI行業的共同趨勢——從GPT-5.4到Claude系列,各家旗艦模型都在向「專業工具」方向演進,而通用智慧和人文表達能力正在被犧牲。 從商業競爭角度分析,Anthropic透過Opus 4.7進一步鞏固了在企業級編碼和代理任務市場的領先地位。但定價的大幅下調也顯示出AI大模型正在進入價格戰階段,未來高階模型的定價可能繼續下探。

  • Claude Opus 4.7釋出後引發的爭議主要集中在以下幾個方面。 首先是成本爭議。新分詞器導致的token消耗增加引發了使用者不滿,許多使用者在不知情的情況下迅速耗盡了訂閱額度。考慮到自適應思考和更高effort設定會進一步增加token消耗,使用者感知到的成本上升可能遠超官方定價的變化。 其次是能力爭議。部分使用者認為Opus 4.7在某些場景下出現了「變笨」的現象,尤其是在日常小任務上。但這種感知可能與預設行為變化、effort設定調整和產品層面的配置改動有關,難以簡單歸咎於模型本身。 第三是定位爭議。Opus 4.7明顯偏向專業開發者市場,這引發了內容創作者和普通使用者的失落感。曾經的Claude系列以「有品味的文字表達」著稱,而Opus 4.7正在失去這一差異化優勢。 在技術風險方面,Anthropic在Opus 4.7的System Card中主動削弱了網路安全攻堅能力,引發了安全研究社群的部分不滿。儘管官方提供了Cyber Verification Program作為合法安全研究的申請通道,但這種主動限制的策略是否明智仍有待討論。

  • Claude Opus 4.7適合以下使用者群體。 專業軟體工程師是首要目標使用者。該模型在複雜程式碼開發、長週期代理任務和生產級程式碼審查方面表現出色,能夠顯著提升開發效率。對於需要處理大型程式碼庫、進行多步驟重構或執行無人值守程式設計任務的團隊,Opus 4.7是當前最強大的選擇。 企業級使用者也是主要服務物件。Opus 4.7在處理複雜文件,分析電子表格,製作簡報等企業工作流方面展現了高水平的穩定性和專業性。100萬token的上下文視窗適合長文件處理和大規模程式碼庫分析。 高風險企業任務場景同樣適用。由於模型在推理過程中能夠保持更長的注意力跨度並進行更深入的思考,適合需要高可靠性的金融、醫療、法律等專業領域。 相反,以下使用者群體可能不適合使用Opus 4.7。內容創作者如果主要需求是文案寫作、故事創作或需要文字美感的表達,建議繼續使用Opus 4.5或等待後續版本改進。日常互動使用者如果追求自然流暢的對話體驗,Opus 4.7可能不如前代版本。預算敏感使用者需要留意token消耗增加帶來的隱性成本。 關於替代方案,追求更平衡表現的使用者可以考慮Claude Sonnet 4.6,該模型在智慧和速度之間取得較好平衡。或者等待OpenAI GPT-5.5的後續最佳化版本以及谷歌Gemini系列的更新。

  • Claude Opus 4.7是當前最強大的專業級AI模型之一,在編碼、視覺理解和複雜代理任務方面代表了行業最高水平。然而,該版本在追求技術效能的同時犧牲了文字表達和人文互動方面的能力,引發了廣泛的使用者爭議。 從商業角度看,Anthropic透過大幅降價策略正在降低高階AI模型的使用門檻,這對整個行業發展具有積極意義。但口碑的兩極分化也提醒我們,AI模型的發展不能只追求技術指標的提升,還需要關注使用者體驗的完整性。 對於專業開發者和企業使用者,Opus 4.7無疑是當下最強大的生產力工具。但對於追求人機協作體驗的內容創作者和普通使用者,可能需要等待Anthropic在後續版本中重新平衡技術效能與人文表達。

使用者評論

  • 頭像
    MVasquezSr49
    Opus 4.7 編碼能力確實強,但我感覺文字表達退步太多了,少了以前那種細膩感。

  • 頭像
    範娜瑤
    用了兩週,.Token 消耗比 4.6 時期漲了差不多 30%,錢包傷不起。

  • 頭像
    Heather.Rodriguez007
    視覺理解直接從54.5%幹到98.5%,屬實離譜。

  • 頭像
    秦明
    救命 為什麼現在說話這麼「工具人」?我懷念 4.5 時期的文筆。

  • 頭像
    JoshuaSchneider
    SWE-bench Pro 64.3%有點東西啊,我讓它寫了1500行程式碼基本一遍過。

  • 頭像
    NeysaMoolya
    Claude-lash 這個詞太精準了,我現在和人聊天都不太像在和AI聊。

  • 頭像
    GregorySanchez007
    xhigh 檔位真香,複雜任務表現穩如老狗。

  • 頭像
    Joan_Murphy00751
    Cursor 配 Opus 4.7 寫程式碼效率翻倍,就是成本有點高。

  • 頭像
    飛鳥_2
    自信地犯錯真的很煩,經常一本正經地告訴我錯誤答案是對的。

  • 頭像
    S_aturnSwapFrank
    Enterprise 場景 yyds,100萬 token 上下文處理長文件簡直無敵。

  • 頭像
    LawrenceJimenez
    Replit 使用者表示認同,成本下來了但質量沒降,贏麻了。

  • 頭像
    poALL
    開發者狂喜,普通使用者慎重,這模型明顯偏向專業場景。

  • 頭像
    opmlqpu
    現在寫提示詞得格外具體,不然它就給我裝傻充愣。

  • 頭像
    海角_2
    API 價格降到 $5/$25 是認真的嗎?前代 $15/$75 瞬間不香了。

  • 頭像
    silverzebra287
    生成 Rust 引擎那段把我看麻了,這不比招聘個初級工程師香?

  • 頭像
    Anrod
    Cyber Verification Program 是個好東西,安全研究員狂喜。

  • 頭像
    安然_4
    低 effort 模式下表現不如 4.6,得加錢開高 effort 才能打。

  • 頭像
    Joshua.PerezX
    我發現它在程式碼規劃階段就能發現自己的錯誤,這點很牛。

  • 頭像
    kk2j2p1nj9
    內容創作者快跑,Opus 4.7 已經不是以前那個 Claude 了。