Sakana AI Fugu Ultra

Sakana AI 釋出的旗艦級多智慧體編排基礎模型,以單一 API 排程全球前沿模型、無需依賴單一供應商即可獲得前沿效能

深度報告

  • Sakana AI Fugu Ultra 是日本 AI 實驗室 Sakana AI 於 2026 年 6 月 22 日釋出的旗艦級「多智慧體編排基礎模型」。它不是一個傳統意義上靠堆算力訓練出來的單體大模型,而是一個被訓練來「排程其他模型」的輕量級語言模型。你向一個 OpenAI 相容 API 端點發出請求,Fugu Ultra 在內部自主決定是直接回答,還是把任務拆解給池中的多個前沿專家模型協同完成,再把結果綜合成單一輸出返回。Sakana 宣稱 Fugu Ultra 在工程、科學、推理等最嚴苛的基準上已比肩 Anthropic 的 Fable 5 與 Mythos Preview,且因其底層模型池可自由替換、不受美國 AI 出口管制約束,成為「無需依賴單一供應商即可獲得前沿效能」的現實路徑。

  • Sakana AI 是一家總部位於東京的前沿 AI 研發公司,由 David Ha、Llion Jones 和 Ren Ito 於 2023 年 7 月創立。公司名字源自日語「魚」,寓意魚群憑藉簡單規則聚合成有序整體,象徵著「集體智慧」。Sakana 自創立起就認為,最強 AI 系統不會是孤立的單體,而是協作的生態。團隊以 The AI Scientist、進化式模型融合、AB-MCTS、Darwin Gödel Machine 等研究聞名。2025 年 11 月,公司完成約 1.35 億美元 B 輪融資,投後估值約 26.5 億美元。Fugu 是繼日語大模型 Namazu、自主深度研究智慧體 Marlin 之後,Sakana 面向普通開發者推出的第三款使用者級產品。

  • Fugu 的本質是一個會「自我遞迴呼叫」的編排器。它自身是一個約 70 億引數的「指揮模型」,本身並不承載前沿能力,而是被訓練來學習「何時把任務委託給誰、智慧體之間如何溝通、如何把多份工作綜合成可靠答案」。一個關鍵的工程機制是遞迴自呼叫:Fugu 在訓練中學到自己作為 Agent 池中的一員再次呼叫自己,實現 test-time scaling。底層模型池完全可交換;若某供應商限制訪問,Fugu 會動態路由繞開中斷。Fugu 提供兩個版本,共用同一個 OpenAI 相容 API:Fugu 是低延遲預設檔,面向日常輕量任務;Fugu Ultra 是旗艦檔,針對最困難的多步問題調優,上下文視窗達 100 萬 token。

  • Fugu 的技術底座來自兩篇被 ICLR 2026 錄用的論文。TRINITY 是一個演化出來的輕量級協調器,在多輪對話中為不同 LLM 動態分配 Thinker(思考)、Worker(執行)、Verifier(驗證)三種角色,自適應地分派程式設計、數學、推理與知識任務。Conductor 則透過強化學習自主發現自然語言協調策略,學的不是「哪個模型擅長什麼」的靜態對映,而是「怎麼設計 Agent 之間的溝通模式和聚焦 prompt 能讓一群模型合作得更好」。Fugu 把這兩篇論文工程化,讓編排成為一種可呼叫的能力,而非寫死的工作流。

  • Sakana 在 2026 年 6 月技術報告中公佈了一組基準分數,聲稱 Fugu Ultra 在多項工程、科學、推理基準上「比肩」Fable 5 與 Mythos Preview。代表性資料:SWE-Bench Pro 73.7(對比 Opus 4.8 約 69.2),LiveCodeBench 93.2,GPQA-Diamond 95.5,Terminal Bench 82.1,MRCRv2 93.6(對比 GPT-5.5 94.8),Humanity's Last Exam 50.0。在金融時間序列預測中,Fugu Ultra 取得 +19.43% 的平均組合收益,跑贏所有單一前沿模型。重要提醒:上述分數均為 Sakana 自報、尚未經第三方獨立驗證,且早期使用者實測反饋基準與真實體驗之間存在可見落差。

  • Fugu Ultra 採用清晰的分層定價,透過 Sakana AI API 與 OpenRouter 均可呼叫。按量付費:輸入 5 美元 / 百萬 token、輸出 30 美元 / 百萬 token(上下文 ≤ 272K),超過 272K 進入擴充套件檔升至輸入 10 美元 / 輸出 45 美元,快取輸入 0.50 美元。Fugu 基礎檔不收固定費率,多 Agent 併發時只按「最貴那一個」計價。訂閱制分 Standard 20 美元、Pro 100 美元、Max 200 美元每月,所有檔位均可用兩個版本,2026 年 7 月底前訂閱可獲次月免費。Fugu 於 2026 年 4 月 25 日開啟 Beta、6 月 22 日 GA;上線時不向歐盟/歐洲經濟區提供服務。

  • Fugu Ultra 面向長週期、高難度的專業工作負載。典型場景包括:AI 研究與原論文復現(多小時級研究迴圈)、網路安全評估(端到端滲透測試,由專精不同漏洞類別的 Agent 分工協作)、專利調查(海量專利庫檢索比對與歸納)、Kaggle 競賽(複雜多步最佳化)、金融時間序列預測與量化(交易基準 +19.43% 平均組合收益)。

  • 儘管技術敘事亮眼,Fugu Ultra 仍有若干邊界:基準未獨立驗證;多 Agent 扇出使延遲顯著偏高、對互動式負載不友好;成本因 token 總消耗遠高於單模型而不可預測;可觀測性削弱,讓渡了部分「哪個系統產出哪個答案」的控制權;用 Fugu 降低供應商依賴本質是把依賴轉移到 Sakana 編排器上——是權衡而非逃離;EU/EEA 不可用,恰是主權 AI 敘事最想爭取的那類買家。

  • Fugu 更大的訊號在於「模型編排作為產品」已成為一個真實品類,與聚合式路由、自建框架、模型廠商內嵌動態工作流並列。在 AI 進步長期由暴力規模驅動之後,Sakana 提出「編排作為一種新的擴充套件維度」——不必再靠堆算力,而是由集體智慧的排程撬動效能躍升。疊加地緣政治現實(Fable/Mythos 受出口管制、訪問可一夜消失),Fugu 把「可替換模型池 + 動態繞開中斷」包裝成針對關鍵基礎設施、金融與政務的「AI 主權」彈性藍圖。Sakana 總結:「最強的 AI 系統不會是孤立的單體,而是協作的生態。」

使用者評論

  • 頭像
    BruceAlvarez520
    Fugu Ultra 輸出 token 30 美金的單價不便宜,但多 Agent 併發只按最貴的那個計費、不疊加,算下來比想象中溫和,比養一支編排工程團隊便宜。

  • 頭像
    NatalieOrtiz
    SWE-Bench Pro 73.7 確實猛,但官方分數沒第三方驗證,建議等大廠複測再上生產,別隻看榜單,我們內部現在已經把它當輔助而不是主力。

  • 頭像
    fmkogz
    延遲是真的高,我跑箇中等複雜度的程式碼任務等了快十分鐘才回來,互動式場景確實不友好,更適合後臺批處理或者長週期研究迴圈,別拿它做實時對話;我們最後把它接到夜間非同步佇列裡,白天只取結果,體感就舒服多了。

  • 頭像
    Lilly120_m
    遞迴自呼叫這個設計挺妙,子任務不夠好就把自己當專家再跑一輪,等於把 test-time scaling 內建進去了,難怪難任務上表現穩,但代價就是耗時和 token 消耗都上去了,我們跑一次深度研究迴圈光賬單就夠喝一壺,適合放真正值錢的問題上。

  • 頭像
    RPerezIII
    基準和真實體感有落差,我照常用編碼測試跑下來沒到 Fable 5 的水平,別被海報數字帶節奏,拿它做嚴肅生產前先在自己資料集上壓一遍。

  • 頭像
    Shirley.Cox
    金融那邊拿它做時間序列預測,組合收益跑贏單一前沿模型,這種多步最佳化確實適合它發揮,比單模型那種一次性回答穩,我們準備接進回測管線試試,先把歷史行情喂進去看它在滾動視窗上的穩定性到底如何再決定投入。

  • 頭像
    JosephParker
    剛註冊試了 Fugu Ultra,把一個跨學科的研究綜述丟進去,它自己拆成幾路分別呼叫不同模型再彙總,出來的結構比我自己搭 LangGraph 順多了,省了大量手寫工作流的時間,而且中間每一步的分工邏輯都能在用量明細裡看到,對需要審計的團隊很友好。

  • 頭像
    BryanPrice_2021
    最戳我的是「不受出口管制」這個點,我們合規團隊一直頭疼單一美國廠商的供應風險,Fugu 把底層池子做成可替換,等於在關鍵基礎設施場景裡給了條退路,這點比 benchmark 分數更實際,客戶聽到「日本公司、模型池可換」明顯更放心把核心業務接進來。

  • 頭像
    KathleenLewis_Plus
    本質是用 Sakana 這個編排器替代了對單個模型廠商的依賴,是換了個依賴物件,不是徹底自由,但權衡下來對我們要划算,至少不會一夜被斷供。

  • 頭像
    Thomas_Wood_77
    訂閱 Pro 100 刀一個月能跑不少,比按量燒錢安心,團隊用著挺合適。

  • 頭像
    Carolyn_Cooper_2021
    在東京的團隊用著很順,終於有個本地背景、又不被地緣卡脖子的前沿選項了。

  • 頭像
    劍客_17
    和 OpenRouter 不一樣,OpenRouter 是你指定模型,Fugu 是一個任務內部調了好幾次不同模型,呼叫方只看到一個答案,心智負擔小很多。

  • 頭像
    Norman436
    可觀測性這塊得問清楚,模型替我挑模型之後,到底能不能審計是哪一路產出的答案,關係到我們上合規,銷售說有用量明細但粒度還沒確認,準備讓對方出一份審計報告樣例再籤合同。

  • 頭像
    JasonRivera007
    我們做滲透測試的,拿它跑端到端評估,不同 Agent 分工查不同漏洞類別,報告邊界保持得還行,比純手寫指令碼省事不少,但關鍵結論還是人工複核了一遍,畢竟安全評估不能全信自動化輸出,把它當第一遍粗篩很合適。

  • 頭像
    Betty.Vasquez_66
    EU 地區現在用不了,我們德國辦公室只能眼饞,等它過 GDPR 吧,偏偏主權 AI 敘事最想爭取的就是我們這類受監管買家。