Sakana AI Fugu Ultra

Sakana AI 发布的旗舰级多智能体编排基础模型,以单一 API 调度全球前沿模型、无需依赖单一供应商即可获得前沿性能

深度报告

  • Sakana AI Fugu Ultra 是日本 AI 实验室 Sakana AI 于 2026 年 6 月 22 日发布的旗舰级「多智能体编排基础模型」。它不是一个传统意义上靠堆算力训练出来的单体大模型,而是一个被训练来「调度其他模型」的轻量级语言模型。你向一个 OpenAI 兼容 API 端点发出请求,Fugu Ultra 在内部自主决定是直接回答,还是把任务拆解给池中的多个前沿专家模型协同完成,再把结果综合成单一输出返回。Sakana 宣称 Fugu Ultra 在工程、科学、推理等最严苛的基准上已比肩 Anthropic 的 Fable 5 与 Mythos Preview,且因其底层模型池可自由替换、不受美国 AI 出口管制约束,成为「无需依赖单一供应商即可获得前沿性能」的现实路径。

  • Sakana AI 是一家总部位于东京的前沿 AI 研发公司,由 David Ha、Llion Jones 和 Ren Ito 于 2023 年 7 月创立。公司名字源自日语「魚」,寓意鱼群凭借简单规则聚合成有序整体,象征着「集体智能」。Sakana 自创立起就认为,最强 AI 系统不会是孤立的单体,而是协作的生态。团队以 The AI Scientist、进化式模型融合、AB-MCTS、Darwin Gödel Machine 等研究闻名。2025 年 11 月,公司完成约 1.35 亿美元 B 轮融资,投后估值约 26.5 亿美元。Fugu 是继日语大模型 Namazu、自主深度研究智能体 Marlin 之后,Sakana 面向普通开发者推出的第三款用户级产品。

  • Fugu 的本质是一个会「自我递归调用」的编排器。它自身是一个约 70 亿参数的「指挥模型」,本身并不承载前沿能力,而是被训练来学习「何时把任务委托给谁、智能体之间如何沟通、如何把多份工作综合成可靠答案」。一个关键的工程机制是递归自调用:Fugu 在训练中学到自己作为 Agent 池中的一员再次调用自己,实现 test-time scaling。底层模型池完全可交换;若某供应商限制访问,Fugu 会动态路由绕开中断。Fugu 提供两个版本,共用同一个 OpenAI 兼容 API:Fugu 是低延迟默认档,面向日常轻量任务;Fugu Ultra 是旗舰档,针对最困难的多步问题调优,上下文窗口达 100 万 token。

  • Fugu 的技术底座来自两篇被 ICLR 2026 录用的论文。TRINITY 是一个演化出来的轻量级协调器,在多轮对话中为不同 LLM 动态分配 Thinker(思考)、Worker(执行)、Verifier(验证)三种角色,自适应地分派编程、数学、推理与知识任务。Conductor 则通过强化学习自主发现自然语言协调策略,学的不是「哪个模型擅长什么」的静态映射,而是「怎么设计 Agent 之间的沟通模式和聚焦 prompt 能让一群模型合作得更好」。Fugu 把这两篇论文工程化,让编排成为一种可调用的能力,而非写死的工作流。

  • Sakana 在 2026 年 6 月技术报告中公布了一组基准分数,声称 Fugu Ultra 在多项工程、科学、推理基准上「比肩」Fable 5 与 Mythos Preview。代表性数据:SWE-Bench Pro 73.7(对比 Opus 4.8 约 69.2),LiveCodeBench 93.2,GPQA-Diamond 95.5,Terminal Bench 82.1,MRCRv2 93.6(对比 GPT-5.5 94.8),Humanity's Last Exam 50.0。在金融时间序列预测中,Fugu Ultra 取得 +19.43% 的平均组合收益,跑赢所有单一前沿模型。重要提醒:上述分数均为 Sakana 自报、尚未经第三方独立验证,且早期用户实测反馈基准与真实体验之间存在可见落差。

  • Fugu Ultra 采用清晰的分层定价,通过 Sakana AI API 与 OpenRouter 均可调用。按量付费:输入 5 美元 / 百万 token、输出 30 美元 / 百万 token(上下文 ≤ 272K),超过 272K 进入扩展档升至输入 10 美元 / 输出 45 美元,缓存输入 0.50 美元。Fugu 基础档不收固定费率,多 Agent 并发时只按「最贵那一个」计价。订阅制分 Standard 20 美元、Pro 100 美元、Max 200 美元每月,所有档位均可用两个版本,2026 年 7 月底前订阅可获次月免费。Fugu 于 2026 年 4 月 25 日开启 Beta、6 月 22 日 GA;上线时不向欧盟/欧洲经济区提供服务。

  • Fugu Ultra 面向长周期、高难度的专业工作负载。典型场景包括:AI 研究与原论文复现(多小时级研究循环)、网络安全评估(端到端渗透测试,由专精不同漏洞类别的 Agent 分工协作)、专利调查(海量专利库检索比对与归纳)、Kaggle 竞赛(复杂多步优化)、金融时间序列预测与量化(交易基准 +19.43% 平均组合收益)。

  • 尽管技术叙事亮眼,Fugu Ultra 仍有若干边界:基准未独立验证;多 Agent 扇出使延迟显著偏高、对交互式负载不友好;成本因 token 总消耗远高于单模型而不可预测;可观测性削弱,让渡了部分「哪个系统产出哪个答案」的控制权;用 Fugu 降低供应商依赖本质是把依赖转移到 Sakana 编排器上——是权衡而非逃离;EU/EEA 不可用,恰是主权 AI 叙事最想争取的那类买家。

  • Fugu 更大的信号在于「模型编排作为产品」已成为一个真实品类,与聚合式路由、自建框架、模型厂商内嵌动态工作流并列。在 AI 进步长期由暴力规模驱动之后,Sakana 提出「编排作为一种新的扩展维度」——不必再靠堆算力,而是由集体智能的调度撬动性能跃升。叠加地缘政治现实(Fable/Mythos 受出口管制、访问可一夜消失),Fugu 把「可替换模型池 + 动态绕开中断」包装成针对关键基础设施、金融与政务的「AI 主权」弹性蓝图。Sakana 总结:「最强的 AI 系统不会是孤立的单体,而是协作的生态。」

用户评论

  • 头像
    BruceAlvarez520
    Fugu Ultra 输出 token 30 美金的单价不便宜,但多 Agent 并发只按最贵的那个计费、不叠加,算下来比想象中温和,比养一支编排工程团队便宜。

  • 头像
    NatalieOrtiz
    SWE-Bench Pro 73.7 确实猛,但官方分数没第三方验证,建议等大厂复测再上生产,别只看榜单,我们内部现在已经把它当辅助而不是主力。

  • 头像
    fmkogz
    延迟是真的高,我跑个中等复杂度的代码任务等了快十分钟才回来,交互式场景确实不友好,更适合后台批处理或者长周期研究循环,别拿它做实时对话;我们最后把它接到夜间异步队列里,白天只取结果,体感就舒服多了。

  • 头像
    Lilly120_m
    递归自调用这个设计挺妙,子任务不够好就把自己当专家再跑一轮,等于把 test-time scaling 内建进去了,难怪难任务上表现稳,但代价就是耗时和 token 消耗都上去了,我们跑一次深度研究循环光账单就够喝一壶,适合放真正值钱的问题上。

  • 头像
    RPerezIII
    基准和真实体感有落差,我照常用编码测试跑下来没到 Fable 5 的水平,别被海报数字带节奏,拿它做严肃生产前先在自己数据集上压一遍。

  • 头像
    Shirley.Cox
    金融那边拿它做时间序列预测,组合收益跑赢单一前沿模型,这种多步优化确实适合它发挥,比单模型那种一次性回答稳,我们准备接进回测管线试试,先把历史行情喂进去看它在滚动窗口上的稳定性到底如何再决定投入。

  • 头像
    JosephParker
    刚注册试了 Fugu Ultra,把一个跨学科的研究综述丢进去,它自己拆成几路分别调用不同模型再汇总,出来的结构比我自己搭 LangGraph 顺多了,省了大量手写工作流的时间,而且中间每一步的分工逻辑都能在用量明细里看到,对需要审计的团队很友好。

  • 头像
    BryanPrice_2021
    最戳我的是「不受出口管制」这个点,我们合规团队一直头疼单一美国厂商的供应风险,Fugu 把底层池子做成可替换,等于在关键基础设施场景里给了条退路,这点比 benchmark 分数更实际,客户听到「日本公司、模型池可换」明显更放心把核心业务接进来。

  • 头像
    KathleenLewis_Plus
    本质是用 Sakana 这个编排器替代了对单个模型厂商的依赖,是换了个依赖对象,不是彻底自由,但权衡下来对我们要划算,至少不会一夜被断供。

  • 头像
    Thomas_Wood_77
    订阅 Pro 100 刀一个月能跑不少,比按量烧钱安心,团队用着挺合适。

  • 头像
    Carolyn_Cooper_2021
    在东京的团队用着很顺,终于有个本地背景、又不被地缘卡脖子的前沿选项了。

  • 头像
    剑客_17
    和 OpenRouter 不一样,OpenRouter 是你指定模型,Fugu 是一个任务内部调了好几次不同模型,调用方只看到一个答案,心智负担小很多。

  • 头像
    Norman436
    可观测性这块得问清楚,模型替我挑模型之后,到底能不能审计是哪一路产出的答案,关系到我们上合规,销售说有用量明细但粒度还没确认,准备让对方出一份审计报告样例再签合同。

  • 头像
    JasonRivera007
    我们做渗透测试的,拿它跑端到端评估,不同 Agent 分工查不同漏洞类别,报告边界保持得还行,比纯手写脚本省事不少,但关键结论还是人工复核了一遍,毕竟安全评估不能全信自动化输出,把它当第一遍粗筛很合适。

  • 头像
    Betty.Vasquez_66
    EU 地区现在用不了,我们德国办公室只能眼馋,等它过 GDPR 吧,偏偏主权 AI 叙事最想争取的就是我们这类受监管买家。