Mira Murati把桥水「祖传判断力」炼成AI,GPT、Gemini、Claude全部翻车
最窄的专有数据才是真正的护城河
前OpenAI CTO Mira Murati创立的Thinking Machines Lab,最近交出了成立一年多以来最重磅的答卷——与桥水基金合作,用后者数十年积累的专家判断数据训练了一个金融信息筛选模型,准确率高达84.66%,让GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8等前沿模型集体「挂科」。
先看测试结果有多尴尬。研究人员把Opus 4.6、Gemini 3.1 Pro、GPT 5.4等五款旗舰模型拉去做金融文章相关性判断——判断一篇文档值不值得投资人花时间看。裸提示下准确率只有45%到50%,几乎在猜正反面。桥水专家亲自写提示词,好了一点,冲到74%到78%,但离投资人心里的80%及格线还差一口气。
模型不是读不懂内容——总结文档它们早就做到了行业顶尖。真正卡住它们的地方是「判断力」:哪条新闻值得看、哪份央行讲话暗示了政策转向、哪封邮件是模板内容、哪部分是一次性分析。这种能力依赖长期在真实市场里摸爬滚打攒下来的「味觉」,连专家自己都很难完整讲明白。
Mira的团队和桥水一起,从数据清洗入手破局。他们先用非专家数据训出一个初版模型,把模型预测和标注对不上的样本挑出来送回桥水专家手里复核。只把最有争议的样本送给最贵的专家时间,成本一下就降下来了。
然后才是训练配方的精调。基座是通义千问Qwen3-235B,通过GRPO算法、多任务轮询交错批处理、CISPO损失函数、在线策略蒸馏等技巧层层叠加,最终准确率84.66%,F1值92.99%。跟表现最好的前沿模型比,错误率降低29.8%,推理成本减少13.8倍。
这个结果引发了一个更深层的讨论。AI研究者Shawn Chauhan的评论最能点题:「大家还在拼命造最大的模型,真正的优势正在悄然转向别处——谁拥有最狭窄、最高质量、别人无法复制的数据集。规模从来不是护城河,专有数据才是。」
桥水拿得出手的数据,是几十年真金白银验证过的判断记录外加一条能持续产生新标签的专家反馈闭环。一般公司根本没有这种东西。
这也给整个AI行业提了个醒:在很多垂直场景里,用不上一个更大的通用模型。谁能持续产生高质量、别人复制不了的判断数据,谁就握着新的护城河。律师事务所可以把资深合伙人判断合同条款风险的经验蒸馏出来,药企可以把科学家筛选文献的直觉教给模型——前提都得先有一群真正知道「什么该被优先看」的专家。
Mira Murati的原话摆在那儿:专家改进AI,AI再反过来赋能专家。这场「双人自行车」,才刚刚开始骑。