Mira Murati把橋水「祖傳判斷力」煉成AI,GPT、Gemini、Claude全部翻車
最窄的專有資料才是真正的護城河
前OpenAI CTO Mira Murati創立的Thinking Machines Lab,最近交出了成立一年多以來最重磅的答卷——與橋水基金合作,用後者數十年積累的專家判斷資料訓練了一個金融資訊篩選模型,準確率高達84.66%,讓GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8等前沿模型集體「掛科」。
先看測試結果有多尷尬。研究人員把Opus 4.6、Gemini 3.1 Pro、GPT 5.4等五款旗艦模型拉去做金融文章相關性判斷——判斷一篇文件值不值得投資人花時間看。裸提示下準確率只有45%到50%,幾乎在猜正反面。橋水專家親自寫提示詞,好了一點,衝到74%到78%,但離投資人心裡的80%及格線還差一口氣。
模型不是讀不懂內容——總結文件它們早就做到了行業頂尖。真正卡住它們的地方是「判斷力」:哪條新聞值得看、哪份央行講話暗示了政策轉向、哪封郵件是模板內容、哪部分是一次性分析。這種能力依賴長期在真實市場裡摸爬滾打攢下來的「味覺」,連專家自己都很難完整講明白。
Mira的團隊和橋水一起,從資料清洗入手破局。他們先用非專家資料訓出一個初版模型,把模型預測和標註對不上的樣本挑出來送回橋水專家手裡複核。只把最有爭議的樣本送給最貴的專家時間,成本一下就降下來了。
然後才是訓練配方的精調。基座是通義千問Qwen3-235B,透過GRPO演算法、多工輪詢交錯批處理、CISPO損失函式、線上策略蒸餾等技巧層層疊加,最終準確率84.66%,F1值92.99%。跟表現最好的前沿模型比,錯誤率降低29.8%,推理成本減少13.8倍。
這個結果引發了一個更深層的討論。AI研究者Shawn Chauhan的評論最能點題:「大家還在拼命造最大的模型,真正的優勢正在悄然轉向別處——誰擁有最狹窄、最高質量、別人無法複製的資料集。規模從來不是護城河,專有資料才是。」
橋水拿得出手的資料,是幾十年真金白銀驗證過的判斷記錄外加一條能持續產生新標籤的專家反饋閉環。一般公司根本沒有這種東西。
這也給整個AI行業提了個醒:在很多垂直場景裡,用不上一個更大的通用模型。誰能持續產生高質量、別人複製不了的判斷資料,誰就握著新的護城河。律師事務所可以把資深合夥人判斷合同條款風險的經驗蒸餾出來,藥企可以把科學家篩選文獻的直覺教給模型——前提都得先有一群真正知道「什麼該被優先看」的專家。
Mira Murati的原話擺在那兒:專家改進AI,AI再反過來賦能專家。這場「雙人腳踏車」,才剛剛開始騎。