清華與騰訊聯合提出GPS方法,把大模型訓練成本砍掉69%
用「小模型指揮大模型」省錢
大模型訓練最燒錢的地方,往往不是模型本身,而是那天文數字般的Rollout——也就是讓模型一遍遍生成、試錯、打分所消耗的算力。7月12日披露的進展裡,清華大學與騰訊聯合提出的GPS方法,正是衝著這塊成本去的:它用小模型去「指揮」大模型做強化學習後訓練,最高能把Rollout成本壓降約69%。這項研究已被ICML 2026接收。

把思路拆開看,GPS的聰明之處在於「不當家不知柴米貴」的反轉。傳統後訓練裡,大模型既要自己生成、又要自己被評估,全程都是最貴的那個在幹活。GPS改成讓一個更輕量的小模型來排程和評判,把大模型從重複跑腿裡解放出來,只在關鍵步驟出手——等於用廉價勞動力指揮昂貴專家,整體賬單自然塌下來一大截。
這事為什麼重要?眼下AI算力的供需緊得像一根快繃斷的弦,訓練開銷早就是頭部實驗室最硬的約束。同樣一筆預算,若能換回更大幅度的能力爬升,意味著中小團隊也有機會擠進前沿模型競爭的牌桌,而不是被算力門檻擋在門外。
其實GPS不是孤例,它踩中的是當下最熱門的一條主線:用更聰明的「組織方式」替代純粹的堆算力。無論是模型蒸餾、混合專家(MoE),還是把訓練流程拆開由不同規模模型分工,方向都一致——在算力天花板肉眼可見的今天,誰能把每一分算力用在刀刃上,誰就握住了下一階段的入場券。清華與騰訊這手「小指揮大」,只是把這條邏輯推到了後訓練環節。
把這層和更大的圖景連起來,中國AI產業今年的勢頭確實猛。國家發改委透露,去年我國人工智慧相關產業規模已超萬億,今年增速預計超過30%,AI手機、AI電腦的銷量有望首次超過非AI產品。高盛近期一份50頁報告也判斷,中國開源大模型的智慧效能已逼近全球頂尖的專有模型。
說到底,對咱們普通人的實在意義是:訓練成本往下掉,模型迭代就會往上快。當「更便宜地造更聰明的模型」從口號變成可復現的方法,下一次你用的那個AI助手,大機率既更強、又更便宜——而這,才是技術紅利真正落到口袋裡的樣子。