清华与腾讯联合提出GPS方法,把大模型训练成本砍掉69%

用「小模型指挥大模型」省钱

2026-07-12 13:18

大模型训练最烧钱的地方,往往不是模型本身,而是那天文数字般的Rollout——也就是让模型一遍遍生成、试错、打分所消耗的算力。7月12日披露的进展里,清华大学与腾讯联合提出的GPS方法,正是冲着这块成本去的:它用小模型去「指挥」大模型做强化学习后训练,最高能把Rollout成本压降约69%。这项研究已被ICML 2026接收。

清华大学
清华大学

把思路拆开看,GPS的聪明之处在于「不当家不知柴米贵」的反转。传统后训练里,大模型既要自己生成、又要自己被评估,全程都是最贵的那个在干活。GPS改成让一个更轻量的小模型来调度和评判,把大模型从重复跑腿里解放出来,只在关键步骤出手——等于用廉价劳动力指挥昂贵专家,整体账单自然塌下来一大截。

这事为什么重要?眼下AI算力的供需紧得像一根快绷断的弦,训练开销早就是头部实验室最硬的约束。同样一笔预算,若能换回更大幅度的能力爬升,意味着中小团队也有机会挤进前沿模型竞争的牌桌,而不是被算力门槛挡在门外。

其实GPS不是孤例,它踩中的是当下最热门的一条主线:用更聪明的「组织方式」替代纯粹的堆算力。无论是模型蒸馏、混合专家(MoE),还是把训练流程拆开由不同规模模型分工,方向都一致——在算力天花板肉眼可见的今天,谁能把每一分算力用在刀刃上,谁就握住了下一阶段的入场券。清华与腾讯这手「小指挥大」,只是把这条逻辑推到了后训练环节。

把这层和更大的图景连起来,中国AI产业今年的势头确实猛。国家发改委透露,去年我国人工智能相关产业规模已超万亿,今年增速预计超过30%,AI手机、AI电脑的销量有望首次超过非AI产品。高盛近期一份50页报告也判断,中国开源大模型的智能性能已逼近全球顶尖的专有模型。

说到底,对咱们普通人的实在意义是:训练成本往下掉,模型迭代就会往上快。当「更便宜地造更聪明的模型」从口号变成可复现的方法,下一次你用的那个AI助手,大概率既更强、又更便宜——而这,才是技术红利真正落到口袋里的样子。