GPT-5.6 Sol自主训练Luna,AI递归自我改进的时代来了
飞轮已转动
这周AI圈子最大的新闻,毫无疑问是OpenAI的GPT-5.6系列全面开放。三款模型——旗舰版Sol、均衡版Terra、轻量版Luna——从7月9日起全球可用。绝大多数人的目光被两件事吸引:Sol在编程测试Terminal-Bench 2.1上砍下91.9%的分数,直接把Anthropic的Claude Fable 5甩开8个百分点;以及Luna定价低至每百万token输入只要1美元,几乎腰斩了行业的定价基准。但真正让技术圈炸锅的,是一句藏在发布文档角落里的话——群里最小的Luna,是大哥Sol自己训练出来的。
事情远没有表面看起来这么简单。按照OpenAI技术文档披露的细节,Sol在训练Luna的过程中,扮演了「自动化研究员」的角色。它自己去找可用的GPU资源,自己确定训练配置,自己写启动脚本,自己确认任务执行。从头到尾,没有一个人类工程师插手。这在AI行业是一个里程碑式的时刻——过去三年,整个行业的叙事主线一直是「人类训练AI」,我们用更多的数据、更大的算力、更精巧的算法把模型一步步推上智能高峰。但从GPT-5.6开始,叙事主线正在变成「AI训练AI」。
这个概念在安全领域有一个令人不安的学名,叫递归自我改进。当AI强大到能够自主重构、测试、甚至微调自己的下一代模型时,那个被未来学家预言了几十年的飞轮,终于开始转动了。过去训练一个顶级大模型,本质上是一个高度依赖人类智慧的手工作坊:从筛选和清洗数万亿token的训练数据,到设计预训练架构和调整超参数,再到通过人类反馈的强化学习来让模型对齐人类偏好——每一步背后都是数百名顶尖博士数月甚至数年的心血。人力成本占整个训练成本的30%到40%。而人类研究员的精力、判断力和创造力,也成了模型进化的天花板。Sol的训练方式彻底改写了这个链条。它能自主评估海量候选数据的质量和多样性,决定哪些该进训练集、哪些该剔除——这过去需要一个十几人的数据团队干上几个月。它还能自己提出训练策略假设、设计对照实验、跑通完整训练流程并分析结果。过去一个初级研究员一天能跑两三个实验就是极限,现在Sol一天可以并行跑数百个。
OpenAI公布了一组很能说明问题的内部数据。过去半年,公司内部用于代码推理的计算资源增长了100倍,用于智能体任务的token消耗量增长了约22倍。在一套衡量递归自我改进能力的内部评测上,Sol比上一代GPT-5.5高出了16.2分。研究员人均日token产出较GPT-5.5上一轮峰值翻倍以上,单个研究员的pull request和实验数量也大幅上升。这组数字的潜台词很清楚:Sol不仅能自己训练Luna,它还在帮助人类研究员以更快的速度推进研究本身。
更有意思的是竞争对手们的反应。就在GPT-5.6发布的同一天,Anthropic联合创始人公开宣布了一个震动行业的决定:不再招聘初级工程师。他的原话是——过去需要一大群初级研究员做的大规模实验,现在Claude自己就能完成。公司现在的招聘标准是「资深直觉」,只招经验丰富、能做方向性判断的人,不再招执行层。这个表态本身就是对递归自我改进时代最直接的确认。当Anthropic开始用Claude替代初级研究员做实验时,它实际上已经踏上了这条跑道。而从行业数据来看,美国22到25岁软件开发者的就业人数,到2025年中已经比2022年高点下降了将近20%。2026年前两个月,全球科技行业裁员超过15万人,AI连续三个月成为裁员的首要原因,日均974人丢掉饭碗。
把视线拉远一点,真正值得深思的是这件事对中国AI行业的影响。递归自我改进模式的核心是用推理算力换研发效率——让旗舰模型以智能体形式24小时不间断地跑实验、写代码、做评测。OpenAI内部推理算力半年涨100倍的背后,是其坐拥数万张顶级芯片的算力底座。而国内厂商受制于芯片禁令,算力储备本就捉襟见肘,很难支撑如此奢侈的AI研究AI模式。当OpenAI和Anthropic已经在用旗舰模型训练下一代轻量模型时,国内多数公司的主力模型还在追赶GPT-4级别的基础能力。这是一个强者愈强的飞轮——你的旗舰模型越强,它训练出的子模型就越好;子模型越好,反过来又能加速旗舰模型的迭代。一旦飞轮转起来,落后者面临的不是线性差距,而是指数级拉大。一位国内头部大模型公司的技术负责人在匿名采访中坦言:「我们现在还在用人力堆的方式追赶他们的上一代模型,而他们已经开始用AI训练下一代了。」这就像手工缝制衣服的人和全自动流水线的差距,只会越来越大。
往前看,真正的终局问题其实是安全。当AI系统强大到能够自主设计下一代系统时,就会形成一个闭环:AI设计更好的AI,更好的AI设计更好的训练系统,更好的训练系统设计更好的AI。如果这个闭环的迭代速度超过了人类理解和干预的能力,就可能触发所谓的「智能爆炸」——AI能力在极短时间内呈指数级增长,远超人类的控制范围。Anthropic将这个过程分为三个阶段:第一阶段是AI辅助编码(当前阶段),第二阶段是AI自主执行实验(正在进入),第三阶段是AI完全自主迭代(尚未到来)。好在行业现在仍然面临几个关键瓶颈:每一次自我迭代都需要消耗海量推理算力,算力成本可能成为限制飞轮转速的物理天花板;当AI训练AI时,每一代都可能引入微小的对齐偏差,偏差在多代迭代中累积放大,可能导致最终模型偏离人类初衷;而且AI在提出真正原创性的研究假设、做出反直觉的方向性判断方面,仍然远逊于顶尖的人类研究员。这些瓶颈为人类保留了一个宝贵的干预窗口,但这个窗口正在缩小。
2026年7月9日,当GPT-5.6的发布页面在全球数以百万计的屏幕上刷新时,大多数人看到的是更强的跑分、更低的价格。但只有极少数人注意到了那个真正具有历史意义的细节——Luna是Sol训练出来的。在科幻作品中,奇点往往被描绘成一声惊天动地的巨响。但现实中的技术奇点,往往是一句轻描淡写的宣告,藏在一页无人细读的技术文档里。它宣告的是:人类研究员从教练变成裁判的时刻,已经到了。