Databricks把中国开源模型设为默认编码引擎:GLM-5.2平替Opus,成本省三成

中国AI模型攻入硅谷

2026-07-12 17:52

中国AI大模型又一次从硅谷拿到了硬核背书。这一次投下信任票的,是估值620亿美元的数据巨头Databricks。

Databricks在自己几百万行代码的生产库上做了一次严谨的编码Agent基准测试。测试样本来自真实的工程师提交请求,覆盖Python、Go、TypeScript、Scala等多种语言,而不是用SWE-Bench那种公开数据集——因为公开数据集的解法和代码可能已经混进模型训练数据了,测不准。甚至为了防作弊,他们把Git历史砍掉了,省得模型直接搜历史记录找答案。

结果让Databricks自己都有点意外:智谱AI的GLM-5.2和Anthropic的Opus 4.8在通过率上打了平手,都是82%到90%。但每任务成本呢?GLM-5.2是1.28美元,Opus 4.8是1.94美元——差了34%。61%的编码任务都是中等复杂度的,被自动路由到了GLM-5.2。Databricks联合创始人Matei Zaharia亲自下场说:证据够了,该把它们当日常编码主力了。

GLM-5.2是什么来头?它是智谱AI在6月13日发布的753B参数混合专家模型,每个Token只激活400亿参数,MIT许可证完全开源。上下文窗口拉到100万token,是前代GLM-5.1的五倍。在API定价上,GLM-5.2输入每百万token大约1.40美元,输出4.40美元——对比Opus 4.8的5美元输入和25美元输出,输入便宜3.6倍,输出便宜5.7倍。而且公司可以下载权重自行部署,只付算力钱,数据都不用出境。

关键不在于Databricks一家做了什么,而在于这不是孤例。Coinbase CEO Brian Armstrong公开说,通过换成GLM-5.2和Moonshot AI的Kimi K2.7 Code组合,AI支出砍了将近一半。AI初创公司Lindy的CEO Flo Crivello更是直接把全部API流量从Anthropic转到了DeepSeek V4,说AI成本之前已经超过工资了。Snowflake也在评估GLM-5.2。

根据最新数据,中国AI模型在OpenRouter等美国平台上的企业API Token流量占比已从2025年初的4.5%飙升至30%到46%。这个数字每季度都在跳涨。

对Anthropic和OpenAI来说,压力相当直接。Opus 4.8性能没输,但价格是GLM-5.2的四到六倍——当开源替代品在真实编码任务上做到统计无差异时,企业采购天平自然就偏了。这跟当年云基础设施开源化挤占AWS份额的剧本很像:一旦质量差距缩窄到可接受范围,企业的选择就是理性的

Databricks做的这个「用自有代码库定制基准测试」的思路本身就是一个信号。它告诉行业:别再信公开排行榜了,你自己的代码库才是最好的测试场。哪家模型在你家业务上跑得又快又好、成本又低,就用哪家。供应商锁定正在瓦解。