Together AI 融 8 亿美元,英伟达入局做 Token 工厂

推理成本战

2026-07-17 07:08

Together AI 宣布完成 8 亿美元 C 轮融资,投资方名单很长:Aramco Ventures、英伟达、Vista Equity、General Catalyst、Salesforce Ventures、March Capital 等都在列。除了股权,它还拿到了超过 500 兆瓦(MW)的算力承诺,由新投资人独立出资建设。

这家公司的定位很清晰:做面向开放模型和定制模型的「生产平台」。创始人反复强调一个判断——大模型竞争的下半场,比的不再是模型谁更聪明,而是整个技术栈的成本效率:模型、内核、编译器、推理系统、训练基础设施、硬件利用率,一个都少不了。

开放权重模型是它的最大杠杆。DeepSeek、Nemotron、MiniMax、Kimi、GLM 这些模型,质量上追平了专有前沿模型,又给了开发者定制和微调的自由。采用开放模型的企业,通常能把成本降 6 到 20 倍。Together AI 举了个例子:客户 Decagon 切换过来后,推理成本直接降了六倍。

为了把成本真正压下来,Together AI 做了不少底层活。它发布了针对英伟达 Blackwell 架构的 FlashAttention-4,推出 Together Megakernel 和 together.compile 做内核级优化,还扩展了训练后 API,支持工具调用、推理和视觉语言模型。它已经成为全球最大的 AI Token 生成方之一。

英伟达入局这笔融资,意味深长。当算力巨头亲自下注推理优化层,说明竞争焦点已从「谁有最多卡」转向「谁能把每张卡的利用率榨到极致」。Together AI 这类公司,本质上是在帮企业绕开自建集群的天价投入,按需买 Token。

说白了,当企业把 AI 从演示工具变成核心生产设施,推理算力的消耗会指数级放大。谁能更高效地把 Token 生产出来,谁就握住了这轮 AI 基建里最稳的那块生意。对开发者来说,开放模型加专业推理平台的组合,正在成为对抗闭源高定价的一条现实路径。那些被大厂 API 账单压得喘不过气的中小团队,终于有了把成本结构打下来的第二选择。