深度报告
-
「Together 3」是产品速递信息流对 Together AI 当前一代平台的命名口径,对应的是 Together AI 这家成立于 2022 年的「AI 原生云」(AI Native Cloud)公司及其全栈开源模型推理与训练平台。它的核心主张很直白:让前沿开源模型跑得更快、更便宜,把 AI 从少数闭源巨头手里解放出来。2026 年 7 月,Together AI 刚完成 8 亿美元 C 轮融资,估值跃升至 83 亿美元,年度预订额突破 11.5 亿美元,已成为开源模型生产级基础设施里最具代表性的「新云」(Neocloud)之一。
-
Together AI 由 Vipul Ved Prakash、Percy Liang 和 Ce Zhang 三人于 2022 年创立。Prakash 是连续创业者,早年在 2013 年把社交媒体搜索引擎 Topsy 以超 2 亿美元卖给苹果;Percy Liang 是斯坦福计算机教授、也是著名开源评测基准 HELM 的发起人;Ce Zhang 则是苏黎世联邦理工(ETH)与芝加哥大学副教授,长期深耕系统与大模型训练。三人把公司使命定为「让智能充裕而不昂贵」,押注开源权重模型会成为生产级 AI 的默认选项。 融资节奏清晰地反映了这条赛道的升温。2023 年完成 1.025 亿美元 A 轮(Kleiner Perkins 领投、英伟达参投);2025 年初完成 3.05 亿美元 B 轮(General Catalyst 领投,估值 33 亿美元);2026 年 3 月市场曾传其寻求 10 亿美元、估值 75 亿美元,最终在 7 月 1 日落地为 8 亿美元 C 轮、83 亿美元投后估值,由沙特阿美旗下 Aramco Ventures 领投,英伟达、Vista Equity、General Catalyst、Emergence、March Capital、Pegatron、SentinelOne 的 S Ventures、Salesforce Ventures 等跟投。除股权外,新投资方还承诺独立资本化超过 500 兆瓦的算力容量,支撑其未来五年约 50 倍的基础设施扩张。
-
Together AI 不是面向普通用户的聊天工具,而是一套对开发者开放的全栈云平台,覆盖从实验到大规模生产的完整链路。推理层提供 Serverless 按需推理、Batch 异步批处理、Provisioned Throughput 预留吞吐,以及专用模型实例和面向生成式媒体(视频/音频/图像)的专用容器推理。计算层是可弹性伸缩的 GPU 集群,支持从单机 8 卡到数百卡的 Instant Clusters,并提供被动健康检查、节点修复、Slurm 可靠性增强等生产级能力。模型塑造层则是一整套微调流水线,支持 LoRA 与全参数微调、DPO、RLHF、继续预训练、长上下文微调与多轮对话微调,配套 TorchForge、AutoJudge 等自研工具。 平台最实在的卖点是模型广度与兼容性。它托管 200 多个开源模型,涵盖 Llama 4、DeepSeek R1/V3、Qwen3、Mixtral、Gemma、Phi、Kimi K2 系列、GLM-5 系列、Nemotron、MiniMax 等,新模型往往在发布数小时内就上线。API 完全兼容 OpenAI SDK,开发者只需改 base URL 和 key 即可从闭源模型迁移过来,并支持 JSON 模式、函数调用与流式输出。图像侧提供 Stable Diffusion、FLUX 等,另有文本嵌入 API 与代码沙箱。底层性能靠自研内核堆叠:FlashAttention-3/4、Together Megakernel、together.compile、ThunderKittens 等,官方宣称推理快 2 倍、预训练快 90%、综合成本降 60%。 2026 年新推的 Provisioned Throughput 是个关键升级:按 token 计费的预留推理容量,提供 99% SLA,支持 MiniMax M3、GLM-5.2 等前沿开源模型,号称比闭源 API 便宜最多 90%,免去 GPU 小时数的繁琐核算。
-
Together AI 的收入分两条线:按 token 计费的 API 调用(约占三到四成)和 GPU 算力租赁(约占六到七成),毛利率约 45%。对开发者而言,定价是它最锋利的部分。Serverless 推理按 token 计费,Llama 3.3 70B 输入输出均为每百万 token 0.88 美元,Llama 4 Scout 为 0.18/0.59、Maverick 为 0.27/0.85,Qwen3 72B 0.90、DeepSeek V3 0.50、Gemma 3 27B 0.30,整体比 GPT 级闭源模型便宜数倍。平台提供 71 个以上免费模型,免费档含 1 美元额度,按量起步约每百万 token 0.10 美元。 微调按训练 token 计费,LoRA SFT 按模型规模从每百万 token 0.48 美元到 2.90 美元不等,70B–100B 的全参数微调最高约 8 美元,单任务最低收费 4 美元。GPU 云按小时计费,A100 约 3.50 美元/小时、H100 约 5.50 美元/小时,Instant Clusters 每卡 2.20–5.50 美元/小时。Batch API 提供 30%–50% 折扣、24 小时交付,单模型可处理 300 亿 token。一个常被用户称赞的点是「无出站流量费」,对比三大云厂商是实打实的成本优势。
-
正面评价高度集中在三处:推理速度快、成本显著低于闭源、OpenAI 兼容带来的低迁移成本。开发者普遍反映,借助自研推理引擎和 FlashAttention 优化,Llama、Qwen、Mixtral 等模型的延迟与吞吐表现优异,从 OpenAI 切过来往往只需改几行配置。模型库的「上新速度」也常被提及,热门开源模型常在发布当天就能用上。研究社区对它的好感还来自它真的反哺生态——RedPajama 开放数据集、FlashAttention 系列研究,都建立了较高的品牌信任。 负面反馈则以稳定性和支持为主。在个别新模型爆火的高峰期,有用户遇到限流(HTTP 429)或间歇性超时,对跑生产应用的团队是真实痛点。文档方面,基础 API 写得清楚,但微调、私有 GPU 集群等进阶能力的文档被认为不如 Azure、AWS 完整。财务与运维团队则抱怨账单看板不够细,难以按 API key 或项目拆解成本。免费档限流较严(每分钟约 60 次),按量档提升到约 600 次,企业档更高。
-
行业把 Together AI 归入「Neocloud」赛道——专为 AI 训练与推理提供算力租赁的新兴云。TechCrunch 在 C 轮报道中称其为「租出英伟达 GPU 集群的 AI 新云」,并指出其年度预订额已超 11.5 亿美元,开源模型全行业使用量一年内翻了三倍。它的客户名单很有分量:Cursor、Cognition、Decagon、ElevenLabs、Suno 等都在用。客户反馈的成本节省从 6 倍到 20 倍不等,Decagon 迁移后推理成本降了六倍,Vercept 推理快了 11 倍。 竞争格局上,Together AI 的直接对手包括 Fireworks AI、Groq、Replicate、Modal,以及 CoreWeave、Lambda、TensorWave(AMD 路线)等算力云。Groq 单 token 更便宜,但模型目录只有 15–20 个且不提供微调与 GPU 云;Together AI 靠「200+ 模型 + 微调 + 推理 + GPU 云」的全套能力撑起了溢价。麦肯锡的调研显示,近四分之三的组织计划增加开源 AI 使用,这股趋势是 Together AI 估值跳涨的底层逻辑。
-
最本质的争议来自定位:Together AI 没有面向消费者的聊天界面,完全是开发者与 API 导向。对想「开箱即用」的个人用户而言,它并不友好。其次是稳定性隐忧——动态限流随用量增长而放宽,但在某个模型突然爆火时仍会出现自定义限流或访问限制,生产环境的突发抖动难以完全规避。模型可用性也随许可证与合作关系变动,开发者需要自己承担供给变化的风险。此外,平台不内置 RAG、向量库或应用框架,一切要自己搭;对中小团队而言,有「无服务器便宜、专属实例才稳」的隐性门槛——当月推理量低于约 2000 美元时,按量更划算,超过才值得上专属实例。
-
Together AI 最适合三类人:用开源模型搭生产级应用的工程师、需要在自有数据上微调开源模型的 ML 团队、以及想以闭源几分之一成本拿到 GPT-4 级表现的初创公司。研究人员和高校实验室也乐于用它做基准测试与实验,免去自建 GPU 集群。 不太适合的是想要现成聊天产品的普通用户、对 SLA 极度敏感却不愿买企业合约的轻量团队,以及只想要「最便宜单 token」而对模型广度无要求的场景(那种情况 Groq 可能更直接)。建议新用户先用免费档和 OpenAI 兼容 SDK 做 PoC,确认模型表现后再按需切到 Batch 或 Provisioned Throughput 压成本;生产负载务必走专属端点或预留吞吐,避免高峰限流。
-
Together AI 的本质,是把「开源模型 + 自研推理内核 + 弹性 GPU 云」揉成一套生产级基础设施,用成本与自由度正面挑战闭源前沿模型的经济账。它不是消费者的玩具,而是工程师手里那把「让智能充裕而不昂贵」的铲子;只要开源模型继续拉近与闭源的差距,这类 Neocloud 的窗口就不会关上。
用户评论
-
Barbara.Castillo_2023—yyds,开源党福音。 -
3g05nz—账单看板太糙,按 key 拆不了。 -
Catherine.Reyes—免费档送 5 刀,撸开源模型评测够玩好久,小项目真香。 -
DEtho—文档基础 API 写得清楚,但微调那块比 Azure 差点,踩了两次坑才搞明白。 -
汪瑶—Together 真香,迁移零成本。 -
JBrown_66—没有网页聊天界面,纯 API,个人玩玩不友好。 -
GAgra—模型库是真的全,Llama、Qwen、DeepSeek、Kimi、GLM 一大堆,新模型经常发布当天就能在 playground 里试。我最看重的是「上新快」这点,调参找模型不用到处换平台。 -
FrancesClarkX—把 OpenAI 的 base_url 一改就切过来了,Llama 3 跑出来效果差不多,账单一半都不到。 -
叶怡—中国大陆能直连,延迟可接受,这点比不少海外推理平台友好。我们国内团队调 Llama 3.3 70B 做摘要,体验跟在美西差不多,没怎么折腾代理。 -
Paul_WalkerZ—做个客服 bot,原本走 GPT-4o 一个月两百多刀,换到 Together 的 DeepSeek V3 之后同样的量三十刀出头,质量基本没感知差别,财务那边终于不找我了。 -
DGreen—微调体验不错,拿几百条自有数据训了个小 Llama,精度从 47% 拉到 65%,成本才几刀。部署成一个端点就能直接 API 调,比自己搞 GPU 省太多事。 -
iHendrikQuaedvlieg_2024—Batch API 真香,离线标注几十万条数据,比实时便宜三到五成,24 小时回也算快。适合我们这种异步活多的场景,正经省了一笔 GPU 钱。 -
Rachel_Watson9—我们生产环境用了一阵子,结论是先别上免费档。免费档限流特别狠,并发一高直接 429,还不清队列。后来改成付费 serverless 加指数退避重试,基本稳了。真要上量还是得买专用实例,专用实例按单租户 GPU 跑确实没有限流,延迟也稳,就是单价贵些。 -
MsCarolMorris_pro—搞了个 RAG 应用,embedding 用 Together 的接口,检索召回效果不输大厂。整套从推理到微调都在一个平台搞定,OpenAI 兼容让我把老代码几乎原样搬过来。唯一吐槽是计费看板不够细,按项目拆成本得自己写脚本拉账单,财务对账略头疼。 -
Heather.JenkinsJr—跟 Groq 比过,Groq 单 token 更便宜、延迟更低,但模型就那十几个,还没有微调。Together 主打一个「全」——200 多个模型加上微调、GPU 云一条龙,对我们这种既要推理又要偶尔训练的小团队更合适,贵一点但省心。 -
Jacob_MartinezX—稳定性实测还行,第三方监控说 30 天可用率 99.2%、平均延迟 156ms,跟我们体感差不多。偶发的高峰限流确实有,尤其某个新模型刚火那几天会抖,但加个重试逻辑就扛过去了。总体比自己托管 vLLM 省心太多,运维人力直接砍掉。