Together 3

面向開發者的開源模型全棧雲平臺,以更快推理和更低成本挑戰閉源前沿模型

深度報告

  • 「Together 3」是產品速遞資訊流對 Together AI 當前一代平臺的命名口徑,對應的是 Together AI 這家成立於 2022 年的「AI 原生雲」(AI Native Cloud)公司及其全棧開源模型推理與訓練平臺。它的核心主張很直白:讓前沿開源模型跑得更快、更便宜,把 AI 從少數閉源巨頭手裡解放出來。2026 年 7 月,Together AI 剛完成 8 億美元 C 輪融資,估值躍升至 83 億美元,年度預訂額突破 11.5 億美元,已成為開源模型生產級基礎設施裡最具代表性的「新雲」(Neocloud)之一。

  • Together AI 由 Vipul Ved Prakash、Percy Liang 和 Ce Zhang 三人於 2022 年創立。Prakash 是連續創業者,早年在 2013 年把社交媒體搜尋引擎 Topsy 以超 2 億美元賣給蘋果;Percy Liang 是斯坦福計算機教授、也是著名開源評測基準 HELM 的發起人;Ce Zhang 則是蘇黎世聯邦理工(ETH)與芝加哥大學副教授,長期深耕系統與大模型訓練。三人把公司使命定為「讓智慧充裕而不昂貴」,押注開源權重模型會成為生產級 AI 的預設選項。 融資節奏清晰地反映了這條賽道的升溫。2023 年完成 1.025 億美元 A 輪(Kleiner Perkins 領投、英偉達參投);2025 年初完成 3.05 億美元 B 輪(General Catalyst 領投,估值 33 億美元);2026 年 3 月市場曾傳其尋求 10 億美元、估值 75 億美元,最終在 7 月 1 日落地為 8 億美元 C 輪、83 億美元投後估值,由沙特阿美旗下 Aramco Ventures 領投,英偉達、Vista Equity、General Catalyst、Emergence、March Capital、Pegatron、SentinelOne 的 S Ventures、Salesforce Ventures 等跟投。除股權外,新投資方還承諾獨立資本化超過 500 兆瓦的算力容量,支撐其未來五年約 50 倍的基礎設施擴張。

  • Together AI 不是面向普通使用者的聊天工具,而是一套對開發者開放的全棧雲平臺,覆蓋從實驗到大規模生產的完整鏈路。推理層提供 Serverless 按需推理、Batch 非同步批處理、Provisioned Throughput 預留吞吐,以及專用模型例項和麵向生成式媒體(影片/音訊/影象)的專用容器推理。計算層是可彈性伸縮的 GPU 叢集,支援從單機 8 卡到數百卡的 Instant Clusters,並提供被動健康檢查、節點修復、Slurm 可靠性增強等生產級能力。模型塑造層則是一整套微調流水線,支援 LoRA 與全引數微調、DPO、RLHF、繼續預訓練、長上下文微調與多輪對話微調,配套 TorchForge、AutoJudge 等自研工具。 平臺最實在的賣點是模型廣度與相容性。它託管 200 多個開源模型,涵蓋 Llama 4、DeepSeek R1/V3、Qwen3、Mixtral、Gemma、Phi、Kimi K2 系列、GLM-5 系列、Nemotron、MiniMax 等,新模型往往在釋出數小時內就上線。API 完全相容 OpenAI SDK,開發者只需改 base URL 和 key 即可從閉源模型遷移過來,並支援 JSON 模式、函式呼叫與流式輸出。影象側提供 Stable Diffusion、FLUX 等,另有文字嵌入 API 與程式碼沙箱。底層效能靠自研核心堆疊:FlashAttention-3/4、Together Megakernel、together.compile、ThunderKittens 等,官方宣稱推理快 2 倍、預訓練快 90%、綜合成本降 60%。 2026 年新推的 Provisioned Throughput 是個關鍵升級:按 token 計費的預留推理容量,提供 99% SLA,支援 MiniMax M3、GLM-5.2 等前沿開源模型,號稱比閉源 API 便宜最多 90%,免去 GPU 小時數的繁瑣核算。

  • Together AI 的收入分兩條線:按 token 計費的 API 呼叫(約佔三到四成)和 GPU 算力租賃(約佔六到七成),毛利率約 45%。對開發者而言,定價是它最鋒利的部分。Serverless 推理按 token 計費,Llama 3.3 70B 輸入輸出均為每百萬 token 0.88 美元,Llama 4 Scout 為 0.18/0.59、Maverick 為 0.27/0.85,Qwen3 72B 0.90、DeepSeek V3 0.50、Gemma 3 27B 0.30,整體比 GPT 級閉源模型便宜數倍。平臺提供 71 個以上免費模型,免費檔含 1 美元額度,按量起步約每百萬 token 0.10 美元。 微調按訓練 token 計費,LoRA SFT 按模型規模從每百萬 token 0.48 美元到 2.90 美元不等,70B–100B 的全引數微調最高約 8 美元,單任務最低收費 4 美元。GPU 雲按小時計費,A100 約 3.50 美元/小時、H100 約 5.50 美元/小時,Instant Clusters 每卡 2.20–5.50 美元/小時。Batch API 提供 30%–50% 折扣、24 小時交付,單模型可處理 300 億 token。一個常被使用者稱讚的點是「無出站流量費」,對比三大雲廠商是實打實的成本優勢。

  • 正面評價高度集中在三處:推理速度快、成本顯著低於閉源、OpenAI 相容帶來的低遷移成本。開發者普遍反映,藉助自研推理引擎和 FlashAttention 最佳化,Llama、Qwen、Mixtral 等模型的延遲與吞吐表現優異,從 OpenAI 切過來往往只需改幾行配置。模型庫的「上新速度」也常被提及,熱門開源模型常在釋出當天就能用上。研究社群對它的好感還來自它真的反哺生態——RedPajama 開放資料集、FlashAttention 系列研究,都建立了較高的品牌信任。 負面反饋則以穩定性和支援為主。在個別新模型爆火的高峰期,有使用者遇到限流(HTTP 429)或間歇性超時,對跑生產應用的團隊是真實痛點。文件方面,基礎 API 寫得清楚,但微調、私有 GPU 叢集等進階能力的文件被認為不如 Azure、AWS 完整。財務與運維團隊則抱怨賬單看板不夠細,難以按 API key 或專案拆解成本。免費檔限流較嚴(每分鐘約 60 次),按量檔提升到約 600 次,企業檔更高。

  • 行業把 Together AI 歸入「Neocloud」賽道——專為 AI 訓練與推理提供算力租賃的新興雲。TechCrunch 在 C 輪報道中稱其為「租出英偉達 GPU 叢集的 AI 新雲」,並指出其年度預訂額已超 11.5 億美元,開源模型全行業使用量一年內翻了三倍。它的客戶名單很有分量:Cursor、Cognition、Decagon、ElevenLabs、Suno 等都在用。客戶反饋的成本節省從 6 倍到 20 倍不等,Decagon 遷移後推理成本降了六倍,Vercept 推理快了 11 倍。 競爭格局上,Together AI 的直接對手包括 Fireworks AI、Groq、Replicate、Modal,以及 CoreWeave、Lambda、TensorWave(AMD 路線)等算力雲。Groq 單 token 更便宜,但模型目錄只有 15–20 個且不提供微調與 GPU 雲;Together AI 靠「200+ 模型 + 微調 + 推理 + GPU 雲」的全套能力撐起了溢價。麥肯錫的調研顯示,近四分之三的組織計劃增加開源 AI 使用,這股趨勢是 Together AI 估值跳漲的底層邏輯。

  • 最本質的爭議來自定位:Together AI 沒有面向消費者的聊天介面,完全是開發者與 API 導向。對想「開箱即用」的個人使用者而言,它並不友好。其次是穩定性隱憂——動態限流隨用量增長而放寬,但在某個模型突然爆火時仍會出現自定義限流或訪問限制,生產環境的突發抖動難以完全規避。模型可用性也隨許可證與合作關係變動,開發者需要自己承擔供給變化的風險。此外,平臺不內建 RAG、向量庫或應用框架,一切要自己搭;對中小團隊而言,有「無伺服器便宜、專屬例項才穩」的隱性門檻——當月推理量低於約 2000 美元時,按量更划算,超過才值得上專屬例項。

  • Together AI 最適合三類人:用開源模型搭生產級應用的工程師、需要在自有資料上微調開源模型的 ML 團隊、以及想以閉源幾分之一成本拿到 GPT-4 級表現的初創公司。研究人員和高校實驗室也樂於用它做基準測試與實驗,免去自建 GPU 叢集。 不太適合的是想要現成聊天產品的普通使用者、對 SLA 極度敏感卻不願買企業合約的輕量團隊,以及只想要「最便宜單 token」而對模型廣度無要求的場景(那種情況 Groq 可能更直接)。建議新使用者先用免費檔和 OpenAI 相容 SDK 做 PoC,確認模型表現後再按需切到 Batch 或 Provisioned Throughput 壓成本;生產負載務必走專屬端點或預留吞吐,避免高峰限流。

  • Together AI 的本質,是把「開源模型 + 自研推理核心 + 彈性 GPU 雲」揉成一套生產級基礎設施,用成本與自由度正面挑戰閉源前沿模型的經濟賬。它不是消費者的玩具,而是工程師手裡那把「讓智慧充裕而不昂貴」的鏟子;只要開源模型繼續拉近與閉源的差距,這類 Neocloud 的視窗就不會關上。

使用者評論

  • 頭像
    Barbara.Castillo_2023
    yyds,開源黨福音。

  • 頭像
    3g05nz
    賬單看板太糙,按 key 拆不了。

  • 頭像
    Catherine.Reyes
    免費檔送 5 刀,擼開源模型評測夠玩好久,小專案真香。

  • 頭像
    DEtho
    文件基礎 API 寫得清楚,但微調那塊比 Azure 差點,踩了兩次坑才搞明白。

  • 頭像
    汪瑤
    Together 真香,遷移零成本。

  • 頭像
    JBrown_66
    沒有網頁聊天介面,純 API,個人玩玩不友好。

  • 頭像
    GAgra
    模型庫是真的全,Llama、Qwen、DeepSeek、Kimi、GLM 一大堆,新模型經常釋出當天就能在 playground 裡試。我最看重的是「上新快」這點,調參找模型不用到處換平臺。

  • 頭像
    FrancesClarkX
    把 OpenAI 的 base_url 一改就切過來了,Llama 3 跑出來效果差不多,賬單一半都不到。

  • 頭像
    葉怡
    中國大陸能直連,延遲可接受,這點比不少海外推理平臺友好。我們國內團隊調 Llama 3.3 70B 做摘要,體驗跟在美西差不多,沒怎麼折騰代理。

  • 頭像
    Paul_WalkerZ
    做個客服 bot,原本走 GPT-4o 一個月兩百多刀,換到 Together 的 DeepSeek V3 之後同樣的量三十刀出頭,質量基本沒感知差別,財務那邊終於不找我了。

  • 頭像
    DGreen
    微調體驗不錯,拿幾百條自有資料訓了個小 Llama,精度從 47% 拉到 65%,成本才幾刀。部署成一個端點就能直接 API 調,比自己搞 GPU 省太多事。

  • 頭像
    iHendrikQuaedvlieg_2024
    Batch API 真香,離線標註幾十萬條資料,比實時便宜三到五成,24 小時回也算快。適合我們這種非同步活多的場景,正經省了一筆 GPU 錢。

  • 頭像
    Rachel_Watson9
    我們生產環境用了一陣子,結論是先別上免費檔。免費檔限流特別狠,併發一高直接 429,還不清佇列。後來改成付費 serverless 加指數退避重試,基本穩了。真要上量還是得買專用例項,專用例項按單租戶 GPU 跑確實沒有限流,延遲也穩,就是單價貴些。

  • 頭像
    MsCarolMorris_pro
    搞了個 RAG 應用,embedding 用 Together 的介面,檢索召回效果不輸大廠。整套從推理到微調都在一個平臺搞定,OpenAI 相容讓我把老程式碼幾乎原樣搬過來。唯一吐槽是計費看板不夠細,按專案拆成本得自己寫指令碼拉賬單,財務對賬略頭疼。

  • 頭像
    Heather.JenkinsJr
    跟 Groq 比過,Groq 單 token 更便宜、延遲更低,但模型就那十幾個,還沒有微調。Together 主打一個「全」——200 多個模型加上微調、GPU 雲一條龍,對我們這種既要推理又要偶爾訓練的小團隊更合適,貴一點但省心。

  • 頭像
    Jacob_MartinezX
    穩定性實測還行,第三方監控說 30 天可用率 99.2%、平均延遲 156ms,跟我們體感差不多。偶發的高峰限流確實有,尤其某個新模型剛火那幾天會抖,但加個重試邏輯就扛過去了。總體比自己託管 vLLM 省心太多,運維人力直接砍掉。