Fireworks 2

由 PyTorch 原班團隊創立的開源模型推理與訓練雲平臺,主打在企業私有資料上定製「專屬智慧」

深度報告

  • 「Fireworks 2」是產品速遞資訊流對該產品的命名口徑,背後對應的真實產品是 Fireworks AI——一家由 PyTorch 原班團隊創立的「開源模型推理與訓練雲平臺」,主打「專屬智慧(specialized intelligence)」理念,幫企業在自己的私有資料上微調並部署開源模型。該公司在 2026 年 7 月剛完成 15.05 億美元 D 輪融資,估值 175 億美元,年化營收突破 10 億美元,日處理 Token 超 40 萬億。它的長板是生產級可靠性、函式呼叫與開發者體驗,硬傷在冷啟動延遲、規模化限流與中間檔客戶的支援響應。下文基於多方公開信源撰寫,並明確標註其命名口徑(參照近期「Together 3」「DALL-E 4 工作室」的處理方式)。

  • Fireworks AI 由林喬(Lin Qiao)在 2022 年離開 Meta 後創立。她在 Meta 任工程高階總監七年,帶領 300 多名工程師搭建並擴張了 PyTorch——如今撐起全球大部分 AI 模型訓練與推理的開源框架。聯合創始團隊幾乎全是基礎設施老手:PyTorch 核心維護者 Dmytro Dzhulgakov、PyTorch 編譯器工程師 James Reed、前 Google Vertex AI 負責人 Chenyu Zhao 等。公司位於加州聖馬特奧,對外口號是「PyTorch 的締造者出品」。 公司的核心賭注是「專屬智慧」:通用大模型只訓練於公開網際網路,而銀行、醫院、律所手裡那些內部文件、客戶記錄與行業用語,才是真正的護城河。把開源權重(Llama、DeepSeek、GLM、Qwen、Kimi、MiniMax、Gemma 等)在企業自有資料上微調後再投入生產,往往能在具體任務上以更低成本追平甚至超過通用前沿模型。其官網反覆強調「擁有你的模型,擁有你的未來」。 融資節奏極快。2025 年 10 月的 C 輪是 2.5 億美元、估值 40 億美元,由 Lightspeed、Index Ventures、Evantic 領投,紅杉、英偉達、AMD、MongoDB、Databricks 跟投,當時總融資已超 3.27 億美元、服務 1 萬多家公司、年化營收約 2.8 億美元、日處理 10 萬億 Token。到 2026 年 7 月 16 日的 D 輪,金額衝到 15.05 億美元、估值 175 億美元,由 Atreides Management、Index Ventures、TCV 領投,英偉達、Lightspeed、20VC、Bessemer、Menlo 等十餘家入局;年化營收破 10 億美元(同比 5 倍)、日 Token 量翻近三倍到 40 萬億以上,且 95% 來自經客戶資料定製化的模型。公司計劃 2026 年底把工程團隊從約 200 人擴到 600 人。客戶名單裡既有三星、Uber、DoorDash、Notion、Shopify、Upwork,也有 Cursor、Harvey、Doximity、Geico、Revolut、UiPath、GitLab。

  • 平臺分兩層能力。其一是訓練:提供「引導式執行」(描述任務、審閱方案與成本、批准後拿到模型)、「配置式執行」(指定模型、資料、方法,平臺負責排程與上線)和「自定義訓練邏輯」(自帶 loss、訓練器與 RL 迴圈)三種路徑,並內建一個能自動跑通微調全流程的 AI 智慧體——開發者描述目標、上傳資料,它自動尋優超參,必要時用 DPO 檔案擴充訓練集。其二是推理:分 Serverless(按 Token 計費,有 Priority 與 Fast 兩檔,相容 OpenAI 與 Anthropic API)、On-Demand(獨佔部署、多區域、支援後訓練模型)與 Reserved(保證算力、優先用最新硬體)三檔。 模型庫覆蓋文字、影象、音訊與多模態,官方稱超 200 個模型,且主流新模型上線數小時內即上架。當前在架的代表有 DeepSeek V4 Pro/Flash、GLM 5.2、Qwen3.7 Plus、Kimi K2.7 Code、MiniMax M3、Gemma 4 系列、gpt-oss-20b、FLUX.1 Kontext Pro、Whisper V3 等。推理引擎在每一層都做了最佳化,自研的 FireAttention(面向多查詢注意力效率的定製 CUDA 核心)是其效能底座。 函式呼叫是 Fireworks 的主打差異點。FireFunction 是其在開源底座上額外訓練出的工具呼叫模型家族,FireFunction-v2 在單工具呼叫上約 96.2% 準確、多工具並行約 92.1%,接近 GPT-4o 水平卻只收約 0.90 美元/百萬 Token 的價格;配合 JSON 模式與語法約束解碼,結構化輸出在生產負載下比較穩。

  • Fireworks 賣的是「權重之外的一切」:連續批處理、快取、量化、自動擴縮、可觀測、安全與計費。推理按 Token 計費,Llama 3.3 70B 混合價約 0.90 美元/百萬 Token;Serverless 另有保底算力約 4.80 美元/副本/小時(不同來源口徑略有差異),也有速率受限的免費檔;批次推理通常打五折。訓練側按 GPU 小時與資料量計價,支援 LoRA 與全量微調。公司不訓練自己的前沿大模型,而是租英偉達 GPU、幫客戶在開源權重上做定製,再把結果託管上線——本質是把「運營層」做成生意。

  • 社群工程師對 Fireworks 的看法比較分化但整體正面。長板集中在三點:延遲、成本、函式呼叫。實測 Llama 3.1 8B/70B 的首次出詞時間(TTFT)小模型在 80–180ms、70B 在 150–350ms,有開發者把客服機器人的 p50 TTFT 從 OpenAI gpt-4o-mini 的 420ms 降到約 110ms;成本方面,開源模型普遍落在 0.20–0.90 美元/百萬 Token,比等價閉源模型便宜約六到八成,有團隊把日處理 5000 萬 Token 的分類管線月賬單從 OpenAI 的 4200 美元砍到 1100 美元且無質量回退;函式呼叫被反覆點名,有開發者稱 FireFunction-v2 在 12 工具智慧體上首次成功率約 92%,明顯優於原始 Llama 3.1 70B 的 78%。新模型「數日內上架」和 OpenAI 相容(幾分鐘遷移)也被認為體驗順滑。 短板同樣集中。最常被詬病的是 Serverless 冷啟動:空閒後首次呼叫要 1–3 秒預熱,對突發流量「很要命」,有團隊被迫常駐暖池。其二是規模化限流:免費與低檔賬戶節流兇猛,付費賬戶在流量高峰也會撞 429,不少人花兩週自建路由做故障轉移,把省下的成本又吃回去。其三是微調有上限:資料量與算力配額受限,想微調 70B 大模型常被單任務 Token 上限逼著拆成多份;訓練看板與可觀測性也落後於 Weights & Biases、Modal。其四是支援響應不穩定:小客戶幾小時內回、企業合同更快,但中端團隊非緊急問題常等 24–48 小時。

  • 2026 年的推理供應商格局大致三分:Groq 靠自研 LPU 晶片佔「速度」(Llama 70B 500+ tok/s、小模型最便宜,但模型少、不支援微調),Together AI 靠「廣度」(200+ 模型、微調與多模態最全)稱王,Fireworks 則吃下「生產可靠性 + 函式呼叫 + 開發者體驗」這一檔(TokenMix 監測其 2026 年 Q1 可用性 99.8%,高於 Groq 的 99.4%)。英偉達 CEO 黃仁勳在 GTC 2026 稱 Fireworks 為「AI 工廠的臺積電」,並點出其日處理 40 萬億 Token。多家評測(ToolHalla、LLMVersus、MegaOne、APIScout)結論一致:沒有單一贏家,多數團隊跨供應商路由——Groq 扛延遲敏感路徑、Fireworks 作生產兜底、Together 補長尾模型。

  • 最尖銳的質疑來自「夾心層」困境:OpenAI、Anthropic、Google 都在推自己的託管推理,微軟、亞馬遜又把託管開源模型塞進自家雲,獨立推理層能否在兩端擠壓下存活,是懸在這輪融資頭上的問號(LDS/letsdatascience 直接提出)。其次是資料口徑:10 億美元 ARR 是年化執行率的外推、40 萬億 Token 等均為公司自報未審計,按該執行率估值約 17.5 倍年營收。其三是繫結與可移植性:推理 API 相容 OpenAI 利於遷移,但訓練與定製棧是專有體系,客戶一旦投入資料飛輪便不易遷出。其四是降價壓力:Gartner 預測到 2030 年萬億引數模型推理成本比 2025 年降九成,客戶議價能力隨之上升,推理有被壓成價格商品的風險。其五是算力依賴:本質租賃英偉達 GPU,供給與定價受上游牽制。至於可用性,官方狀態頁顯示 embeddings API 約 99.96% 線上、全年僅零星數分鐘中斷;獨立監測(Tickerr)記到 2026 年 7 月 14 日一次約 24 分鐘的重大中斷、30 天可用性 99.9%,總體穩健但偶有抖動。

  • 適合誰:要把 AI 做成「基礎設施」而非「訂閱工具」的企業——客服模型訓在三年真實工單上、預測模型訓在自有供應鏈資料上、分析助手訓在內部報表上,這類場景定製模型往往以小博大。也適合需要穩定生產延遲、強函式呼叫與結構化輸出的 API 型 SaaS。不適合誰:純粹想要最便宜小模型的極速原型可選 Groq;需要最寬模型族與深度微調選 Together;對冷啟動敏感、流量極突發的輕量應用要謹慎,最好常駐暖例項或配故障轉移。替代方案就是上述兩家加自建 vLLM。

  • Fireworks AI 的真正護城河不在某個模型,而在「PyTorch 級工程 + 專屬智慧飛輪」:把企業私有資料變成越用越強的定製模型,並以生產級可靠性交付。風險同樣清晰——夾在雲巨頭與前沿實驗室之間、依賴未審計的高增長敘事、且推理終局可能走向商品化。對想「擁有自己 AI」的公司,它是當下最完整的一站式選擇之一;對只想省錢的開發者,它未必是最便宜的那個。

使用者評論

  • 頭像
    MLewisQ
    把客服模型從 gpt-4o-mini 遷過來,首次出詞直接砍到 110ms,體感明顯。

  • 頭像
    月光_2
    D 輪 15 億刀、估值 175 億,林喬這步「擁有自己的 AI」賭注算是被市場認了。

  • 頭像
    AshleyJimenez_X18
    OpenAI 相容,遷移幾分鐘搞定,這點對懶人太友好了。

  • 頭像
    3cetni
    批次推理打五折,跑文件處理和夜間 eval pipeline 很划算。

  • 頭像
    Alexander_GreenX221
    官方那個自動微調智慧體挺省事,描述目標傳資料就幫找超參,新手友好。

  • 頭像
    RonaldBarnes_20217
    7 月 14 號那次中斷二十多分鐘,凌晨告警把我吵醒了。

  • 頭像
    沈琪怡
    新模型上架是真的快,DeepSeek V4、GLM 5.2、Qwen3.7 這些基本幾天內就上,不用苦等。

  • 頭像
    Jennifer_Hughes_996
    PyTorch 原班人馬做的推理層,工程底子確實硬,CUDA 核心最佳化不是吹的。

  • 頭像
    Sean_Ramos_778
    函式是真穩,FireFunction 調 12 個工具基本一遍過。

  • 頭像
    DeborahKim520
    規模上來後被限流搞怕了。免費和低價檔節流很兇,付費檔流量高峰照樣撞 429。我們最後花兩週寫了個路由做故障轉移,省下的錢又搭進去不少。建議用量大的團隊一開始就把 fallback 架構設計好。

  • 頭像
    Gregory.Ross_2020799
    回不去了。

  • 頭像
    何明
    Fireworks 真香。

  • 頭像
    孫睿月
    我們日處理 5000 萬 Token 的分類管線,月賬單從 OpenAI 的 4200 刀掉到 1100 刀,eval 上沒看出質量回退。

  • 頭像
    Sean_HendersonIII
    結構化輸出強制 JSON,agent 裡省了不少心。

  • 頭像
    孫彤哲
    用了快半年,最滿意的是延遲和函式呼叫。Llama 3.1 8B 的 p50 TTFT 穩定在 80 到 180ms,70B 也就 150 到 350ms。但冷啟動是真坑,serverless 空閒後再調要 1 到 3 秒預熱,我們這種流量突發的 B2B SaaS 被搞得很慘,最後只能常駐暖池,成本優勢被吃回去一部分。

  • 頭像
    SatsChaserLarsen
    微調有上限,想訓 70B 大模型被單任務 Token 上限逼著拆成好幾份,訓練看板也比不上 W&B 和 Modal。

  • 頭像
    JAdams_2024
    在 r/LocalLLaMA 看到的共識:Fireworks 不像 Together 那種模型超市,也不像 Groq 只拼速度,它就是穩。我們生產環境跑下來可用性確實比 Groq 高,函式呼叫比原生 Llama 強一大截。代價是模型沒那麼多,想用偏門模型還是得回 Together。

  • 頭像
    nlptd
    中端客戶支援有點慢,非緊急問題等個一兩天是常態。

  • 頭像
    BrendaCastillo_202332
    說點實在的:它不是來跟 OpenAI 拼誰模型更強,而是幫你把開源權重在自家資料上微調後上線。我們客服模型訓在三年真實工單上,處理自家使用者就是比通用模型順。但這套飛輪一旦轉起來,想換平臺成本很高,繫結得想清楚。

  • 頭像
    KatherineHernandez
    價格比 Groq 貴一截,但比 Together 略便宜,看你怎麼取捨。

  • 頭像
    鄭宇梅
    我們拿 Fireworks 給內部 coding assistant 做微調,參考 Cursor 那套思路。量化後的模型質量 degradation 很小,推理速度還比自託管 vLLM 穩。關鍵是 checkpoint 訓完幾秒就能上線,迭代節奏比之前快了一個量級,工程團隊終於不用天天盯著 GPU 了。

  • 頭像
    Bobby.Watson_2021
    對比下來三家各有坑:Groq 最快但模型少還不支援微調;Together 模型最全微調最強;Fireworks 最均衡、生產最穩。我們最終 Groq 扛延遲敏感路徑、Fireworks 作兜底、Together 補長尾,三家的錢都花。