Fireworks 2

由 PyTorch 原班团队创立的开源模型推理与训练云平台,主打在企业私有数据上定制「专属智能」

深度报告

  • 「Fireworks 2」是产品速递信息流对该产品的命名口径,背后对应的真实产品是 Fireworks AI——一家由 PyTorch 原班团队创立的「开源模型推理与训练云平台」,主打「专属智能(specialized intelligence)」理念,帮企业在自己的私有数据上微调并部署开源模型。该公司在 2026 年 7 月刚完成 15.05 亿美元 D 轮融资,估值 175 亿美元,年化营收突破 10 亿美元,日处理 Token 超 40 万亿。它的长板是生产级可靠性、函数调用与开发者体验,硬伤在冷启动延迟、规模化限流与中间档客户的支持响应。下文基于多方公开信源撰写,并明确标注其命名口径(参照近期「Together 3」「DALL-E 4 工作室」的处理方式)。

  • Fireworks AI 由林乔(Lin Qiao)在 2022 年离开 Meta 后创立。她在 Meta 任工程高级总监七年,带领 300 多名工程师搭建并扩张了 PyTorch——如今撑起全球大部分 AI 模型训练与推理的开源框架。联合创始团队几乎全是基础设施老手:PyTorch 核心维护者 Dmytro Dzhulgakov、PyTorch 编译器工程师 James Reed、前 Google Vertex AI 负责人 Chenyu Zhao 等。公司位于加州圣马特奥,对外口号是「PyTorch 的缔造者出品」。 公司的核心赌注是「专属智能」:通用大模型只训练于公开互联网,而银行、医院、律所手里那些内部文档、客户记录与行业用语,才是真正的护城河。把开源权重(Llama、DeepSeek、GLM、Qwen、Kimi、MiniMax、Gemma 等)在企业自有数据上微调后再投入生产,往往能在具体任务上以更低成本追平甚至超过通用前沿模型。其官网反复强调「拥有你的模型,拥有你的未来」。 融资节奏极快。2025 年 10 月的 C 轮是 2.5 亿美元、估值 40 亿美元,由 Lightspeed、Index Ventures、Evantic 领投,红杉、英伟达、AMD、MongoDB、Databricks 跟投,当时总融资已超 3.27 亿美元、服务 1 万多家公司、年化营收约 2.8 亿美元、日处理 10 万亿 Token。到 2026 年 7 月 16 日的 D 轮,金额冲到 15.05 亿美元、估值 175 亿美元,由 Atreides Management、Index Ventures、TCV 领投,英伟达、Lightspeed、20VC、Bessemer、Menlo 等十余家入局;年化营收破 10 亿美元(同比 5 倍)、日 Token 量翻近三倍到 40 万亿以上,且 95% 来自经客户数据定制化的模型。公司计划 2026 年底把工程团队从约 200 人扩到 600 人。客户名单里既有三星、Uber、DoorDash、Notion、Shopify、Upwork,也有 Cursor、Harvey、Doximity、Geico、Revolut、UiPath、GitLab。

  • 平台分两层能力。其一是训练:提供「引导式运行」(描述任务、审阅方案与成本、批准后拿到模型)、「配置式运行」(指定模型、数据、方法,平台负责调度与上线)和「自定义训练逻辑」(自带 loss、训练器与 RL 循环)三种路径,并内置一个能自动跑通微调全流程的 AI 智能体——开发者描述目标、上传数据,它自动寻优超参,必要时用 DPO 文件扩充训练集。其二是推理:分 Serverless(按 Token 计费,有 Priority 与 Fast 两档,兼容 OpenAI 与 Anthropic API)、On-Demand(独占部署、多区域、支持后训练模型)与 Reserved(保证算力、优先用最新硬件)三档。 模型库覆盖文本、图像、音频与多模态,官方称超 200 个模型,且主流新模型上线数小时内即上架。当前在架的代表有 DeepSeek V4 Pro/Flash、GLM 5.2、Qwen3.7 Plus、Kimi K2.7 Code、MiniMax M3、Gemma 4 系列、gpt-oss-20b、FLUX.1 Kontext Pro、Whisper V3 等。推理引擎在每一层都做了优化,自研的 FireAttention(面向多查询注意力效率的定制 CUDA 内核)是其性能底座。 函数调用是 Fireworks 的主打差异点。FireFunction 是其在开源底座上额外训练出的工具调用模型家族,FireFunction-v2 在单工具调用上约 96.2% 准确、多工具并行约 92.1%,接近 GPT-4o 水平却只收约 0.90 美元/百万 Token 的价格;配合 JSON 模式与语法约束解码,结构化输出在生产负载下比较稳。

  • Fireworks 卖的是「权重之外的一切」:连续批处理、缓存、量化、自动扩缩、可观测、安全与计费。推理按 Token 计费,Llama 3.3 70B 混合价约 0.90 美元/百万 Token;Serverless 另有保底算力约 4.80 美元/副本/小时(不同来源口径略有差异),也有速率受限的免费档;批量推理通常打五折。训练侧按 GPU 小时与数据量计价,支持 LoRA 与全量微调。公司不训练自己的前沿大模型,而是租英伟达 GPU、帮客户在开源权重上做定制,再把结果托管上线——本质是把「运营层」做成生意。

  • 社区工程师对 Fireworks 的看法比较分化但整体正面。长板集中在三点:延迟、成本、函数调用。实测 Llama 3.1 8B/70B 的首次出词时间(TTFT)小模型在 80–180ms、70B 在 150–350ms,有开发者把客服机器人的 p50 TTFT 从 OpenAI gpt-4o-mini 的 420ms 降到约 110ms;成本方面,开源模型普遍落在 0.20–0.90 美元/百万 Token,比等价闭源模型便宜约六到八成,有团队把日处理 5000 万 Token 的分类管线月账单从 OpenAI 的 4200 美元砍到 1100 美元且无质量回退;函数调用被反复点名,有开发者称 FireFunction-v2 在 12 工具智能体上首次成功率约 92%,明显优于原始 Llama 3.1 70B 的 78%。新模型「数日内上架」和 OpenAI 兼容(几分钟迁移)也被认为体验顺滑。 短板同样集中。最常被诟病的是 Serverless 冷启动:空闲后首次调用要 1–3 秒预热,对突发流量「很要命」,有团队被迫常驻暖池。其二是规模化限流:免费与低档账户节流凶猛,付费账户在流量高峰也会撞 429,不少人花两周自建路由做故障转移,把省下的成本又吃回去。其三是微调有上限:数据量与算力配额受限,想微调 70B 大模型常被单任务 Token 上限逼着拆成多份;训练看板与可观测性也落后于 Weights & Biases、Modal。其四是支持响应不稳定:小客户几小时内回、企业合同更快,但中端团队非紧急问题常等 24–48 小时。

  • 2026 年的推理供应商格局大致三分:Groq 靠自研 LPU 芯片占「速度」(Llama 70B 500+ tok/s、小模型最便宜,但模型少、不支持微调),Together AI 靠「广度」(200+ 模型、微调与多模态最全)称王,Fireworks 则吃下「生产可靠性 + 函数调用 + 开发者体验」这一档(TokenMix 监测其 2026 年 Q1 可用性 99.8%,高于 Groq 的 99.4%)。英伟达 CEO 黄仁勋在 GTC 2026 称 Fireworks 为「AI 工厂的台积电」,并点出其日处理 40 万亿 Token。多家评测(ToolHalla、LLMVersus、MegaOne、APIScout)结论一致:没有单一赢家,多数团队跨供应商路由——Groq 扛延迟敏感路径、Fireworks 作生产兜底、Together 补长尾模型。

  • 最尖锐的质疑来自「夹心层」困境:OpenAI、Anthropic、Google 都在推自己的托管推理,微软、亚马逊又把托管开源模型塞进自家云,独立推理层能否在两端挤压下存活,是悬在这轮融资头上的问号(LDS/letsdatascience 直接提出)。其次是数据口径:10 亿美元 ARR 是年化运行率的外推、40 万亿 Token 等均为公司自报未审计,按该运行率估值约 17.5 倍年营收。其三是绑定与可移植性:推理 API 兼容 OpenAI 利于迁移,但训练与定制栈是专有体系,客户一旦投入数据飞轮便不易迁出。其四是降价压力:Gartner 预测到 2030 年万亿参数模型推理成本比 2025 年降九成,客户议价能力随之上升,推理有被压成价格商品的风险。其五是算力依赖:本质租赁英伟达 GPU,供给与定价受上游牵制。至于可用性,官方状态页显示 embeddings API 约 99.96% 在线、全年仅零星数分钟中断;独立监测(Tickerr)记到 2026 年 7 月 14 日一次约 24 分钟的重大中断、30 天可用性 99.9%,总体稳健但偶有抖动。

  • 适合谁:要把 AI 做成「基础设施」而非「订阅工具」的企业——客服模型训在三年真实工单上、预测模型训在自有供应链数据上、分析助手训在内部报表上,这类场景定制模型往往以小博大。也适合需要稳定生产延迟、强函数调用与结构化输出的 API 型 SaaS。不适合谁:纯粹想要最便宜小模型的极速原型可选 Groq;需要最宽模型族与深度微调选 Together;对冷启动敏感、流量极突发的轻量应用要谨慎,最好常驻暖实例或配故障转移。替代方案就是上述两家加自建 vLLM。

  • Fireworks AI 的真正护城河不在某个模型,而在「PyTorch 级工程 + 专属智能飞轮」:把企业私有数据变成越用越强的定制模型,并以生产级可靠性交付。风险同样清晰——夹在云巨头与前沿实验室之间、依赖未审计的高增长叙事、且推理终局可能走向商品化。对想「拥有自己 AI」的公司,它是当下最完整的一站式选择之一;对只想省钱的开发者,它未必是最便宜的那个。

用户评论

  • 头像
    MLewisQ
    把客服模型从 gpt-4o-mini 迁过来,首次出词直接砍到 110ms,体感明显。

  • 头像
    月光_2
    D 轮 15 亿刀、估值 175 亿,林乔这步「拥有自己的 AI」赌注算是被市场认了。

  • 头像
    AshleyJimenez_X18
    OpenAI 兼容,迁移几分钟搞定,这点对懒人太友好了。

  • 头像
    3cetni
    批量推理打五折,跑文档处理和夜间 eval pipeline 很划算。

  • 头像
    Alexander_GreenX221
    官方那个自动微调智能体挺省事,描述目标传数据就帮找超参,新手友好。

  • 头像
    RonaldBarnes_20217
    7 月 14 号那次中断二十多分钟,凌晨告警把我吵醒了。

  • 头像
    沈琪怡
    新模型上架是真的快,DeepSeek V4、GLM 5.2、Qwen3.7 这些基本几天内就上,不用苦等。

  • 头像
    Jennifer_Hughes_996
    PyTorch 原班人马做的推理层,工程底子确实硬,CUDA 内核优化不是吹的。

  • 头像
    Sean_Ramos_778
    函数是真稳,FireFunction 调 12 个工具基本一遍过。

  • 头像
    DeborahKim520
    规模上来后被限流搞怕了。免费和低价档节流很凶,付费档流量高峰照样撞 429。我们最后花两周写了个路由做故障转移,省下的钱又搭进去不少。建议用量大的团队一开始就把 fallback 架构设计好。

  • 头像
    Gregory.Ross_2020799
    回不去了。

  • 头像
    何明
    Fireworks 真香。

  • 头像
    孙睿月
    我们日处理 5000 万 Token 的分类管线,月账单从 OpenAI 的 4200 刀掉到 1100 刀,eval 上没看出质量回退。

  • 头像
    Sean_HendersonIII
    结构化输出强制 JSON,agent 里省了不少心。

  • 头像
    孙彤哲
    用了快半年,最满意的是延迟和函数调用。Llama 3.1 8B 的 p50 TTFT 稳定在 80 到 180ms,70B 也就 150 到 350ms。但冷启动是真坑,serverless 空闲后再调要 1 到 3 秒预热,我们这种流量突发的 B2B SaaS 被搞得很惨,最后只能常驻暖池,成本优势被吃回去一部分。

  • 头像
    SatsChaserLarsen
    微调有上限,想训 70B 大模型被单任务 Token 上限逼着拆成好几份,训练看板也比不上 W&B 和 Modal。

  • 头像
    JAdams_2024
    在 r/LocalLLaMA 看到的共识:Fireworks 不像 Together 那种模型超市,也不像 Groq 只拼速度,它就是稳。我们生产环境跑下来可用性确实比 Groq 高,函数调用比原生 Llama 强一大截。代价是模型没那么多,想用偏门模型还是得回 Together。

  • 头像
    nlptd
    中端客户支持有点慢,非紧急问题等个一两天是常态。

  • 头像
    BrendaCastillo_202332
    说点实在的:它不是来跟 OpenAI 拼谁模型更强,而是帮你把开源权重在自家数据上微调后上线。我们客服模型训在三年真实工单上,处理自家用户就是比通用模型顺。但这套飞轮一旦转起来,想换平台成本很高,绑定得想清楚。

  • 头像
    KatherineHernandez
    价格比 Groq 贵一截,但比 Together 略便宜,看你怎么取舍。

  • 头像
    郑宇梅
    我们拿 Fireworks 给内部 coding assistant 做微调,参考 Cursor 那套思路。量化后的模型质量 degradation 很小,推理速度还比自托管 vLLM 稳。关键是 checkpoint 训完几秒就能上线,迭代节奏比之前快了一个量级,工程团队终于不用天天盯着 GPU 了。

  • 头像
    Bobby.Watson_2021
    对比下来三家各有坑:Groq 最快但模型少还不支持微调;Together 模型最全微调最强;Fireworks 最均衡、生产最稳。我们最终 Groq 扛延迟敏感路径、Fireworks 作兜底、Together 补长尾,三家的钱都花。