Foresight by Lightning Rod
兼容 OpenAI 的 AI 预测 API,为真实未来事件返回校准概率,比前沿模型更准更便宜
深度报告
-
Foresight 是 Lightning Rod Labs 推出的一款面向开发者的预测 API,核心能力不是生成「听起来正确」的文字,而是针对任何未来真实事件返回经过校准的概率。它完全兼容 OpenAI API 格式,开发者改动几行代码即可接入,在已解决的真实预测市场题目上的 Brier Skill Score 超过 GPT-5、Gemini 3.1 Pro、Opus 4.6 等前沿模型,而推理价格仅为对手的 1/4 到 1/2。其底层方法论 Future-as-Label 被 ICML 2026 AI Forecasting Workshop 选为 Spotlight,并被美国国防创新市场列入可采购清单。
-
Lightning Rod Labs 由 Ben Turtel 创立并担任 CEO。在创办公司前,他曾把视频平台 Kazm 卖给哈佛大学,担任 Google Area 120 内部项目 Rivet 的创始人兼 CTO,在 Google 有六年以上的软件工程师经验,并拥有纽约大学科学计算硕士学位。公司的技术路线最早可追溯至 2025 年 5 月发表于 TMLR 的论文——一个 14B 模型在预测准确度上追平 OpenAI o1,并在实时交易模拟中产生超过 10% 的收益。 公司定位很清晰:通用大模型被训练来模仿文本,而 Lightning Rod 主张用真实世界的结果来训练模型做预测。这一思路在 2025 年 7 月即被验证——Foresight-32B 在实时 Polymarket 数据上击败了体量百倍于己的前沿模型。此后团队陆续在 ProphetArena、ForecastBench、体育预测等公开基准上拿下第一。
-
Foresight 对外提供的是一组预测模型,以 API 形式交付。调用方式与 OpenAI 完全一致:把客户端 base_url 指向对应地址,再传入模型名与问题即可。区别在于请求体里多了两个预测专用参数——research 控制是否自动联网检索上下文,answer_type 控制返回格式。模型最终输出既有概率也有推理过程。 其训练方法 Future-as-Label 是产品真正的护城河。传统大模型用海量静态文本做预测;Foresight 则把历史数据中晚于预测时刻才出现的真实结果当作标签,让模型从真实因果里学习,而不是模仿通用文本。这样做带来的直接收益是校准:如果模型给某事件 70% 的概率,长期来看它就该在约 70% 的情况下发生。ICML 2026 的工作坊论文显示,这一方法让 Brier 分数提升约 27%,校准误差减半,且用 32B 模型就能压过更大的模型。 在能力延展上,Foresight 不只做公开市场和政治预测。团队把同一套流水线搬到多个垂直域:用 10-K 财报训练的模型预测上市公司风险实质化,准确度与 GPT-5 持平、校准好三倍;用美联储 Beige Book 预测区域经济,准确度高出 GPT-5 约 26%;用公开新闻与贸易指数覆盖 25 个国家、88 种商品的供应链中断预测,准确度与校准分别优于 GPT-5 约 34% 与 59%;在 MIMIC-III 临床记录上预测临床事件,校准误差下降约 70%,Brier 分数略胜 GPT-5。
-
公开模型按 token 计价,Foresight 为每百万输出 token 6 美元,对比 GPT-5、Gemini 3.1 Pro、GPT-5.4、Opus 4.6,价格分别是后者的 1.7 倍到 4.2 倍更低。每千次预测的综合成本也显著低于通用模型。新用户注册可获 50 美元免费额度,Product Hunt 活动期间还可用优惠码再领 50 美元额度。 商业模式有两条腿。一条是面向开发者与量化团队的公开推理 API;另一条是面向企业与政府的私有化定制——客户用自己的杂乱数据通过 SDK 自动生成训练集并微调专属预测模型,部署在自有云端,数据不出域。政府侧已通过 DARPA 相关资质审核,可经联邦创新市场直接采购。
-
支持者最买账的是「校准概率」这个切入点。Product Hunt 上不少开发者表示,与其问通用大模型要一个没有校准依据的概率,不如直接拿一个被打过分的预测;对预测市场机器人、做市、风险监控这类需要可以直接行动的概率的场景尤其有价值。OpenAI 兼容的接口形态也被反复称赞。该产品上线即拿下 Product Hunt 当日第三。 负向反馈集中在三点。其一,重度使用必须付费、没有免费档,对想先验证的团队是一道门槛。其二,概率输出本身仍需下游做解释与二次校准,不能直接当真理用。其三是社区提出的相关性风险:当大量预测 agent 都跑同一个底层模型,它们的预测会趋于相关,这在依赖独立信号的系统里会改变性质。还有人关心校准漂移。
-
在学术与基准层面,Foresight 的战绩相当硬。它在 ProphetArena 总榜按 Brier 分数排第一,把 GPT-5、Gemini 3 Pro 及所有前沿模型甩在身后,体育分榜同样是第一;在 ForecastBench 上进入前五,超过 Gemini 3 Pro、Claude Sonnet 4.5 与 o3;v3 在 ForecastBench 上落入超级预测者中位区间,且是在单张 GPU 上跑出来的。多家第三方工具站将其列为比通用 LLM 更准、更便宜的预测 API。 横向看,Foresight 的差异化不在又一个大模型,而在把预测本身当成一个独立问题来建模。它不试图覆盖聊天、写作等通用能力,而是专攻校准概率这一垂直能力,并用更低的推理成本换取在 agent 循环里高频调用的可行性。
-
风险点主要来自产品定位本身。第一,预测市场对校准高度敏感,一旦真实了结结果偏离模型长期校准曲线,信任会快速流失,而官方对校准漂移的监控机制披露有限。第二,相关性风险如前所述。第三,高后果、低概率事件即便概率低也可能需要行动,模型如何在低概率下给出可操作提示,官方文档尚未充分说明。第四,企业私有化训练依赖客户自有数据的质量与时序结构,若历史数据本身有偏,预测也会继承偏误。
-
这款产品最适合已经在用 OpenAI API、且工作流里需要回答接下来会发生什么的团队:预测市场做市与套利机器人开发者、需要预测工具的 agent 构建者、以及要监控供应链冲击、政策动作、财报意外的风险与量化团队。它也适合想把自有历史数据变成可部署预测模型的企业与政府机构。 不太适合的人群是:只想在对话框里聊聊未来的普通用户;对免费额度依赖度高、又不愿先付 API key 的个人玩家;以及需要模型给出确定性结论而非概率分布的决策场景。如果你的需求是通用写作或问答,直接用前沿通用模型更划算;如果你的需求是成千上万次、可被程序直接消费的概率预测,Foresight 的性价比与校准质量值得一试。
-
Foresight 把预测从通用大模型的附赠能力,重新定义成一门独立的、可被基准验证的工程能力——用真实结果训练、用校准概率交付、用 OpenAI 兼容的接口降低接入门槛。在预测市场、风险监控与 agent 工作流这类场景里,它是目前公开基准上最便宜也最准的选择之一;能否持续兑现校准承诺、并化解规模化部署后的相关性风险,将决定它从工具变平台的距离。
用户评论
-
彭萍桂—校准概率这个角度真刁钻,比问通用大模型要个没依据的猜测靠谱多了。 -
Shirley_Torres_2022—每百万 token 才 6 美元,比 Opus 便宜四倍多,量大真的香。 -
JeffreyPowell_99—OpenAI 兼容太省事了,改个 base_url 就能接进现有 agent 流水线,零重构。 -
u0ns5—我最大的顾虑是校准漂移。模型在 Polymarket 上赢了不假,可事件一旦大量了结,它还能不能保持长期校准?官方说持续对照实时基准,但具体是流式验证还是周期评估没说清楚,这点对实盘特别重要。 -
PatrickHendersonQ—我们之前用 GPT-5 跑预测市场机器人,一个月 token 费用吓死人。换成 Foresight 之后成本直接砍到四分之一,校准还更好,已经准备全量切过去了。 -
iBertaFleury_pro—有人拿它做供应链中断预测,覆盖 25 国 88 种商品,准确度比 GPT-5 高三成以上,这比纯聊天模型务实太多了。 -
Steven_Russell_77—Product Hunt 当日第三,有点东西。 -
Douglas_Hall_77—相关性风险是真问题。如果一堆预测 agent 都调同一个底层模型,它们的概率会越来越像,到头来系统里全是相关信号。官方说企业可私有化训练,但通用 API 这层怎么破?希望后续能开放 ensemble 接口。 -
BWood_7703—重度使用要付费、没有免费档,个人玩家先被挡在门外了。 -
Megan_Hicks—我们风控组接了 Foresight 监控政策动作和财报意外。以前靠分析师拍脑袋给概率,现在直接喂新闻和 SEC 文件出校准分布,决策会上终于有可被质疑、可被追溯的数字了。不过低概率高后果事件还是得人盯着,不能全信模型。 -
3611ENAW—answer_type 设 auto 直接吐 <answer> 标签里的校准概率,解析起来很顺手,配合 research=True 还能自动拉上下文,省了自己再接搜索。 -
buJEN—比起「70% 会降息」这种嘴上说说的预测,我更信它有 Brier 分数背书、还落进超级预测者区间。量化团队就吃这一套,毕竟我们在 ProphetArena 上比对过,它总榜第一、体育分榜也是第一,比直接问 GPT-5 拿个没校准的概率踏实多了,回测时也不会被假确信带偏。 -
黎伟丹—文档里说单张 GPU 就能跑 v3,私有部署数据不出域,这点对金融客户很关键。 -
顾龙强—校准区间会在返回里给吗?还是只有点估计?实盘里知道何时别信它,比知道概率本身更值钱。 -
Frank_PerezZ—把预测做成独立能力而非大模型的附赠,思路很清楚。 -
SOcol—试了用它做做市:拉 Polymarket 实时盘口,拿模型概率给每个合约定价,吃市场价和公允值之间的价差。一晚跑了数千次调用,成本比用前沿模型低一个数量级,速度也跟得上。唯一担心的是同类 agent 多了之后信号同质化。