Foresight by Lightning Rod
相容 OpenAI 的 AI 預測 API,為真實未來事件返回校準機率,比前沿模型更準更便宜
深度報告
-
Foresight 是 Lightning Rod Labs 推出的一款面向開發者的預測 API,核心能力不是生成「聽起來正確」的文字,而是針對任何未來真實事件返回經過校準的機率。它完全相容 OpenAI API 格式,開發者改動幾行程式碼即可接入,在已解決的真實預測市場題目上的 Brier Skill Score 超過 GPT-5、Gemini 3.1 Pro、Opus 4.6 等前沿模型,而推理價格僅為對手的 1/4 到 1/2。其底層方法論 Future-as-Label 被 ICML 2026 AI Forecasting Workshop 選為 Spotlight,並被美國國防創新市場列入可採購清單。
-
Lightning Rod Labs 由 Ben Turtel 創立並擔任 CEO。在創辦公司前,他曾把影片平臺 Kazm 賣給哈佛大學,擔任 Google Area 120 內部專案 Rivet 的創始人兼 CTO,在 Google 有六年以上的軟體工程師經驗,並擁有紐約大學科學計算碩士學位。公司的技術路線最早可追溯至 2025 年 5 月發表於 TMLR 的論文——一個 14B 模型在預測準確度上追平 OpenAI o1,並在實時交易模擬中產生超過 10% 的收益。 公司定位很清晰:通用大模型被訓練來模仿文字,而 Lightning Rod 主張用真實世界的結果來訓練模型做預測。這一思路在 2025 年 7 月即被驗證——Foresight-32B 在實時 Polymarket 資料上擊敗了體量百倍於己的前沿模型。此後團隊陸續在 ProphetArena、ForecastBench、體育預測等公開基準上拿下第一。
-
Foresight 對外提供的是一組預測模型,以 API 形式交付。呼叫方式與 OpenAI 完全一致:把客戶端 base_url 指向對應地址,再傳入模型名與問題即可。區別在於請求體裡多了兩個預測專用引數——research 控制是否自動聯網檢索上下文,answer_type 控制返回格式。模型最終輸出既有機率也有推理過程。 其訓練方法 Future-as-Label 是產品真正的護城河。傳統大模型用海量靜態文字做預測;Foresight 則把歷史資料中晚於預測時刻才出現的真實結果當作標籤,讓模型從真實因果裡學習,而不是模仿通用文字。這樣做帶來的直接收益是校準:如果模型給某事件 70% 的機率,長期來看它就該在約 70% 的情況下發生。ICML 2026 的工作坊論文顯示,這一方法讓 Brier 分數提升約 27%,校準誤差減半,且用 32B 模型就能壓過更大的模型。 在能力延展上,Foresight 不只做公開市場和政治預測。團隊把同一套流水線搬到多個垂直域:用 10-K 財報訓練的模型預測上市公司風險實質化,準確度與 GPT-5 持平、校準好三倍;用美聯儲 Beige Book 預測區域經濟,準確度高出 GPT-5 約 26%;用公開新聞與貿易指數覆蓋 25 個國家、88 種商品的供應鏈中斷預測,準確度與校準分別優於 GPT-5 約 34% 與 59%;在 MIMIC-III 臨床記錄上預測臨床事件,校準誤差下降約 70%,Brier 分數略勝 GPT-5。
-
公開模型按 token 計價,Foresight 為每百萬輸出 token 6 美元,對比 GPT-5、Gemini 3.1 Pro、GPT-5.4、Opus 4.6,價格分別是後者的 1.7 倍到 4.2 倍更低。每千次預測的綜合成本也顯著低於通用模型。新使用者註冊可獲 50 美元免費額度,Product Hunt 活動期間還可用優惠碼再領 50 美元額度。 商業模式有兩條腿。一條是面向開發者與量化團隊的公開推理 API;另一條是面向企業與政府的私有化定製——客戶用自己的雜亂資料透過 SDK 自動生成訓練集並微調專屬預測模型,部署在自有云端,資料不出域。政府側已透過 DARPA 相關資質稽核,可經聯邦創新市場直接採購。
-
支持者最買賬的是「校準機率」這個切入點。Product Hunt 上不少開發者表示,與其問通用大模型要一個沒有校準依據的機率,不如直接拿一個被打過分的預測;對預測市場機器人、做市、風險監控這類需要可以直接行動的機率的場景尤其有價值。OpenAI 相容的介面形態也被反覆稱讚。該產品上線即拿下 Product Hunt 當日第三。 負向反饋集中在三點。其一,重度使用必須付費、沒有免費檔,對想先驗證的團隊是一道門檻。其二,機率輸出本身仍需下游做解釋與二次校準,不能直接當真理用。其三是社群提出的相關性風險:當大量預測 agent 都跑同一個底層模型,它們的預測會趨於相關,這在依賴獨立訊號的系統裡會改變性質。還有人關心校準漂移。
-
在學術與基準層面,Foresight 的戰績相當硬。它在 ProphetArena 總榜按 Brier 分數排第一,把 GPT-5、Gemini 3 Pro 及所有前沿模型甩在身後,體育分榜同樣是第一;在 ForecastBench 上進入前五,超過 Gemini 3 Pro、Claude Sonnet 4.5 與 o3;v3 在 ForecastBench 上落入超級預測者中位區間,且是在單張 GPU 上跑出來的。多家第三方工具站將其列為比通用 LLM 更準、更便宜的預測 API。 橫向看,Foresight 的差異化不在又一個大模型,而在把預測本身當成一個獨立問題來建模。它不試圖覆蓋聊天、寫作等通用能力,而是專攻校準機率這一垂直能力,並用更低的推理成本換取在 agent 迴圈裡高頻呼叫的可行性。
-
風險點主要來自產品定位本身。第一,預測市場對校準高度敏感,一旦真實了結結果偏離模型長期校準曲線,信任會快速流失,而官方對校準漂移的監控機制披露有限。第二,相關性風險如前所述。第三,高後果、低機率事件即便機率低也可能需要行動,模型如何在低機率下給出可操作提示,官方文件尚未充分說明。第四,企業私有化訓練依賴客戶自有資料的質量與時序結構,若歷史資料本身有偏,預測也會繼承偏誤。
-
這款產品最適合已經在用 OpenAI API、且工作流裡需要回答接下來會發生什麼的團隊:預測市場做市與套利機器人開發者、需要預測工具的 agent 構建者、以及要監控供應鏈衝擊、政策動作、財報意外的風險與量化團隊。它也適合想把自有歷史資料變成可部署預測模型的企業與政府機構。 不太適合的人群是:只想在對話方塊裡聊聊未來的普通使用者;對免費額度依賴度高、又不願先付 API key 的個人玩家;以及需要模型給出確定性結論而非機率分佈的決策場景。如果你的需求是通用寫作或問答,直接用前沿通用模型更划算;如果你的需求是成千上萬次、可被程式直接消費的機率預測,Foresight 的價效比與校準質量值得一試。
-
Foresight 把預測從通用大模型的附贈能力,重新定義成一門獨立的、可被基準驗證的工程能力——用真實結果訓練、用校準機率交付、用 OpenAI 相容的介面降低接入門檻。在預測市場、風險監控與 agent 工作流這類場景裡,它是目前公開基準上最便宜也最準的選擇之一;能否持續兌現校準承諾、並化解規模化部署後的相關性風險,將決定它從工具變平臺的距離。
使用者評論
-
彭萍桂—校準機率這個角度真刁鑽,比問通用大模型要個沒依據的猜測靠譜多了。 -
Shirley_Torres_2022—每百萬 token 才 6 美元,比 Opus 便宜四倍多,量大真的香。 -
JeffreyPowell_99—OpenAI 相容太省事了,改個 base_url 就能接進現有 agent 流水線,零重構。 -
u0ns5—我最大的顧慮是校準漂移。模型在 Polymarket 上贏了不假,可事件一旦大量了結,它還能不能保持長期校準?官方說持續對照實時基準,但具體是流式驗證還是週期評估沒說清楚,這點對實盤特別重要。 -
PatrickHendersonQ—我們之前用 GPT-5 跑預測市場機器人,一個月 token 費用嚇死人。換成 Foresight 之後成本直接砍到四分之一,校準還更好,已經準備全量切過去了。 -
iBertaFleury_pro—有人拿它做供應鏈中斷預測,覆蓋 25 國 88 種商品,準確度比 GPT-5 高三成以上,這比純聊天模型務實太多了。 -
Steven_Russell_77—Product Hunt 當日第三,有點東西。 -
Douglas_Hall_77—相關性風險是真問題。如果一堆預測 agent 都調同一個底層模型,它們的機率會越來越像,到頭來系統裡全是相關訊號。官方說企業可私有化訓練,但通用 API 這層怎麼破?希望後續能開放 ensemble 介面。 -
BWood_7703—重度使用要付費、沒有免費檔,個人玩家先被擋在門外了。 -
Megan_Hicks—我們風控組接了 Foresight 監控政策動作和財報意外。以前靠分析師拍腦袋給機率,現在直接喂新聞和 SEC 檔案出校準分佈,決策會上終於有可被質疑、可被追溯的數字了。不過低機率高後果事件還是得人盯著,不能全信模型。 -
3611ENAW—answer_type 設 auto 直接吐 <answer> 標籤裡的校準機率,解析起來很順手,配合 research=True 還能自動拉上下文,省了自己再接搜尋。 -
buJEN—比起「70% 會降息」這種嘴上說說的預測,我更信它有 Brier 分數背書、還落進超級預測者區間。量化團隊就吃這一套,畢竟我們在 ProphetArena 上比對過,它總榜第一、體育分榜也是第一,比直接問 GPT-5 拿個沒校準的機率踏實多了,回測時也不會被假確信帶偏。 -
黎偉丹—文件裡說單張 GPU 就能跑 v3,私有部署資料不出域,這點對金融客戶很關鍵。 -
顧龍強—校準區間會在返回裡給嗎?還是隻有點估計?實盤裡知道何時別信它,比知道機率本身更值錢。 -
Frank_PerezZ—把預測做成獨立能力而非大模型的附贈,思路很清楚。 -
SOcol—試了用它做做市:拉 Polymarket 實時盤口,拿模型機率給每個合約定價,吃市場價和公允值之間的價差。一晚跑了數千次呼叫,成本比用前沿模型低一個數量級,速度也跟得上。唯一擔心的是同類 agent 多了之後訊號同質化。