小紅書 RedKnot

小紅書開源的長文字大模型推理加速引擎,沿注意力頭拆分 KV 快取與 FFN,在近乎無損精度下大幅降低長上下文預填充算力與首字延遲

深度報告

  • RedKnot 是小紅書(REDnote)引擎架構部 AI Infra 團隊於 2026 年 6 月底開源的長文字大模型推理加速引擎,底層構建在開源推理框架 SGLang 之上,作為注意力層擴充套件整合。它的核心判斷很樸素:並非每個注意力頭都需要完整的鍵值快取(KV),也並非每個詞元(token)都要走完整的前饋網路(FFN)。沿這個思路,RedKnot 把長文字推理的預填充算力削減了約五到七成,首字延遲(TTFT)帶來 1.35 倍到 2.2 倍的加速,且上下文越長收益越明顯。它不是一個消費級 AI 應用,而是一套面向開發者和服務商的底層推理最佳化基礎設施,採用 Apache-2.0 協議開源。

  • RedKnot 由小紅書主導研發,北京大學與華為雲提供合作支援,核心研發工作由小紅書引擎架構部 AI Infra 團隊的蕭逸、安茲等人完成,配套論文《RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention》由小紅書、北京大學、華為雲的多位作者共同署名,已同步釋出於 arXiv(編號 2606.06256)。小紅書做這件事並不偶然——它在推薦系統、搜尋和多輪 Agent 呼叫場景有深厚積累,內部對長文件檢索增強生成(RAG)、多輪 Agent 排程等需求極其迫切。隨著大模型上下文視窗不斷拉長,長文字推理的視訊記憶體佔用與首字延遲成了服務規模化落地的核心瓶頸,傳統推理引擎在長上下文下預填充延遲過高、短上下文下 FFN 計算又成為瓶頸,RedKnot 正是為解這兩個問題而生。

  • RedKnot 的技術骨架由四塊拼成,三者作用在「頭、儲存、通道」三條正交維度上,收益相乘而非互相爭搶餘量。第一塊是注意力頭分類,它把每個「層 + 頭」組合歸入 global(全域性)、local(區域性)、retrieval(檢索)、dense(稠密)四類,按類別決定 KV 的儲存與複用策略。實測中區域性頭佔比穩定在 83.4% 到 96.8%,也就是說絕大多數頭其實只看區域性視窗,不需要完整上下文。第二塊是離線 KV 複用加 RoPE 重定位,可複用片段的 KV 離線儲存,服務時只選擇性重算必要 token,並用旋轉位置編碼重定位保證數值對齊。第三塊是彈性稀疏或者說稀疏 FFN,基於注意力重要性做 token 級 FFN 選擇,跳過低貢獻 token 的前饋計算,這條特別針對 Agent 場景常見的 2K 到 8K 短片段——在那個長度下 FFN 才是預填充的真正瓶頸,佔首字延遲的五成到六成。第四塊是 SegPagedAttention 執行時,為每個頭建立獨立頁表加分段 KV 儲存,讓不同類別的頭擁有各自不同的可見視窗,全程留在 FlashAttention 快速路徑上,不構造 attn_mask,從而避開了傳統字首快取一旦傳入掩碼就退回慢核函式、帶來 4.9 到 7.6 倍懲罰的老問題。 因為 RedKnot 是作為 SGLang 的注意力層擴充套件整合,它完整保留了 RadixAttention、零開銷排程、PD 分離、連續批處理、量化等原生高效能能力,服務商無需重構原有架構即可接入。程式碼已公開維護在 GitHub(rednote-machine-learning/RedKnot),一行命令即可復現全部 RAG 基準測試。

  • RedKnot 本身開源免費,採用 Apache-2.0 協議,沒有商業定價。它的價值不在直接變現,而在降低小紅書自身及外部開發者執行長上下文模型的算力成本。對算力資源日益緊缺的推理服務商而言,這種透過底層架構精細化拆解來緩解長文字推理負擔的思路,等於用更少的 GPU 幹更多的活。團隊表示 DeepSeek-V4 與完整 Qwen 3.5 系列將在下一版本完整適配,目前開源的是基礎版本。

  • 作為剛開源的基礎設施,RedKnot 的真實使用者反饋主要來自開源社群和技術媒體,尚未形成大規模終端使用者口碑。社群普遍認可它把 KV 快取從「按 token 統一管理的被動資料塊」變成了「按注意力頭拆分的、模型感知的執行時基礎設施」這一視角創新,認為它給長上下文服務提供了一個有價值的思考框架:複用的收益能不能落地,取決於複用與重算的粒度是否對齊了模型推理的內在結構。也有開發者指出,GitHub 倉庫在初始化階段內容尚不完整,配套文件和更多模型的適配還在路上,需要時間驗證工程成熟度。

  • 多家中文科技媒體對 RedKnot 給出了偏正面的解讀。行業觀點認為,它將稀疏化粒度從傳統的 token 級下沉到注意力頭級,並引入與注意力正交的 FFN 稀疏化,與現有注意力最佳化方法形成乘法疊加收益,是長文字推理領域一次有代表性的系統級創新。在 8 卡 H800 的實測中,RedKnot 將 TTFT 加速 1.6 倍到 3.54 倍,單卡併發能力提升 4.7 倍到 7.8 倍,預填充階段算力消耗削減 67% 到 79.5%;在 DeepSeek-V4-Flash 的 128K 超長上下文任務上,首字生成速度提升 5.16 倍,KV 資料傳輸效率最佳化 6.3 倍,推理精度仍保持在稠密模型效能的 95% 以上。有評測認為,RedKnot 在長上下文推理加速方向上與 vLLM、SGLang 原生最佳化形成了互補而非替代關係,更適合作為高效能推理棧的可選擴充套件。

  • RedKnot 當前最明確的已知風險來自團隊自己的誠實披露:在 Llama-3.3-70B 的長文字場景下,RedKnot 的 decode 路徑存在退化,仍待進一步排查。這意味著它並非對所有模型都即插即用,適配範圍目前集中在 Qwen、Mistral、Llama 等已驗證模型,DeepSeek-V4 與完整 Qwen 3.5 系列尚待下一版適配。此外,作為一項偏底層的系統最佳化,它的收益高度依賴具體模型結構、上下文長度與服務負載,通用場景下的穩定性仍需更多生產環境檢驗。稀疏化帶來的是「近乎無損」而非「絕對無損」,在對精度極度敏感的金融、醫療等場景,仍需謹慎評估。

  • RedKnot 適合兩類人:一是執行長上下文大模型服務的工程師與團隊,尤其是做長文件 RAG、多輪 Agent 編排、長會話記憶系統、多 Agent 協作框架、實時流式長文字生成的服務商,它能直接緩解視訊記憶體與首字延遲壓力;二是研究推理系統最佳化的學者與基礎設施愛好者,可基於其開原始碼做二次研究。它不太適合只想用現成 AI 應用、不碰部署的普通使用者。如果團隊追求開箱即用的成熟方案,vLLM、SGLang 原生能力仍是更穩妥的預設選擇;若長上下文成本已成痛點,RedKnot 值得作為補充擴充套件評估試用。

  • RedKnot 是小紅書把內部推理系統經驗外溢為開源基礎設施的一次紮實嘗試,它用「按頭拆分 KV」的樸素洞察撬動了長文字推理的效率天花板,在近乎不損精度的前提下把預填充算力砍掉大半。它未必會取代現有推理引擎,但很可能成為高效能長上下文服務棧裡一個值得關注的拼圖。

使用者評論

  • 頭像
    CYcoo
    按頭拆 KV 這個思路確實比 token 級稀疏更貼合模型結構,點贊。

  • 頭像
    Eric_SandersX
    Llama-3.3-70B 長文字 decode 會退化,團隊自己都寫了,態度可以。

  • 頭像
    zure1yg
    Apache-2.0 協議,商用無憂,準備 fork 一份研究。

  • 頭像
    Raymond.Rivera_888
    小紅書這次開源挺實在,論文和程式碼一起放,比只發部落格強多了。

  • 頭像
    PhoenixFireColeman
    GitHub 上 star 漲得很快,社群熱度起來了。

  • 頭像
    h22n5dovn
    倉庫現在還是初始化階段,文件不全,想直接上生產的話得自己啃程式碼。

  • 頭像
    PeytonKristensen
    我們做長文件 RAG 的,之前 SGLang 跑 32K 上下文首字延遲經常過兩秒,接上 RedKnot 的注意力頭分類後穩定在 0.9 秒左右,精度幾乎沒掉,這周的 P99 指標好看了不少,已經準備推到預發環境再觀察一週。

  • 頭像
    Jack220
    單卡併發能從 4 路提到 30 路以上,長會話記憶場景太友好了。

  • 頭像
    urpzgze1y
    我們主要在短上下文的 Agent 場景用,2K 到 8K 的片段裡 FFN 才是瓶頸,RedKnot 的稀疏 FFN 跳過那些低貢獻 token 的前饋,TTFT 直接砍掉一截,多輪工具呼叫順滑很多,這塊收益比長文字還明顯。

  • 頭像
    DDiaz_7
    認真讀了論文,位置無關 KV 複用(PIC)以前加速不明顯,是因為傳入掩碼就退回慢核函式、帶來四到七倍懲罰,RedKnot 用 RoPE 重定位加 SegPagedAttention 把這個問題繞開了,工程上很聰明,難怪精度能保住。

  • 頭像
    haSAN
    在 8 卡 L20Y 上覆現了 Qwen3-32B 的 HotpotQA,16K 到 32K 下 F1 確實不低於基線,TTFT 從 1.39x 漲到 1.93x,FLOPs 省了七成左右,和官方資料對得上,沒有虛標。

  • 頭像
    琉璃
    論文署名有北大和華為雲,產學研結合,質量有保障。

  • 頭像
    天涯573
    和 vLLM 的實測對比過,RedKnot 不是替代而是補充,它作為 SGLang 的注意力層擴充套件存在,保留了 RadixAttention、連續批處理、量化這些能力,接入成本不高,適合已經被 SGLang 棧繫結的團隊。

  • 頭像
    nODElINK
    深度用了兩週,結論是長上下文越長越划算,我們 128K 的檢索任務首字速度翻了五倍多,KV 傳輸也最佳化了不少,不過要注意它目前對 Qwen、Mistral、Llama 適配最好,別的模型得自己驗證。

  • 頭像
    Larry.Moore_202218
    踩了個坑提醒一下:DeepSeek-V4 和完整 Qwen 3.5 系列官方說下一版才完整適配,現在基礎版跑這兩個模型要自己改配置,別直接照著 README 的預設引數上,容易在 decode 階段退化。