EverMind Raven

基於 EverOS 自研記憶系統的深度自進化 AI Agent 框架,可重寫自身程式碼

深度報告

  • EverMind Raven(中文名「渡鴉」)是盛大集團孵化的 AI 科技團隊 EverMind 於 2026 年 7 月 8 日釋出的深度自進化智慧體框架(Agent Harness)。它構建在 EverMind 自研的記憶作業系統 EverOS 之上,透過雙向記憶機制與可重寫自身程式碼的進化能力,試圖將 AI 從「被動響應的工具」推向「主動進化的數字生命」。官方將其定位為「The Self-Improving Agent Harness」——圍繞記憶、工具、技能、程式碼執行和策略做持續改進的智慧體底座。Raven 目前已開源,支援 macOS 與 Windows,託管於 GitHub,並以 Apache-2.0 協議釋出。

  • 長期以來,大模型存在一個基礎性痛點——AI 的「失憶症」。當使用者關閉對話視窗,無論剛才的交流多麼深入,AI 都會瞬間清空一切回到初始狀態。這種被稱為「無狀態」的技術侷限,成為 AI 向真正智慧體演進的瓶頸。過去兩年行業普遍採用 RAG(檢索增強生成)或不斷擴大上下文視窗來應對,但 EverMind 團隊認為這些方案本質上仍是「高階書籤系統」——「真正的記憶不是檢索,而是內化」。 EverMind 提出的判斷是:記憶,是區分「工具」與「智慧體」的分界線。一個沒有記憶的實體,無法表現出一致性、無法從經驗中學習、也無法演化。基於此,EverMind 規劃了數字生命演進的四個階段:L1 角色化指令體(當前多數套殼 AI)、L2 記憶增強體、L3 自我進化體、L4 全自主數字生命。Raven 的釋出,代表 EverMind 向 L3 階段邁出了實質性一步。

  • Raven 依託 EverOS 底層的「四層仿生架構」工作,透過代理層、記憶層、索引層和介面層協同運作。原始對話流被切分為獨立的記憶單元,再經聚類演算法形成「記憶場景」,最終構建出包含使用者身份、偏好、技能及工作目標的深度畫像。 在程式碼層面,Raven 的 GitHub 倉庫顯示其執行時圍繞一條名為 Spine 的主幹組織:每一輪互動都流經 submit(提交)→ lanes(車道,負責排序與取消)→ emit(產出)的單一入口與單一出口,各特徵引擎透過顯式交接(handoff)而非相互 import 的方式接入 Agent Loop。特徵引擎包括:Context Engine(上下文組裝與 Curator 路徑)、Memory Engine(EverOS 記憶、本地技能、SkillForge)、Proactive Engine(Sentinel 排程與提醒策略)、TokenWise(用量追蹤與快取路由)以及 Eval Engine(任務判斷與協調)。倉庫當前處於 pre-alpha 階段,但核心產品介面(原生 TUI + CLI、Spine 執行時、基礎 Agent Loop、Context Engine、Sentinel 主動性、TokenWise、SkillForge)已可用,Eval Engine 仍部分實現。

  • Raven 的記憶是雙向且動態的。它基於 EverOS 的深度畫像能力,將每一次互動中的關鍵資訊內化為對使用者的認知模型——不是「翻閱你的檔案」,而是「用你的經歷持續更新它對你的理解」。它會在你不知情時記住你「喝咖啡不加糖」「寫稿先列提綱」,而這些偏好會成為它認知的一部分。 更重要的是,這種記憶是雙向的:Raven 不僅記住了你,還會從與你的每一次互動中提煉出對自身能力的反思和改進方向。如果你糾正了它的一個錯誤,它不僅會記住正確答案,還會反思自己為什麼出錯,並在下次互動中改進。EverOS 1.1.0 引入了三層記憶分類法——使用者記憶(定義「人」)、智慧體記憶(定義「智慧體」)和世界知識(Knowledge Wiki,定義「世界」),並配套一套受人類沉思啟發的 Reflection 機制,讓智慧體在空閒時段自動整合與鞏固 intelligence。 測試資料顯示,在 EverOS 支撐下,Raven 能以傳統方案約 1/10 的 Token 消耗,實現超越全量上下文(Full Context)的準確率。官方基準 LoCoMo 達 93.05%、LongMemEval 達 83.00%、HaluMem 達 93.04%。

  • Raven 最核心、也最具話題性的能力,是「改寫自身程式碼」。它不僅能重寫自己的技能、執行時邏輯和策略,甚至可以透過使用者側個性化小模型 EverBrain 動態微調模型權重。這意味著 Raven 能從成功任務中提煉最佳實踐,從失敗中識別改進空間,並將洞察直接寫入程式碼,實現經驗內化與能力迭代。 Raven 內建約 10 萬項經過深度評測的技能,覆蓋從日常生產力到專業垂直領域的廣泛場景。這些技能並非一成不變:在實際使用中,Raven 會持續評估哪些技能好用、哪些失效,然後主動淘汰、強化或組合出新的技能。這種「技能記憶」(Skill Memory)是非引數化、自我進化的——EverOS 將智慧體軌跡記錄為 Cases(案例),把重複出現的模式提煉為可複用的 Skills,使智慧體能從先前經驗中學習,隨時間持續改進,而不是每項任務都從零開始。

  • Raven 以「記憶優先」為設計理念,提供原生終端 TUI 與 CLI 介面,並內建 gateway 連線 Telegram、Discord、Slack、Matrix、WhatsApp、企業微信等訊息平臺。它內建工具管理器,可自動安裝、更新或撤除外部工具,並支援多模型切換(Anthropic、OpenAI、Claude 等)。 安裝採用一行命令:macOS / Linux 執行 curl -fsSL https://raven.evermind.ai/install.sh | bash,Windows 使用 PowerShell irm https://raven.evermind.ai/install.ps1 | iex,隨後 raven start 即可啟動。開發者可將成功工作流封裝為可複用的 Agent Template 或「數字工作者」,並透過 Raven Builder 為任意場景定義專屬 Agent 並一鍵分享。 作為開放平臺,Raven 的記憶模組、主動性引擎和工具路由完全獨立,開發者無需觸及核心框架即可自由替換任何元件。其高度解耦的模組化架構形成正向飛輪:更多智慧體建立帶來更多使用資料,資料反哺 EverOS 使記憶系統更精準,進而推動新智慧體更快進化。

  • 多智慧體系統:編排多個 AI 代理需要複雜協調與任務分配,Raven 的群組記憶(Group Memory)與 Memory Bank 讓跨平臺智慧體共享知識與團隊上下文。 個性化 AI 伴侶:從個人助手到療愈聊天機器人,陪伴型 AI 需要真正的長期記憶才能帶來情感智慧與行為一致性。 企業知識庫:構建隨團隊演化的組織記憶,AI 從內部討論、文件與決策中學習,成為企業制度性知識層。 客戶支援智慧:記住歷史問題、解決記錄、客戶偏好與溝通風格,讓支援「有溫度且連續」。 可穿戴硬體:將碎片化互動、視覺線索與語音指令處理為結構化模式,讓硬體主動預判需求。 單人生產力:商務使用者微信發語音即可下達「整理跨國會議紀要、提煉三項核心任務、錄入專案系統並郵件通知負責人」,Raven 一站式跑完流程。EverMind 設想的未來是「單人 + 智慧 Agent」勝任以往數十人工作量。

  • EverMind 的學術團隊同步構築了理論護城河,近期連發數篇頂級論文:MSA(Memory Sparse Attention)端到端可訓練稀疏注意力機制,將上下文擴充套件至 1 億 Token、效能衰減不足 9%,釋出當日登頂 HuggingFace Daily Papers;HyperMem 超圖層次化記憶架構在 LoCoMo 達 92.73% SOTA,獲 ACL 2026 Oral;EverMemOS 自組織記憶作業系統入選 ACL 2026 主會;多方協作對話長時記憶評測填補行業空白,獲 KDD 2026 Oral。 EverOS 開源後約一個月內 GitHub Star 突破 10,000,增速超過 mem0 前七個月約 7,000 的水平。EverMind 全棧生態涵蓋 EverBrain(個性化記憶模型)、EverOS(記憶作業系統與 Agent 基礎設施)、Raven(自進化 Agent Harness)、EverMe(個人記憶中心),並以 ReUnite 公益尋人平臺踐行「科技向善」。

  • Raven 代表了自進化智慧體從 L2(記憶增強)向 L3(自我進化)的實質性跨越。其「記憶不是檔案館而是神經網路」「不是查到而是悟到」的理念,以及 1/10 Token 消耗實現超全量上下文準確率的指標,的確在正規化層面具有吸引力。開源優先、Apache-2.0 協議與一行命令部署,顯著降低了企業與個人使用門檻,有利於構建類似 Android / Windows 的底層開發者生態護城河。 但客觀看,Raven 仍處於 pre-alpha,API 可能隨時變化,不宜以成熟生產系統理解。其「可重寫自身程式碼」的激進能力在帶來迭代效率的同時,也引申出可解釋性、安全邊界與失控風險等工程與治理問題。對開發者而言,Raven 當前更像是一個早期但野心很大的 Harness 樣本,值得跟蹤,但落地到關鍵業務仍需謹慎評估穩定性與可監控性。

使用者評論

  • 頭像
    KellyBarnesX
    EverBrain 那個使用者側小模型能動態微調權重這個點很關鍵,等於記憶真正反哺了模型本身,而不是隻在提示詞裡打補丁。

  • 頭像
    BreadBudNielsen
    「記憶不是檢索而是內化」這句話說到點子上了。傳統 RAG 就是個高階書籤,Raven 這種雙向記憶才算像人。

  • 頭像
    MChavezII632
    我把 Raven 接到了 Discord 和 Slack,群組記憶能讓幾個頻道共享上下文,做團隊知識庫雛形挺順手的。

  • 頭像
    SHernandezQ
    作為開發者最驚喜的是架構解耦,記憶、工具路由、主動性引擎都能單獨換,不用被綁死在核心框架上。

  • 頭像
    薛明強
    EverOS 開源一個月 Star 就破萬,增速確實猛,社群氛圍也起來了,跟著 mem0 的節奏明顯快一截。

  • 頭像
    RasmusChristiansen
    Token 消耗只有全量上下文的十分之一還能超準確率,長文件處理成本肉眼可見降下來了,對小團隊很實用。

  • 頭像
    Sandra.Kim_Pro
    它真能把成功的工作流沉澱成可複用的 Agent Template,我讓它整理了三天的會議紀要,後面直接複用模板,效率直接起飛。

  • 頭像
    jEFFREYrOGERS
    裝了 Raven 玩了一晚上,記憶是真的能跨會話保留,第二天接著聊它還記得我昨天說的偏好,比一堆套殼助手強太多了。

  • 頭像
    ZHillIII
    客觀說,L3 自我進化的故事講得漂亮,但「改寫自身程式碼」帶來的安全和失控風險被談得不夠。我建議真要落地關鍵業務前,先把它當黑盒壓測一遍:故意喂錯誤反饋看它會不會把錯誤經驗固化成技能,再檢查 SkillForge 生成的技能有沒有越權呼叫。Raven 現在更像一個野心很大的早期樣本,值得跟蹤,但把它當成熟平臺用還為時過早。

  • 頭像
    Megan_Campbell_2021
    嘗試用 Raven Builder 給客服場景定義了一個專屬 Agent,一鍵分享到 EverMe,整個流程比想象中簡單,非技術同事也能上手。我們小團隊拿它做了個售前問答助手,把歷史工單喂進去之後,它回答的連貫度明顯比之前用固定提示詞的那版高,客戶也反饋「這次終於記得我上次問過什麼」。不過高峰期偶爾會卡在 Memory Bank 的寫入上,估計是 EverOS 那邊還要再最佳化吞吐。

  • 頭像
    ASICant433
    10 萬內建技能這數字太誇張了,實測常用場景確實開箱即用,不過我後來仔細翻了技能庫,發現很多垂直領域技能還只是腳手架級別,真要上生產得自己再調一遍,不能全信這個數量。建議官方把「經評測」的標準透明出來,不然新手很容易誤以為開箱即全能。

  • 頭像
    GregoryGray_2021
    LoCoMo 93%、LongMemEval 83% 這些基準是真能復現的,我跑了官方開源評測指令碼,資料基本對得上,這點比很多隻會喊口號的強。

  • 頭像
    iDylanLewis_dev
    「可重寫自身程式碼」聽著很酷,但也讓人有點慌,我拿它跑了個資料清洗任務,它確實自己改了工具呼叫順序讓成功率上去了,可我完全看不出它改了哪。萬一它改錯了策略誰來兜底?希望官方早點出可解釋性和回滾機制,不然這種黑盒自我進化我是不敢接關鍵業務的。

  • 頭像
    DVasquez_2021
    現在還是 pre-alpha,API 說變就變,我上週寫的指令碼這周就跑不起來了,生產環境慎用,當玩具和實驗平臺倒是沒話說。我自己的做法是把所有配置和 Agent Template 都進版本庫,每次升級先 diff 一遍再決定要不要跟,這樣至少不會半夜被一個 breaking change 搞崩。

  • 頭像
    MoniqueRamos
    一行命令就裝好了,curl 那個 install.sh 跑完 raven start 直接進 TUI,對終端黨很友好。