EverMind Raven

基于 EverOS 自研记忆系统的深度自进化 AI Agent 框架,可重写自身代码

深度报告

  • EverMind Raven(中文名「渡鸦」)是盛大集团孵化的 AI 科技团队 EverMind 于 2026 年 7 月 8 日发布的深度自进化智能体框架(Agent Harness)。它构建在 EverMind 自研的记忆操作系统 EverOS 之上,通过双向记忆机制与可重写自身代码的进化能力,试图将 AI 从「被动响应的工具」推向「主动进化的数字生命」。官方将其定位为「The Self-Improving Agent Harness」——围绕记忆、工具、技能、代码执行和策略做持续改进的智能体底座。Raven 目前已开源,支持 macOS 与 Windows,托管于 GitHub,并以 Apache-2.0 协议发布。

  • 长期以来,大模型存在一个基础性痛点——AI 的「失忆症」。当用户关闭对话窗口,无论刚才的交流多么深入,AI 都会瞬间清空一切回到初始状态。这种被称为「无状态」的技术局限,成为 AI 向真正智能体演进的瓶颈。过去两年行业普遍采用 RAG(检索增强生成)或不断扩大上下文窗口来应对,但 EverMind 团队认为这些方案本质上仍是「高级书签系统」——「真正的记忆不是检索,而是内化」。 EverMind 提出的判断是:记忆,是区分「工具」与「智能体」的分界线。一个没有记忆的实体,无法表现出一致性、无法从经验中学习、也无法演化。基于此,EverMind 规划了数字生命演进的四个阶段:L1 角色化指令体(当前多数套壳 AI)、L2 记忆增强体、L3 自我进化体、L4 全自主数字生命。Raven 的发布,代表 EverMind 向 L3 阶段迈出了实质性一步。

  • Raven 依托 EverOS 底层的「四层仿生架构」工作,通过代理层、记忆层、索引层和接口层协同运作。原始对话流被切分为独立的记忆单元,再经聚类算法形成「记忆场景」,最终构建出包含用户身份、偏好、技能及工作目标的深度画像。 在代码层面,Raven 的 GitHub 仓库显示其运行时围绕一条名为 Spine 的主干组织:每一轮交互都流经 submit(提交)→ lanes(车道,负责排序与取消)→ emit(产出)的单一入口与单一出口,各特征引擎通过显式交接(handoff)而非相互 import 的方式接入 Agent Loop。特征引擎包括:Context Engine(上下文组装与 Curator 路径)、Memory Engine(EverOS 记忆、本地技能、SkillForge)、Proactive Engine(Sentinel 调度与提醒策略)、TokenWise(用量追踪与缓存路由)以及 Eval Engine(任务判断与协调)。仓库当前处于 pre-alpha 阶段,但核心产品界面(原生 TUI + CLI、Spine 运行时、基础 Agent Loop、Context Engine、Sentinel 主动性、TokenWise、SkillForge)已可用,Eval Engine 仍部分实现。

  • Raven 的记忆是双向且动态的。它基于 EverOS 的深度画像能力,将每一次交互中的关键信息内化为对用户的认知模型——不是「翻阅你的档案」,而是「用你的经历持续更新它对你的理解」。它会在你不知情时记住你「喝咖啡不加糖」「写稿先列提纲」,而这些偏好会成为它认知的一部分。 更重要的是,这种记忆是双向的:Raven 不仅记住了你,还会从与你的每一次互动中提炼出对自身能力的反思和改进方向。如果你纠正了它的一个错误,它不仅会记住正确答案,还会反思自己为什么出错,并在下次交互中改进。EverOS 1.1.0 引入了三层记忆分类法——用户记忆(定义「人」)、智能体记忆(定义「智能体」)和世界知识(Knowledge Wiki,定义「世界」),并配套一套受人类沉思启发的 Reflection 机制,让智能体在空闲时段自动整合与巩固 intelligence。 测试数据显示,在 EverOS 支撑下,Raven 能以传统方案约 1/10 的 Token 消耗,实现超越全量上下文(Full Context)的准确率。官方基准 LoCoMo 达 93.05%、LongMemEval 达 83.00%、HaluMem 达 93.04%。

  • Raven 最核心、也最具话题性的能力,是「改写自身代码」。它不仅能重写自己的技能、运行时逻辑和策略,甚至可以通过用户侧个性化小模型 EverBrain 动态微调模型权重。这意味着 Raven 能从成功任务中提炼最佳实践,从失败中识别改进空间,并将洞察直接写入代码,实现经验内化与能力迭代。 Raven 内置约 10 万项经过深度评测的技能,覆盖从日常生产力到专业垂直领域的广泛场景。这些技能并非一成不变:在实际使用中,Raven 会持续评估哪些技能好用、哪些失效,然后主动淘汰、强化或组合出新的技能。这种「技能记忆」(Skill Memory)是非参数化、自我进化的——EverOS 将智能体轨迹记录为 Cases(案例),把重复出现的模式提炼为可复用的 Skills,使智能体能从先前经验中学习,随时间持续改进,而不是每项任务都从零开始。

  • Raven 以「记忆优先」为设计理念,提供原生终端 TUI 与 CLI 界面,并内置 gateway 连接 Telegram、Discord、Slack、Matrix、WhatsApp、企业微信等消息平台。它内置工具管理器,可自动安装、更新或撤除外部工具,并支持多模型切换(Anthropic、OpenAI、Claude 等)。 安装采用一行命令:macOS / Linux 执行 curl -fsSL https://raven.evermind.ai/install.sh | bash,Windows 使用 PowerShell irm https://raven.evermind.ai/install.ps1 | iex,随后 raven start 即可启动。开发者可将成功工作流封装为可复用的 Agent Template 或「数字工作者」,并通过 Raven Builder 为任意场景定义专属 Agent 并一键分享。 作为开放平台,Raven 的记忆模块、主动性引擎和工具路由完全独立,开发者无需触及核心框架即可自由替换任何组件。其高度解耦的模块化架构形成正向飞轮:更多智能体创建带来更多使用数据,数据反哺 EverOS 使记忆系统更精准,进而推动新智能体更快进化。

  • 多智能体系统:编排多个 AI 代理需要复杂协调与任务分配,Raven 的群组记忆(Group Memory)与 Memory Bank 让跨平台智能体共享知识与团队上下文。 个性化 AI 伴侣:从个人助手到疗愈聊天机器人,陪伴型 AI 需要真正的长期记忆才能带来情感智能与行为一致性。 企业知识库:构建随团队演化的组织记忆,AI 从内部讨论、文档与决策中学习,成为企业制度性知识层。 客户支持智能:记住历史问题、解决记录、客户偏好与沟通风格,让支持「有温度且连续」。 可穿戴硬件:将碎片化交互、视觉线索与语音指令处理为结构化模式,让硬件主动预判需求。 单人生产力:商务用户微信发语音即可下达「整理跨国会议纪要、提炼三项核心任务、录入项目系统并邮件通知负责人」,Raven 一站式跑完流程。EverMind 设想的未来是「单人 + 智能 Agent」胜任以往数十人工作量。

  • EverMind 的学术团队同步构筑了理论护城河,近期连发数篇顶级论文:MSA(Memory Sparse Attention)端到端可训练稀疏注意力机制,将上下文扩展至 1 亿 Token、性能衰减不足 9%,发布当日登顶 HuggingFace Daily Papers;HyperMem 超图层次化记忆架构在 LoCoMo 达 92.73% SOTA,获 ACL 2026 Oral;EverMemOS 自组织记忆操作系统入选 ACL 2026 主会;多方协作对话长时记忆评测填补行业空白,获 KDD 2026 Oral。 EverOS 开源后约一个月内 GitHub Star 突破 10,000,增速超过 mem0 前七个月约 7,000 的水平。EverMind 全栈生态涵盖 EverBrain(个性化记忆模型)、EverOS(记忆操作系统与 Agent 基础设施)、Raven(自进化 Agent Harness)、EverMe(个人记忆中心),并以 ReUnite 公益寻人平台践行「科技向善」。

  • Raven 代表了自进化智能体从 L2(记忆增强)向 L3(自我进化)的实质性跨越。其「记忆不是档案馆而是神经网络」「不是查到而是悟到」的理念,以及 1/10 Token 消耗实现超全量上下文准确率的指标,的确在范式层面具有吸引力。开源优先、Apache-2.0 协议与一行命令部署,显著降低了企业与个人使用门槛,有利于构建类似 Android / Windows 的底层开发者生态护城河。 但客观看,Raven 仍处于 pre-alpha,API 可能随时变化,不宜以成熟生产系统理解。其「可重写自身代码」的激进能力在带来迭代效率的同时,也引申出可解释性、安全边界与失控风险等工程与治理问题。对开发者而言,Raven 当前更像是一个早期但野心很大的 Harness 样本,值得跟踪,但落地到关键业务仍需谨慎评估稳定性与可监控性。

用户评论

  • 头像
    KellyBarnesX
    EverBrain 那个用户侧小模型能动态微调权重这个点很关键,等于记忆真正反哺了模型本身,而不是只在提示词里打补丁。

  • 头像
    BreadBudNielsen
    「记忆不是检索而是内化」这句话说到点子上了。传统 RAG 就是个高级书签,Raven 这种双向记忆才算像人。

  • 头像
    MChavezII632
    我把 Raven 接到了 Discord 和 Slack,群组记忆能让几个频道共享上下文,做团队知识库雏形挺顺手的。

  • 头像
    SHernandezQ
    作为开发者最惊喜的是架构解耦,记忆、工具路由、主动性引擎都能单独换,不用被绑死在核心框架上。

  • 头像
    薛明强
    EverOS 开源一个月 Star 就破万,增速确实猛,社区氛围也起来了,跟着 mem0 的节奏明显快一截。

  • 头像
    RasmusChristiansen
    Token 消耗只有全量上下文的十分之一还能超准确率,长文档处理成本肉眼可见降下来了,对小团队很实用。

  • 头像
    Sandra.Kim_Pro
    它真能把成功的工作流沉淀成可复用的 Agent Template,我让它整理了三天的会议纪要,后面直接复用模板,效率直接起飞。

  • 头像
    jEFFREYrOGERS
    装了 Raven 玩了一晚上,记忆是真的能跨会话保留,第二天接着聊它还记得我昨天说的偏好,比一堆套壳助手强太多了。

  • 头像
    ZHillIII
    客观说,L3 自我进化的故事讲得漂亮,但「改写自身代码」带来的安全和失控风险被谈得不够。我建议真要落地关键业务前,先把它当黑盒压测一遍:故意喂错误反馈看它会不会把错误经验固化成技能,再检查 SkillForge 生成的技能有没有越权调用。Raven 现在更像一个野心很大的早期样本,值得跟踪,但把它当成熟平台用还为时过早。

  • 头像
    Megan_Campbell_2021
    尝试用 Raven Builder 给客服场景定义了一个专属 Agent,一键分享到 EverMe,整个流程比想象中简单,非技术同事也能上手。我们小团队拿它做了个售前问答助手,把历史工单喂进去之后,它回答的连贯度明显比之前用固定提示词的那版高,客户也反馈「这次终于记得我上次问过什么」。不过高峰期偶尔会卡在 Memory Bank 的写入上,估计是 EverOS 那边还要再优化吞吐。

  • 头像
    ASICant433
    10 万内置技能这数字太夸张了,实测常用场景确实开箱即用,不过我后来仔细翻了技能库,发现很多垂直领域技能还只是脚手架级别,真要上生产得自己再调一遍,不能全信这个数量。建议官方把「经评测」的标准透明出来,不然新手很容易误以为开箱即全能。

  • 头像
    GregoryGray_2021
    LoCoMo 93%、LongMemEval 83% 这些基准是真能复现的,我跑了官方开源评测脚本,数据基本对得上,这点比很多只会喊口号的强。

  • 头像
    iDylanLewis_dev
    「可重写自身代码」听着很酷,但也让人有点慌,我拿它跑了个数据清洗任务,它确实自己改了工具调用顺序让成功率上去了,可我完全看不出它改了哪。万一它改错了策略谁来兜底?希望官方早点出可解释性和回滚机制,不然这种黑盒自我进化我是不敢接关键业务的。

  • 头像
    DVasquez_2021
    现在还是 pre-alpha,API 说变就变,我上周写的脚本这周就跑不起来了,生产环境慎用,当玩具和实验平台倒是没话说。我自己的做法是把所有配置和 Agent Template 都进版本库,每次升级先 diff 一遍再决定要不要跟,这样至少不会半夜被一个 breaking change 搞崩。

  • 头像
    MoniqueRamos
    一行命令就装好了,curl 那个 install.sh 跑完 raven start 直接进 TUI,对终端党很友好。