深度报告
-
Reka Core 2 是 Reka AI 在 2026 年 3 月推出的第二代旗舰多模态模型,原生支持文本、图像、音频、视频四类输入,主打企业级可靠交付与 API 易用性。它延续了 Reka 从零训练、原生多模态的技术路线,在视频理解上仍保留相对头部闭源模型的差异化优势,但社区声量与公开基准披露较 OpenAI、Anthropic、Google 仍有明显差距。
-
Reka AI 成立于 2022 年,由一批来自 Google DeepMind、Meta FAIR 与百度的研究科学家创立,总部位于美国加州森尼维尔。核心团队包括 CEO Dani Yogatama、CTO Cyprien de Masson d'Autume,以及联合创始人 Qi Liu、Mikel Artetxe 等;原首席科学家 Yi Tay 已于 2024 年底离开,重返 Google DeepMind。公司从创立起就坚持「效率」作为核心路线,强调以更低的算力成本训练与部署市场领先的模型。 融资层面,Reka 在 2023 年完成约 5800 万美元 A 轮(DST Global 领投),2025 年 7 月又获得 1.1 亿美元 B 轮融资,估值突破 10 亿美元跻身独角兽,投资方包括英伟达与 Snowflake。新资金用于加速多模态平台研发与企业级市场扩张。Reka 的产品矩阵按参数量分为 Spark(1B)、Edge(7B)、Flash(21B)与 Core(旗舰)四档,其中 Flash 3 于 2025 年 3 月以 Apache 2.0 协议开源。
-
Reka Core 2 是 Reka Core 的迭代版本,官方将其定位为「第二代旗舰多模态模型」。它在文本、图像、视频、音频理解任务上相较初代均有提升,官方称其可与一线前沿模型竞争,同时把重点放在企业可靠性与 API 可达性上。模型上下文窗口为 128K,覆盖文本生成、视觉、音频理解、视频理解与推理五类能力,通过 Reka API 与 AWS Bedrock 两种渠道对外提供。 Reka 的核心技术叙事是「原生多模态」:文本、图像、视频、音频从训练阶段就是一等公民,而非事后挂载的适配器。这一路线的最大亮点是视频理解——初代 Reka Core 在 Perception-Test 视频问答基准上拿到 59.3 分,超过 Gemini Ultra 的 58.7 分,而当时的 GPT-4o 尚不支持连续视频片段的原生处理。Core 2 沿用了这一能力取向,并强化了与智能体工作流的结合,可用于多模态 RAG、视频检索、事件检测等场景。
-
据 Reka 官方定价文档(2026 年 6 月核验),Reka Core 的文本调用价格为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元;图像按张计费(约 0.02 美元/张),视频 0.08 美元/分钟,音频 0.02 美元/分钟。作为对照,Edge 为 0.10/0.10 美元、Flash 为 0.80/2.00 美元。Reka Research 智能体按每千次请求计费,标准档 25 美元、并行思考低/高档分别为 35 与 60 美元。 相较初代 Core 发布时的 10/25 美元定价,Core 2 的单位价格已明显下降,体现出「效率优先」的定价取向。企业还可选择托管云、本地、VPC 或完全离线(air-gapped)部署,部署灵活度接近传统数据库厂商。
-
Reka 的用户口碑集中在两类群体。一是需要原生视频/图像理解的企业客户,如 Shutterstock、Turing Video 等使用 Reka Vision 做大规模视频与图像检索;二是看重部署可控性的金融、医疗等行业客户,离线部署与数据不出域是核心卖点。开发者普遍认为 Reka 的多模态原生能力真实可用,API 与 Python/JavaScript SDK 体验顺滑。 负面反馈主要来自社区声量不足:公开基准、第三方复现与真实使用案例偏少,开发者在选型时缺乏足够的中立参考。此外,Core 2 的具体参数量、训练细节与独立基准分数均未公开,信息透明度弱于同档竞品,增加了企业的评估成本。
-
行业普遍将 Reka 视为「小而精」的多模态模型厂商,认可其由资深研究科学家组成的小团队能以远低于巨头的算力做出有竞争力的模型。第三方模型索引(aaas.blog)给 Reka Core 2 的质量与新鲜度评级较高(Quality A、Freshness A+),但采用度(C)与引用、参与度(均为 F)偏低,综合指数仅 33,建议「谨慎使用」。这与 Reka 的企业定位相符:模型能力不弱,但生态与社区成熟度尚未建立。 与头部模型对比,Reka Core 2 在文本/图像基准上接近 GPT-4、Claude、Gemini 同档水平(初代 Core 的 MMLU 83.2、GSM8K 92.2、HumanEval 76.8 可作参照),视频理解是其相对优势项;短板在于生态规模、工具调用与外部集成的丰富度。
-
主要风险集中在三点。其一,透明度不足:Core 2 的参数量、训练数据构成与独立基准均未披露,企业需自行做充分 PoC 才能评估真实能力。其二,人才与生态波动:首席科学家 Yi Tay 于 2024 年底离职,核心团队稳定性是长期变量。其三,市场声量小导致社区资源、排障文档与中文资料稀缺,个人开发者或小团队的上手成本偏高。
-
Reka Core 2 适合需要原生多模态(尤其视频/图像理解)、且对数据驻留与部署方式有硬性要求的企业客户,例如媒体内容检索、安防事件检测、多模态客服与文档分析。它也适合已在使用 AWS Bedrock 并希望补充多模态能力的团队,避免额外接入新供应商。 它不太适合追求最大社区生态、最丰富工具链或需要大量公开基准背书的个人开发者;若场景以纯文本推理为主,同档闭源模型的生态成熟度通常更高。替代方案包括 GPT-5.6 系列、Claude Opus、Gemini 系列,以及开源的 Qwen-VL、InternVL 等多模态模型。
-
Reka Core 2 是一款能力扎实、部署灵活的企业级原生多模态旗舰模型,视频理解是其差异化长板,但生态规模与透明度仍是它走向更主流市场前必须补的课。
用户评论
-
Noah.MooreIII—整体是能力扎实的企业级多模态模型,视频是长板,想要最全生态还是去抱 OpenAI。 -
Stephen_RamirezQ—说实话 Core 2 具体参数和独立基准都不公开,选型时只能自己跑 PoC,透明度这块确实扣分。我们内部对比了一圈,多模态尤其视频确实强,但纯文本推理离一线旗舰有差距。如果你的核心需求就是视频和图像理解,它值得上,否则建议先看清楚再决定。 -
JoshuaAllen_2021—没有 ChatGPT 那种聊天界面,纯 API,想给团队用得自己搭前端,门槛摆在那。 -
HaroldFoster77—我们安防场景用它做摄像头事件检测,连续视频理解比抽帧方案误报少很多。之前用别的模型得先把视频切成一帧帧再识别,丢了大量时序信息,Core 2 原生看视频之后,越界、逗留这类依赖前后文的行为识别准了不少,落地效果超预期。 -
BrianKelly_99—Reka Core 2 的视频理解是真能打。我们做体育集锦自动剪辑,之前用抽帧方案经常漏掉连续动作,换成 Core 2 直接喂整场录像让它按时间戳出高光片段,命中率高了一大截,后期人工补的工作量明显少了。 -
xAmáliaCastro_x—首席科学家 Yi Tay 都回 DeepMind 了,长期团队稳定性是个问号。 -
ATurner—在物理 AI 和机器人场景里 Reka 是真首选。它不像很多大模型把视频当一堆静止图片处理,而是真的在统一潜空间里理解动作序列和意图,时序推理明显更强。我们做机械臂演示,让它看一段操作视频就能复述步骤,这种能力别家还真不一定有。 -
Brittany.Carter00761—价格还行,Core 2/6 每百万 token,比 GPT 同档便宜一截,但视频按分钟另算,量大要算清账单。 -
Lauren_PatelII6—n8n 社区节点出来了,媒体团队用 Reka Clips 工作区做短视频切片方便不少。 -
Deborah_Sanders_752—视频问答偶尔会一本正经胡说八道,关键场景还是得人工复核,不能完全托管。 -
AngelaReed_202199—企业部署灵活度是它最大的卖点。我们金融客户的数据必须不出域,Core 2 支持本地和完全离线部署,合规那边一次就过了,这点比 OpenAI 和 Claude 好谈太多。代价是得自己维护推理栈,小团队没运维的话还是走云 API 省事。 -
Sharon_RuizZ09—通过 AWS Bedrock 也能调,已在用 Bedrock 的团队接多模态不用再接新供应商,省事。 -
GGonzalezJr—代码能力还行,但 prompt 得写仔细,它特别较真字面意思,新手容易翻车。 -
WRivera_202270—128K 上下文在 2026 年属实有点寒酸,Google 都给到 2M 了,长文档 RAG 只能切片。 -
Alice_Fisher8—Reka Research 并行思考档偏贵,最高 60 刀每千次请求,值不值见仁见智。 -
DonnaRoberts—原生多模态不是吹的,图像音频视频文本统一处理,内容审核一条管线通吃。 -
Alan.Thompson_Max—二十来人的小团队做出这水平不容易,效率路线值得respect。 -
RachelBellQ—生态太小了,中文资料基本搜不到,排障全靠翻文档,个人开发者慎入。