RAGFlow

基于深度文档理解的开源RAG引擎,帮助企业构建知识库问答系统

詳細レポート

  • RAGFlow は、文書の深い理解に基づいて構築されたオープンソースの RAG (検索拡張生成) エンジンであり、あらゆる規模の企業や個人に合理化された RAG ワークフローを提供するように設計されています。このプラットフォームは、最先端の RAG テクノロジーとエージェント機能を統合し、ユーザーが信頼性の高いナレッジ ベースの質問と回答システムを構築できるようにします。 RAGFlow は、ベクトル検索、BM25 フルテキスト検索、テンソル検索、高度な並べ替えなどのテクノロジーをサポートし、データ インジェスト パイプライン、ビジュアル ワークフロー、AI エージェント構築機能を提供します。現在、GitHub スターの数は 40,000 を超えており、オープンソース RAG 分野の人気プロジェクトとなっています。

  • RAGFlow は Infraflow チームによって開発および保守されており、プロジェクトのオープンソース アドレスは https://github.com/infiniflow/ragflow です。チームの中心メンバーは Sogou や Baidu などの検索エンジンの出身であり、自然言語処理と検索の分野で深い蓄積を持っています。 この製品の中核的な位置付けは、企業のナレッジ管理と AI アプリケーションの実装の問題点を解決することです。従来の企業は、ナレッジ ベースを構築する際に、混乱を招くデータ形式、貧弱な検索結果、深刻な幻覚問題などの課題に直面しています。 RAGFlow は、深層文書理解テクノロジーを使用して、複雑な非構造化文書から高品質の意味情報を抽出し、質問と回答の精度を大幅に向上させます。

  • RAGFlow は、完全なデータ処理と質疑応答システム構築機能を提供します。 データ インジェスト パイプラインは、製品の中核となるハイライトの 1 つです。ユーザーはデータのクリーニングと処理のプロセスを構成し、複数のドキュメント形式のインポートと前処理をサポートできます。システムは文書構造を自動的に分析し、重要な情報を抽出してベクトル表現に変換し、その後の検索の基礎を築きます。 マルチモーダル検索テクノロジーも、もう 1 つのコア機能です。また、RAGFlow はベクトル検索 (Vector)、全文検索 (BM25)、テンソル検索 (Tensor) の 3 つの検索方法をサポートし、検索結果を最適化するための高度な再ランキング (Re-ranking) 機能を提供します。ユーザーは、実際のニーズに応じて、さまざまな検索戦略を柔軟に選択または組み合わせることができます。このマルチチャンネルリコール設計により、リコール率と検索の精度が大幅に向上します。 AI エージェントとワークフロー機能により、ユーザーはビジュアル インターフェイスを通じて複雑な質疑応答プロセスを構築できます。このプラットフォームには、財務分析、法的事例分析、機器メンテナンス ガイドなどのさまざまなプリセット ワークフロー テンプレートが用意されており、ユーザーはこれらをすぐに参照してカスタマイズできます。 RAGFlow は、MCP (Model Context Protocol) も統合し、大規模な言語モデルとのシームレスな接続をサポートします。 クラウドとローカル展開の 2 つのソリューションが、さまざまなシナリオのニーズに対応します。クラウド バージョンは迅速な検証と中小規模の導入に適しており、ローカル導入バージョンはデータ セキュリティとプライバシーに関する企業のコンプライアンス要件を満たしています。 ユーザーエクスペリエンスの観点から見ると、RAGFlow の利点は、オープンソース、無料、包括的な機能、および詳細なドキュメントです。課題は、展開には特定の技術的能力が必要であり (Docker およびモデル環境を構成する必要がある)、インターフェイスは現在英語と中国語のみをサポートしており、一部の高度な機能には高性能ハードウェアのサポートが必要であることです。

  • RAGFlow は、オープンソースの無料 + クラウド有料のビジネス モデルを採用しています。 オープンソース版は完全に無料で、ユーザーは GitHub でソースコードをダウンロードして自分でデプロイできます。オープンソース バージョンは完全に機能しており、技術チームによる二次開発やカスタマイズに適しています。 クラウド版 (RAGFlow Cloud) はホスティング サービスを提供し、使用量に基づいて課金されます。クラウド バージョンでは、導入とメンテナンスのコストが不要で、プロジェクトを迅速に開始したいチームに適しています。具体的な価格は https://cloud.ragflow.io/ で確認できます。 Pinecone (純粋なベクター データベース、手数料が高い)、Weaviate (オープン ソースだが比較的単一機能)、Qdrant (オープン ソースのベクター エンジン) などの競合製品と比較すると、RAGFlow の利点はエンドツーエンドの RAG ソリューションにあり、オープン ソース バージョンは非常にコスト効率が高いです。

  • GitHub や技術コミュニティからのフィードバックから判断すると、RAGFlow はより肯定的な評価を受けています。開発者は、その優れたドキュメント処理、高い検索精度、および柔軟なワークフロー構成を高く評価しています。オープンソース コミュニティは活発で、頻繁に更新されています。 否定的なフィードバックは主に、展開ドキュメントが初心者にとって不親切であること、ローカル展開には高いハードウェア要件があること、大規模なデータを扱う場合にはパフォーマンスを最適化する必要があることなどに焦点を当てています。

  • オープンソース RAG の分野では、RAGFlow は現在最も注目されているプロジェクトの 1 つです。 Pinecone、Weaviate、Qdrant などの純粋なベクター データベースとは異なり、RAGFlow は、データの取り込みから Q&A 出力まで、完全なエンドツーエンドの RAG ソリューションを提供します。 競合他社には、LangChain (アプリケーション フレームワーク、RAG 機能は比較的基本的)、LlamaIndex (データ インデックス作成ツール、より多くの開発者ツール)、Milvus (エンタープライズ レベルのベクトル データベース、下位レベルに位置します) が含まれます。

  • RAGFlow の使用に適したシナリオ: 企業は社内ナレッジ ベースの質問と回答システムを構築し、開発者は RAG アプリケーションを迅速に構築する必要があり、AI アプリケーションには信頼性の高いナレッジ検索機能が必要で、技術チームは Docker の導入と運用とメンテナンスが可能です。 使用が推奨されない状況: 技術的な背景がまったくないユーザー、単純なキーワード検索のみが必要なシナリオ、および応答遅延要件が非常に高いリアルタイム システム。

  • RAGFlow は強力なオープンソース RAG エンジンで、エンタープライズ レベルのナレッジ ベースと AI 質疑応答システムを構築する技術チームに特に適しています。文書理解・検索効果に優れており、オープンソース版を無償で利用できるため利用の敷居が低くなります。主な課題は、展開と運用に一定の技術的能力が必要であることです。チームに技術的能力があり、データ プライバシーの必要性がある場合、RAGFlow は試す価値のあるオプションです。

ユーザーレビュー

  • 头像
    BitShark586
    用 RAGFlow 搭了个合同审核助手,表格解析是真的稳,跨页表格居然能自动拼接,之前用别的方案拆得一塌糊涂。

  • 头像
    Joyce_Russell_704
    部署确实有点门槛,Docker Compose 拉起来倒是不难,但要配好外部 LLM 和 embedding 得折腾半天。第一次搞建议直接走 Cloud 版。

  • 头像
    XS894PJ1Y
    自托管太香了,一台 $40 的 Hetzner VPS 跑了 5 个客户的知识库,总共五万多份文档,每个月 API 费才几十块。跟托管服务比省太多了!

  • 头像
    JTorres_77
    说它低代码我觉得是个误解,你要是不知道 chunk overlap 是什么意思、embedding dimension 怎么调、retrieval top-K 怎么设,做出来的东西根本没法用。我前两个项目全栽在分块策略上了——第一次 chunk 太大丢失精度,第二次太小丢失上下文,前后折腾了两周才调好。

  • 头像
    JackPerez
    社区真的活跃,30K GitHub stars 不是白给的,提了个 Excel 解析的 bug,5 天就合并了修复。Discord 群里也经常有人分享部署经验。

  • 头像
    侠客_5
    可视化流水线比 LangChain 那些框架直观多了,给律所搭了 15000 个案卷的知识库,拖拖拽拽 4 小时就搞定了,包括调 chunk 参数和测试。换了以前用 LangChain 干这活至少 3 天起步,还得写一堆胶水代码。

  • 头像
    Judy.CastilloQ
    深度分块确实牛,不再是简单 500 token 一刀切,表头跟内容在一起、段落上下文不丢。实测检索准确率比 naive chunking 高了差不多 20%。

  • 头像
    iساراعلیزاده_dev
    100 页的 PDF 解析要 2-5 分钟,这个速度说实话有点慢。刚接入新客户的时候一万份文档灌进去跑了十几个小时,客户差点等不及。建议批量导入的时候安排好时间窗口,白天别搞大规模 ingestion。

  • 头像
    BGonzales_2022
    云端的定价有点离谱,$49 一个月才 100MB 存储空间,正经企业文档随便就超了。还是自托管划算。

  • 头像
    KennethMurphy_q
    ARM Mac 用户劝退,官方 Docker 镜像只有 x86 的,自己 build 踩了一堆坑。最后换了台 x86 服务器才算消停。

  • 头像
    Keith.James_X
    新版本改成 slim 镜像了,不内置 LLM 和 embedding,得自己配外部服务。好处是灵活了,坏处是部署步骤又多了两步。

  • 头像
    Vincent_PhillipsJr00
    四款开源知识库(FastGPT、WeKnora、Dify、RAGFlow)都测了一遍,RAGFlow 的文档解析是唯一一个能把复杂表格完整保留的,92% 的识别率,服气。其他三款在跨页表格和合并单元格上都不同程度地翻车了,对我这种做招标合同场景的来说没有别的选择。

  • 头像
    SharonCarter_66
    SSPL 协议要注意一下,如果你打算拿它做 SaaS 对外卖的话需要买商业授权。企业内部用完全没问题。

  • 头像
    清风_26
    我们是律所,主要用来检索历史判例和合同条款。答案带引用溯源这个功能太重要了,合伙人只认「哪个文件第几页说的」,RAGFlow 给得清清楚楚。之前试过 LangChain + Chroma 的方案,溯源功能得自己写,而且准确率远不如这个。

  • 头像
    TuckerRoberts
    跟 Dify 比的话,RAGFlow 在文档解析上强太多,但 Dify 的全栈应用编排能力更强。如果只做知识库选 RAGFlow,要做复杂 AI 应用就 Dify。

  • 头像
    Brenda.PowellX
    Agent 功能最近的更新挺惊喜的,能接 MCP、做可视化 workflow,把 RAG 和工具调用串起来。不过对纯做检索的人来说可能用不上。

  • 头像
    angrymouse550
    生产环境部署一定要先配好监控和备份,我有一次 Elasticsearch 挂了,整个知识库查不了,排查了半天才发现是 ES 配置的问题。

  • 头像
    Gary_Hill
    chunk 可视化这个功能太棒了,能直接看到文档是怎么被切的,不对的地方还能手动改。数据质量可控,安心很多。

  • 头像
    MsMileKapetanović_2024
    我们金融行业用着挺好,合规那边要求所有 AI 回答必须有据可查,RAGFlow 的 citation 功能完美满足。就是部署初期调参花了点时间。

  • 头像
    LaurieCook
    yyds,真正能处理扫描件里表格的 RAG 工具,没有之一。其他方案遇到扫描件的表格直接崩,它居然能准确还原行列结构。

  • 头像
    Edward_Ross_7723
    有个坑,vm.max_map_count 不改的话 Elasticsearch 根本起不来,我第一次部署卡在这步一个多小时。Linux 用户务必注意。

  • 头像
    侠客_18
    对比了一圈还是选 RAGFlow,FastGPT 表格解析太弱(合并单元格直接崩),Dify 没内置 OCR 得自己花钱买插件,WeKnora 不支持 Excel 和 PPT。只有 RAGFlow 全格式通吃,虽然不好装但值得,生产环境已经稳定跑了两个月了。

  • 头像
    LKelly007948
    说实话学习曲线是陡的,头两周基本在跟 chunk 策略和 embedding 模型较劲。但过了那个坎之后是真顺手,现在客户都很满意。

  • 头像
    MichaelMitchell_99971
    有个做医疗的朋友也用的 RAGFlow,他们要求数据绝对不能出内网,自托管完美满足合规。处理临床指南和文献的效果据说很好。

  • 头像
    xcfj82
    容量规划要做好,50GB 磁盘是最低要求,实际跑起来索引文件涨得很快。我一开始只分了 80GB,三个月就不够了。

  • 头像
    DennisEdwards_202029
    Text2SQL 功能挺惊喜的,可以直接用自然语言查数据库,虽然还不够完美但已经能解决不少日常查询需求了。

  • 头像
    Brittany.Perry52083
    DeepDoc 引擎确实是核心卖点,普通的 RAG 工具只能提取文字,它能理解文档的版面结构。我试过一份带三层嵌套表格的财报 PDF,完美解析,连单元格里的合并注释都识别出来了,换别的工具早成一团乱码了。

  • 头像
    墨染445
    开了重排序之后效果提升明显,BGE-Reranker 一上,top-5 结果的相关性高了一个档次。建议必开。

  • 头像
    Catherine.White_88
    提醒一下,GPT-4 做 LLM 的话 API 费用不低,我后来换了 DeepSeek V3 成本降了 90%,效果差不太多。

  • 头像
    happywolf343
    个人用的话建议先上 Cloud 免费版试试水,虽然免费版只给 0.1GB 存不了多少文档,但功能体验是一样的。觉得行再自己部署。