RAGFlow 是领先的开源检索增强生成引擎:以自研 DeepDoc 深度文档理解技术啃下复杂格式非结构化数据,叠加可视化 Agent 编排与 MCP 支持,为 LLM 提供高保真的"上下文层",个人到大型企业都能自助部署。企业落地的瓶颈早已不是模型而是"垃圾进、垃圾出"——扫描件与多栏 PDF 的解析质量决定 RAG 成败,RAGFlow 用模板化切块加人工可干预的可视化分块正面解决该痛点;

| 项目 | 内容 |
|---|---|
| 仓库 | infiniflow/ragflow |
| 语言 / 许可证 | Go(主体含 Python) / Apache-2.0 |
| 总星标 | ⭐ 89313 |
| 本月净增星标 | +3498 |
| 榜单 | GitHub官方月度趋势榜 第39名 |
RAGFlow 是领先的开源检索增强生成引擎:以自研 DeepDoc 深度文档理解技术啃下复杂格式非结构化数据,叠加可视化 Agent 编排与 MCP 支持,为 LLM 提供高保真的"上下文层",个人到大型企业都能自助部署。
企业落地的瓶颈早已不是模型而是"垃圾进、垃圾出"——扫描件与多栏 PDF 的解析质量决定 RAG 成败,RAGFlow 用模板化切块加人工可干预的可视化分块正面解决该痛点;更新节奏凶猛:Agent 工作流、代码沙箱、记忆机制、Confluence/S3/Notion 同步、飞书/Discord/Telegram 多渠道接入接连上线。入选 GitHub Octoverse 并登 Trendshift,堪称国产开源基础设施的国际名片。
7. 记忆(Memory)机制赋予跨会话的 AI Agent 上下文延续能力;
8. 文档解析引擎可选:引入 MinerU 与 Docling 作为替代解析后端。
后端 Python 为主微服务化拆分(ragflow_server 与 task_executor 进程),存储层默认 Elasticsearch 承担全文+向量双职责,可通过 .env 把 DOC_ENGINE 切换成自家研发的 Infinity 数据库;外围依赖 MinIO 对象存储、MySQL 元数据、Redis 队列。前端 React Web 控制台覆盖知识库管理、对话测试与 Agent 画布编排。Docker Compose 一键拉起全家桶,x86_64 镜像官方直供,ARM64 需自行构建。
前置条件:CPU ≥4 核、RAM ≥16GB、磁盘 ≥50GB、Docker ≥24.0.0 与 Docker Compose ≥v2.26.1、Python ≥3.13;启用代码执行器沙箱才需另装 gVisor。
sysctl vm.max_map_count # 确认 ≥262144,否则 sudo sysctl -w vm.max_map_count=262144
git clone https://github.com/infiniflow/ragflow.git
cd ragflow/docker && git checkout v0.27.0
docker compose -f docker-compose.yml up -d # 默认 CPU 跑 DeepDoc;GPU 版先 sed 写入 DEVICE=gpu
容器起来后 `docker logs -f docker-ragflow-cpu-1` 看到 ASCII Logo 即成功;浏览器访问 `http://服务器IP`(默认 80 端口免端口号)注册登录;在 service_conf.yaml.template 的 user_default_llm 区选择模型厂商并填入 API_KEY;新建知识库上传 PDF,挑选对应模板分块,几分钟后即可发起带引用标注的问答,或拖拽节点搭建自己的 Agentic RAG 流程。
Dify 强在通用 LLM 应用编排但 RAG 深度一般;LangChain 是代码框架需大量胶水工程;FastGPT 轻量易上手却缺深度文档理解;RAGFlow 以文档解析质量和溯源能力树立护城河,代价是部署资源门槛偏高——重 RAG 场景下仍是首选底座。