8.9万 Stars 的开源 RAG 引擎 RAGFlow:用深度文档理解重新定义检索增强生成
8.9万 Stars 的开源 RAG 引擎:RAGFlow 用深度文档理解重新定义检索增强生成
多数 RAG 系统只是把文档切成块、向量检索。RAGFlow 的做法完全不同——用深度文档理解(DeepDoc)解析 PDF/Word/PPT/Excel 的版式和表格结构,把”真正读懂文档”作为 RAG 的前置步骤,89K Stars,Go,Apache 2.0。
RAGFlow(infiniflow/ragflow,⭐ 89,669,Go,Apache 2.0)是开源 RAG 引擎,核心理念:RAG 的效果瓶颈不在检索,而在文档理解——用深度文档解析(DeepDoc)替代简单的文本切块,让大模型真正”看懂”复杂文档的结构和上下文。
核心数据
| 指标 | 数值 |
|---|---|
| ⭐ Stars | 89,669 |
| 🍴 Forks | 10,371 |
| 💻 语言 | Go |
| 📜 许可证 | Apache 2.0 |
| 🌐 云端 | cloud.ragflow.io |
| 📖 文档 | ragflow.io/docs/dev |
它解决什么问题
传统 RAG 的局限:
- 把 PDF 当纯文本切块,丢失表格、标题层级、版式信息
- 无法处理扫描件、图表混合内容
- 向量检索再精确,底座是”没看懂”的文档,答案依然残缺
RAGFlow 的解法:先深度理解文档,再构建检索——
- DeepDoc 模组:OCR + 版面分析 + 表格结构识别 + 段落语义理解
- 融合式上下文引擎:把文档的层级结构、标题关系、表格数据都编码进检索上下文
- 支持任意格式:PDF / Word / PPT / Excel / 图片 / 视频 / 网页
技术亮点
1. DeepDoc 深度文档理解
# DeepDoc 自动识别文档结构
doc = deepdoc.parse("合同.pdf")
# → 识别标题层级、表格坐标、签名区域、关键条款位置
不是把 PDF 转成文字再切块,而是理解文档的视觉和逻辑结构。
2. 融合上下文引擎
传统 RAG 检索的是”文本片段”,RAGFlow 检索的是”结构化上下文”——包含标题关系、段落归属、表格单元格位置。
3. 多模态文档支持
文档类型:PDF、Word、PPT、Excel、txt、Markdown
图片:扫描件、截图、图表
视频:自动抽取字幕和时间戳
网页:自动抓取并解析结构
4. 预置 Agent 模板
不是所有人都懂 RAG 调优,RAGFlow 提供预置模板:
问答 Agent / 摘要 Agent / 对比 Agent / 报告 Agent
开箱即用,也可以深度定制。
5. 端到端 RAG 工作流
文档上传 → DeepDoc 解析 → 向量化 → 检索增强 → LLM 生成
一条链搞定,不需要自己拼装 LangChain。
6. Docker 一键部署
docker run -d --name ragflow
-v ~/.cache/huggingface:/root/.cache/huggingface
-p 9380:9380
infiniflow/ragflow:latest
安装使用
# Docker 部署(推荐)
docker run -d --name ragflow
-v ~/.cache/huggingface:/root/.cache/huggingface
-p 9380:9380
infiniflow/ragflow:latest
# 访问 http://localhost:9380
和普通 RAG 方案的区别
| 特性 | 普通 RAG(LangChain 等) | RAGFlow |
|---|---|---|
| 文档解析 | 文本切块 | DeepDoc 深度理解 |
| 表格处理 | ❌ 或弱 | ✅ 结构化识别 |
| 多模态 | 有限 | PDF/Word/PPT/图片/视频 |
| 上下文质量 | 片段级 | 结构感知 |
| 预置 Agent | ❌ | ✅ 多场景模板 |
项目地址:github.com/infiniflow/ragflow
官网:ragflow.io
云端体验:cloud.ragflow.io
评论区
0 条评论
登录后可评论。