8.9万 Stars 的开源 RAG 引擎 RAGFlow:用深度文档理解重新定义检索增强生成

8.9万 Stars 的开源 RAG 引擎:RAGFlow 用深度文档理解重新定义检索增强生成

多数 RAG 系统只是把文档切成块、向量检索。RAGFlow 的做法完全不同——用深度文档理解(DeepDoc)解析 PDF/Word/PPT/Excel 的版式和表格结构,把”真正读懂文档”作为 RAG 的前置步骤,89K Stars,Go,Apache 2.0。

RAGFlowinfiniflow/ragflow,⭐ 89,669,Go,Apache 2.0)是开源 RAG 引擎,核心理念:RAG 的效果瓶颈不在检索,而在文档理解——用深度文档解析(DeepDoc)替代简单的文本切块,让大模型真正”看懂”复杂文档的结构和上下文。

核心数据

指标 数值
⭐ Stars 89,669
🍴 Forks 10,371
💻 语言 Go
📜 许可证 Apache 2.0
🌐 云端 cloud.ragflow.io
📖 文档 ragflow.io/docs/dev

它解决什么问题

传统 RAG 的局限:

  • 把 PDF 当纯文本切块,丢失表格、标题层级、版式信息
  • 无法处理扫描件、图表混合内容
  • 向量检索再精确,底座是”没看懂”的文档,答案依然残缺

RAGFlow 的解法:先深度理解文档,再构建检索——

  • DeepDoc 模组:OCR + 版面分析 + 表格结构识别 + 段落语义理解
  • 融合式上下文引擎:把文档的层级结构、标题关系、表格数据都编码进检索上下文
  • 支持任意格式:PDF / Word / PPT / Excel / 图片 / 视频 / 网页

技术亮点

1. DeepDoc 深度文档理解

# DeepDoc 自动识别文档结构
doc = deepdoc.parse("合同.pdf")
# → 识别标题层级、表格坐标、签名区域、关键条款位置

不是把 PDF 转成文字再切块,而是理解文档的视觉和逻辑结构。

2. 融合上下文引擎

传统 RAG 检索的是”文本片段”,RAGFlow 检索的是”结构化上下文”——包含标题关系、段落归属、表格单元格位置。

3. 多模态文档支持

文档类型:PDF、Word、PPT、Excel、txt、Markdown
图片:扫描件、截图、图表
视频:自动抽取字幕和时间戳
网页:自动抓取并解析结构

4. 预置 Agent 模板

不是所有人都懂 RAG 调优,RAGFlow 提供预置模板:

问答 Agent / 摘要 Agent / 对比 Agent / 报告 Agent

开箱即用,也可以深度定制。

5. 端到端 RAG 工作流

文档上传 → DeepDoc 解析 → 向量化 → 检索增强 → LLM 生成

一条链搞定,不需要自己拼装 LangChain。

6. Docker 一键部署

docker run -d --name ragflow 
  -v ~/.cache/huggingface:/root/.cache/huggingface 
  -p 9380:9380 
  infiniflow/ragflow:latest

安装使用

# Docker 部署(推荐)
docker run -d --name ragflow 
  -v ~/.cache/huggingface:/root/.cache/huggingface 
  -p 9380:9380 
  infiniflow/ragflow:latest

# 访问 http://localhost:9380

和普通 RAG 方案的区别

特性 普通 RAG(LangChain 等) RAGFlow
文档解析 文本切块 DeepDoc 深度理解
表格处理 ❌ 或弱 ✅ 结构化识别
多模态 有限 PDF/Word/PPT/图片/视频
上下文质量 片段级 结构感知
预置 Agent ✅ 多场景模板

项目地址:github.com/infiniflow/ragflow
官网:ragflow.io
云端体验:cloud.ragflow.io

评论区

0 条评论

登录后可评论。

拾光·开源拾遗 15 阅读