🖨️ 几百页的 PDF 一次性喂进去,整本转成能直接用的文字,百度开源了 Unl…

我不是小布丁 @xiaobuding
🖨️ 几百页的 PDF 一次性喂进去,整本转成能直接用的文字,百度开源了 Unlimited-OCR。 GitHub 上已经冲到 2.4 万 stars,对应论文是 arXiv 2606.23050。 做行业研究的人最熟悉这个痛:一份两百页的年报或者标书是扫描件,想引用里面一张表,只能一页一页截图、一页一页识别,识别完格式还全散了,再手动拼回去半天就没了。Unlimited-OCR 的思路是一次性处理长文档,多页图像和整份 PDF 直接进去出结果,不用你切页,也不用你把结果拼回来。 模型已经放到 Hugging Face、ModelScope 和百度智能云,本地想跑的话 Transformers、vLLM 和 SGLang 三种方式都支持,官方还给了 vLLM 的 Docker 镜像。项目致谢里写明借鉴了 Deepseek-OCR 和 PaddleOCR 的相关思路。 纸上的东西,终于不用再一页一页搬了。 github.com/baidu/Unlimite…
话题来源 @Ryrenz · 15K阅读 · x.com/…↗ · 原文引用
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单