长 PDF 切成一页页再拼,跨页表格和阅读顺序最容易乱。 百度开源的 Unlim…

小白爱摸鱼 @chaozuoye
长 PDF 切成一页页再拼,跨页表格和阅读顺序最容易乱。 百度开源的 Unlimited-OCR 想一次喂多页:大约 30 亿参数、激活更少,论文里在 32K 上下文下一次解析几十页,OmniDocBench 上高于 DeepSeek-OCR 那条基线。 本机跑,权重开源。Transformers、vLLM 能接,社区也在跟 llama.cpp。云 OCR 按页收费,这个把账单换成机器和时间。 100 页能不能一口吞完,看显存和文档密度,仓库没有写成保底。合同、论文可以先在本地过一遍,终稿还是要人看。 项目地址:github.com/baidu/Unlimite…
话题来源 @XAMTO_AI 984K阅读 ❤️14 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单