OCR It 今日发布
开源浏览器插件,专门解决「文档被锁在阅读器里、文字无法选中复制」的问题,适用于扫描版书籍、幻灯片
OCR It 是一款开源浏览器插件,专门解决「文档被锁在阅读器里、文字无法选中复制」的问题,适用于扫描版书籍、幻灯片、禁止复制的 PDF 阅读器等场景。用户只需用快捷键 Option+Shift+R 拖选一次截取区域,之后每次按 Option+Shift+S 就截取同一矩形区域、执行 OCR 并把文字追加到一份连续转录稿;按 Option+Shift+A 进入全自动模式,由插件自动完成截图—识别—翻页的完整循环,直到文档结束,按 ESC 可随时中断。
技术层面,所有识别通过内置的 Tesseract WASM 引擎 100% 离线完成,不需要 API Key、不需要联网,图片不会离开本机,插件本身不发出任何外部网络请求。翻页控制采用屏幕坐标点而非 CSS 选择器,可以穿透跨域 iframe 与 Shadow DOM,兼容大多数主流在线文档阅读器。自动停止逻辑会在连续两张相同页面、无法继续翻页、OCR 失败或达到 300 页上限时自动退出,避免在末页无限抓取。
输出方面,每页识别结果以缩略图形式列出,文字可直接在界面内编辑,错误页可单独重跑。Copy all 与 Download .txt 导出带「--- page N ---」分隔符的完整转录稿,可直接粘贴给 Claude、ChatGPT 等大模型进行总结、问答或搜索。该工具采用 Manifest V3 与 MIT 协议,同时提供 Chrome 与 Firefox 版本,Chrome 用户可在 Chrome Web Store 一键安装,Firefox 用户在 addons.mozilla.org 安装,Firefox 140+ 还支持从同一源码树构建。
在「为 LLM 准备数据」成为日常工作的当下,这类零上传、零成本、零 API Key 的本地 OCR 工具填补了 RAG 与语料整理流程中处理受限文档的关键缺口,敏感合同、内部资料不出本机即可完成数字化。
评论与建议
登录 后参与评论或提建议