纯文本 Claude 也能”看”图了:localvision 让图片分析完全本地化
你有没有遇到过这种情况——想让 AI 帮你看一张截图、分析一张设计稿,但你的 Claude 或者 Codex 是个”盲人”,根本看不见图片?
以前唯一的解法是:掏钱买带视觉能力的模型,或者把图片往云端一传、祈祷数据别被滥用。但如果你用的是纯文本的 Codex CLI,或者公司政策不允许图片外传,这这条路就堵死了。
localvision 就是来解决这个问题的。
本地视觉:给盲人 LLM 长一双眼睛
localvision 是一个跑在本地的 MCP 服务器,背后是 llama.cpp。它不需要任何云服务,图片永远不会离开你的机器。纯文本的 Claude 或者 Codex 接上这个工具,就能”看见”了——读取截图、分析 UI、OCR 识别、图表转数据,统统在本地完成。
SkillsMP 上配套的 Skill 叫 image-reading,当你的 AI 需要处理任何图片时触发,自动路由到本地 VLM 工具。
11 个专用工具,覆盖真实工作流
这个 Skill 不是简单调一个通用模型,而是根据任务类型分发到专门的提示词上,效果比通用方案好 2-3 倍:
- read_document — 读 PDF 论文、报告、幻灯片
- extract_code — 从截图里提取代码(编辑器、终端、白板照片都行)
- extract_text — 逐字转录(收据、文档、路牌)
- extract_table — 从截图或表格图片里提取数据
- describe_ui — 描述 UI 截图、设计稿、App 界面
- describe_diagram — 架构图、流程图、ER 图(可输出 Mermaid)
- describe_chart — 图表可视化(可输出 CSV/JSON 原始数据)
- diagnose_error — 分析终端报错、堆栈信息
- image_to_prompt — 把图片转成文生图 prompt
- compare_images — 对比两张图(前后对比、视觉回归)
实测:一分钱不花的视觉能力
配置需要:GPU 8GB 以上显存(RTX 3060 12GB 够用),llama.cpp 编译好(CUDA 支持),一个视觉模型的 GGUF 文件(比如 Qwen3-VL-4B)。没有 API key,没有月费,没有数据外传。
llama-server 在空闲时会自动关闭,不占你的显卡。图片处理默认 200 DPI 渲染,扫描版 PDF 用 poppler 直接提取文字层,不走模型调用——又快又准。
适合谁用
如果你用 Codex CLI、DeepSeek 这类纯文本模型做开发,这个 Skill 能把图片相关的活也接进来——截图转代码、报错图分析、设计稿描述,一句话的事。
隐私敏感场景(医疗、金融、内部文档)尤其适合,图片不上云是企业合规的基本要求,localvision 从架构上就满足了这个需求。
GitHub:https://github.com/froggeric/llm
GitHub: https://github.com/froggeric/llm
评论区
登录后可评论。