纯文本AI也能看图?1k star的视觉工具箱把DeepSeek逼成多模态
你用 DeepSeek、Codex 这种纯文本模型跑 Agent,最痛苦的事是什么?
我猜是:图片发不出去、截图它看不懂、UI 还原全靠嘴描述。
但你看 Anionex/agent-vision-toolkit 这个仓库——1k+ stars,干的就是把「视觉能力」从模型层搬到工具层,给任何文本模型装上一双眼睛。
它到底解决了什么?
传统思路:模型必须自己多模态,所以 DeepSeek 这种便宜能打的纯文本模型天然被排除在「能看图」的赛道之外。
这个项目的思路反过来:视觉能力不一定非得住进模型里,它可以住在 Harness 里。 作者在工具 + 技能层补了一套视觉管线,把图像问答、长截图 OCR、前端 UI 还原、GUI 自动化全都做出来,纯文本模型也能调用,效果甚至不输原生多模态。
一份「技能 + 工具」双层结构
仓库里其实给了两套东西:
- Vision tool CLIs:一组命令行小工具,加一个 SKILL.md 教会 Agent 何时该调哪一个。任何能调 shell 的 Agent(Codex、Claude Code、Pi、Oh My Pi、OpenCode)都能直接用。
- 可选的无缝集成:一个本地透明代理 + 单文件原生插件,你直接粘贴图片,Agent 自带的图片工具也能正常用,不需要任何额外提示词。
最贴心的一点——所有代码都在真实的 Codex + DeepSeek 会话里跑通过验证,Claude Code、Pi、Oh My Pi、OpenCode 同样做过端到端验证。这不是 PPT 工程,是真能用的。
谁最该装?
- 重度 DeepSeek 用户:终于不用每次看到 Claude/GPT 才能处理图片了。
- 前端工程师:UI 截图 → 代码还原这条链路,现在纯文本模型也能干。
- 自动化研究员:GUI 自动化、跨应用操作场景,受够了 OCR 抽风的可以试试。
- 穷鬼玩家:不想订阅 GPT-4V/Gemini 多模态,又想给 Agent 加视觉能力,这就是当下最务实的解。
上手成本
零依赖框架,主要就是一个 npm 包 + SKILL.md,配置按项目级放在 .claude/skills/ 即可。MIT 协议,作者还开放了 DeepSeek Harness 的原生 Profile Bundle 子模块(dsh-vision-toolkit),10 个结构化视觉工具直接当 DSH 官方扩展用。
更新也很勤,2026-08-18 刚把内置技能名从 vision-tools 改成 vision-skills,定位更清晰——讲的是能力,不是底层工具。
如果说之前「给纯文本 Agent 加眼睛」是奢侈品,那这套基本就是当下最务实的平替。装起来试试,被惊艳到了别忘了回来谢我 😎
GitHub: https://github.com/Anionex/agent-vision-toolkit
评论区
登录后可评论。