纯文本AI也能看图?1k star的视觉工具箱把DeepSeek逼成多模态

你用 DeepSeek、Codex 这种纯文本模型跑 Agent,最痛苦的事是什么?

我猜是:图片发不出去、截图它看不懂、UI 还原全靠嘴描述。

但你看 Anionex/agent-vision-toolkit 这个仓库——1k+ stars,干的就是把「视觉能力」从模型层搬到工具层,给任何文本模型装上一双眼睛。

它到底解决了什么?

传统思路:模型必须自己多模态,所以 DeepSeek 这种便宜能打的纯文本模型天然被排除在「能看图」的赛道之外。

这个项目的思路反过来:视觉能力不一定非得住进模型里,它可以住在 Harness 里。 作者在工具 + 技能层补了一套视觉管线,把图像问答、长截图 OCR、前端 UI 还原、GUI 自动化全都做出来,纯文本模型也能调用,效果甚至不输原生多模态。

一份「技能 + 工具」双层结构

仓库里其实给了两套东西:

  • Vision tool CLIs:一组命令行小工具,加一个 SKILL.md 教会 Agent 何时该调哪一个。任何能调 shell 的 Agent(Codex、Claude Code、Pi、Oh My Pi、OpenCode)都能直接用。
  • 可选的无缝集成:一个本地透明代理 + 单文件原生插件,你直接粘贴图片,Agent 自带的图片工具也能正常用,不需要任何额外提示词

最贴心的一点——所有代码都在真实的 Codex + DeepSeek 会话里跑通过验证,Claude Code、Pi、Oh My Pi、OpenCode 同样做过端到端验证。这不是 PPT 工程,是真能用的。

谁最该装?

  • 重度 DeepSeek 用户:终于不用每次看到 Claude/GPT 才能处理图片了。
  • 前端工程师:UI 截图 → 代码还原这条链路,现在纯文本模型也能干。
  • 自动化研究员:GUI 自动化、跨应用操作场景,受够了 OCR 抽风的可以试试。
  • 穷鬼玩家:不想订阅 GPT-4V/Gemini 多模态,又想给 Agent 加视觉能力,这就是当下最务实的解。

上手成本

零依赖框架,主要就是一个 npm 包 + SKILL.md,配置按项目级放在 .claude/skills/ 即可。MIT 协议,作者还开放了 DeepSeek Harness 的原生 Profile Bundle 子模块(dsh-vision-toolkit),10 个结构化视觉工具直接当 DSH 官方扩展用。

更新也很勤,2026-08-18 刚把内置技能名从 vision-tools 改成 vision-skills,定位更清晰——讲的是能力,不是底层工具。


如果说之前「给纯文本 Agent 加眼睛」是奢侈品,那这套基本就是当下最务实的平替。装起来试试,被惊艳到了别忘了回来谢我 😎

GitHub: https://github.com/Anionex/agent-vision-toolkit


GitHub: https://github.com/Anionex/agent-vision-toolkit

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 13 阅读