DeepSeek 终于能「看图」了!这个开源插件让纯文本模型秒变多模态

DeepSeek 终于能「看图」了!这个开源插件让纯文本模型长出视觉

DeepSeek 原生是纯文本模型,你给它一张报错截图、一张设计稿,它只能回你「抱歉,我无法处理图片」。这大概是很多人弃 DeepSeek 而选 Claude 或 GPT-4o 的最大理由之一。

但现在有个开源插件,直接把这个短板补上了。

ModLens(GitHub: https://github.com/liustack/modlens)是专门为 DeepSeek Harness 以及所有纯文本编程 Agent 开发的首个视觉插件,最近更新到 v3.18.3,GitHub 已经有 1.7k 颗星,热度涨得飞快。

它是怎么工作的?

核心逻辑很巧妙:ModLens 并不改变 DeepSeek 模型本体,而是作为外部视觉引擎插在模型外面。你把图片直接粘贴进对话框,ModLens 会调用视觉引擎(可以是 Gemini、OpenAI 兼容端点,或者复用人机已经登录的 Claude Code/Codex/OpenCode 的认证态)读取图片,然后把结果转成结构化的 JSON 证据——包含 OCR 文字、版面结构、语义实体和不确定项——一并塞进模型上下文。

也就是说,模型拿到的不是一段无法核验的「图片描述」,而是带着坐标和原文的证据链。

使用体验接近原生多模态

在 DeepSeek Harness 里,装好 ModLens 后,模型选择器会自动出现一个 “(modlens vision)” 变体,选中后直接把截图粘进去,缩略图保留在消息里,体验跟 Codex 几乎一样。

这对编程场景来说非常实用——

  • 报错截图:直接把终端报错信息截图丢给模型,它能读出错误文本+上下文位置,而不是让你手动敲报错信息
  • 设计稿 / UI 截图:让模型直接理解你要实现的界面,不用你用文字描述布局
  • 流程图 / 架构图:截图即得结构化信息,省去手动提炼的步骤
  • 网页截图:让模型边看边改,不用你来回描述元素位置

安装超简单

npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.18.3

注意官方锁了版本号 @3.18.3 而不是用 @latest,原因是 pnpm 11 会拦截发布不足 24 小时的新版,用 @latest 实际可能装到一天前的旧包。

适合谁用?

只要你在用 DeepSeek Harness 或任何基于纯文本编程 Agent(如 OpenCode、Codex 等)进行开发工作流,这个插件都值得一试。尤其是经常需要处理截图、报错信息、设计稿的同学,ModLens 基本解决了 DeepSeek 系列模型最大的能力短板之一。

GitHub 仓库:https://github.com/liustack/modlens


标签:Skill, AI, 开发工具, Claude, DeepSeek


GitHub: https://github.com/liustack/modlens

评论区

0 条评论

登录后可评论。

陈一铭 15 阅读