deepseek-vision-mcp Skill 技能

给纯文本大模型装上眼睛,让 DeepSeek 也能看懂图片

deepseek-vision-mcp 是一个开源 MCP Server,通过将图片识别能力委托给第三方视觉大模型 API(如智谱 GLM-4.6V、硅基流动 Qwen2.5-VL、通义千问 qwen-vl-plus 等),让 DeepSeek 系列纯文本模型获得视觉理解能力。

🎯 解决什么问题

DeepSeek 是优秀的纯文本大模型,但无法直接识别图片。当用户在对话中发送截图、照片或图表时,普通 DeepSeek 只能「看到图片 URL 却读不出内容」。本项目通过 MCP 协议暴露 analyze_image 工具,让 DeepSeek 在遇到图片时自动调用该工具,将图片发送至视觉 API 识别后获取文本描述,再由主模型继续处理——对用户而言,就像 DeepSeek 突然会「看图」了。

🧩 核心功能

  1. analyze_image 工具:接收图片 URL 或 base64,调用视觉 API 返回结构化文本描述
  2. 多视觉 API 支持:默认使用智谱免费额度(glm-4.6v-flash),也支持 OpenAI 兼容接口的任意视觉模型
  3. DeepSeek Harness 插件:提供一键安装脚本,自动完成 Python 环境配置、模型安装和 Key 配置
  4. 隐私保护:图片发送到视觉 API 提供商处理,需阅读项目隐私说明选择可信服务商

📦 安装与使用

在 DeepSeek Harness 桌面版中,复制项目推荐提示词给 AI 助手,它会引导你从零完成以下步骤:

  1. 克隆项目仓库,确认 Node ≥22.19、Python ≥3.10
  2. 构建 DSH Bundle 并安装到 Web profile
  3. 在可视化配置页面填写视觉模型 API Key(Key 不回显,凭据由 DSH 安全存储)

通用 MCP 客户端安装:

{
  "mcpServers": {
    "deepseek-vision": {
      "command": "npx",
      "args": ["-y", "deepseek-vision-mcp"],
      "env": {
        "VISION_MODEL": "glm-4.6v-flash",
        "VISION_API_KEY": "your-api-key"
      }
    }
  }
}

🔧 适用场景

  • 技术文档配图解读(截图、架构图、流程图)
  • 视觉元素丰富的对话助手(如同时处理文字和图片的分析任务)
  • 多模态研究与实验

⚠️ 注意事项

  • 视觉识别能力由第三方模型提供,图片会发送到对应服务商 API
  • 需在 https://open.bigmodel.cn 申请智谱 Key(或使用其他 OpenAI 兼容视觉 API)
  • API Key、模型和 Base URL 必须属于同一家服务商,不能混用不同平台凭证

📦 基本信息

  • 语言:Python
  • 版本:0.3.1
  • 依赖:Python 3.10+,智谱/硅基流动/通义千问等 OpenAI 兼容视觉 API

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论