d
deepseek-vision-mcp Skill 技能
给纯文本大模型装上眼睛,让 DeepSeek 也能看懂图片
deepseek-vision-mcp 是一个开源 MCP Server,通过将图片识别能力委托给第三方视觉大模型 API(如智谱 GLM-4.6V、硅基流动 Qwen2.5-VL、通义千问 qwen-vl-plus 等),让 DeepSeek 系列纯文本模型获得视觉理解能力。
🎯 解决什么问题
DeepSeek 是优秀的纯文本大模型,但无法直接识别图片。当用户在对话中发送截图、照片或图表时,普通 DeepSeek 只能「看到图片 URL 却读不出内容」。本项目通过 MCP 协议暴露 analyze_image 工具,让 DeepSeek 在遇到图片时自动调用该工具,将图片发送至视觉 API 识别后获取文本描述,再由主模型继续处理——对用户而言,就像 DeepSeek 突然会「看图」了。
🧩 核心功能
- analyze_image 工具:接收图片 URL 或 base64,调用视觉 API 返回结构化文本描述
- 多视觉 API 支持:默认使用智谱免费额度(glm-4.6v-flash),也支持 OpenAI 兼容接口的任意视觉模型
- DeepSeek Harness 插件:提供一键安装脚本,自动完成 Python 环境配置、模型安装和 Key 配置
- 隐私保护:图片发送到视觉 API 提供商处理,需阅读项目隐私说明选择可信服务商
📦 安装与使用
在 DeepSeek Harness 桌面版中,复制项目推荐提示词给 AI 助手,它会引导你从零完成以下步骤:
- 克隆项目仓库,确认 Node ≥22.19、Python ≥3.10
- 构建 DSH Bundle 并安装到 Web profile
- 在可视化配置页面填写视觉模型 API Key(Key 不回显,凭据由 DSH 安全存储)
通用 MCP 客户端安装:
{
"mcpServers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision-mcp"],
"env": {
"VISION_MODEL": "glm-4.6v-flash",
"VISION_API_KEY": "your-api-key"
}
}
}
}
🔧 适用场景
- 技术文档配图解读(截图、架构图、流程图)
- 视觉元素丰富的对话助手(如同时处理文字和图片的分析任务)
- 多模态研究与实验
⚠️ 注意事项
- 视觉识别能力由第三方模型提供,图片会发送到对应服务商 API
- 需在 https://open.bigmodel.cn 申请智谱 Key(或使用其他 OpenAI 兼容视觉 API)
- API Key、模型和 Base URL 必须属于同一家服务商,不能混用不同平台凭证
📦 基本信息
- 语言:Python
- 版本:0.3.1
- 依赖:Python 3.10+,智谱/硅基流动/通义千问等 OpenAI 兼容视觉 API
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议