DeepSeek Harness升级 多模态能力拉满
时间:2026年8月20日凌晨
地点:开源社区(GitHub)
人物:DeepSeek Harness 开源团队
事件详情:DeepSeek Harness 正式发布 v0.1.0-rc.8 版本,这是该 Agent Harness 框架 8 月 13 日 v0.1 公测以来的首次重要更新,共带来 14 项调整。核心亮点是补齐多模态能力:DeepSeek 模型适配器现在可通过配置启用原生图片请求,/goal、/plan 等指令也支持图文混合输入;@菜单新增文件与会话引用,用户可直接把本地文件、已有会话拉进当前任务。
背景:DeepSeek Harness 是 DeepSeek AI 在 8 月 13 日 v0.1 公测并同步开源的"智能体编织"框架,采用"一切皆插件"架构,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 均可由插件替换组合。公测当晚,智东西曾第一时间拉取源码实测,完成 88 页论文翻译、贪吃蛇游戏开发等任务。仅过去不到一周,团队就把多模态这块关键能力补齐。
核心细节:rc.8 同步上线多项配套能力。子代理协作方面,Claude Code 与 Codex 进一步接入子代理体系,可作 Profile Bundle 按需安装,Codex 支持非交互权限模式与多命名实例,方便在同一个任务中配置不同 Codex 子代理。终端体验方面,Windows PTY 终端加入持久 PowerShell 会话,极简模式预设默认开启。工具调用方面,web_search 支持并发查询,子代理 reportDelivery 及时唤醒父任务,本地运行 dsh web 自动打开浏览器。
特殊亮点:面对本身不支持图像输入的模型,DeepSeek Harness 会自动退化到工具层视觉方案:先调用 OCR 文字识别,再统计颜色比例、扫描像素行、读取图片尺寸和色彩模式等元信息,把图片拆成"文字内容及坐标""背景颜色比例""特定区域像素变化""图片尺寸"等结构化结果,再交给文本大模型推理,相当于给纯文本模型拼出一套工具层"视觉"。
修复与优化:聚焦解决公测后的若干痛点,包括单张图片尺寸过大或历史图片累积导致请求失败、取消流式生成后回复前缀未带入下一轮提问或分叉会话、部分自定义 OpenAI 兼容网关因请求格式差异无法调用及推理内容回传缺失等;同步提升大型历史会话分叉和 SQLite 后端读写性能。
影响与意义:v0.1.0-rc.8 让 DeepSeek Harness 从纯文本/代码/工具调用场景正式扩展到多模态 Agent 工作流,"插件化 Harness"路线进一步落地。OCR+像素分析+结构化证据的工具层视觉方案,把视觉能力从底座模型解耦,为 Agent 视觉能力提供了一种"不依赖底座模型"的新路径。
总结:8 月 13 日公测、8 月 20 日首次大版本迭代,DeepSeek Harness 用"一周一迭代"的节奏验证了"一切皆插件"的产品思路;多模态与子代理同步强化,让它在 Anthropic Claude Code、OpenAI Codex 等海外智能体框架之外,提供了"插件化 Agent Harness"的差异化选项。
参考来源:
1. 智东西:https://zhidx.com/p/586603.html
2. 36 氪:https://www.36kr.com/p/3947115501845891
3. 腾讯新闻:https://view.inews.qq.com/a/20260820A03U8O00
4. 今日头条:https://www.toutiao.com/a7675991377217438246
5. 新浪财经:https://finance.sina.cn/stock/estate/2026-08-20/detail-ininxkry2175009.d.html
6. 观点网:https://www.guandian.cn/article/20260820/587708.html
7. 腾讯新闻(实测):https://new.qq.com/rain/a/20260820A0F03U00
8. GitHub Release:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8









