时间:2026年8月31日
地点:北京(深度求索总部)/ Hugging Face 全球开源平台
人物:深度求索(DeepSeek)官方团队 / Hugging Face 平台
事件详情:DeepSeek 于 Hugging Face 正式开源 DeepSeek-V4-Flash-Vision-Exp,这是一款 305B 参数的多模态视觉理解模型,采用 MIT 协议开源。模型基于 DeepSeek-V4-Flash 架构集成视觉模块,并通过持续训练解锁视觉理解能力。开源内容包括完整模型权重(约 168GB,48 个 Safetensors 分片)、Tokenizer、Prompt Encoding 参考实现以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash 注意力、MoE、Hyper-Connections 和 DSpark 等核心模块。
背景:该模型最早于 8 月 21 日登陆 DeepSeek API 平台(API 模型名 deepseek-v4-flash-vision-exp),支持文本 + 图片混合输入,可识别 JPEG/PNG/GIF/WebP 格式;此次开源补齐了权重与本地推理能力,使开发者能够脱离官方 API 进行研究、私有化部署与二次开发。同期官方同步上线 Harness 0.1.1 开发者预览版,开箱即用支持该模型。
影响:在多模态 Agent 基准测试上,DeepSeek-V4-Flash-Vision-Exp 相对纯文本 V4-Flash 出现大幅跃升,多项指标逼近甚至反超 Anthropic Opus-4.8:DeepSWE 真实软件工程测试 59.3(Opus-4.8 为 58.0)、ApexBench Pass@1 36.5(Opus-4.8 为 39.4)、Agents' Last Exam 27.3(Opus-4.8 为 25.7)、ZeroBench Pass@5 35.0(Opus-4.8 为 34.0)、Toolathlon-Verified 75.9(Opus-4.8 为 76.2)、Chartography 64.3(Opus-4.8 为 65.0)。在纯文本 Agent 任务上保持与 V4-Flash-0731 相当水平,意味着多模态升级是"叠加式"而非"权衡式"。MIT 协议允许商业使用,意味着国产开源多模态模型正式具备支撑企业级视觉 Agent 部署的合规与工程基础。
总结:DeepSeek V4 首款原生视觉模型以 MIT 协议开源,305B 多模态能力逼近 Opus-4.8、DeepSWE 反超 Opus-4.8,进一步压缩国产开源模型与全球顶级的差距;图片理解与本地化部署能力同步开放,将带动视觉 Agent、图表分析、UI 自动化等多模态应用开发进入下一阶段。
参考来源:
- 智东西:https://zhidx.com/p/589405.html
- Hugging Face 官方仓库:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
- IT之家:https://www.ithome.com/0/996/637.htm
- AIHub:https://www.aihub.cn/news/deepseek-v4-flash-vision-exp-open-weights
- ITBear 科技资讯:https://www.itbear.com.cn/html/2026-09/1533983.html
- AIWeekly:https://aiweekly.co/alerts/deepseek-releases-305b-v4-flash-vision-exp-under-mit-license
- Silicon Report:https://www.siliconreport.com/deepseek-launches-experimental-v4-flash-vision-model-559bbb7392
- DeepSeek 官方 API 文档:https://api-docs.deepseek.com/zh-cn/updates









