DeepSeek发布了V4-Flash-Vision-Exp,一个实验性的多模态模型。核心亮点是:它在文本能力上和V4-Flash完全一致——包括Agent、推理和世界知识;但在多模态Agent基准测试上,直接跃升了一个量级,性能接近GPT-4o的Opus-4.8。
用一句话总结就是:不花钱也能用上接近顶级的多模态能力。
V4-Flash本身就是以性价比著称的模型,现在加上视觉能力后,意味着开发者可以用极低的成本构建多模态Agent应用——看图理解、视觉问答、图表分析、UI自动化,这些场景的门槛被大幅拉低了。
更值得注意的是DeepSeek的节奏。从V3到V4到V4-Flash再到Vision版本,几乎每隔几周就有一次能力迭代。这种高频发布策略直接把模型厂商之间的竞争从「谁更聪明」变成了「谁更快」。当别人还在测试上一个版本时,DeepSeek已经发了三个新模型。
对开发者来说,这是一个明确的信号:多模态Agent的基础设施正在快速成熟。以前需要自研视觉模型或调用昂贵API的场景,现在一个Flash级别的模型就能搞定。
话题来源 @deepseek_ai
243K阅读 ❤️1.1万 x.com/…↗ 已改写,非原文转载
31 浏览 0 评论
0 反应









