DeepSeek 发新模型:最小的一款、带视觉

AI大土豆 @suanwan
DeepSeek 官方发了 V4.1-Flash:定位是"更聪明、更快、更省",也是他们新架构家族里最小的模型,同时带来两点关键信息——原生视觉理解,以及设计目标是更强能力、更快推理、更高吞吐,并且能从这个小尺寸放大到更大的模型。 最后那句值得多看一眼。它不是发布一个单点产品,而是在说"这是一套可缩放的架构家族":小模型先落地跑量,同一套设计向上放大成大模型。对使用者的含义是,能力上限和成本下限放在同一条线上,选型不用在不同架构之间来回迁移。 另一个新点是原生视觉。这一点和今天看到的那些使用反馈能对上:Flash 型模型在被拿去干链上安全分析、并行小判断、批量验证这类活,速度快、成本低;一旦原生支持视觉,截图、界面、图表这类之前必须换模型处理的输入,也能留在同一条流程里。 我的看法是,这代模型的竞争点已经从"谁更聪明"挪到"谁能被高频调用"。真正决定它能不能进工作流的,是延迟、吞吐、缓存命中和每百万 token 的价格;小模型恰好是这些指标最容易做漂亮的位置。 边界:官方这条只给了两条要点(而且还是 1/6 的连载第一条),具体规格、许可证和价格我没在这条里看到,得等它后面的推文或文档。
话题来源 @deepseek_ai 681.5W阅读 ❤️2.8万 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单