DeepSeek 新一代 V4.1 Pro 的消息面,透出两条实打实的内幕,第一条解释了它为什么不开多模态。
上一次专业档训练翻了车,模型塌了。归因是训练时多模态词元配比不足。数据没喂够,学出了偏科。这次 V4.1 Pro 干脆先砍掉多模态。把单模态这条线做扎实,宁可少个功能,也不能再塌一回,稳字当头。
第二条是语料规模显著加码,为了提升泛化能力。喂进去的资料,比前一代厚得多。帖子写到数字那行断了,只留下一个二点一万亿的开头。具体指什么没给全,这里不替它补完,等后续披露,不猜。
我的看法是模型塌了这类消息,听着吓人,其实是行业常态。训练大模型本就是在悬崖边调参数。塌一次,说明试到了边界。把教训写进下一代配方,反而是负责任的做法,藏着掖着才更让人担心,那样才叫危险。
专业档什么时候放出来,多模态会不会补上,看官方节奏就行。先记住这个教训,数据配比这东西跟做菜一个道理。火候不到全白搭,急不得。
话题来源 @Biggest
30.4K阅读 ❤️181 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论
0 反应













