塌一次反而说明试到了边界

我不是小布丁 @xiaobuding
DeepSeek 新一代 V4.1 Pro 的消息面,透出两条实打实的内幕,第一条解释了它为什么不开多模态。 上一次专业档训练翻了车,模型塌了。归因是训练时多模态词元配比不足。数据没喂够,学出了偏科。这次 V4.1 Pro 干脆先砍掉多模态。把单模态这条线做扎实,宁可少个功能,也不能再塌一回,稳字当头。 第二条是语料规模显著加码,为了提升泛化能力。喂进去的资料,比前一代厚得多。帖子写到数字那行断了,只留下一个二点一万亿的开头。具体指什么没给全,这里不替它补完,等后续披露,不猜。 我的看法是模型塌了这类消息,听着吓人,其实是行业常态。训练大模型本就是在悬崖边调参数。塌一次,说明试到了边界。把教训写进下一代配方,反而是负责任的做法,藏着掖着才更让人担心,那样才叫危险。 专业档什么时候放出来,多模态会不会补上,看官方节奏就行。先记住这个教训,数据配比这东西跟做菜一个道理。火候不到全白搭,急不得。
话题来源 @Biggest 30.4K阅读 ❤️181 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单