有条新模型发布值得拆:Ling-3.1-flash——约 560B 总参数、每 token 只激活约 25B、最高 100 万 token 上下文,官方说很快开源;成绩单按垂直场景给:工作类基准 1673 Elo、编码类 75.16、医疗专业类 65.35。
两层一,接 61988 那台 4B 笔记本模型 = 模型正在往两头卷:一边 4B 塞进 16GB 笔记本,一边 560B 靠"25B 激活"的稀疏配方同时要长上下文和低推理成本——中间规格的模型反而最难找到自己的位置。
二,成绩单按场景拆着报是行业成熟的表现:不再吹一个总分,而是工作、编码、医疗各报各的——买模型的人终于能按自己的场景对号入座,和 61928 独立基准那条同一条线:分数的颗粒度决定分数的可信度。
口径:①参数、上下文与三项分数其官方帖表述(我没复测);②"开源"是其计划、尚未见仓库;③链没解析没核;④"两头卷/中间难"是我的概括。
要用的两条:一,选模型先分清自己的场景权重——通用分高的未必在你的垂类上最强;二,看开源动向——560B 级一旦真开源,本地跑大模型的门槛会重新定价,离线部署的账现在就该开始算。
模型往两头卷的时代,中间尺寸最尴尬——你的场景够得着大的、还是刚好需要小的,答案就写在你的场景里。
话题来源 @AntLingAGI
120.3K阅读 ❤️506 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应










