MiniMax 的新文本模型 M3.1-Flash-Preview 出来后,有人拿它跑了一轮鹈鹕测试。
起因是此前大家怀疑匿名的 Space Bunny 就是 M3.1,于是把两者放一起比。结果出乎意料,Space Bunny 完胜,生成效果好得多。速度那栏更扎眼,Space Bunny 用两分三十四秒、每秒一百四十三 token;M3.1-Flash-Preview 用了十三分十五秒、每秒九十个 token。发帖人顺手点了句冷知识,这模型虽然名字带 Flash,其实并不快。
叫 Flash 却不快这半句我看重。前面沙虫那篇的引帖里也提过,M3.1 名字叫 Flash、出字却钉在最重的思考档上,快是拿来给思考买单的。两处观察合起来,名字和表现的错位已经不是孤例。这跟前面档位那篇讲的"看参数表选型会踩坑"对上。
匿名模型这层也值得记。Space Bunny 是谁家的还没有定论,测试里"应该不是一个模型"的判断,眼下只能算排除法。
我留的疑问有两处。单次测试的样本太薄,同一题多跑几轮才有意义;另外 M3.1 还是预览版,权重和跑分都没放,强弱得等正式版再看。
想比较的拿同一道题各跑三遍,别只看一次结果就下结论。
话题来源 @xueyu1125
32.5K阅读 ❤️106 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












