单价逐项列:MiMo2.6Pro的实测三张牌

一份给 小米 Mimo 2.6 Pro 的第三方上手实测,含金量在单价逐项列、假设写明

价格牌:在"agentic coding + 缓存命中"的标准假设下——比 Kimi K3 便宜约 15 倍、比 GLM 5.3 便宜约 6 倍、比 DeepSeek V4 便宜约 2 倍,只比 DeepSeek V4.1 Flash 贵 2 倍;单价给出:缓存命中 $0.0036/M、输入 $0.435/M、输出 $0.87/M——他的评价是"难以置信的便宜"。

性能牌无可争议地处在性能与质量的 Pareto 前沿上;Fast mode 官方称"最高 20 倍速",他实测在 OpenRouter 上约 3 倍吞吐、p50 约 150 tokens/s(口径按其记述)。

安全研究牌(双刃):它在网络安全类问题上基本不设防——多数模型会拒绝的缓冲区溢出类问题(他举了 ImageMagick 的例子)能给出像样的回答,CyberGym 拿到 95 分

CyberGym 是面向真实漏洞发现的安全基准,95 分意味着它在这个垂直场景的可用性极高;框在安全研究与攻防测试的语境里看,这既是能力也是风险:对研究者是低摩擦的基准利器,对部署者则意味着"护栏必须自己加"——安全边界不能指望模型自觉,这一点正好呼应今天另一篇真车实验的结论。

为什么"假设"要写明:那组 15 倍、6 倍、2 倍全都挂在他设定的 agentic coding + 缓存命中率上——同一款模型,命中率高与低的账单能差出好几倍(另一条线里 Spotify 的案例正好说明缓存与路由对成本的杠杆有多大)。所以看便宜不便宜,先看任务形态与命中率假设,再看单价本身

多模态牌:做信息类视频很顺(TTS 开箱即用、自动配音效),在 DAW 里作曲被他形容为"惊人地强";官方技术报告还深入讲了 RL 是怎么 scale 上去的,值得一读。

我的看法:三张牌连起来看,MiMo 这条线今晚已经凑齐——早前的定价、官方案例(进实验室干"干实验")、这份第三方实测——便宜、Pareto、不设防,每张牌都带着自己的使用前提。更难得的是作者的克制:对"是不是最佳开源模型"他只说"还早,但确实是强竞争者"——没把话说满的评测,才值得信。

以上为作者实测口径(含缓存命中与任务形态等假设),训练细节以官方技术报告为准。

话题来源 @deedydas 48.3K阅读 ❤️710 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单