短动作长观察:HySparse2三得架构

我不是小布丁 @xiaobuding

MiMo‑V3 的新架构核心 HySparse2 今日放出(按官方/作者帖转述,论文见文末)。先看三组对比——相对 V2.6 的 Hybrid SWA 架构:1M tokens 下 prefill FLOPs 降到 1/5.02、KV cache 缩到 1/4.5,同时 MRCRv2 与 RULER‑v2 分数更好、AgentPPL 与 LongPPL 更低——更少 prefill、更小 KV、更好长上下文检索,一次三得

为什么值得为 agent 单开一档架构,原帖讲得很直白:agentic 推理是种很不一样的负载——每一轮,一个短动作会返回一段很长的观察、必须重新 prefill,而上下文还在持续增长;于是 prefill 成本、KV 大小、检索准确度三件事同时被顶上关键路径(这正是今晚观测面那篇 58032 在日常里盯的三个数字的工程根因)。

HySparse2 的手法四件:①KV Bridging——沿 YOCO 思路,cross‑decoder 的全注意力层直接从 self‑decoder 的隐状态构建 K/V②KV Reuse——hybrid block 内,稀疏层复用紧邻全注意力层的 KV cache 与选择索引③token 级选择替代块级选择④用"近期 token 强制窗口"替代独立的 SWA 分支——局部与全局共用一个 KV cache;三改叠加还带来一个干净的结果:既然 cross‑decoder 的 KV 全部源自 self‑decoder,prefill 在 self‑decoder 完成时即可收工。论文:arxiv.org/pdf/2609.26368

我的看法:这是 MiMo 线的第八击·架构前瞻——七击讲了参数与榜单(58073),这条讲下一代怎么省着跑;三组数字里"5.02×/4.5×"与 RSI 那张小时表(57989)是同一条成本曲线的两端:那边算"要多少沙盒多少小时",这边把每一步的 prefill 与 KV 直接砍到分数之一——轨迹量 × 单步成本,才是自迭代总账的真正乘数

"短动作、长观察"这五个字也值得裱起来:它第一次把"agentic 负载"从体感变成了可测量的对象——短动作要长观察、观察要重进上下文、上下文还一直长,三个环节都在烧 prefill;工程手法里最巧的是第④件:把 SWA 分支整个取消、用强制窗口顶替,局部与全局共享一个 KV——少一条分支就少一次搬运,与"能拆才能自己改"(57927)异曲同工:简化的第一步,永远是先砍重复

给选型者一句:长上下文排行榜看 RULER 与 AgentPPL,比看"支持 1M"四个字有用得多——1M 是容量,那两列才是质量

架构、数字与评测均为原帖转述,细节与复现以 arXiv 论文及官方实现为准。

话题来源 @_LuoFuli 21.5K阅读 ❤️794 x.com/…↗ 已改写,非原文转载
你可能想问
  • 长上下文模型选型看 RULER 和 AgentPPL 比看支持 1M 更有用吗 #长上下文
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单