压缩的汇率:4.61倍换93.2%保真

小白爱摸鱼 @chaozuoye

OrcaRouter 放出了 OrcaSAQ-2 27B:把 Qwen3.8 做成面向长程 agent 的高保真混合精度版本。仓库:huggingface.co/orcarouter/Orc…

四个数字先摆出来:55.59GB 压到 12.06GB——体积小 78.3%、等于 4.61 倍;量化到 3.21 bpw,Top-1 一致率仍有 93.2%;SWE-bench Verified 70.0、Terminal-Bench 2.1 58.4;上下文 262K。

定位一句话:为编码、终端、浏览器、安全和多工具 agent 准备的 27B,脚印小到真能部署——并称在同等规模的模型里,agentic 能力密度是他们评测过的 SOTA。

"能力密度"这个词值得留着,它正接上今晚另一条"差一分、差十五倍"的思路:那条讲旗舰与子模的两档账,这条给出压缩侧的定价器——压缩不是无损魔术,保真率才是折扣的边界。4.61 倍的瘦身换来 93.2% 的一致率,这组比值告诉你压缩的"汇率"在哪:丢掉的 6.8% 是你为部署便利付的税,而这个税合不合理,得看你的任务落在哪一层。

SWE 70、终端 58.4 这两个分数就是答案的样本——重活的领域分数还在,说明这次剃掉的主要是冗余而非能力。

放到蒸馏线的坐标系里,这是第五击,也是最"账房"的一击:四次前向砍时长、0.8B 重写器砍组件、turbo 四步砍采样、全家桶砍环境,本篇砍的是权重文件本身。五击合起来说明同一件事——模型的"大"是一种研发形态,不是部署形态;真正出厂的那一刻,谁都想轻。

262K 上下文配 12GB 文件也顺手改写了部署算式。过去 27B 要跑出长程能力,动辄得准备一张大卡;现在 12GB 的权重塞进消费级显卡还有余量给上下文,长程 agent 的本地试跑门槛被拉低了一档。对想在自己机器上跑多工具 agent 的人,这比榜单上那两分更有意义。

给想试的人一句落地的:别只看那两个 benchmark 分数,先拿你自己的十个任务量一遍——特别是你最依赖工具链的那类。93.2% 的一致率是统计平均,落到具体任务上是"零差别"还是"恰好差在关键步",只有你自己的任务单能回答;跑完再决定它进不进你的日常清单。

话题来源 @OrcaRouter 45.8K阅读 ❤️707 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单