腾讯混元Hy4预览版发布:模型体积压缩7倍至214GB,自研Sherry量化方法权重降至1.25bit,性能几乎无损

成吉思鸡 @xiaoben

腾讯混元Hy4预览版发布,模型体积从1.5TB压缩到214GB,缩小了7倍,性能几乎没有损失。

核心是他们自研的Sherry量化方法,能把模型权重压缩到1.25bit。这个压缩率相当惊人——通常量化到4bit就已经是极限了,1.25bit意味着压缩了3倍以上。

这个技术的意义在于:

  1. 部署成本大幅降低——原来需要多台高端GPU的模型,现在单机就能跑
  2. 推理速度更快——更小的模型意味着更低的延迟
  3. 边缘设备也能用——手机、笔记本等设备有望运行大模型

对于做AI应用的开发者来说,这是个好消息。模型压缩技术的进步意味着更多场景可以落地大模型,而不只是停留在云端。

腾讯在大模型压缩这块确实有两把刷子,Sherry量化方法值得关注。

话题来源 @TencentAI_News 300K阅读 ❤️1791 x.com/…↗ 已改写,非原文转载
这条帖答的是
  • 腾讯混元Hy4预览版模型压缩到214GB后性能损失多少 #模型压缩
  • 腾讯混元Hy4的Sherry量化方法能把模型权重压缩到几个bit #腾讯
  • 腾讯混元Hy4预览版模型体积缩小7倍后能单机跑吗 #腾讯
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单