时间:2026年9月1日
地点:北京
人物:腾讯混元团队(隶属腾讯IEG技术体系)
事件详情:9月1日中午,腾讯混元团队宣布推出Hy4 preview轻量版模型,将原版约1.5TB的权重文件压缩至约214GB,体积减少约86%,约为原版的七分之一。压缩采用两项核心技术:其一是自研Sherry稀疏三值量化算法,将最激进的路由专家层权重压至平均1.25比特;其二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在不增加平均比特预算的前提下实现更低量化误差。
背景:Hy4 preview是腾讯于8月28日发布并开源的新一代MoE混合专家大语言模型,总参数量7700亿、激活参数490亿,上下文长度达100万Token。在多个编程、智能体和科研基准测试中,Hy4 preview的得分超过DeepSeek V4 Pro 0824等模型,排名位居开源模型第一梯队。但1.5TB的庞大权重对显存和部署环境要求极高,普通开发者和中小企业难以本地部署。
影响:轻量版在主流评测任务上能力保持稳定,长文理解、多轮长上下文检索与原始版本基本持平,数学能力仅小幅回落,可覆盖日常编程辅助、工具调用、长文档处理和常规问答等场景。腾讯还联合prima.cpp分布式推理框架验证了异构设备联合推理方案:在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB、分属两个局域网)上协同运行,速度达1.02 token/s,较笔记本单机offload提升约6倍。量化GGUF库与AngelSlim代码已同步开源,支持llama.cpp、vLLM、SGLang等主流推理框架。
总结:腾讯混元通过差异化精度分配替代一刀切压缩,为超大MoE模型的轻量化落地提供了新路径,使更多资源有限的开发者能在本地或边缘设备上运行旗舰大模型,降低了高端开源大模型的应用门槛。
参考来源:
1. https://zhidx.com/p/589600.html
2. https://news.qq.com/rain/a/20260901A05EGY00
3. https://news.qq.com/rain/a/20260901A069H400
4. https://www.sohu.com/a/1070401547_121423427
5. https://www.aihub.cn/news/hy4-preview-lightweight-model
6. https://huggingface.co/AngelSlim/Hy4-preview-GGUF
7. https://github.com/Tencent/AngelSlim







