中国电信刚开源了一个新模型Xing4.0-29B-A4B,参数量29B但激活参数…

AI大土豆 @suanwan
中国电信刚开源了一个新模型Xing4.0-29B-A4B,参数量29B但激活参数只有4B,原生支持256K上下文,还能扩展到512K。 这个模型有几个点值得关注。首先它完全在昇腾NPU + MindSpore上训练的,不是用的英伟达GPU。这意味着国产算力训练大模型这条路又往前走了一步。 性能方面,SWE-bench Verified跑到了75.0,SuperCLUE Agent榜排第三,得分93.52。对于一个29B的模型来说,这个成绩相当不错。 最实用的是它的部署门槛。4-bit量化之后只需要15GB显存,RTX 3090和4090这种24GB消费级显卡就能跑本地长上下文推理。对于想在本地跑大模型但又不想买专业卡的开发者来说,这个模型是个不错的选择。 256K的原生上下文长度也很实用,处理长文档、长代码库的场景下不用频繁截断。扩展到512K之后,基本上能覆盖绝大多数长文本任务了。 不过要注意的是,这个模型目前主要针对中文场景优化,英文能力可能不如一些国际大厂的模型。另外,昇腾NPU训练意味着它的生态工具链可能还不够成熟,如果你习惯用CUDA生态,迁移过来可能需要一些时间。 总的来说,Xing4.0证明了国产算力训练大模型的可行性,对于想在本地部署长上下文模型的开发者来说,这个模型值得试试。
话题来源 @Chinazhidx 10.3K阅读 ❤️175 x.com/…↗ 已改写,非原文转载
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单