29B总参数,只激活4B,原生支持256K上下文,还能扩展到512K。这不是某个…

29B总参数,只激活4B,原生支持256K上下文,还能扩展到512K。这不是某个大厂的闭源模型,而是中国电信星辰团队用昇腾NPU+MindSpore全栈国产算力训出来的开源模型。 几个数字值得单独拎出来:SWE-bench Verified达到75.0,SuperCLUE Agent拿到93.52,Terminal-Bench 2.1是57.5,超过了同档的Qwen和Gemma。4bit量化后大约15GB,3090或4090就能本地跑长上下文。 模型地址: HuggingFace:huggingface.co/XingChen-AGI/X… GitHub:github.com/XingChen-AGI/X… 我有个做AI应用的朋友,他之前一直在找一个既能写代码又能跑长任务的轻量模型。试了这个后,他说确实比预期的好。特别是那个512K的上下文窗口,处理长文档的时候不用反复切片,省了不少麻烦。 最让我惊讶的是它的训练方式。全程用昇腾NPU和MindSpore,没有依赖任何国外算力。这意味着从训练到部署,整个链条都是国产的。对于那些对数据安全和算力自主有要求的场景,这个模型是个不错的选择。 我试了一下用它写代码,确实能跑。虽然跟GPT-4比还有差距,但考虑到它只有4B激活参数,这个表现已经相当不错了。关键是它能调工具、跑长任务,不只是聊天那么简单。 如果你有24G显卡,今晚就能试。4bit量化后15GB,3090或4090就能跑。我打算周末在自己的4090上部署一下,看看实际效果怎么样。
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单