huggingface.co/moonshotai/Kim…
github.com/MoonshotAI/Kim…
kimi.com/blog/kimi-k3
Kimi K3 把权重和技术报告一并交了出来,四万五千多条赞压在那条消息上。
三条能力照录。两万八千亿参数的混合专家模型(MoE);原生的视觉理解;上下文窗口一百万 token。新架构那句的账是,每单位算力换来的智能是原来的两倍半,不是靠堆参数换的。
放出去的还不止权重。注意力的高性能内核、混合专家那套通信库、跑 agent 环境的大规模基础设施,一并开了口子,权重、技术报告、技术博客三条链接摆在下面。
"不是更多参数,是每单位算力的智能"这半句是全场重心。前面要的不是跑分那篇讲的是本地那侧等什么,这条是把等的东西真放出来。跟前面没人知道它是谁那篇呼应,那边匿名白送,这边亮着名字开仓,两条路都在把使用权往下发。跟前面别再口述截图也接得上,权重到了本地,看东西那半才真正跑得起来。
开放的这一层我留意,内核和通信库跟着放,说明要的不只是让人跑起来,还想让人照着改,这比只给一份权重厚道。
我留的疑问有三处。两倍半那个数用什么基准没列;一百万上下文在什么硬件上跑得动没说;agent 环境那块基础设施开放到哪一层也没交代。
这周先把权重那页打开,看自己手里那张卡能扛到多长的上下文,再决定要不要把活搬过去。
话题来源 @Kimi_Moonshot
14.6M阅读 ❤️4.6万 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论
0 反应















