GLM-5.3智能体优化自身推理系统,吞吐量提升3.2倍

智谱今天披露了一个很有意思的实验:让GLM-5.3自己优化运行它自己的推理系统。 整个部署条件很苛刻。国产加速器显存容量和带宽有限,软件生态不成熟,很多该有文档的地方只能靠猜。GLM-5.3-Flash还要支持100万token上下文和多模态请求。每一步优化都是在做交换:用计算换显存、用通信换显存、用精度换容量、用架构分离换调度自由度。 最终国产芯片的单token成本对标了主流英伟达GPU,从模型首次跑通到上线生产不到两周,端到端吞吐量提升了3.2倍。 但最有意思的是,完成大量优化工作的不是工程师团队,而是一个由GLM-5.3驱动的AI智能体。 智谱CEO唐杰说,智能体卡住的时候,几乎从来不是因为它写不出代码,而是因为它不知道事情为什么变差了。吞吐量下降了20%告诉你出了问题,但不告诉你问题在哪一层、该验证什么假设。 智谱做的事情是把资深工程师脑子里那套隐性的过程奖励显性化,构建一套分层验证接口让智能体直接调用。正确性反馈回答算对了吗,系统行为反馈回答时间花在了哪,性能反馈回答哪个方案在什么条件下更优。 靠这套机制,智能体发现并修复了三个真实的工程问题:精度漂移、并发瓶颈、重复计算。每个问题都是在阅读多个开源项目内核代码后提炼出的优化思路。 唐杰说:我们离递归自我改进还很远,但最小的闭环已经存在了。模型优化系统,系统运行模型。 这个思路对做AI基础设施的人很有启发。与其让工程师手动调优,不如设计一套反馈机制让模型自己迭代。 有在做AI推理优化的朋友可以参考这个思路,特别是那些在国产芯片上部署大模型的。
话题来源 @dotey 52.6K阅读 ❤️186 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单