智谱今天披露了一个挺有意思的事情:GLM-5.3-Flash的全部生产推理已经跑在超过10万块国产AI加速器上了。从模型首次跑通到上线生产,不到两周时间,端到端吞吐量提升了3.2倍。
但最让我惊讶的是,完成这些优化工作的不是工程师团队,而是一个由GLM-5.3驱动的AI智能体。用模型优化运行它自己的系统,这个思路确实有点东西。
国产加速器的部署条件其实很苛刻。显存容量和带宽有限,软件生态不成熟,很多该有文档的地方只能靠猜。GLM-5.3-Flash还要支持100万token上下文和多模态请求。每一步优化都是在做交换:用计算换显存,用通信换显存,用精度换容量,用架构分离换调度自由度。
智能体在优化过程中发现了三个真实的工程问题。第一个是精度漂移,KDA内核在上下文并行路径中,TF32的舍入误差通过链式状态矩阵合并不断累积,上下文越长漂移越大。第二个是并发瓶颈,KV缓存传输本该和计算并行,但智能体发现两者从未重叠,追到Python和C++的边界才发现是GIL的问题。第三个是重复计算,一个解码内核因分块方式把同一归一化运算重复做了四遍。
智谱CEO唐杰说,智能体卡住的时候,几乎从来不是因为它写不出代码,而是因为它不知道事情为什么变差了。"吞吐量下降了20%"告诉你出了问题,但不告诉你问题在哪一层、该验证什么假设、下一步该测什么。
他们构建了一套分层验证接口让智能体直接调用:正确性反馈回答"算对了吗",系统行为反馈回答"时间花在了哪",性能反馈回答"哪个方案在什么条件下更优"。靠这套机制,智能体发现并修复了上述三个问题。
唐杰强调了边界:目标设定、反馈环境搭建、高风险变更审查仍然由人负责。但工程师的角色正在变化——从解决问题的人,变成设计反馈的人。
话题来源 @dotey
27.6K阅读 ❤️102 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论
0 反应













