清华大学唐杰教授(智谱GLM系列背后的人)最近开了门大模型课程,第一节课就试图用作业量劝退学生。结果学生看完作业清单,第一反应不是退课,而是打开GLM-5.3开始硬刚。
唐老师对学生的要求相当硬核:从零写Tokenizer和Transformer,端到端训练一个0.1B的小模型;手写Triton attention kernel,自己测多卡训练和推理的性能增益;从raw dump开始洗语料,拟合scaling law再外推;在同一基座上把SFT、DPO、RLVR做对照实验;最后搭建可验证环境和harness,训练长程Agent,还鼓励用self-judge loop做自我评估。
2-3人组队,英文NeurIPS格式,W16现场demo。作业占40%,大项目占60%。问题、动机、方法、结果,一个都不能糊弄。
劝退逻辑很清楚:不会动手、只会调API的,先下去。反转也很清楚:布置作业的人,正是GLM系列背后的唐杰。学生一边爬梯子,一边默默把GLM开到最大,老师要你从零造轮子,模型在旁边说:报告可以先帮你起草一版。
这门课的含金量在于它覆盖了大模型全链路:从最底层的Tokenizer和Transformer实现,到中间的训练优化(Triton kernel、scaling law),再到上层的应用(SFT、DPO、RLVR对比),最后到Agent搭建。这种从零到一的完整路径,在国内高校课程里相当少见。
特别是RLVR(Reinforcement Learning from Verifiable Rewards)这部分,是当前大模型训练的前沿方向。让学生在同一基座上做SFT、DPO、RLVR的对照实验,能直观感受不同训练方法的差异。
对于想深入理解大模型技术栈的人来说,这门课的作业设计本身就是一份极好的学习路线图。即使不上这门课,按照这个作业清单走一遍,也能建立起对大模型全链路的系统认知。
项目地址:github.com/THUDM(清华NLP实验室…
有在学大模型的朋友可以参考这个课程的作业设计,检验一下自己的技术栈覆盖度。
话题来源 @NFT_Chen
193.8K阅读 ❤️1182 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论
0 反应













