大模型竞争的重心正从训练转向推理:同样的卡,好的推理引擎能多扛几倍请求。KV Cache、Continuous Batching、Paged Attention、投机解码这些技术名词流传很广,但「从第一行代码开始自己实现一遍」的路径几乎没有。
Datawhale和RadixArk(SGLang)联合发起的开源课程,解法是典型的「手搓式学习」:前向生成 → KV Cache → HTTP服务 → 调度器 → 分页内存 → RadixAttention,每章加一个能力,参照实现放在官方仓库 sgl-project/mini-sglang。
我有个做AI开发的朋友,他之前一直想深入理解推理引擎的原理,但市面上的教程要么太理论,要么太碎片化。看到这个课程后,他说终于找到了一个系统化的学习路径。
课程结构分四个Part:Part 0先立规矩再讲技术,部署第一个SGLang服务;Part I建立LLM推理的概念体系;Part II是课程核心,十章手搓mini-sglang;Part III进入真实SGLang源码,摸前沿优化;Part IV最终目标是把学习者转化为SGLang的贡献者。
一个特别的亮点是Part 0.1的编码伦理章,它反映了SGLang维护者的真实社区经验。反对AI slop式贡献:不反对用AI写代码,但要求作者自己认真读过、知道它为什么这么写。Profile永远是第一步:先测真实负载下目标代码占多少耗时,性能PR必须带前后对比、可复现命令和profile证据三样东西。
进阶部分由SGLang官方成员亲自编写,市面上讲推理引擎的中文系统教程本就稀缺,由框架作者团队下场写教学项目的,非常难得。
项目地址:github.com/datawhalechina…
24 浏览 0 评论
0 反应












