大模型推理引擎这个领域,中文教程一直很稀缺。KV Cache、Continuou…

AI大土豆 @suanwan
大模型推理引擎这个领域,中文教程一直很稀缺。KV Cache、Continuous Batching、Paged Attention这些技术名词流传很广,但真正从第一行代码开始自己实现一遍的路径几乎没有。Datawhale和RadixArk联合发起的这门开源课程,填补了这个空白。 项目地址:github.com/datawhalechina… 课程分四个Part,设计逻辑很清晰。Part I先建立LLM推理的概念体系,零代码零GPU门槛,讲清楚prefill vs decode、compute-bound vs memory-bound这些基础概念。Part II是核心,十章手搓mini-sglang,从正确性到效率到服务化到调度,每章加一个能力。 我有个做AI基础设施的朋友,他之前想深入理解推理引擎但找不到好的中文资料。用了这门课后,他说终于把KV Cache的工作原理搞明白了,不是那种我知道它是什么的明白,而是我知道它为什么这么设计的明白。 Part III进入真实SGLang源码,讲Attention后端、量化、分层缓存、PD分离这些前沿优化。最难得的是,这部分由SGLang官方成员亲自编写,框架作者团队下场写教学项目,市面上非常少见。 Part IV是Cookbook部署、Profiling与Trace、PR工作流,最终目标是把学习者转化为SGLang的贡献者。课程还有统一写作模板和CI脚本自动检查章节结构,规范化程度在教育类开源项目里少见。 我试了一下Part II的前几章,确实比自己啃源码效率高很多。特别是把模型调用和推理引擎的区别讲清后,再引入Req/Batch/Context这些对象,理解起来顺畅多了。 如果你也在做AI推理相关的工作,可以试试这门课。特别是那些想深入理解推理引擎原理但找不到好资料的人,这门课能省不少时间。
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单