让AI真正理解你的LLM架构——这个Skill把GPT/BERT/Attention优化讲透了

很多人用 LLM,却对底层原理一头雾水。看 attention 机制只懂”它很神奇”,看 BERT 只知道”双向语言模型”——真正工程落地时,该选 encoder 还是 decoder、位置编码用哪种、KV-cache 怎么算、RLHF 和 DPO 选哪个,这些问题一追问就卡壳。

今天挖到一个超硬的参考 Skillllm,来自 hung-phan/ml-skills 仓库。它不是科普文章,是一份面向工程师的完整 LLM 架构与优化参考手册,覆盖从模型结构到推理调优的全链路。

先搞清楚:LLM 不是一蹴而就的

Skill 一开头就给了一个反直觉的认知框架:

  • RNN 看似处理序列,实际上无法并行、长期依赖差——LSTM/GRU 只是缓解,不是解决
  • CNN 可以并行,但感受野受限,要很多层才能捕获长距离依赖
  • Self-attention 让每个 token 直接 attend 到任意其他 token,O(1) 层数完成跨距离建模

这个框架的价值在于:它不是告诉你”正确答案是什么”,而是让你理解为什么 LLM 最终选择了 Transformer 架构——只有懂了这个,才能在具体场景下做正确的架构选型。

核心内容:三条主线拆解

第一,架构家族。Skill 完整梳理了三种主流架构:GPT 系的 decoder-only + causal masking、BERT 系的 encoder-only + MLM、双向注意力,以及 T5 系的 encoder-decoder + span corruption。搞清楚了这些,才知道为什么翻译任务用 T5 而不是 GPT。

第二,现代优化。这是干货最密集的部分:

  • RoPE:旋转位置编码,用数学技巧在 attention 分值里注入位置信息,比 Sinusoidal 更适合长上下文
  • GQA(Grouped Query Attention):LLaMA-2/3、Mistral 都在用——多个 query 共享一组 key/value,大幅降低 KV-cache 显存
  • SwiGLU:LLaMA 2 引入的激活函数,比 ReLU 有更强的表达能力
  • RMSNorm:比 LayerNorm 更简洁,训练速度更快

第三,Attention 变体与工程优化。Flash Attention 的 tiling 思想让显存从 O(N²) 降到 O(N),PagedAttention(vLLM)解决推理时 KV-cache 碎片化问题,Ring Attention 把上下文分散到多卡处理。这些内容 Skill 都给出了核心原理 + 适用场景,不是浮于表面的列举。

训练与对齐:RLHF、DPO、LoRA

Fine-tuning 部分覆盖了从业者最纠结的几个选择:

  • LoRA / QLoRA:低秩适配,用少量参数训练撬动大模型微调
  • RLHF:先用 Reward Model 训练,再用 PPO 更新策略——但存在 reward hacking 风险
  • DPO(Direct Preference Optimization):绕过 Reward Model,直接用偏好数据优化,简化了 RLHF 的流程

Skill 的价值在于,它把每种方法的 trade-off 讲清楚了:DPO 简单但需要更大的数据量,RLHF 灵活但调参复杂,QLoRA 适合单卡微调但效果有上限。

推理优化:量化、vLLM、投机解码

最后一部分是 Skill 最贴近工程实践的内容:FP16/BF16 训练精度问题、INT8/INT4 量化压缩、vLLM 的 PagedAttention 显存管理、Speculative Decoding 用小模型预测大模型 token 以提升吞吐。每一项都给出了关键参数和适用条件,不是泛泛而谈。

怎么用

安装方式非常简洁:

npx skills add https://github.com/hung-phan/ml-skills --skill llm

装好后,Claude Code 会自动在需要时加载这份参考。遇到”该用哪种位置编码”、”这个 Attention 算子为什么慢”之类的问题,直接激活 skill,它会给出对应章节的详细解释。

GitHub:https://github.com/hung-phan/ml-skills

这个仓库还内置了配套的 ml-review Skill,可以当作 ML/DL 问题的路由中枢——它会判断你的问题属于哪个子方向,然后调用对应的 reference 文档。对于需要系统学习 LLM 架构的开发者来说,这套组合是目前市面上最完整的开源参考之一。


GitHub: https://github.com/hung-phan/ml-skills

评论区

0 条评论

登录后可评论。

陈一铭 12 阅读