Transformer核心流程概览:
- Tokenizer:文字怎么变成数字
- Embedding:数字怎么变成有意义的向量
- Positional Encoding:模型怎么知道"谁在前谁在后"
- Self-Attention:一个词怎么"看"到其他词
- Multi-Head Attention:怎么同时从多个角度看
- Residual Connection:怎么保住原始信息不丢
- LayerNorm:怎么让每层输入分布稳定
- FFN:每个位置怎么单独做非线性加工
其中 1~3 是输入处理
4~8 是一个 Transformer Block 的核心组件
整个 Transformer = 输入处理 + N 层这样的 Block + 输出层
24 浏览 0 评论
0 反应












