关键技术概览
LLM 的核心技术体系
大语言模型的成功依赖于一系列关键技术的协同创新,涵盖模型架构、训练方法、对齐技术等多个层面。

模型架构
- Transformer 架构:自注意力机制(Self-Attention)是 LLM 的核心,支持长距离依赖建模
- 多头注意力(Multi-Head Attention):从不同表示子空间并行捕捉信息
- 层归一化(Layer Normalization):稳定训练过程
- 激活函数:如 GELU、SwiGLU 等
预训练技术
- 因果语言建模(Causal LM):自回归方式预测下一个 token
- 混合精度训练:FP16/BF16 训练以降低显存占用
- 张量并行与流水线并行:分布式训练策略
- 梯度检查点(Gradient Checkpointing):以计算换内存

对齐技术(Alignment)
LLM 通过后训练阶段对齐人类偏好:
- 监督微调(SFT):使用人工标注的指令数据进行微调
- 奖励建模(Reward Modeling):训练奖励模型反映人类偏好
- 强化学习微调:如 RLHF、PPO、GRPO 等
高效推理
- KV Cache:缓存历史键值对,加速自回归解码
- 量化(Quantization):INT4/INT8 量化减少模型大小
- 投机解码(Speculative Decoding):用小模型辅助大模型推理

链接到
- 上一个知识点:11.1 大语言模型概述
- 下一个知识点:11.3 后训练范式
- 相关知识点:7.3 多头注意力模型、6.3 GPT