关键技术概览

LLM 的核心技术体系

大语言模型的成功依赖于一系列关键技术的协同创新,涵盖模型架构、训练方法、对齐技术等多个层面。

模型架构

  • Transformer 架构:自注意力机制(Self-Attention)是 LLM 的核心,支持长距离依赖建模
  • 多头注意力(Multi-Head Attention):从不同表示子空间并行捕捉信息
  • 层归一化(Layer Normalization):稳定训练过程
  • 激活函数:如 GELU、SwiGLU 等

预训练技术

  • 因果语言建模(Causal LM):自回归方式预测下一个 token
  • 混合精度训练:FP16/BF16 训练以降低显存占用
  • 张量并行与流水线并行:分布式训练策略
  • 梯度检查点(Gradient Checkpointing):以计算换内存

对齐技术(Alignment)

LLM 通过后训练阶段对齐人类偏好:

  • 监督微调(SFT):使用人工标注的指令数据进行微调
  • 奖励建模(Reward Modeling):训练奖励模型反映人类偏好
  • 强化学习微调:如 RLHF、PPO、GRPO 等

高效推理

  • KV Cache:缓存历史键值对,加速自回归解码
  • 量化(Quantization):INT4/INT8 量化减少模型大小
  • 投机解码(Speculative Decoding):用小模型辅助大模型推理

链接到