大语言模型概述

什么是大语言模型

大语言模型(Large Language Model, LLM)是指基于 Transformer 架构、在海量文本数据上进行预训练的大规模语言模型。其核心特征包括:

  • 规模巨大:参数规模从数十亿到数千亿不等
  • 自监督预训练:通过语言建模目标(如预测下一个 token)从无标注数据中学习
  • 涌现能力:当模型规模超过某个阈值时,展现出小模型不具备的新能力

规模定律(Scaling Laws)

研究表明,LLM 的性能与三个因素之间存在幂律关系:

  • 参数量(Model Size):更多参数带来更强能力
  • 数据量(Data Size):更多数据提升模型泛化能力
  • 计算量(Compute):更大计算预算支持更大规模训练

这三大因素需要协同扩展,才能实现最优的性能提升。

涌现能力(Emergent Abilities)

当模型规模达到一定阈值后,LLM 会展现出以下涌现能力:

  • 上下文学习(In-Context Learning):通过提示中的示例进行学习
  • 思维链推理(Chain-of-Thought):逐步推理解决复杂问题
  • 指令遵循(Instruction Following):理解和执行自然语言指令

LLM 的发展历程

从早期的 GPT-1、BERT 等预训练模型,到 GPT-3 展示出强大的少样本学习能力,再到 ChatGPT、GPT-4、DeepSeek 等对话式模型,LLM 经历了快速迭代和革命性进步。

链接到