GPT
GPT(Generative Pre-trained Transformer)是由OpenAI开发的预训练语言模型系列。与BERT不同,GPT采用自回归(Autoregressive) 语言模型作为预训练目标,以从左到右的单向方式生成文本。
自回归语言模型
GPT的预文本任务是标准的自回归语言模型:给定前面的Token序列,预测下一个Token出现的概率:
这种单向建模方式使得GPT天然适合文本生成任务。
模型架构
GPT基于Transformer的解码器(Decoder)部分,使用掩码自注意力机制确保每个位置只能关注到其左侧的上下文。主要版本演进:
| 版本 | 发布时间 | 参数量 | 核心特点 |
|---|---|---|---|
| GPT-1 | 2018年6月 | 117M | 开创性的生成式预训练 |
| GPT-2 | 2019年2月 | 1.5B | zero-shot能力显著提升 |
| GPT-3 | 2020年5月 | 175B | 少样本/零样本的语境学习能力 |
GPT vs BERT
| 特性 | GPT | BERT |
|---|---|---|
| 架构 | Transformer解码器 | Transformer编码器 |
| 注意力方向 | 单向(从左到右) | 双向 |
| 预训练目标 | 自回归语言模型 | 掩码语言模型 |
| 擅长任务 | 文本生成 | 文本理解 |
| 语境学习 | 支持 | 不支持 |
生成过程
GPT使用自回归解码生成文本:模型根据已经生成的前缀,逐步预测下一个词,再将新词添加到输入序列中继续生成,直到输出终止标记或达到最大长度。
影响与意义
GPT系列模型展示了随着模型规模扩大,语言模型涌现出的强大能力(如语境学习、推理能力等),推动了大语言模型(LLM)研究的发展。GPT-3及后续版本证明了”规模化”(scaling)的有效性,开启了通用人工智能探索的新方向。

链接到
- 上一个知识点:6.2 BERT
- 下一个知识点:6.4 微调与语境学习
- 相关知识点:11.1 大语言模型概述、11.2 关键技术概览