GPT

GPT(Generative Pre-trained Transformer)是由OpenAI开发的预训练语言模型系列。与BERT不同,GPT采用自回归(Autoregressive) 语言模型作为预训练目标,以从左到右的单向方式生成文本。

自回归语言模型

GPT的预文本任务是标准的自回归语言模型:给定前面的Token序列,预测下一个Token出现的概率:

这种单向建模方式使得GPT天然适合文本生成任务。

模型架构

GPT基于Transformer的解码器(Decoder)部分,使用掩码自注意力机制确保每个位置只能关注到其左侧的上下文。主要版本演进:

版本发布时间参数量核心特点
GPT-12018年6月117M开创性的生成式预训练
GPT-22019年2月1.5Bzero-shot能力显著提升
GPT-32020年5月175B少样本/零样本的语境学习能力

GPT vs BERT

特性GPTBERT
架构Transformer解码器Transformer编码器
注意力方向单向(从左到右)双向
预训练目标自回归语言模型掩码语言模型
擅长任务文本生成文本理解
语境学习支持不支持

生成过程

GPT使用自回归解码生成文本:模型根据已经生成的前缀,逐步预测下一个词,再将新词添加到输入序列中继续生成,直到输出终止标记或达到最大长度。

影响与意义

GPT系列模型展示了随着模型规模扩大,语言模型涌现出的强大能力(如语境学习、推理能力等),推动了大语言模型(LLM)研究的发展。GPT-3及后续版本证明了”规模化”(scaling)的有效性,开启了通用人工智能探索的新方向。

链接到