自监督学习概述
自监督学习(Self-Supervised Learning, SSL)是一种利用无标注数据构造监督信号进行预训练的机器学习范式。其核心思想是设计预文本任务(pretext task),让模型从数据本身的结构中自动生成标签,从而学习到通用的数据表示。
基本思想
自监督学习的关键在于构造伪标签(pseudo label),即将无监督问题转化为有监督问题。常见的做法包括:
- 掩码重建:遮挡输入的一部分,让模型预测被遮挡的内容(如BERT的掩码语言模型)
- 对比学习:让模型区分相似样本和不相似样本(如SimCLR、MoCo)
- 旋转预测:预测图像的旋转角度
- 相对位置预测:预测图像块或文本片段的相对位置关系
预训练与微调范式
自监督学习的标准流程分为两个阶段:
预训练阶段
在大规模无标注数据上,通过预文本任务训练模型。预训练使得模型获得对数据的通用理解能力,学习到良好的特征表示。
微调阶段
在预训练模型的基础上,使用少量有标注数据针对特定下游任务进行调整。通过微调,预训练的特征表示得以适配目标任务。
优势与意义
- 充分利用无标注数据:大幅降低对人工标注数据的依赖
- 强大的迁移能力:预训练模型可以作为通用特征提取器
- 显著提升下游任务性能:在标注数据有限的情况下尤其明显
代表性方法
| 方法 | 领域 | 核心机制 |
|---|---|---|
| BERT | 自然语言处理 | 掩码语言模型 + 下一句预测 |
| GPT | 自然语言处理 | 自回归语言模型 |
| SimCLR | 计算机视觉 | 对比学习 |
| MAE | 计算机视觉 | 掩码自编码器 |
