自监督学习概述

自监督学习(Self-Supervised Learning, SSL)是一种利用无标注数据构造监督信号进行预训练的机器学习范式。其核心思想是设计预文本任务(pretext task),让模型从数据本身的结构中自动生成标签,从而学习到通用的数据表示。

基本思想

自监督学习的关键在于构造伪标签(pseudo label),即将无监督问题转化为有监督问题。常见的做法包括:

  • 掩码重建:遮挡输入的一部分,让模型预测被遮挡的内容(如BERT的掩码语言模型)
  • 对比学习:让模型区分相似样本和不相似样本(如SimCLR、MoCo)
  • 旋转预测:预测图像的旋转角度
  • 相对位置预测:预测图像块或文本片段的相对位置关系

预训练与微调范式

自监督学习的标准流程分为两个阶段:

预训练阶段

在大规模无标注数据上,通过预文本任务训练模型。预训练使得模型获得对数据的通用理解能力,学习到良好的特征表示。

微调阶段

在预训练模型的基础上,使用少量有标注数据针对特定下游任务进行调整。通过微调,预训练的特征表示得以适配目标任务。

优势与意义

  • 充分利用无标注数据:大幅降低对人工标注数据的依赖
  • 强大的迁移能力:预训练模型可以作为通用特征提取器
  • 显著提升下游任务性能:在标注数据有限的情况下尤其明显

代表性方法

方法领域核心机制
BERT自然语言处理掩码语言模型 + 下一句预测
GPT自然语言处理自回归语言模型
SimCLR计算机视觉对比学习
MAE计算机视觉掩码自编码器

链接到

  • 上一个知识点:无(本章第一个知识点)
  • 下一个知识点:6.2 BERT
  • 相关知识点:8.4 自我学习