数据标准化
在聚类算法中,距离计算是核心操作之一。然而,当不同特征的量纲或数值范围差异较大时,直接使用原始数据计算距离会导致量纲较大的特征主导聚类结果,从而掩盖其他特征的影响。
为什么需要标准化
聚类算法(如K-均值、层次聚类)通常基于欧氏距离或曼哈顿距离等距离度量。如果特征的取值范围不同:
- 特征A(如年龄:0-100)与特征B(如收入:0-100000)数值差异巨大
- 距离计算会被收入特征主导,年龄特征几乎不起作用
- 某些特征的单位选择(如米 vs 厘米)会人为改变聚类结果
因此,在计算距离之前,需要将数据标准化,使各特征处于相同的尺度。
常用标准化方法
Z-score 标准化(零均值标准化)
将数据转换为均值为0、标准差为1的分布:
其中 为特征均值, 为标准差。适用于数据近似服从正态分布的场景。
Min-Max 标准化(归一化)
将数据线性映射到 [0, 1] 区间:
适用于已知取值范围边界的场景,但对异常值敏感。
鲁棒标准化
使用中位数和四分位距进行标准化,对异常值更鲁棒:
注意事项
- 标准化参数(均值、标准差等)应从训练集计算,再应用于测试集
- 并非所有聚类算法都需要标准化——基于密度的聚类(如DBSCAN)更为敏感
- 对于分类特征,需要使用专门的编码方式(如独热编码)后再考虑是否需要标准化

链接到
- 上一个知识点:无(本章第一个知识点)
- 下一个知识点:4.2 K-均值聚类