充分统计量
定义与信息论刻画
充分统计量(Sufficient Statistic)是统计推断中的一个核心概念,它描述了一种无损数据压缩的方式——在不损失关于模型参数任何信息的前提下,用更简洁的统计量代替原始观测数据。设 为待估计的参数, 为原始观测数据, 是 的一个统计量。从信息论的角度,互信息 表示原始数据 中包含的关于参数 的信息量,而 表示统计量 中包含的关于参数 的信息量。
当以下等式成立时,称 为 的充分统计量:
这意味着 完整地保留了原始数据 中关于参数 的全部信息,对数据进行压缩后没有造成任何信息损失。从马尔可夫链的角度看,充分统计量满足 构成马尔可夫链,即给定 后, 与 条件独立:
Neyman-Fisher因子分解定理
判断一个统计量是否充分的最常用工具是Neyman-Fisher因子分解定理。该定理指出: 是 的充分统计量当且仅当概率密度函数(或概率质量函数)可以分解为以下形式:
其中 是一个依赖于 和 的非负函数, 是一个与 无关的非负函数。这个分解清晰地表明,样本 中关于参数 的所有信息都通过 传递,而 部分不包含任何关于 的信息。
例如,对于独立同分布的伯努利试验 ,联合概率为:
其中 ,因此 是参数 的充分统计量。对于高斯分布 ,样本均值 和样本方差 共同构成充分统计量。
最小充分统计量与指数族
在所有充分统计量中,具有最强压缩能力的是最小充分统计量(Minimal Sufficient Statistic),即任何其他充分统计量都可以表示为该统计量的函数。最小充分统计量实现了最大程度的无损数据压缩。从互信息的角度,对于最小充分统计量 ,有:
指数族分布(Exponential Family)是一类具有特殊结构的重要分布族,其概率密度函数可以写为:
对于指数族分布, 天然就是充分统计量,且其维数通常是有限且固定的,不随样本量增加而增长。这使得指数族分布在大规模数据分析中具有显著的计算优势。常见的指数族分布包括高斯分布、伯努利分布、泊松分布、Gamma分布等。
与数据处理不等式的联系
充分统计量与数据处理不等式有着深刻的联系。数据处理不等式指出,对于任何马尔可夫链 ,有 ,即数据处理过程不能增加信息量。充分统计量恰好达到了这个上界——它是在数据处理不等式约束下最优的数据压缩方式,在压缩数据的同时完整保留了所有关于参数的信息。从这一角度看,充分统计量揭示了信息处理的基本极限,是信息论与统计推断之间的重要桥梁。
链接到
- 上一个知识点:5.2 数据处理不等式
- 下一个知识点:5.4 Fano不等式