考虑特征向量 x∈Rd,假设类条件概率密度是高斯分布:
p(x∣ωi)=(2π)d/2∣Σi∣1/21exp(−21(x−μi)TΣi−1(x−μi))∼N(μi,Σi)
此时的判别函数为:
TIP贝叶斯判别准则就是最小错误率准则,选择后验概率最大的类别。
gi(x)i=lnp(x∣ωi)+lnP(ωi)=−21(x−μi)TΣi−1(x−μi)−21ln∣Σi∣+lnP(ωi)−2dln(2π)=argimaxgi(x)
情况1:Σi=σ2I,P(ωi)=c1#
假设每一类数据在特征空间中都长成一个正圆球体(二维是圆,三维是球),并且所有类别的球体大小(半径)完全一样。
gi(x)=−2σ21∥x−μi∥2+constant∝−∥x−μi∥2i=argimaxgi(x)⟹i=argimin∥x−μi∥2此分类器称为距离分类器,判别函数可以用待识模式 x 与类别均值 μi 之间的距离表示 gi(x)=−d(x,μi),最大化判别函数等于最小化距离,因此也称为最小距离分类器。
决策边界:两个球心连线的垂直平分线(超平面)。
情况2:Σi=Σ#
假设每一类数据都长成椭球体,而且所有类别的椭球体形状、大小、朝向完全一致(比如都是东北-西南方向拉长的椭球),只是它们中心点(均值μ的位置不同。
gi(x)=−21(x−μi)TΣ−1(x−μi)+lnP(ωi)+constant∝−21(x−μi)TΣ−1(x−μi)+lnP(ωi)=−21xTΣ−1x+μiTΣ−1x−21μiTΣ−1μi+lnP(ωi)里面的纯二次 −21xTΣ−1x 对于所有类别相同,可以视为常数的一部分忽略。进一步展开:
gi(x)=μiTΣ−1x−21μiTΣ−1μi+lnP(ωi)简化成线性形式,这就是 线性判别分析(LDA)。
gi(x)=wiTx+wi0决策边界:依旧是超平面,但不再是两个球心连线的垂直平分线了,而是根据 Σ 的形状调整过的超平面。
情况3:Σi 不同#
彻底放飞。每个类别的数据可以有自己的形状、大小和朝向。A类可以是细长的椭球,B类可以是扁平的圆盘,旋转的角度也可以完全不同。
和上面的情况2一样,纯二次项 −21xTΣi−1x 不能视为常数了,因为 Σi 不同了。忽略常数展开后:
gi(x)=−21xTΣi−1x+μiTΣi−1x−21μiTΣi−1μi−21ln∣Σi∣+lnP(ωi)决策边界:不再是超平面了,而是二次曲面(比如椭圆、双曲线等)。因此也称为二次判别分析(QDA)。
QDA 每类需要估计一个 d×d 的协方差矩阵 Σi,即 2d(d+1) 个参数。当 d 较大而样本数不足时,Σ^i 可能奇异或不稳定。
思路:减少需要估计的参数数量。一个极端做法是假设各维特征条件独立——协方差矩阵退化为对角矩阵,每类只需 d 个方差参数。
朴素贝叶斯分类器#
TIP参数估计里面的独立性假设是针对数据集中的特征向量之间而言的,而朴素贝叶斯分类器的独立性假设是针对具体特征向量的各个维度之间而言的。
假设特征向量的各个维度之间条件独立,即 p(x∣ωi)=∏j=1dp(xj∣ωi) (第i类,第j维),每个特征单独建模为一维高斯分布:
p(xj∣ωi)=2πσij1exp(−2σij2(xj−μij)2)特征向量的类条件概率密度函数为:
p(x∣ωi)=j=1∏dp(xj∣ωi)=j=1∏d2πσij1exp(−2σij2(xj−μij)2)判别函数为:
gi(x)=lnp(x∣ωi)+lnP(ωi)=j=1∑d(−2σij2(xj−μij)2−21ln(2π)−lnσij)+lnP(ωi)=−21j=1∑dσij2(xj−μij)2−j=1∑dlnσij+lnP(ωi)−2dln(2π)
小结:协方差假设 → 分类器对照#
高斯判别分析的不同假设直接决定了决策面的形状和可训练参数的数量:
| 假设 | 决策面 | 每类参数数量 | 分类器名称 |
|---|
| Σi=σ2I | 线性(超平面) | d+1 | 最小距离分类器 |
| Σi=Σ | 线性(超平面) | 2d(d+3) | 线性判别分析(LDA) |
| Σi 任意 | 二次(超二次曲面) | 2d(d+3)+2d(d+1) | 二次判别分析(QDA) |
| Σi 对角(Naive Bayes) | 二次(轴线与坐标轴平行) | 2d | 朴素贝叶斯 |
趋势:对协方差限制越强,参数越少、越不容易过拟合,但模型表达能力也越低。从 Σi=σ2I 一路放宽到任意 Σi,就是在 偏差与方差之间做权衡。