符号约定
本系列统一使用以下符号规则:
| 符号 | 含义 | 示例 |
|---|
| P(⋅) | 概率(离散事件) | 先验 P(ωi)、后验 P(ωi∣x) |
| p(⋅) | 概率密度(连续变量) | 类条件密度 p(x∣ωi)、证据因子 p(x) |
| x | 加粗 = 特征向量 | x=(x1,…,xd)T |
| ωi | 第 i 个类别 | ω1 表示”正类”,ω2 表示”负类” |
| ω^ | 预测类别 | ω^=argmaxiP(ωi∣x) |
角标规则:λij 中第一个下标 i 为真实类别,第二个 j 为预测类别。
密度和概率永远不会出现在等式同侧参与比较(密度可以 >1,概率始终 ∈[0,1])。
三种判别准则:
- 最小错误率准则:选择后验概率最大的类别。
- 最小风险准则:考虑不同类型错误的损失,选择期望风险最小的类别。
- 聂曼-皮尔逊准则:在二分类问题中,在限定一类错误率条件下使另一类错误率为最小
1. 最小错误率准则#
单个样本 x 的条件错误率(用于决策)#
- 多分类判别 x 为 ω^ 的条件错误率:
P(error∣x)=1−P(ω^∣x){P(error1∣x)=P(ω2∣x),P(error2∣x)=P(ω1∣x),if ω^=ω1if ω^=ω2整体数据集的总体错误率(用于评估)#
从联合概率密度的视角来看,可以用积分表示:设 x^ 是决策边界,当特征向量 x 实际为 ω1 时,错误率为
P(error2)=∫R2p(x∣ω1)P(ω1)dx
当 x 实际为 ω2 时,错误率为
P(error1)=∫R1p(x∣ω2)P(ω2)dx。
整体:P(mistake)=P(error1)+P(error2)
最小错误率决策准则#
对于一个待分类样本 x,我们计算每个类别 ωj 的后验概率 P(ωj∣x),然后选择后验概率最大的类别 ωi 作为预测结果:
i=arg1≤j≤cmaxP(ωj∣x),x∈ωi最小错误率判别函数#
对于每个类别 ωj,定义判别函数 gj(x):
gj(x)=P(ωj∣x)∝p(x∣ωj)P(ωj)或对数形式:
gj(x)=lnp(x∣ωj)+lnP(ωj)i=arg1≤j≤cmaxgj(x),x∈ωi对于两类问题(1)#
两类问题的等价形式:似然比(或者他们的对数形式)和阈值比大小
ω^=⎩⎨⎧ω1,ω2,if p(x∣ω2)p(x∣ω1)>P(ω1)P(ω2)otherwise决策边界 x 由 p(x∣ω2)p(x∣ω1)=P(ω1)P(ω2) 定义。
2. 最小风险准则#
单个样本 x 的条件风险 (用于决策)#
将真实类别 ωi 判断成 ωj 的损失定义为 λij,则对于一个待分类样本 x,我们计算每个类别 ωj 的期望风险 R(ωj∣x) ,是 x 属于 ωi 的条件下,将 x 误分类为 ωj 的期望损失。
R(ωj∣x)=i∑λijP(ωi∣x)TIP例如有正常人(w1)和病人(w2)两类,误将病人判断为正常人的风险就是 R(ω1∣x)=λ21P(ω2∣x),误将正常人判断为病人的风险就是 R(ω2∣x)=λ12P(ω1∣x)。
整体数据集的总体风险(用于评估)#
整个特征空间上,总体风险是对所有样本的条件风险求期望:
Rtotal=∫R(ω^(x)∣x)p(x)dx其中 ω^(x) 是决策准则。
最小风险决策准则#
对于一个待分类样本 x,计算所有类别 ωj 的期望风险 R(ωj∣x),然后选择风险最小的类别作为预测结果:
i=arg1≤j≤cminR(ωj∣x),x∈ωi最小风险判别函数#
对于每个类别 ωj,定义判别函数 gj(x) 为期望风险的负数,把最小风险问题转化为最大判别函数问题:
gj(x)=−R(ωj∣x)=−i=1∑cλijP(ωi∣x)=−i=1∑cλijp(x∣ωi)P(ωi)i=arg1≤j≤cmaxgj(x),x∈ωi对于两类问题(2)#
定义决策表,里面的元素 λij 表示将真实类别 ωi 判断成 ωj 的损失。对于二分类问题,决策表可以简化为:
| 预测 ω1 | 预测 ω2 |
|---|
| 真实 ω1 | λ11=0 | λ12 |
| 真实 ω2 | λ21 | λ22=0 |
误分类只包括 λ12 和 λ21
对于一个待分类样本 x,计算误分类的期望风险:
R(ω1∣x)R(ω2∣x)=λ21P(ω2∣x)=λ21p(x∣ω2)P(ω2)=λ12P(ω1∣x)=λ12p(x∣ω1)P(ω1)对应的判别函数:
g1(x)g2(x)=−R(ω1∣x)=−λ21p(x∣ω1)P(ω1)=−R(ω2∣x)=−λ12p(x∣ω2)P(ω2)判别准则:
ω^=⎩⎨⎧ω1,ω2,if p(x∣ω2)p(x∣ω1)>P(ω1)λ12P(ω2)λ21otherwise当使用0-1损失函数时,λij=0 if i=j else 1,此时最小风险准则退化为最小错误率准则。
决策边界 x 由 p(x∣ω2)p(x∣ω1)=P(ω1)λ21P(ω2)λ12 定义。
3. 聂曼-皮尔逊准则#
单个样本 x 的似然比检验(用于决策)#
与最小错误率直接使用后验概率不同,N-P 准则不依赖先验,而是直接构造似然比
Λ(x)=p(x∣ω2)p(x∣ω1)整体数据集的错误率约束(用于评估)#
二分类问题中,第一类错误率(ϵ1 , ω2 被误判为 ω1)不超过某个阈值 α,第二类错误率(ϵ2 , ω1 被误判为 ω2)。定义两类错误率:
∫R1p(x∣ω2)P(ω2)dx=ϵ1,∫R2p(x∣ω1)P(ω1)dx=ϵ2
- 决策区域: R1 是将 x 分类为 ω1 的区域,R2 是将 x 分类为 ω2 的区域。
- 约束条件:固定 ϵ2=α,最小化 ϵ1。
聂曼-皮尔逊决策准则#
似然比检验:大于某个阈值 λ 则判为 ω1,否则判为 ω2
聂曼-皮尔逊判别函数#
minϵ1s.t.ϵ2=α固定 ϵ2=α,最小化 ϵ1。用拉格朗日乘子法求解,引入拉格朗日乘子 μ:
ω^minimizeL=∫R1p(x∣ω2)P(ω2)dx+μ(∫R2p(x∣ω1)P(ω1)dx−α)subject to∫R2p(x∣ω1)P(ω1)dx=α推导:
L=∫R1p(x∣ω2)P(ω2)dx+μ(1−∫R1p(x∣ω1)P(ω1)dx−α)=∫R1(p(x∣ω2)P(ω2)−μp(x∣ω1)P(ω1))dx+μ(1−α)等价于对每个 x 逐点最小化被积函数:
- 若 p(x∣ω2)P(ω2)−μp(x∣ω1)P(ω1)>0,说明把 x 分入 R1 产生的代价更大,因此 x 应属于 R2
- 若为负,则 x 应属于 R1
即:
p(x∣ω2)P(ω2)−μp(x∣ω1)P(ω1)<0移项:
p(x∣ω2)p(x∣ω1)>μP(ω1)P(ω2)(*)确定判别阈值 μ:
先用 (*) 定义决策区域 R2 ,然后用等式 ∫R2p(x∣ω1)P(ω1)dx=α 来求解 μ。
TIP推导过程中,先验是固定的,可以最后算。
4. 三类准则的统一视角#
三类准则看似不同,但本质上都是 对似然比 p(x∣ω2)p(x∣ω1) 设一个阈值,区别仅在于阈值由什么决定:
| 准则 | 决策依据 | 似然比阈值(二分类) | 依赖先验? | 依赖损失? | 适用场景 |
|---|
| 最小错误率 | 最大后验概率 P(ωj∣x) | P(ω1)P(ω2) | 是 | 否(隐含0-1损失) | 默认选择,各类错误代价相同 |
| 最小风险 | 最小期望损失 R(ωj∣x) | P(ω1)λ21P(ω2)λ12 | 是 | 是(λij) | 误分类代价不对称(如医疗诊断) |
| 聂曼-皮尔逊 | 固定一类错误率,最小化另一类 | μP(ω1)P(ω2)(μ 由约束 α 解出) | 形式上不依赖 | 否 | 先验未知或两类错误有硬约束(如安检) |
记法:三类准则都等价于p(x∣ω2)p(x∣ω1)>threshold⟹判为 ω1。核心框架是同一个,变化的只是分子的分母的权重。
同时 argmax 视角也统一:三类都可以写成 i=argmaxjgj(x) 的形式——最小错误率用后验概率,最小风险用负风险,NP 用似然比(等价于 g1=Λ,g2=threshold)。
5. 贝叶斯错误率#
任何分类器的错误率都有一个理论下界,称为贝叶斯错误率(Bayes Error Rate)。
条件错误率与总体错误率#
对于任意分类器 ω^(x),在样本 x 处的条件错误率为:
P(error∣x)=1−P(ω^(x)∣x)总体错误率是对所有 x 积分:
P(error)=∫P(error∣x)p(x)dx=1−∫P(ω^(x)∣x)p(x)dx最优性证明#
贝叶斯分类器选择后验概率最大的类别 ω^∗(x)=argmaxjP(ωj∣x),因此:
P(ω^∗(x)∣x)=jmaxP(ωj∣x)≥P(ω^(x)∣x),∀ω^(x)代入总体错误率公式,不等式反向(减去更大的数得更小的值):
P∗(error)=1−∫jmaxP(ωj∣x)p(x)dx≤1−∫P(ω^(x)∣x)p(x)dx=P(error)即 任何分类器的错误率 ≥ 贝叶斯错误率,等号仅当分类器 ω^(x) 每点都选择后验最大的类。
另一种等价形式#
用 §1 的积分区域语言,最小错误率分类器选择:
R1∗={x∣P(ω1∣x)>P(ω2∣x)},R2∗={x∣P(ω2∣x)≥P(ω1∣x)}贝叶斯错误率就是在这个最优分界下的积分值(即 §1 中 P(mistake) 在最优决策 R1∗,R2∗ 下的取值):
P∗(error)=∫R2∗p(x∣ω1)P(ω1)dx+∫R1∗p(x∣ω2)P(ω2)dx或等价地写成后验的 min 形式(更紧凑):
P∗(error)=∫jminP(ωj∣x)p(x)dx贝叶斯错误率是分类问题的”天花板”——它反映数据本身的重叠程度。如果两类在特征空间上完全可分(分布不重叠),贝叶斯错误率为 0;如果完全不可分(分布完全重合),贝叶斯错误率等于 min(P(ω1),P(ω2))(瞎猜的水平)。实际分类器的错误率越接近这个值,说明模型越充分挖掘了数据的信息。
6. 生成式与判别式分类器#
从本篇到下一章,分类器的设计哲学有一条重要的分水岭:生成式 vs 判别式。
两种建模路径#
| 生成式(Generative) | 判别式(Discriminative) |
|---|
| 方式 | 先建模 p(x∣ωi) 和 P(ωi),再用贝叶斯公式反推 P(ωi∣x) | 直接建模决策边界 P(ωi∣x) 或 g(x)=0 |
| 路径 | 数据 → 类条件分布 → 后验概率 → 决策 | 数据 → 决策函数 → 决策 |
| 例子 | 贝叶斯分类器、朴素贝叶斯、GMM、HMM | 逻辑回归、感知机、SVM、神经网络 |
| 优点 | 可生成新样本、自然处理缺失值、对数据量要求更低 | 聚焦在分类边界上,通常数据充分时精度更高 |
| 缺点 | 需要假设分布形式,假设错误时偏差大 | 无法生成样本、无法利用无标签数据 |
直观对比#
以两类问题为例:
- 生成式先回答”ω1 的数据大概长什么样?ω2 呢?“,再根据新样本更像哪个来分类。
- 判别式直接回答”分界线在哪?“,不在意外围数据长什么样,只关心边界附近的样本。
本篇定位#
本篇(Bayes)是生成式的典范——从概率密度出发,通过贝叶斯公式得到决策规则。接下来(线性分类器)将转向判别式路径,直接从数据学习决策边界,不再显式建模概率密度。两种范式各有所长,理解它们的差异是理解整个模式识别学科的关键视角。