Typst 文档 / ml / 考前一张纸

考前一张纸

模式识别与机器学习 — 考场速查公式、别名与推导要点

" /boxed-sheet:0.1.0": cheatsheet, concept-block, inline : cheatsheet.with( title: "模式识别与机器学习 · 考前一张纸", authors: "", write-title: true, title-align: center, num-columns: 3, column-gutter: 4pt, font-size: 11pt, line-skip: 5pt, x-margin: 14pt, y-margin: 8pt, numbered-units: false, ) [线性回归 OLS] -block(body: [ bold(hat(w)) = (bold(X)^T bold(X))^(-1) bold(X)^T bold(y) \ 别名 :最小二乘法、普通最小二乘、Normal Equation、正规方程、闭式解 \ 推导 : L = ||bold(y) - bold(X) bold(w)|| 2^2 , nabla L = -2 bold(X)^T(bold(y)-bold(X) bold(w)) = 0 ]) [Ridge 回归] -block(body: [ bold(hat(w)) = (bold(X)^T bold(X) + lambda bold(I))^(-1) bold(X)^T bold(y) \ 别名 :岭回归、L2 正则化、Tikhonov 正则化、权重衰减、Weight Decay \ 推导 : L = ||bold(y)-bold(X) bold(w)|| 2^2 + lambda ||bold(w)|| 2^2 ,求导为零 \ 关键 :加入 lambda bold(I) 使 bold(X)^T bold(X) 奇异时仍可逆 ]) [Lasso] -block(body: [ min ||bold(y) - bold(X) bold(w)|| 2^2 + lambda ||bold(w)|| 1 \ 别名 :L1 正则化、套索回归 \ 特点 :无闭式解,解在坐标轴 → 稀疏(自动特征选择)\ 求解 :坐标下降法 Coordinate Descent、ISTA ]) [逻辑回归] -block(body: [ P(1|x) = sigma(bold(w)^T bold(x)) = 1/(1+"e"^(-bold(w)^T bold(x))) \ 别名 :Logistic Regression、对数几率回归、logit 回归 \ 损失 :交叉熵 L = -sum [y i log hat(y) i + (1-y i) log(1-hat(y) i)] \ 梯度 : nabla w L = sum (hat(y) i - y i) bold(x) i (与 OLS 梯度形式相同!)\ 关键 :用交叉熵而非 MSE,因为 MSE+Sigmoid = 非凸 ]) [感知机] -block(body: [ hat(y) = "sign"(bold(w)^T bold(x) + b) \ 别名 :Perceptron、阈值逻辑单元 \ 损失 : L = -sum (i in M) y i (bold(w)^T bold(x) i + b) (仅错分样本)\ 更新 : bold(w) <- bold(w) + eta y i bold(x) i , b <- b + eta y i ]) [SVM — 原始] -block(body: [ min 1/2 ||bold(w)||^2 \ s.t. y i(bold(w)^T bold(x) i + b) >= 1 \ 别名 :支持向量机、最大间隔分类器、硬间隔 SVM \ 关键 :间隔 = 2 / ||bold(w)|| → 最大化间隔 = 最小化 ||bold(w)||^2 \ 软间隔 :引入 xi i ,目标 1/2||bold(w)||^2 + C sum xi i ]) [SVM — 对偶] -block(body: [ max sum alpha i - 1/2 sum i sum j alpha i alpha j y i y j bold(x) i^T bold(x) j \ s.t. sum alpha i y i = 0, 0 <= alpha i <= C \ KKT : alpha i [y i (bold(w)^T bold(x) i+b)-1] = 0 \ 决策 : f(x) = "sign"(sum alpha i y i K(bold(x) i, bold(x)) + b) ]) [核技巧] -block(body: [ K(bold(x) i, bold(x) j) = phi(bold(x) i)^T phi(bold(x) j) \ 别名 :Kernel Trick、核方法 \ 常见核 : - 线性: bold(x) i^T bold(x) j - 多项式: (bold(x) i^T bold(x) j + c)^d - RBF: exp(-gamma ||bold(x) i - bold(x) j||^2) Mercer :核矩阵半正定 ↔ 存在 phi \ 优点 :隐式高维映射,计算量 O(d) 不变 ]) [BP 反向传播] -block(body: [ delta^((l)) = (bold(W)^((l+1)))^T delta^((l+1)) ⊙ sigma'(bold(z)^((l))) \ 别名 :Backpropagation、误差逆传播、链式法则 \ 推导 :先正向传播到输出 → 计算 delta^((L)) = partial L / partial bold(a)^((L)) → 反向传播到各隐层 \ 输出层权重 : partial L / partial w (i j)^((l)) = delta i^((l)) a j^((l-1)) ]) [CNN 输出尺寸] -block(body: [ W ("out") = floor((W ("in") + 2P - K)/S) + 1 \ 别名 :卷积输出尺寸公式 \ P = K/2, S = 1 → 尺寸不变(Same Padding)\ 参数量 : K times K times C ("in") times C ("out") (+ bias) ]) [PCA] -block(body: [ bold(Sigma) bold(w) = lambda bold(w) \ 别名 :主成分分析、Principal Component Analysis、Karhunen-Loève 变换 \ 两个视角 :① 最大方差 ② 最小重构误差 \ 步骤 :中心化 → 协方差矩阵 → 特征分解 → 前 k 个特征向量 \ 降维 : bold(z) = bold(W)^T bold(x) , bold(W) 为 top-k 特征向量矩阵 ]) [LDA] -block(body: [ bold(S) B bold(w) = lambda bold(S) W bold(w) \ 别名 :线性判别分析、Fisher 线性判别、Linear Discriminant Analysis \ 准则 :瑞利商 J = (bold(w)^T bold(S) B bold(w)) / (bold(w)^T bold(S) W bold(w)) \ 解 : bold(w) ∝ bold(S) W^(-1)(bold(mu) 1 - bold(mu) 2) \ 多类 :至多 K-1 维 ]) [K-means] -block(body: [ min sum k sum (i in C k) ||bold(x) i - bold(mu) k|| 2^2 \ 别名 :K 均值聚类、Lloyd 算法 \ E 步 : c i = op("argmin") k ||bold(x) i - bold(mu) k||^2 \ M 步 : bold(mu) k = (1/(|C k|)) sum (i in C k) bold(x) i \ 局限 :需预设 K、只凸簇、异常点敏感、初始化敏感 ]) [GMM + EM] -block(body: [ E 步 : gamma (i k) = (pi k cal(N)(bold(x) i | bold(mu) k, bold(Sigma) k)) / (sum j pi j cal(N)(bold(x) i | bold(mu) j, bold(Sigma) j)) \ M 步 : bold(mu) k = (sum gamma (i k) bold(x) i) / (sum gamma (i k)) \ bold(Sigma) k = (sum gamma (i k)(bold(x) i-bold(mu) k)(bold(x) i-bold(mu) k)^T) / (sum gamma (i k)) \ pi k = (sum gamma (i k)) / N \ 别名 :高斯混合模型 + 期望最大化 \ EM 思想 :固定 θ 估算隐变量(E)→ 固定隐变量优化 θ(M)→ 单调收敛 ]) [决策树分裂准则] -block(body: [ 熵 : H(Y) = -sum p k log 2 p k (ID3:信息增益 "IG" = H(Y) - H(Y|X) )\ 增益率 : "IG" / H(X) (C4.5,偏好多值属性问题)\ 基尼 : "Gini"(Y) = 1 - sum p k^2 (CART,计算快 无需 log)\ 别名 :信息增益 / 增益率 / Gini 指数 \ 预剪枝 :建树时提前停(效率高但过早停)\ 后剪枝 :建完再剪(效果更好但慢),CART 用 CCP ]) [信息论三角] -block(body: [ 熵 Entropy : H(P) = -sum P(i) log P(i) \ 交叉熵 Cross-entropy : H(P,Q) = -sum P(i) log Q(i) = H(P) + D ("KL")(P||Q) \ KL 散度 : D ("KL")(P||Q) = sum P(i) log(P(i)/Q(i)) ,非对称!\ 关系 :交叉熵 = 熵 + KL 散度 ]) [模型评估指标] -block(body: [ 混淆矩阵 : - Accuracy = (TP+TN)/(TP+TN+FP+FN) - Precision = TP/(TP+FP)(预测为正的中有多少真) - Recall = TP/(TP+FN)(真正正类找回多少) - Specificity = TN/(TN+FP)(真正负类找回多少) - F 1 = 2 P R/(P + R) (P 和 R 的调和平均) ROC 曲线 :TPR vs FPR,AUC = 下方面积 \ TPR = Recall , FPR = FP/(FP+TN) ]) [朴素贝叶斯] -block(body: [ P(y|x) ∝ P(y) product P(x i | y) \ 别名 :Naive Bayes、朴素贝叶斯、条件独立假设 \ "朴素" :特征在给定类别下条件独立 → 参数量从指数降到线性 \ 平滑 : P(x i=v|y=c) = (N (v c) + alpha)/(N c + alpha V) (拉普拉斯 / Lidstone)\ 高斯 NB : P(x i | y) = cal(N)(x i | mu (i y), sigma (i y)^2) ]) [K 近邻] -block(body: [ 别名 :KNN、K-Nearest Neighbors、距离分类器、惰性学习、Lazy Learning \ 核心 :给定 bold(x) ,找训练集中最近的 K 个邻居,投票(分类)/ 平均(回归)\ 距离度量 :欧氏距离 ||bold(x)-bold(x) i|| 2 、曼哈顿 ||bold(x)-bold(x) i|| 1 、余弦、马氏 \ 关键参数 : K (小 → 过拟合 / 大 → 欠拟合)、距离权重(等权 / 反距离加权)\ 特点 :无训练过程(记忆型)、非参数、决策边界非线性、维度灾难(高维需降维)\ 懒惰vs急切 :KNN 无显式训练/决策函数;SVM/决策树需训练得到模型参数 ]) [集成学习] -block(body: [ Bagging :并行训练、有放回采样、投票/平均 → 降方差 \ Boosting :串行训练、调整样本权重 → 降偏差 \ 随机森林 :Bagging + 随机特征选择 \ AdaBoost :增加错分样本权重 \ GBDT :每轮拟合前轮残差(负梯度) ]) [Batch/Layer Norm] -block(body: [ BN (跨样本): hat(x) j = (x j - mu (cal(B), j)) / sqrt(sigma (cal(B))^2 + epsilon) \ LN (跨特征): hat(x) i = (x i - mu i) / sqrt(sigma i^2 + epsilon) \ BN 别名 :Batch Normalization、批归一化 \ LN 别名 :Layer Normalization、层归一化 \ BN 缺点 :依赖 batch size,小 batch 不稳定 \ LN 优点 :不受 batch 影响,适合 RNN/Transformer ]) [MLE vs 贝叶斯] -block(body: [ MLE : hat(theta) = op("argmax") theta P(D | theta) (点估计,小样本易过拟合)\ MAP : hat(theta) = op("argmax") theta P(D | theta) p(theta) (点估计 + 先验)\ 贝叶斯 : p(theta | D) ∝ P(D | theta) p(theta) (后验分布,全概率积分)\ 共轭先验 :先验和后验同分布族(Beta-Bernoulli、Dirichlet-Multinomial、Gaussian-Gaussian) ])