lecture 1 2


SVM 损失

SVM Loss 的计算:将其他类别的得分减去正确类别的得分,加上阈值(margin),再求和。

Pasted image 20260622165036

Pasted image 20260622170228

公式中的 1-1 是为了扣除本组(正确分类)被多算的那一项——正确类别对自己的 margin 总是 00,不应该计入损失。

Softmax / Cross Entropy

另一种计算 Loss 的方法。

Pasted image 20260622203952

sis_{i} 是输入经过 WW 分类后的原始输出向量,ii 是分类编号。(xi,yi)(x_{i},y_{i}) 是输入样本和真实标签。

Li=logP(Y=yiX=xi)=log(exp(syi)jexp(sj))L_{i}=-\log P(Y=y_{i}|X=x_{i})=-\log\left(\frac{\exp(s_{y_{i}})}{\sum_{j} \exp(s_{j})}\right)

KL Divergence 衡量两个概率分布的差异。

  • PP 是真实分布(比如一张图 100% 是猫)。
  • QQ 是模型预测出的分布。
  • KL 散度 DKL(PQ)D_{KL}(P||Q) 表示用 QQ 代替 PP 所损失的信息量。

Pasted image 20260622205558


Pasted image 20260622205805


Pasted image 20260622225628


SGD

SGD 只随机选取一小部分样本(mini-batch)来近似计算总 Loss,而不是在全量数据上求梯度。

SGD + Momentum

在梯度下降中引入动量(历史速度),不再简单地沿当前梯度方向更新,而是结合之前的速度来加速收敛、减少震荡。

Pasted image 20260622231743

RMSProp

Pasted image 20260622234641


Pasted image 20260622234712


Pasted image 20260622234759