从概率预测开始

分类模型输出每个类别的概率。若真实类别为 y,模型给它的概率是 p(y|x), 一个自然目标就是让这个概率尽可能大,也就是最大化数据的似然。

为什么取负对数

多个独立样本的联合似然是概率的乘积。取对数后,乘积变成求和,更容易计算; 再加负号,就把最大化问题改写为最小化问题。

L = − Σᵢ log p(yᵢ | xᵢ)

对单个多分类样本,用 one-hot 标签写出来就是:

H(y, p) = − Σₖ yₖ log pₖ

它在惩罚什么

当模型对真实类别很有把握时,损失接近 0;当模型把真实类别概率压得很低时, 负对数会快速增大。因此,交叉熵会强烈惩罚“自信但错误”的预测。

常见误区

  • 多分类交叉熵通常直接接收 logits,不要提前手动做 Softmax。
  • 二分类与多标签分类的数据假设不同,不能只看输出维度选择损失。
  • 类别不平衡时,准确率和未加权交叉熵可能掩盖少数类表现。
  • 标签平滑改变了训练目标,可改善校准,但也会降低极端置信度。