从概率预测开始
分类模型输出每个类别的概率。若真实类别为 y,模型给它的概率是 p(y|x), 一个自然目标就是让这个概率尽可能大,也就是最大化数据的似然。
为什么取负对数
多个独立样本的联合似然是概率的乘积。取对数后,乘积变成求和,更容易计算; 再加负号,就把最大化问题改写为最小化问题。
L = − Σᵢ log p(yᵢ | xᵢ)
对单个多分类样本,用 one-hot 标签写出来就是:
H(y, p) = − Σₖ yₖ log pₖ
它在惩罚什么
当模型对真实类别很有把握时,损失接近 0;当模型把真实类别概率压得很低时, 负对数会快速增大。因此,交叉熵会强烈惩罚“自信但错误”的预测。
常见误区
- 多分类交叉熵通常直接接收 logits,不要提前手动做 Softmax。
- 二分类与多标签分类的数据假设不同,不能只看输出维度选择损失。
- 类别不平衡时,准确率和未加权交叉熵可能掩盖少数类表现。
- 标签平滑改变了训练目标,可改善校准,但也会降低极端置信度。