0%

训练深度学习模型时,我们每天都在用 SGD、Momentum、Adam、AdamW,但很少有人能说清它们之间的数学关系:为什么动量能加速收敛?为什么 Adam 要维护两个矩估计?偏差修正那一项到底在修什么?AdamW 与 Adam 的区别真的只是"先做权重衰减"吗?本文从凸优化的收敛性分析出发,建立梯度下降的理论基线,然后逐步推导动量法、Nesterov 加速、Adagrad、RMSProp、Adam 与 AdamW,把优化器的演进理解为"逐步修补梯度估计的偏差与尺度缺陷",并给出每个关键公式的严格推导与收敛性说明。

阅读全文 »

行人重识别(ReID)的核心任务是学一个特征空间:同一行人的不同图像特征距离近,不同行人的特征距离远。上一篇文章梳理了 MTMCT 方向的度量学习整体脉络,本文深入损失函数的数学本质:从 Softmax 与 Triplet 的对比出发,推导 Triplet Loss 的边界与难样本挖掘,再介绍 Circle Loss 的柔性目标设计,最后讨论它们在 ReID 特征学习中的实际取舍。

阅读全文 »
🌙