三七二十一
LUCKY !

基本原理

x(n+1) = x(n) - η∇f(x(n))。沿目标函数梯度负方向(最陡下降方向)迭代移动。η 是学习率。

Move in steepest descent direction. Foundation of deep learning.

变体

随机梯度下降(SGD)、小批量梯度下降、Momentum(累加历史梯度)、Adam(自适应学习率)。

在AI中的角色

训练神经网络的核心算法。全球每天数万亿次梯度下降步骤在数据中心运行。

返回