基本原理
x(n+1) = x(n) - η∇f(x(n))。沿目标函数梯度负方向(最陡下降方向)迭代移动。η 是学习率。
Move in steepest descent direction. Foundation of deep learning.变体
随机梯度下降(SGD)、小批量梯度下降、Momentum(累加历史梯度)、Adam(自适应学习率)。
在AI中的角色
训练神经网络的核心算法。全球每天数万亿次梯度下降步骤在数据中心运行。
x(n+1) = x(n) - η∇f(x(n))。沿目标函数梯度负方向(最陡下降方向)迭代移动。η 是学习率。
Move in steepest descent direction. Foundation of deep learning.随机梯度下降(SGD)、小批量梯度下降、Momentum(累加历史梯度)、Adam(自适应学习率)。
训练神经网络的核心算法。全球每天数万亿次梯度下降步骤在数据中心运行。