arXiv:1412.6980 · 中英对照阅读
Adam:一种用于随机优化的方法
Adam: A Method for Stochastic Optimization
中文速览
针对随机目标函数的梯度优化,传统方法常难以同时应对大规模数据、参数众多、梯度噪声大或稀疏等情况,论文提出了 Adam(自适应矩估计)算法。它通过估计梯度的一阶和二阶矩来自动调整每个参数的步长,计算和存储开销小,对梯度的按维缩放不敏感,且通常不需要复杂调参。理论分析表明,Adam 在在线凸优化中具有与当时最佳结果相近的收敛和遗憾界,实验也显示它的实际表现优于多种随机优化方法,并进一步给出了基于无穷范数的 AdaMax 变体。
术语表
- Adam
- Adam 优化器
- A Method for Stochastic Optimization
- 随机优化方法
- stochastic optimization
- 随机优化
- stochastic gradient descent
- 随机梯度下降
- gradient-based optimization
- 基于梯度的优化
- adaptive learning rate
- 自适应学习率
- learning rate
- 学习率
- first moment estimate
- 一阶矩估计
- second raw moment estimate
- 二阶原始矩估计
- exponential moving average
- 指数移动平均
- bias correction
- 偏差修正
- gradient
- 梯度
- objective function
- 目标函数
- stochastic objective function
- 随机目标函数
- parameter update
- 参数更新
- convergence
- 收敛
- convergence rate
- 收敛速率
- regret bound
- 遗憾界
- online convex optimization
- 在线凸优化
- convex function
- 凸函数
- non-convex optimization
- 非凸优化
- sparse gradients
- 稀疏梯度
- regularization
- 正则化
- hyperparameter
- 超参数
- mini-batch
- 小批量
- RMSProp
- RMSProp
- AdaGrad
- AdaGrad
- AdaDelta
- AdaDelta
- SGD
- SGD