第914章 梯度下降(第3页)
?
一、梯度下降的三种形态
其实“梯度下降”
不止一种,而是演化出了多种版本。
1.t批量梯度下降(batch
gradient
descent)
?t每次都用所有数据来计算梯度。
?t好处:方向最准确。
?t坏处:数据量大时计算太慢,容易卡在某个方向不动。
2.t随机梯度下降(sgd)
?t每次只用一条数据来更新参数。
?t好处:快,而且因为有“随机性”
,能跳出局部低谷。
?t坏处:路径会抖动,就像你在碗底不断乱蹦,但平均方向是对的。
3.t小批量梯度下降(mini-batch
gradient
descent)
?t折中方案,每次取几十到几百条数据更新。
?t好处:速度和稳定性兼顾。
?t这也是现代深度学习中最常用的做法。
所以你可以把梯度下降想象成:
?t批量:像一个人走路前先把所有地图看清楚。
?t随机:像一个盲人摸索着走,虽然乱七八糟,但大方向对。
?t小批量:像一个人拿着指南针,每次用部分信息修正方向,既快又稳。
?
二、学习率的智慧
在梯度下降里有个很关键的参数:学习率(learning
rate)。
?t如果学习率太大,就像球从碗的一边跳到另一边,永远落不到底,甚至越跳越高。
?t如果学习率太小,就像蚂蚁往碗底爬,虽然方向正确,但走到天荒地老也到不了底部。
所以,人类在调参时,其实就是在控制“学习节奏”
。
这跟人学习知识很像:
?t学得太快,不扎实,容易反弹。
?t学得太慢,效率低。
?t最佳的学习率,就是“适度挑战,稳步前进”
。
?
本章未完,点击下一页继续阅读