第914章 梯度下降(第6页)
是梯度。
换句话说,每一步都像在地图上用指南针找方向,永远往“下坡最快”
的方向走。
?
二、工程视角:梯度下降的改进
在大模型里,光靠最原始的梯度下降其实不够。
工程师们发明了很多“加速方法”
:
1.t动量法(mentum)
?t类比:滚珠下山时不仅看坡度,还带有惯性。
?t这样就不会在小坑里乱跳,而是能跨过去。
2.t自适应学习率(adagrad,
rmsprop,
adam
等)
?t传统学习率是固定的,但现实中不同方向的地形不一样。
?t比如有的维度很陡,有的很平缓。
?t自适应方法会自动调整步长,让学习更快更稳。
3.t正则化和噪声
?t有时反而要给“山谷”
里加点小石头,让球不会死死卡住。
?t这对应于
dropout、l2
正则化等手段,避免模型过拟合。
所以,你可以把现代的梯度下降想象成:一个球在复杂山谷里滚动,背后有风(动量)、有指南针会调节步子(自适应),还时不时给它推一把(噪声),最终让它更可能滚到一个“够好的位置”
。
?
三、类比人类学习过程
把这个思想投射到人类的认知:
1.t负梯度
=
纠错学习
?t错误最大的地方,才是你最该调整的地方。
?t就像小孩学语言,第一次说“狗”
叫“猫”
,大人会立刻纠正,因为这是最明显的错误。
2.t学习率
=
学习节奏
本章未完,点击下一页继续阅读