首页>职场中聪明的女人 > 第914章 梯度下降

第914章 梯度下降(第4页)

目录

三、为什么说“碗”

可能不是碗

你一开始用“碗”

比喻很好,但在大模型里,真实情况更复杂:

?t损失函数往往不是一个光滑的大碗,而是一个

崎岖的山谷。

?t它可能有很多小洼地(局部极小值),还有长长的平地(鞍点)。

?t模型就像一个人在雾中走山路,只能靠脚下的坡度感知方向。

这时,随机梯度下降反而有好处,它带来的“抖动”

能让人跳出一些小陷阱,继续往更深的谷底走。

?

四、和人的认知对比

你说“认识猫和狗”

特别好,我再帮你扩展一下:

1.t模糊性

?t人类分类不是绝对的,而是“差不多”

——这就是概率思维。

?t比如一辆小巧的

suv

和一个装甲车,它们都有四个轮子,但我们用

特征加权

来识别:形状、功能、用途。

2.t迭代修正

?t小孩第一次见到“猫”

,可能把“狗”

也叫猫。

?t随着父母纠正,小孩在心里不断“调整参数”

,逐渐收敛到更准的概念。

?t这就是梯度下降在人脑中的投影。

3.t永远不是绝对答案

?t人类也不会给一个“100%确定”

的结论。

?t比如看到一只奇怪的宠物,你可能说:“嗯,看起来像猫,但也有狗的特征。”

?t这就是机器学习中的

概率输出。

?

五、哲学层面的启示

1.t学习是渐进的

梯度下降提醒我们:学习不是跳跃,而是一次次小步调整。

本章未完,点击下一页继续阅读



返回顶部