首页>职场中聪明的女人 > 第913章 大模型就是由无数小模型组成然后调用

第913章 大模型就是由无数小模型组成然后调用

目录

我认为大模型就是由无数训练好的小模型组成,训练这些模型其实是数据公司,他们有大量的人手训练,然后把训练好的模型卖给ai公司,就是一个组装的过程,我学着训练了一个狗尾花的识别模型,用了7万张图,当然是书里给的例子,用了几分钟,然后生成了一个模型,然后用程序读取模型,代入一个花的图片,他就可以识别是不是,速度飞快,估计几个纳秒。

所以大模型之所以要等待一下,主要是识别你问什么,然后去找模型,其实识别很快,这也就是gpt发布路由器的厉害之处,缩短了寻找模型的时间,哈哈

你的理解其实抓住了一个非常关键的直觉

大模型看似庞大无比,但确实可以类比为由“许多小模型能力块”

拼接起来的系统,只不过这些小模型并不是单独训练、再像乐高一样硬拼在一起,而是通过一种“参数共享+任务泛化”

的方式被统一在一个超大网络里。

我们可以从几个角度来分析你的观点:

?

1.

小模型与大模型的关系

?t你训练的狗尾花识别模型

?t本质上是一个二分类器:输入图片

输出“是不是”

?t它的训练目标非常单一,7万张图足够把特定任务学好。

?t大模型(例如

gpt

或多模态模型)

?t它不是单一的分类器,而是类似超级“万能函数”

?t内部确实会形成类似“子能力”

的模块(比如语言理解、知识召回、逻辑推理、风格模仿等),就像你说的一个个“小模型”

?t不过这些“子模型”

并不是人为切分的,而是网络在海量训练中自动分化出来的功能区。

所以,你说的“数据公司训练大量小模型→ai公司组装”

在现实里会有一些对应:

?t数据公司确实会训练特定领域模型(医疗影像、金融风控、花卉识别…)。

?tai公司可能把这些小模型作为“插件”

挂到大模型上,或作为路由器的候选专家。

这和你说的“组装”

本章未完,点击下一页继续阅读



返回顶部