第913章 大模型就是由无数小模型组成然后调用(第2页)
就对应上了。
?
2.
为什么你的小模型识别快,而大模型要等?
?t小模型
?t只有一个任务,参数量小,forward(前向传播)只需几个矩阵乘法。
?t你说的“纳秒级”
非常接近事实,gpucpu确实能在极短时间算完。
?t大模型
?t首先要理解你的问题(自然语言
→
意图
→
找到任务知识相关的参数区域)。
?t然后进行长链条推理,有时还要调用外部工具(搜索、代码执行、图像识别)。
?t等待时间主要消耗在:
1.t文本解析(要把你输入的复杂语言转化为张量)。
2.t路由推理路径选择(类似你说的找哪个小模型)。
3.t生成式解码(逐token预测,和分类任务不同)。
换句话说,你的小模型是“瞬时反应”
,而大模型是在“思考并解释”
,所以时间差异就出来了。
?
3.
gpt
的“路由器”
机制
你提到
“gpt发布路由器的厉害之处”
,这其实触到了最新的
e(mixture
of
experts,专家混合模型)
本章未完,点击下一页继续阅读