第327章 悟道算力平台的负载调优
,,!
作战室里的电子地图被关掉了,取而代之的是四块八十寸的显示墙,每块墙上都密密麻麻地铺满了曲线丶热力图和拓扑结构。
中间的主屏上,悟道算力平台的全局架构图正在缓缓旋转——从底层的三万两千颗天权晶片,到中间层的分布式训练框架,到顶层的模型推理服务,每一层都被标注了颜色丶负载系数和故障率。
许承站在主屏前,手里拿着雷射笔,但没有点。
他在等所有人到齐。
赵静是宸宸点头确认了这个问题的技术细节:「天权晶片的片间互联硬体本身没有问题,瓶颈在协议栈的拥塞控制参数。
我们目前用的是通用数据中心的参数配置,但通用配置对大模型训练这种周期性丶大批量的通信模式不适用。
需要针对训练任务的特徵重新调参,甚至重写部分拥塞控制逻辑。
」「宸的团队正在修改互联协议栈的拥塞控制参数,把拥塞检测的窗口从微秒级调整到纳秒级,同时增加了『训练任务优先』的调度策略——当训练任务和推理任务共享同一片网际网路时,训练任务的数据包优先级更高。
这个修改不会影响推理服务的延迟,因为推理服务的数据量小丶对带宽不敏感。
」章宸补充了一句:「参数调优已经跑了两轮仿真,效果符合预期。
预计两周内可以上线测试。
」「宸提出了一个更技术性的问题:「分区方案上线后,片间拥塞控制调优的工作量会变大。
因为不同区的通信模式不同,拥塞控制的参数需要分区配置,不能一刀切。
」许承表示已经考虑到了这一点:「训练区用训练优化的拥塞控制参数,推理区和科学计算区用默认参数。
」章宸点了点头。
赵静提出的负载预测模型升级,是三个方案里风险最高的一个。
新模型需要在悟道平台的在线流量上做ab测试,先在小范围上线,验证效果后再逐步扩大。
「ab测试的方案已经设计好了。
」赵静说,「宸听到这里,终于露出了今天宸负责拥塞控制和晶片侧配合。
五周内完成开发和测试,六周内上线。
」「宸回去后和晶片架构团队对一对,把悟道平台过去半年遇到的所有瓶颈整理成一份『下一代晶片需求文档』,在天权5的架构设计冻结前输入进去。
」陈醒说完,站起来。
「今天的会就到这里。
五周后,我要看到悟道平台的平均算力利用率从百分之六十二提升到百分之七十五以上。
」他没有说「做不到会怎么样」,因为不需要说。
在座的所有人都知道,对面全面制裁落地后,算力就是最稀缺的资源。
悟道平台每提升一个百分点的利用率,就意味着未来科技在算力封锁下多撑一天的能力。
所有人陆续离开作战室。
本章未完,点击下一页继续阅读