昊梵体育网

网络通信重大突破!中科曙光要“消灭”GPU的等待时间 今儿中科曙光发了套新东西,

网络通信重大突破!中科曙光要“消灭”GPU的等待时间
今儿中科曙光发了套新东西,是scaleFabric Token加速技术体系,开始我以为又是啥模型优化技巧,仔细一看发现他们盯上的是GPU的“等待时间”。
之前德科技副总裁就在Keysight World大会上分享过,计算机视觉模型训练里,GPU超过60%的时间花在数据移动和通信上,真正计算只占20%左右。
换句话说,一块几十万的GPU,大部分时间不是在算,是在等。等隔壁GPU把梯度传过来,等参数同步完,等KV Cache从存储搬过来。千亿参数GPT-3训练里,通信耗时能占单迭代总时间的70%。万卡集群里,有统计说GPU可能只有30%的时间在算,剩下70%在等对方传参数。
所以中科曙光发这个Token加速技术体系,我觉得方向是对的。它盯上的不是怎么让GPU算得更快,而是怎么让GPU少等。这套体系不是ppt构想,已经在十万卡级别集群上跑通,其中的IBGDA技术更是国内的首次规模落地,它让GPU自己能直接驱动网卡发数据,不用再通过CPU中转指令。存储这边NVMe over RDMA和XDS也是让GPU绕过CPU直接读存储。
算力再强,数据过不来也是白搭。这个道理搞智算的都懂,但真正把“减少等待”当成系统级工程来做的,目前看到的还不多。
中科曙光 GPU