群发资讯网

AI转圈的罪魁祸首,被中科曙光找到了 用大模型最烦什么?问完问题光标转圈,首To

AI转圈的罪魁祸首,被中科曙光找到了
用大模型最烦什么?问完问题光标转圈,首Token死活不出来。中科曙光发了个发布基于scaleFabric的Token加速技术体系,说的就是这事。
模型推理慢,很多时候瓶颈不在计算,在搬运。长上下文场景里,KV Cache体积能到几十个GB。PD分离架构下,这些缓存要在Prefill节点和Decode节点之间传来传去,还得在GPU、网络、存储之间倒手。搬得慢,TTFT就高,TPOT就长。
这次scaleFabric在存储通道上堆了不少技术。NVMe over RDMA让GPU直接访问远端NVMe存储,存储访问延迟降80%以上;XDS让加速卡绕过CPU直接读存储;NFS over RDMA让传统文件存储也能跑在RDMA上。
有实践数据说,NFS over RDMA能把GPU利用率从55%提到95%以上,单轮训练时间减30%到60%。这些数字背后就是一个朴素的道理,用户等Token的时间,很大一部分花在了数据搬运上。把搬运效率提上去,回答自然就快了。
大模型时代有个很直白的逻辑,GPU在等,用户就在等。谁能让数据搬得更快,谁才真正能解决用户的“转圈焦虑”。
大模型 Token