群发资讯网

海光在联通大会上扔了枚深水炸弹 刚从联通合作伙伴大会现场出来,今年最受关注的就是

海光在联通大会上扔了枚深水炸弹
刚从联通合作伙伴大会现场出来,今年最受关注的就是海光这次发布的“词元经营双芯加速方案”。前两年大家聊AI算力,动不动就是多少TFLOPS、多少GB/s。但到今天,运营商要面对的是百万级Token吞吐、秒级TTFT响应、千级并发请求。单卡峰值再高,到了集群里调度一团糟、互联带宽卡脖子、KV Cache放不下,全都白搭。
海光这次方案的逻辑,其实就是把算力当作一项系统工程来做。我梳理了几个关键点:
第一,解耦PD。预填充和解码分开处理,Prefill节点堆算力密度,Decode节点堆显存带宽。这样一来,TTFT和TPOT互不拖累,各自优化。
第二,CPU上位。就是让CPU成为Agent业务的系统枢纽。这个定位在以前的AI架构里确实少见。DCU只管并行计算加速和长序列支撑,各干各的,不打架。
第三,安全下沉。芯片级内生安全,密钥管理、可信计算、显存加密一条龙,覆盖Token从生产到交付的全流程。运营商做大规模商用,安全不是加分项,是入场券。
算力行业如今看重的是那些能把CPU调度、DCU加速、集群互联、KV Cache管理、安全防护捏合成一个体系的玩家。这套能力,最终决定了运营商把Token卖给客户时,能不能算得过账来。
海光信息 智能体