刚刚!中科曙光盯上了KV Cache的新价值
中科曙光在CCF大会上发布FN Neo,这个消息挺值得聊。过去大家看AI产业,注意力大多在芯片、服务器和大模型上,存储多少有点像幕后角色。可到了推理阶段,用户每发起一次请求,背后都要消耗算力和时间,首个Token出得快不快、后面输出稳不稳,都会影响最终体验。
尤其是智能体开始处理长任务以后,上下文会不断积累,KV Cache也跟着越来越大。它已经不只是用完就丢的临时缓存,而是有生成成本、还能重复利用的数据。
FN Neo做的事情,就是用集中式全闪把这些缓存池化,让不同计算节点可以共享。
现场有两个数据很直观:配合方案实测,TTFT缩短73%,Token吞吐提升150%。再加上控制器冗余、自动缩列和慢盘隔离,既追求速度,也照顾长时间运行的稳定性。换个角度看,AI推理继续增长,机会自然不只属于GPU。网络、内存、全闪存储和缓存软件,也会跟着走到更靠前的位置。
人工智能 算力产业
