AI生成一个字,最贵的不是算,是搬
你可能有过这种体验:问AI一个问题,它一个字一个字往外蹦。你盯着转圈的光标,心里默念,快点,再快点。
我以前一直以为,慢,是算力不够。直到看到一组数字。
大模型每生成一个字,都要把几十亿颗权重重新读一遍。一颗权重只有4个比特,搬一次微不足道。可哪怕一个40亿参数的小模型,按每秒生成2000个字算,仅搬运权重,就需要每秒4TB的带宽。
怎么办?主流答案是把路修宽。于是高带宽内存一代比一代贵,涨了五成,照样抢空。
昨天,一家叫寒序科技的公司给出另一个答案:让货别出门。
他们把权重长期驻留在MRAM存储阵列里,计算就在同一片硅片上完成。大矩阵不动,只有很小的激活向量在路上跑。片内读出带宽设计值每秒24TB,40亿参数模型每秒生成2000字以上。
这家公司2023年才从北京大学应用磁学中心孵化出来,三年就干了这一件事。验证芯片已经回片,120个存储单元连续稳定跑了24小时。三星在把计算往内存里推,英伟达也在让权重少上路,方向惊人地一致。
我算了笔账:推理的成本,大头不在乘法器,在搬运。搬运变带宽,带宽变功耗,功耗变电费,电费变成你每个月的账单。
真正省钱的办法,从来不是把路修得更宽,而是让货根本不用上路。
当然,每秒24TB还是设计值,成色要看流片实测。但这个问题问对了:与其搬得更快,不如干脆不搬。
AI生成一个字,最贵的不是算,是搬 你可能有过这种体验:问AI一个问题,它一个
阅读:0
点赞:0