群发资讯网

一台跑不动就上16台!开发者硬核组网,桌面集群成功跑通Kimi K3,速度冲到3

一台跑不动就上16台!开发者硬核组网,桌面集群成功跑通Kimi K3,速度冲到38 t/s
一台DGX Spark跑不动Kimi K3怎么办?
硬核开发者的答案是:那就上16台。
近日,NVIDIA开发者论坛上的一则帖子引发关注。开发者成功用16台DGX Spark“小金盒”组成集群,完整跑通了月之暗面最新的Kimi K3大模型,输出速度平均21 token/s,峰值达到38 token/s,预填充分数更是跑到8288 token/s。
靠堆算力“大力出奇迹”
DGX Spark是NVIDIA年初发布的桌面级AI超级计算机,单台算力1千万亿次/秒,配128GB统一内存。一台的极限是运行2000亿参数的模型推理,但Kimi K3高达2.8万亿参数,单台根本塞不下。
这名开发者用16台DGX Spark通过RoCE高速网络互联,配合MikroTik交换机组建集群,总算把模型完整加载了起来。硬件基础是现成的——NVIDIA官方已支持最多4台DGX Spark组网,可实现近线性性能扩展。16台集群相当于把算力池扩大到512GB统一内存。
关于生成速度,实测代码生成稳定在21 token/s左右,散文生成约15.16 token/s,但在实际使用中“感觉更慢”。峰值38 token/s的实现需要将推测令牌数从6调到8,牺牲稳定性换取速度尖峰。
“速度或慢,但我有了本地Kimi K3”
帖子中最打动人的一句话是:“速度或慢,但我有了本地运行的Kimi K3,而这就够了。”
不过,一些开发者认为这套方案性价比不高。16台DGX Spark单台售价约3000美元,集群总投入近5万美元。有人指出,同样成本租用云端计算资源,可能跑出更高的吞吐量。
但对追求“模型主权”、数据不能出本地的高安全需求场景来说,桌面集群提供了一个合法合规的选项。
把“不可能的任务”变成现实
一台不够就堆16台,个人开发者用“大力出奇迹”的方式,把2.8万亿参数的大模型搬上了桌面。虽然这更像一次技术验证而非商业方案,但它切切实实证明了一件事:开源大模型的本地化运行,门槛正在被一群硬核玩家一步步踩低。