Deltafin 项目展示了在消费级硬件上运行完整 Kimi K3 模型的可能性。
该方案未对模型进行任何剪枝,保留了全部 16 个专家模块,确保每个 token 都由 Kimi K3 亲自决策。通过在 M1 Max 笔记本上从四块 SSD 流式加载模型,实现了每秒约 1 个 token 的推理速度。
Deltafin 项目展示了在消费级硬件上运行完整 Kimi K3 模型的可能性。
该方案未对模型进行任何剪枝,保留了全部 16 个专家模块,确保每个 token 都由 Kimi K3 亲自决策。通过在 M1 Max 笔记本上从四块 SSD 流式加载模型,实现了每秒约 1 个 token 的推理速度。