Strata - Qwen3.8-Flash-Next 开源本地模型推理引擎 - Strata 实测
1. 专为 Qwen3.8-Flash-Next 开发,不支持别的模型;2. 一张 12GB 以上显存的 NVIDIA/AMD 显卡加 32GB 内存即可;3. 利用显卡、内存和 SSD 同时计算,叠加 MTP,性能炸裂;4. 只支持 Windows 和 Linux;5. 我在 A6000 显卡跑出 deepseek-flash 的输出效果100+t/s6. Strata 借鉴了 llama.cpp 的 GGML 量化格式,算子那些计算都是自己单独写得

