梁圣的好模型正式版DeepSeek-V4-Flash-0731部署操作(简版)
部署成本真的很低,感兴趣你自己也可以整一个[笑哭]
核心要求:
显存+内存总大小有150GB就能很从容部署这个大模型了(无显卡也可尝试)
虽然90GB左右就只能把很低精度的版本运行起来,效果大打折扣,不太推荐。
系统环境:
ubuntu22.04、rtx3080/rtx2080ti、cuda13、32核cpu、系统内存256GB
模型:
unsloth的UD-Q8_K_XL量化版本(质量无损失版)
DeepSeek-V4-Flash-0731-UD-Q8_K_XL
(拥抱脸、国内魔搭等社区有权重可下载)
推理框架:
llama.cpp b10092(自行编译)
不会编译的话,我编译好了RTX20系和30系英伟达显卡,可以拿去试试,评论区我会放个地址
部署启动命令:
CUDA_VISIBLE_DEVICES=0 ./llama-server -m /models/unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-Q8_K_XL/DeepSeek-V4-Flash-0731-UD-Q8_K_XL-00001-of-00005.gguf --port 18003 --host 0.0.0.0 -c 500000 --n-cpu-moe 999 --override-tensor "exps=CPU" --load-mode none -np 1 --cache-prompt --cache-ram 40000 -t 20 -a unsloth/DeepSeek-V4-Flash-0731-UD-Q8_K_XL -ctk q8_0 -ctv q8_0
以上主要参数说明:
CUDA_VISIBLE_DEVICES=0表示只用了一张显卡第一张卡
-m是模型位置
-c上下文大小,我这里设置成50w
--n-cpu-moe --override-tensor把权重放到系统内存上
-t 20表示20个cpu核用于模型生成
kvcache的数据类型都设置成了q8_0,损失较小
以上是我的初步运行环境和命令(显存会常驻占用16GB左右),仅供参考,特别推荐你自己也改改参数,如有错误或更好的优化细节欢迎指正!
如果你有更强的显卡和硬件,速度会很强!你也可以在别的系统上使用llama.cpp官方编译、自行编译,或者用lmstudio、ollama等类似框架尝试[憨笑]
后面,我会持续部署其他热门大模型、研究优化其他部署方法如vllm等,有新发现随时更新,欢迎持续关注或指导交流![呲牙]
deepseekv4flash
梁圣的好模型正式版DeepSeek-V4-Flash-0731部署操作(简版)
阅读:0
点赞:0