群发资讯网

老登显卡能跑qwen3.8-flash-next,但是... 好家伙!阿里千问真

老登显卡能跑qwen3.8-flash-next,但是...
好家伙!阿里千问真是卷的无情飞起
前两天qwen3.8-27b还没怎么用的趁手这就又来了个更狠的角色——qwen3.8-flash-next

这个qwen3.8-flash-next是moe架构模型,注重运行速度,有好的设备会快的飞起!
这里就不讨论这个下一代架构的原理和好坏了,只看看用几张老登显卡+大内存能不能跑起来,跑得有多快

这里使用unsloth的Q4_K_XL量化版本和llama.cpp来运行的
图1和图2是2080ti和3080分别两张和一张跑的,预填充prefill速度都是一张好一些,生成速度差不多。
3080的prefill速度比2080ti要高100tok/s左右

图3是一张V100跑的,v100是最老的,但prefill速度居然比2080ti快,和3080差不多,还是宝刀不老!

生成速度限于的主机内存带宽,这三种都差不多在20tok/s左右
感觉速度还是有优化空间的,后面再调调,或者你有更好的运行策略来讨论下