咪叭 (@ChiyoSekai) 在 本地部署了 Qwen3.8 Flash Next 嘿嘿 IQ3量化的【4080 + 2080Ti】,附加鹈鹕 中发帖
还是很喜欢这种 A6B 的MoE模型的
硬件配置是 4080 Super 32G【USB4】 + 2080 Ti 22G + 64G DDR5
小主机上带俩显卡坞跑的
感觉还是2080Ti 性价比高一些哈哈
不过有点极限,其实好像没加载视觉模型,也没开MTP
要是显存是64G就好了
生成速度的话大概是22-30 Token/s
[tihu]
估计是用了内存,或者是USB4的延迟或者带宽问题吧
Prefill并不快,350 Token/s好像,好像是需要CPU也在运算的
我感觉Qwen的前端是挺漂亮的哈哈
如果是 RTX Pro 6000的话应该会很爽!
附加一下启动参数(用q2kl的话 可以开 200K 上下文 q8量化):
.\llama-server.exe -m B:\models\llm\Qwen\Qwen3.8-Flash-Next\Qwen3.8-F...