996Qwen3.8-flash-next 成功本地部署4bit量化!仅单卡RTX3090 24G,128K上下文,27t/s,无MTP 中发帖

[image] 
我的配置:RTX3090 24G +DDR5 32G + 2T固态硬盘
使用的模型: Qwen3.8-Flash-Next-AD-3.84bpw-IQ4_XS-M64
这个模型有很大一部分占空间的是 n-gram 表。
我用24G显存+32G内存放下了 45.8G,其他的39.1GB都放在了SSD里,上下文128K,
目前还没有MTP支持,速度在27t/s。
[image]
[image]
我现在更期待社区MTP草稿模型的更新,以及破限的4bit模型!
启动参数:
~/llama.cpp/build/bin/llama-server \
-m /root/models/AtomicChat/Qwen3.8-Flash-Next-AD-3.84bpw-IQ4_XS-M64-00001-of-00028.gguf \
-...