咪叭 (@ChiyoSekai)在 GPT6 的帮助下 Qwen3.8 Flash 从30tps提高到50 (54G显存 Q2KL 量化) 中发帖

背景
上次部署了 Qwen3.8 Flash IQ3,后来没怎么用了,因为DeepSeek V4 Flash Vision Exp暂时满足我的需求了
然而最近拉闸了,都换成 → V4.1 Flash了,甲太厚了
受不了了,重操就业 本地部署了

因为我是不对称双卡,又有usb4这种低宽带的,跑不了vllm或者sgland
继续llama.cpp了,但是之前的输出速度我并不满意, Prefill 300-600 tps 20-30
于是想到了,直接让GPT6 Astra看llama.cpp给出优化,给出方案后让gemini 3.8 Flash按照方案去做和测试
模型配置
用的 Qwen 3.8 Flash Next 一个 iq2 uncensored 版本 和 unsloth q2kl
对话的话开ub1024 prefill能破1000,但是48k上下文,20k上下文时tps...