飛空 (@feikong)单卡4090,本地跑Qwen3.8-27B,效果还是挺惊艳的 中发帖

启动配置
Q2量化版本,开启视觉,128k上下文,60-80 token/s
思考时间比较长 😂 鹈鹕骑自行车思考了9分钟
/home/ubuntu/ai/llama.cpp/build/bin/llama-server \
-m /home/ubuntu/ai/model/Qwen3.8-27B-UD-Q2_K_XL.gguf \
--mmproj /home/ubuntu/ai/model/mmproj-BF16.gguf \
--ctx-size 131072 \
--flash-attn on \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--spec-draft-p-min 0.75 \
-ngl 99 \
--temp 0.75 \
--top-p 0.95 \
--top-k ...