萝北来信 LuobeiLetters (@tobenot)OpenCode Go 的 DeepSeek 涨价,大用量的我想转向本地部署了 中发帖

开始部署 Qwen3.8-27B ! 
我的家用机(4090D,24G)跑的本地 Qwen3.8-27B,量化 Q4_K_M(19GB)
高速的时候能跑到 50 tok/s(MTP 投机解码,草稿接受率 94%), 显存占用 23.5GB,但是只能打出 60k 的上下文了, 去掉 MTP 草稿也只能上 96K,确实也还不太够用… 我的内存有 96GB,这可以利用来强化它吗。
大家本地部署都用什么呀?
[dsh-012-OpenCodeGo调价-3x4-P1-封面]
[dsh-012-OpenCodeGo调价-3x4-P2-核心]
llama-server -m Qwen3.8-27B-Q4_K_M.gguf \
--model-draft mtp-Qwen3.8-27B-Q4_0.gguf \
--spec-type draft-mtp --spec-draft-n-m...