yeyucca 在 DeepSeek v4 flash 0731 本地部署+DSpark草稿模型,生成速度43toks/s,峰值60toks/s 中发帖
背景信息:4张5090(单卡32G显存),用的是unsloth的dv4f_0731_UD_8_DXL gguf,162GB权重加上10.9GB的DSpark draft草稿模型,选的是q8_0的gguf。
为了开启deek v4 flash的thinking max(384k起步),上下文开到392K,我觉得有这个速度已经能用了。
优化心得:
1.显存吃不下大模型权重时,想着offload到cpu,这时需要有大内存支撑,比如128GB以上的内存,
2.重型的layer尽可能的留给gpu,gpu毕竟快,每张卡在调整时,显存尽量不要到适量程度,不能太空闲,又不能过于紧绷,预留2GB显存空间支撑burst,甚至为了更稳可以有3.5GB显存已支撑burst
3.llama.cpp与先进模型是相辅相成,互相成长的,llama.cpp尽可能的追新,因为AI变化太快了,基本上出一款,就适配一款...