nakanojinharuka (@jinkelajin)有没有佬使用过llama.cpp在内存大显存小的机子上部署上了较大参数的模型? 中发帖

如题,实际测试测下来之后我们有一台4090(24G)和128G内存的机子能够部署deepseek v4 flash的Q4量化,然后像Qwen等这些都能本地部署(也是Q4量化甚至是Q8),就是可能要分配下显存。 
我这里做研究够用了,但还需要问下佬友,怎么尽可能吃完这些资源?