@KemouArxiv 论文:4060 笔电也能跑几十 B 模型了,吼吼吼夸张哦 中发帖

一句话总结: 

原本个人PC跑不起来大模型,主要是因为显存不够用,但是如果把东西放到CPU内存后,PCIe传输速度成了瓶颈
这个优化直接把整个电脑视作一个整体,灵活地把 MoE 里不常用的 Expert 放到 CPU 内存里,常用的放在 GPU,甚至让一部分直接用 CPU 算,从而实现个人电脑跑大 MoE

具体实例:

4060 笔电 32g 内存跑Qwen3.6-35B-A3B,30+tok/s


5090 192ram 跑 dsv4f(284b a13B),20tok/s


[image]测试的设备跑 Qwen3.6,注意到速度没差多少,因为算力不是核心瓶颈

原论文: [2608.16157] FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
要注意的是...