@W1nge 在 5070 45tps本地跑180B Qwen3.8 q3!? 中发帖

如题
Reddit 老哥给 Qwen3.8 flash next 开发了一个专用推理引擎 Strata
在同样的 5070 12G + 64G 5600内存 + 六核 7600 CPU 配置下能够跑到
Q2_0 → 65.1 tps decode + 543 tps prefill
IQ2_XS → 52.0 tps decode + 472 tps prefill
IQ3_XXS → 44.8 tps decode + 414 tps prefill
与此同时 llama.cpp 的decode只有15tps
[图片]
另附上原帖链接:https://www.reddit.com/r/LocalLLaMA/comments/1wp7zyb/qwen38flashnext_on_12gb_vram_65_tokens_per_second/
老哥Twitter:Niko Ve...