@Love_Runs_Out 在 求大佬们教一下本地部署优化 中发帖
小白自己搭着玩的
推理速度稳定在 ~28.45 tokens/s,
设备:双路 NVIDIA RTX 5880 Ada Generation 单卡 48GB显存,拿pcie连一起的
模型:Qwen/Qwen3.8-27B (270亿参数,原生 BF16 精度完整加载,权重占用约 51GB)
直接从hf拉下来的官方原生,有没有什么好建议,感觉输出的好慢,想要快一点
是换轻量化一点的模型,还是有什么加速推理的技巧,能否请大佬指点一二,可以直接甩我链接我自己学,不胜感激