Miao (@SmartZZZ) 在 本地模型跑鹈鹕,效果还不错 中发帖
今天试了一下本地部署的Qwen3.8-27B-FP8,跑了一下鹈鹕,看着还可以啊
[image]
接到Pi里跑了大概十多分钟出来的
顺道问一下各位佬部署这块还有没有优化方案:
两张4090 24G配合VLLM部署,原生FP8,262K上下文,mtp开到2。速度大概32token/s
要换SGLang吗?还是换个其他量化版本? :tieba_001: