无名氏 (@xinmeng2030) 在 vLLM 换 SGLang,qwen3.8-27B 推理提速 59%,准确率零损失 中发帖
Qwen3.8-27B + DFlash2 投机解码实测:单流 57 tok/s,4 并发 163 tok/s,多模态近翻倍
一、升级方案
项目
之前
现在
推理框架
vLLM v0.19.0
SGLang 0.5.18(git main)
投机解码
无(MTP 曾尝试,并发性能更差已回退)
DFlash2(草稿模型 Qwen3.8-27B-DFlash2,5 层,8 个候选 token)
模型
Qwen3.8-27B-FP8(多模态 VL,8 图)
不变
服务
模型 ID Qwen3.8-27B,API 与调用方
完全不变,调用方零改动
二、速度提升(实测)
场景
vLLM 基线
SGLang+DFlash2
提升
单流(长文本生成)
~36 tok/s
57.1 tok/s
+59%
4 并发
~97 tok/s
163.1 ...