GPLer 在 Qwen3.8-Flash-Next 前端效果测试 中发帖
前言
本帖为 BF16 满血版本模型测试,FP8 量化版本测试贴在这,可以对比着看看
测试环境
模型: Qwen/Qwen3.8-Flash-Next
显卡: 4 x A800 80GB
引擎: vllm/vllm-openai:qwen38-flash-next (目前只能用这个,v0.28.0 起不来)
上下文长度: 256k (原生 256k 简单测测够用)
软件: Cherry Studio
思考强度: 默认 (xhigh)
投机解码: MTP, 3
需要配置环境变量 VLLM_PLE_CPU_OFFLOAD=1 将 51B 的 NGram 卸载到内存,不然显存差一点默认参数会 OOM
开启 (MTP, 3) 输出速度大概 128 token/s
web 前端效果测试
鹈鹕骑自行车
提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D...