炫彩小鱼干 (@Yuookie) 在 分享一下关于部署 qwen27b 的最新成果【配置分享】 中发帖
qwen-3-8-27b这个模型真是特别好用啊,在这段时间用的同时,也在不断追踪社区里最新的解决方案,综合了很多讨论和方案,经过实测之后,现在的状态比之前的状态又有了明显的进化,所以开贴来记录一下。
从上文继续:
依旧4090,依旧262k全上下文,开启视觉
但现在变成了:无重复bug的去审查版本,更高精度上下文,加入了 DFlash2 投机加速,最高速度可达130tps
配置分享:
去审查、修复重复bug的主模型:
Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS.gguf(14.4 GB)
dflash2加速模型:
Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf
视觉模型:
mmproj-F16.gguf
启动命令:
llama-server \
-m Huihui-Q...