winffy chu (@winffy2009)12G 3060 尝试跑Qwen3.8 27B 中发帖

上下文 96k 开始没有使用DFlash2不到3tok/s,中断几次后调整参数如下大概5tok/s ,输出质量还可以,就是慢,好处是无审查,奇奇怪怪的东西丢后台慢慢跑,算是勉强可玩吧。12G 3060 +64GRAM 按我自己的环境调优最佳上下文和速度: 
set llama-cache="%~dp0llama-cache"
set llama="D:\ai\llama-cpp\b10666\llama-server.exe"
set /a ctx=1024 * 96

%llama% ^
-m models/Qwen3.8-27B-Uncensored-Q4_K_M.gguf ^
-md models/Qwen3.8-27B-DFlash2-Q4_K_M.gguf ^
-c %ctx% ^
-ctk q4_0 ^
-ctv q4_0 ^
--override-tensor "blk\....