jeffccie 在 花巨资测试:Qwen3.8-27B_RTX3090_Ollama_上下文对比 中发帖
[image]
Qwen3.8-27B 在 RTX 3090 24G 上的上下文对比实测
基于 Ollama 0.32.15 DEBUG 日志 + 此前 32K 基准测试数据
数据源:ollama64k.log / ollama128.log(本次 log)+ 原 Qwen3.8-27B_RTX3090_Ollama_上下文性能对比报告.md 32K 章节
测试时间:2026-08-22
TL;DR
档位
结论
32K
100% GPU、Prefill ~1200 tok/s、Decode 30-42 tok/s。性能最好,但 Coding Agent 容易撑爆。
64K
100% GPU、Prefill ~1100 tok/s、Decode ~37 tok/s。真正的甜点档。
128K
触发 12 层 CPU Offload,Decode 掉到 2...