@jrerrq 在 RTXpro6000大战Qwen 27B 8位版本 中发帖
[5330380f10bb48787ff935e9c466c8dd]
基本之前chatgpt这种大模型常见翻车的问题都能答对,速度60左右,显存只占了1/3。
上下文拉满到 26w token 作为api 给 agent 用能跑到一半显存(45G+)。
[image]