逍遥 (@chgblog)加州理工团队把Qwen3.8 从 54GB 暴力压至仅 5.9GB,性能保留98.2% 中发帖

由加州理工(Caltech)团队创立的 AI 实验室 PrismML 发布了名为 Ternary Bonsai 2 27B 的三值量化模型。 
该模型基于阿里的 Qwen3.8 27B,通过三值量化(权重仅为 -1, 0, +1)配合 FP16 分组缩放,将模型体积从全精度的约 54GB 压缩至 5.9GB,平均有效位宽为 1.76-bit。
模型在数学(保留99.5%)、代码(保留99.3%)和指令遵循(反超基座)方面表现极佳,几乎无损。
劣势在需要长程推理和复杂工具调用的 Agent 任务中,性能保留率约为 75%(例如 SWE-bench 和 Terminal-Bench 得分有明显下降)。因此,它非常适合本地代码补全、短链路任务,但在处理复杂长链条任务时能力会有折损。
模型权重下载位置
Hugging Face:
prism-ml/Ternary-Bonsai-2-27B...