亦乘风 (@HTC) 在 分享下 Qwen3.8-27B 在 Mac Studio M1 Ultra 多轮调试的一个「鹈鹕骑行动画」结果 中发帖
之前有做过各种功课,27B 这个模型主要卡的速度是内存带宽。从其他人的分享发现,M3 Ultra 512G 内存的速度也只有 30 token 每秒,但是我发现 M1 Ultra 的内存带宽也是 800G。于是让 Codex 进行多轮调试,从 Llama.cpp 转到 oMLX,最终发现速度+MTP可以跑在 30+,但这里有个问题:一旦开了 MTP,会发现某些工具调用经常出错,或有无限循环的问题。于是把 MTP 尽可能降低或关闭,这样可以保证支撑。然后做了一个简单的「鹈鹕骑行动画」,好坏大家评论吧。
### 🛠 本地环境与配置
**模型**: Qwen3.8-27B(推理级别 high)
**模型服务**: omlx 本地 LLM 端点 http://127.0.0.1:8000/v1(OpenAI 兼容 API)
**编码代理**: pi coding agent v0.84.2...