@qilme 在 Qwen-3.8-27B 自部署与 api 体验 中发帖
不说废话直接上表
对比项
RTX PRO 6000 96G
Mac M5 Pro 32G
Vercel*
模型精度
BF16
MLX 4-bit
BF16
上下文长度
262k
43k(随手调的)
262k
速度(tokens/s)
21
7**
100
内存占用
88G***
22G(模型 17G)
*可能限时免费
**其中简单聊天的速度在 7 tokens/s 以上,使用 dsh 在 10k 上下文之后速度为5 tokens/s
*** 88G = 52G 模型 + 4G 其他开销 + 32G KV Cache
附图
[令人绝望的吕布测试]
[缓慢但好像能用的 agent 测试]