@qilmeQwen-3.8-27B 自部署与 api 体验 中发帖

不说废话直接上表 





对比项
RTX PRO 6000 96G
Mac M5 Pro 32G
Vercel*




模型精度
BF16
MLX 4-bit
BF16


上下文长度
262k
43k(随手调的)
262k


速度(tokens/s)
21
7**
100


内存占用
88G***
22G(模型 17G)




*可能限时免费
**其中简单聊天的速度在 7 tokens/s 以上,使用 dsh 在 10k 上下文之后速度为5 tokens/s
*** 88G = 52G 模型 + 4G 其他开销 + 32G KV Cache
附图

[令人绝望的吕布测试]
[缓慢但好像能用的 agent 测试]