yeyucca 在 GLM 5.3 Flash with TensorFold 2*DGX Spark, decode 在60tks,确实比vLLM要快 中发帖
舒服了,菜单用的是Mia的,tensorfold也在进化,这是一个兼容cuda和apple silicon的新框架,几乎是倍增vLLM
EXL3也是新格式,相当于是nvfp4还小,但更接近bf16,好处是exl3不再是blackwell的专利,
新框架和新格式,都对旧卡友好,可以持续关注
[image]