@yricky 在 128G的dgx spark单台即可运行官方完整版deepseek v4 flash正式版 中发帖
如题,这里的官方正式版指deepseek-ai/DeepSeek-V4-Flash-0731模型,使用Colibri推理,目前没有适配GPU,用纯CPU能跑到约0.5tok/s,如果GPU适配好的话,理论上极限能跑到20tok/s每秒左右。
codex 20x还有93%州县,就用来蹬这个了
[截屏2026-08-01 13.41.52]