@knying24自部署deepseek flash 中发帖

准备自己部署一个deepseek flash,8*H100,主要是4个人用左右,低并发,准备在codex中用,大家有没有推荐的推理引擎,vllm或者sglang?这个预期的速度和官方api比如何呀