@Li_xx 在 8×H200 部署 DeepSeek-V4.1-Flash,并发 8 就极慢,首字延迟数分钟,GPU SM 100% 但 generation tput 为 0 中发帖
机器是8张H200,2T内存,本地NVMe放的模型。vLLM用的nightly镜像,部署的DeepSeek-V4.1-Flash。启动参数大概是这样:
--tensor-parallel-size 8 --enable-expert-parallel
–max-model-len 1048576 --max-num-seqs 64
–enable-prefix-caching
–speculative-config ‘{“method”:“dspark”,“num_speculative_tokens”:5,…}’
–mm-encoder-tp-mode data
-e VLLM_USE_RUST_FRONTEND=1
还挂了SimpleCPUOffloadConnector
现在问题是:并发才8个请求,就卡得不行。New API那边看日志全是“首字不适用”,frt=-10...