黯绛 (@amlkiller)rk3588跑大模型 中发帖

依旧整活 


跑的是 HY-MT2-1.8B-Q8_0
使用率不高于50%,没跑满,主要原因可能是npu不支持此模型的一些算子需要频繁同步。
slot print_timing: id 0 | task 371 |
prompt eval time = 2298.51 ms / 273 tokens ( 8.42 ms per token, 118.77 tokens per second)
eval time = 26019.50 ms / 234 tokens ( 111.19 ms per token, 8.99 tokens per second)
total time = 28318.01 ms / 507 tokens
slot release: id 0 | task 371 | s...