c.1 (@concentrate1) 在 小模型品鉴:讯飞 Spark-X2.5 中发帖
最近看到讯飞出了上下文能到 1M 的 Spark-X2.5-4B 和 Spark-X2.5-1.7B,很高兴有国内厂商在研究长上下文的小模型,于是立马下载下来研究了一下。正当我考虑要不要分享经验的时候,正好看到有论坛网友在问 https://linux.do/t/topic/2843690 ,于是决定再多测一点,然后写成一篇帖子吧。
上下文
小模型存在的意义是在个人的设备里也能跑。但即便是小模型, 1M 的上下文会有很大的 KV cache,实际上对显存的要求还是很高的。我的显卡是 5070 Ti 16GB,根据我的测试,如果要把 KV cache 保留在显存中的话(这样速度更快),1.7B 上下文可以到 450K:
[image]
4B 上下文可以到 170K :
[image]
如果拉满1M上下文,默认配置下 1.7B 至少需要 31.12 GB 显存,4B 需要 52.55...