c.1 (@concentrate1) 在 小模型小测评:MiniCPM5-2B、Spark-X2.5-4B、Qwen3.5-9B 蒸馏版 中发帖
在先前的 讯飞 Spark-X2.5 测试 过后,官方推出了量化版本 GGUF,llama.cpp 也更新了相关架构。昨天,面壁智能发布了 MiniCPM5-2B 。此外,虽然 Qwen3.5-9B 已经出局了,但 有网友 让我也测一下民间做的 claude-opus-4.6 蒸馏版。所以就放到一起简单品鉴一下吧。
基础配置
所有模型都在 Windows 端 LM Studio 运行(利用其自带的API功能向外部开放),显卡为 RTX 5070 Ti 16GB。更新最新 CUDA 12 llama.cpp 运行时(v2.34.0)以支持 Spark-X2.5-4B 架构(不用自己编译了)。之后每道题都连续测 3 次,记录结果。
MiniCPM5-2B:FP16 原版,测试上下文为 131,072,显存占用 7.55 GB。已经是最高上下文。
Spark-X2.5-4B:Q4_K_M ...