P0T47O 在 为deepseek接入本地部署视觉模型效果总结 中发帖
楼主的设备是5060 8G
Deepseek没有视觉能力实在是巨大痛点,于是尝试本地部署视觉小模型用于处理图片 目前实测效果如下
Qwen3VL Flash 8b:压缩图片分辨率后,一张图片推理时间可达一分钟,识别和输出效果尚可
Qwen3VL Flash 4b:同上情况,一张图片推理时间仅30秒,略差一点,没感觉区别特别大
Gemma4 12b:ollama内可以正常调用 opencode调用提示显存不足 不能正常使用
Gemma4 e4b-it-qat:可以用,推理时间仅十几秒,但是错别字情况严重,不知道英文识别能力会不会好一点
目前的主力方案是求稳用8b,还在找有没有效果更好的模型,如果大家一更好的方案可以交流一下