ytbglht55古建筑以图搜图精度提升求助:Chinese-CLIP 微调后,相似建筑实例仍容易混淆 中发帖

最近在做一个古建筑图片检索项目,希望通过用户上传的照片, 
识别或召回具体的古建筑实例。
目前系统能够判断图片大致属于古建筑,也能召回外观相近的建筑,
但遇到建筑形制、屋顶、立面和材料比较相似的实例时,
Top1 经常不是正确建筑。
想请教大家:这种“同类别下的实例级识别”,应该怎样继续提高精度?
当前方案
模型:

Chinese-CLIP ViT-L/14
使用整理后的“建筑图片 + 中文描述”进行微调
图像向量和文本向量均做 L2 归一化
使用余弦相似度进行向量召回

图片处理:

保留完整图片,使用 letterbox 避免横图或竖图被中心裁剪掉
同时生成一个中心区域视图
完整图与中心图分别提取向量
当前按照 full 0.8、center 0.2 加权,再做一次 L2 归一化

检索流程:

上传图片
提取 CLIP 图像向量
从向量索引中召回 TopK 相似图片
...