胖死了的阿猫 (@dogwin1123) 在 【请教】如何实现自动化数据标注? 中发帖
背景:最近在做一个YOLO目标检测项目。训练集用的是公开数据集,训练好的yolo模型不理想,检测结果受到摄像头角度、检测目标特征不在训练集内等问题导致目标检测不到。
想到的解决方案:目前想到的方向是,通过图片分割模型来获取物体坐标框,然后通过的多模态模型给所有坐标框生成标签。
第一步:用图像分割模型生成“候选轮廓”
虽然YOLO不认识我的目标,但有之前看到号称“分割一切”的开源分割模型可以所有物体分割开来
第二步:用多模态大模型给轮廓“命名”
这里想引入多模态大模型,比如Qwen-VL。把第一步切出来的每个小图块喂给VLLM,用Prompt让它从我的目标类别列表里做选择。
第三步:用CLIP做本地预筛,降低API成本
如果每张裁切图都调VLLM,API费用感觉扛不住。
可以本地部署一个CLIP模型做初筛分类,只有CLIP拿不准的“难例”才交给VLLM...