胖死了的阿猫 (@dogwin1123)【请教】如何实现自动化数据标注? 中发帖

背景:最近在做一个YOLO目标检测项目。训练集用的是公开数据集,训练好的yolo模型不理想,检测结果受到摄像头角度、检测目标特征不在训练集内等问题导致目标检测不到。 
想到的解决方案:目前想到的方向是,通过图片分割模型来获取物体坐标框,然后通过的多模态模型给所有坐标框生成标签。


第一步:用图像分割模型生成“候选轮廓”

虽然YOLO不认识我的目标,但有之前看到号称“分割一切”的开源分割模型可以所有物体分割开来



第二步:用多模态大模型给轮廓“命名”

这里想引入多模态大模型,比如Qwen-VL。把第一步切出来的每个小图块喂给VLLM,用Prompt让它从我的目标类别列表里做选择。



第三步:用CLIP做本地预筛,降低API成本


如果每张裁切图都调VLLM,API费用感觉扛不住。


可以本地部署一个CLIP模型做初筛分类,只有CLIP拿不准的“难例”才交给VLLM...