← 返回技术笔记计算机视觉基础
COMPUTER VISION

分类、检测、分割与跟踪:任务边界

计算机视觉任务的差异,首先体现在模型需要输出什么。只有先定义输出对象、空间粒度和时间维度,才能选择合适的数据标注、模型结构与评价指标。

主题:视觉任务更新:2026-08状态:持续修订

1. 四类任务解决什么问题

任务典型输出回答的问题常见指标
图像分类类别概率图中主要是什么Accuracy、Precision、Recall、F1
目标检测类别与边界框有什么、在哪里IoU、mAP、Recall
语义分割逐像素类别每个像素属于什么mIoU、Dice、Pixel Accuracy
目标跟踪跨帧目标身份与轨迹目标之后去了哪里MOTA、IDF1、HOTA、Success

2. 标注粒度决定学习目标

分类标签只描述整张图像;检测框加入了粗粒度空间信息;分割掩膜描述物体边界;跟踪数据还需要跨帧身份一致。标注越细,数据成本越高,但模型能够学习的空间信息也越丰富。

3. 不要仅按模型名称划分任务

同一种骨干网络可以服务不同任务。CNN 或 Transformer 通常负责特征提取,真正决定任务的是预测头、损失函数和训练数据。例如分类头输出类别向量,检测头同时预测类别和位置,分割头恢复空间分辨率。

判断任务的简单方法:先写清楚系统最终必须返回的结构化结果,再选择模型,而不是先选一个热门模型再寻找应用场景。

4. 评价指标要对应实际错误

类别不均衡时,Accuracy 可能掩盖少数类漏检;工业检测通常更关注缺陷召回率和误报率;分割任务不能只看像素准确率,因为背景像素可能占绝大多数;跟踪还需要考虑身份切换,而不仅是每帧检测精度。

参考资料