4.5 深度学习计算机视觉任务
主要任务
深度学习计算机视觉涵盖了许多帮助机器理解图像和视频的任务。常见任务包括图像分类(判断主要物体是什么)、目标检测(找到物体并在它们周围画框)以及分割(为每个像素打标签或分离独立物体)。它还包括用于身体关节等关键点的关键点检测、用于估计帧间运动的光流,以及用于理解视频中动作的视频分类。
简单来说,这些任务从回答**"图像中有什么?"进展到"它在哪里?"、"它是什么形状?"以及"它如何运动?"**。
1. 图像分类
图像分类为整张图像预测一个或多个标签。
示例:
- 猫还是狗
- 健康叶片还是病叶
- 合格品还是次品

当全局内容比物体位置更重要时,这一任务非常有用。
2. 目标检测
目标检测同时预测类别和位置。
示例:
- 行人检测
- 安全帽检测
- 车辆检测

检测非常重要,因为它成为许多下游任务的基础,例如计数、跟踪和事件推理。
3. 分割
分割在像素级别上工作。

两种常见形式:
- 语义分割:按类别对每个像素进行分类
- 实例分割:分离同一类别下的各个独立物体
示例:
- 道路区域分割
- 产品边界提取
- 背景去除
4. 目标跟踪
跟踪将检测结果在时间上关联起来。

它回答的是与检测不同的问题:
- 不仅是这里现在有什么
- 还有哪个物体在不同帧之间是同一个
这对于以下任务至关重要:
- 计数人员
- 监控运动
- 行为分析
5. 姿态估计
姿态估计预测结构化的关键点,例如关节或地标。

示例:
- 人体骨架估计
- 手部关键点
- 动物姿态估计
当形状和姿态比一个简单的边框更重要时,这非常有用。
6. 人脸识别
人脸识别不只是检测人脸,它试图识别或验证此人是谁。

它通常涉及:
- 人脸检测
- 人脸对齐
- 特征提取
- 比较或匹配
这一任务引入了关于隐私、偏见和安全的重要关注点。
7. OCR 与场景文本理解
OCR 从图像或视频中提取文本。

示例:
- 收据
- 标签
- 车牌
- 表格
OCR 是视觉与语言交互的最清晰的例子之一。
8. 事件与行为理解
一些实际系统更关注事件而非静态物体:
- 越线
- 入侵
- 跌倒检测
- 徘徊
这些任务通常结合了检测、跟踪和基于规则的逻辑。
常见误解
- "检测总是足够的。"
- 一些应用需要分割、姿态估计、OCR 或时间推理。
- "跟踪只是重复的检测。"
- 跟踪还需要跨时间的身份连续性。
- "人脸识别和人脸检测是同一回事。"
- 检测找到人脸。识别是识别或验证此人。
练习 / 反思
- 从下列每个领域中各选择一个应用,并指出最合适的视觉任务:
- 智慧零售
- 工厂检测
- 交通分析
- 文档处理
- 解释什么时候分割比检测更好。
- 解释为什么跟踪在视频分析中很重要,但在每个图像任务中并非必需。
总结
深度学习计算机视觉包括许多任务类型,每种任务都有自己的输出、优势和应用。理解这一任务图景有助于学习者为问题选择合适的工具。在下一节中,本课程将以 YOLO26 作为主要的实践案例,学习如何训练和部署自定义模型。
建议下一步
继续学习 4.6 训练并部署你自己的视觉模型。
参考资料:
https://github.com/NVIDIA/semantic-segmentation
https://github.com/yehengchen/Object-Detection-and-Tracking
https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation
