4.5 深度学习计算机视觉任务

主要任务

深度学习计算机视觉涵盖了许多帮助机器理解图像和视频的任务。常见任务包括图像分类(判断主要物体是什么)、目标检测(找到物体并在它们周围画框)以及分割(为每个像素打标签或分离独立物体)。它还包括用于身体关节等关键点的关键点检测、用于估计帧间运动的光流,以及用于理解视频中动作的视频分类

简单来说,这些任务从回答**"图像中有什么?"进展到"它在哪里?""它是什么形状?"以及"它如何运动?"**。

cv-tasks

1. 图像分类

图像分类为整张图像预测一个或多个标签。

示例:

  • 猫还是狗
  • 健康叶片还是病叶
  • 合格品还是次品

image-20260402090916279

当全局内容比物体位置更重要时,这一任务非常有用。

2. 目标检测

目标检测同时预测类别和位置。

示例:

  • 行人检测
  • 安全帽检测
  • 车辆检测

image-20260402091838482

检测非常重要,因为它成为许多下游任务的基础,例如计数、跟踪和事件推理。

3. 分割

分割在像素级别上工作。

alt text

两种常见形式:

  • 语义分割:按类别对每个像素进行分类
  • 实例分割:分离同一类别下的各个独立物体

示例:

  • 道路区域分割
  • 产品边界提取
  • 背景去除

4. 目标跟踪

跟踪将检测结果在时间上关联起来。

img

它回答的是与检测不同的问题:

  • 不仅是这里现在有什么
  • 还有哪个物体在不同帧之间是同一个

这对于以下任务至关重要:

  • 计数人员
  • 监控运动
  • 行为分析

5. 姿态估计

姿态估计预测结构化的关键点,例如关节或地标。

img

示例:

  • 人体骨架估计
  • 手部关键点
  • 动物姿态估计

当形状和姿态比一个简单的边框更重要时,这非常有用。

6. 人脸识别

人脸识别不只是检测人脸,它试图识别或验证此人是谁。

img

它通常涉及:

  • 人脸检测
  • 人脸对齐
  • 特征提取
  • 比较或匹配

这一任务引入了关于隐私、偏见和安全的重要关注点。

7. OCR 与场景文本理解

OCR 从图像或视频中提取文本。

Demo

示例:

  • 收据
  • 标签
  • 车牌
  • 表格

OCR 是视觉与语言交互的最清晰的例子之一。

8. 事件与行为理解

一些实际系统更关注事件而非静态物体:

  • 越线
  • 入侵
  • 跌倒检测
  • 徘徊

这些任务通常结合了检测、跟踪和基于规则的逻辑。

常见误解

  • "检测总是足够的。"
    • 一些应用需要分割、姿态估计、OCR 或时间推理。
  • "跟踪只是重复的检测。"
    • 跟踪还需要跨时间的身份连续性。
  • "人脸识别和人脸检测是同一回事。"
    • 检测找到人脸。识别是识别或验证此人。

练习 / 反思

  1. 从下列每个领域中各选择一个应用,并指出最合适的视觉任务:
    • 智慧零售
    • 工厂检测
    • 交通分析
    • 文档处理
  2. 解释什么时候分割比检测更好。
  3. 解释为什么跟踪在视频分析中很重要,但在每个图像任务中并非必需。

总结

深度学习计算机视觉包括许多任务类型,每种任务都有自己的输出、优势和应用。理解这一任务图景有助于学习者为问题选择合适的工具。在下一节中,本课程将以 YOLO26 作为主要的实践案例,学习如何训练和部署自定义模型。

建议下一步

继续学习 4.6 训练并部署你自己的视觉模型

参考资料:

https://github.com/NVIDIA/semantic-segmentation

https://github.com/yehengchen/Object-Detection-and-Tracking

https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation

https://github.com/ageitgey/face_recognition

https://github.com/RapidAI/RapidOCR