4.1 计算机视觉简介

什么是 CV?

计算机视觉(CV)是人工智能的一个领域,它使计算机能够解释和理解来自世界的视觉信息,例如图像和视频。借助深度学习、模式识别等技术,计算机视觉系统可以高精度地识别物体、检测人脸、跟踪运动并分析场景。它被广泛应用于自动驾驶、医学影像、安防监控、工业检测和增强现实等场景,帮助机器基于自己“看到”的内容做出决策。

img

学习目标

本节结束时,你应该能够:

  • 解释什么是计算机视觉
  • 描述该领域试图解决的主要问题
  • 识别主要的应用领域
  • 理解图像理解与视频理解的区别
  • 了解课程其余部分的组织方式

为什么计算机视觉很难

人类之所以能毫不费力地完成许多视觉任务,是因为我们在世界中拥有多年的具身体验。计算机则不具备这一点。现实世界中的视觉问题之所以困难,是因为:

  • 光照会变化
  • 物体从不同视角看起来不同
  • 场景杂乱
  • 一些物体很小、模糊或被遮挡
  • 相机会引入噪声和失真
  • 视频还增加了时间这一维度

正因如此,计算机视觉已经从简单的图像处理演进到深度学习和多模态系统。

计算机视觉的主要任务

img

该领域可以划分为几大主要任务:

任务核心问题示例
分类图像中是什么猫还是狗、缺陷品还是正常品
检测存在哪些物体以及它们在哪里人、安全帽、车辆
分割哪些像素属于哪个区域或物体路面区域、背景、产品轮廓
姿态估计关键点或身体结构是什么人体关节、手部关键点
跟踪哪个被检测到的物体在时间上是同一个在整段视频中跟踪 17 号人物
OCR场景中出现了什么文字车牌、标签、收据
事件理解场景中发生了什么越线、入侵、跌倒

图像与视频

图像捕捉单个瞬间。视频则是随时间演变的帧序列。

这一区别很重要,因为有些任务用单张图像就能解决,而另一些任务则需要时间推理:

  • 图像分类作用于单帧
  • 物体跟踪需要跨帧的连续性
  • 事件分析依赖于运动和时间

标准视觉流水线

image-20260330175514717

尽管实现方式各不相同,但许多计算机视觉系统遵循共同的逻辑:

  1. 采集数据
  2. 预处理数据
  3. 运行算法或模型
  4. 应用后处理与决策逻辑
  5. 输出结果或触发动作

常见误解

  • “计算机视觉就是物体检测。”
    • 检测很重要,但该领域的范围要广得多。
  • “模型能跑通一张图像,就可以部署了。”
    • 实际部署需要稳定的输入、延迟控制和故障处理。
  • “视频不过是许多张图像,所以并不会难太多。”
    • 视频引入了时间、连续性和系统约束。

练习 / 思考

  1. 选择三种你在日常生活中使用的产品或系统,找出其中可能涉及计算机视觉的地方。
  2. 对于以下每一项,判断它主要属于分类、检测、分割、跟踪还是事件理解任务:
    • 手机上的人脸解锁
    • 停车场中的车辆计数
    • 读取收据
    • 检测工人是否佩戴安全帽
  3. 写一段简短的文字,解释为什么视频理解通常比图像理解更难。

总结

计算机视觉的核心在于把原始的视觉数据转化为有用的理解。它涵盖众多任务,从分类、检测到 OCR 和事件推理。

建议的下一步

继续学习 4.2 计算机如何表示图像

参考资料