4.1 计算机视觉简介
什么是 CV?
计算机视觉(CV)是人工智能的一个领域,它使计算机能够解释和理解来自现实世界的视觉信息,例如图像和视频。通过使用深度学习和模式识别等技术,计算机视觉系统能够高精度地识别物体、检测人脸、追踪运动和分析场景。它广泛应用于自动驾驶、医学影像、安防监控、工业检测和增强现实等领域,帮助机器基于"看到"的内容做出决策。

学习目标
本节结束时,你应该能够:
- 解释什么是计算机视觉
- 描述该领域试图解决的主要问题
- 识别主要的应用领域
- 理解图像理解与视频理解的区别
- 了解课程其余部分的组织方式
为什么计算机视觉很难
人类能够轻松地解决许多视觉任务,因为我们在世界中拥有多年的具身体验。计算机则没有。现实世界中的视觉之所以困难,是因为:
- 光照会变化
- 物体从不同视角看起来不同
- 场景杂乱
- 一些物体很小、模糊或被遮挡
- 相机会引入噪声和失真
- 视频还增加了时间这一维度
这就是为什么计算机视觉从简单的图像处理演进到深度学习和多模态系统。
计算机视觉的主要任务

该领域可以分为几大主要任务:
| 任务 | 核心问题 | 示例 |
|---|---|---|
| 分类 | 图像中是什么 | 猫还是狗、合格品还是次品 |
| 检测 | 存在哪些物体以及在哪里 | 人、安全帽、车辆 |
| 分割 | 哪些像素属于哪个区域或物体 | 路面区域、背景、产品轮廓 |
| 姿态估计 | 关键点或身体结构是什么 | 人体关节、手部关键点 |
| 跟踪 | 检测到的同一物体在时间上如何关联 | 在视频中追踪 17 号人物 |
| OCR | 场景中出现的文字是什么 | 车牌、标签、收据 |
| 事件理解 | 场景中发生了什么 | 越线、入侵、跌倒 |
图像与视频
图像捕捉单个瞬间。视频是随时间演变的帧序列。
这一区别很重要,因为有些任务可以从单张图像解决,而其他任务则需要时间推理:
- 图像分类适用于单帧
- 物体跟踪需要跨帧的连续性
- 事件分析依赖于运动和时间
标准视觉流水线

虽然实现方式各有不同,但许多计算机视觉系统遵循一个共同的逻辑:
- 采集数据
- 预处理数据
- 运行算法或模型
- 应用后处理和决策逻辑
- 输出结果或触发动作
常见误解
- "计算机视觉就是物体检测。"
- 检测很重要,但该领域的范围要广得多。
- "如果一个模型在一张图上能跑,就可以部署。"
- 实际部署需要稳定的输入、延迟控制和故障处理。
- "视频不过是许多张图像,所以并不会难太多。"
- 视频引入了时间、连续性和系统约束。
练习 / 反思
- 选择三种你日常使用的产品或系统,找出可能涉及计算机视觉的部分。
- 对于以下每一项,判断它主要属于分类、检测、分割、跟踪还是事件理解任务:
- 手机的人脸解锁
- 停车场中的车辆计数
- 读取收据
- 检测工人是否佩戴安全帽
- 写一段简短的文字,解释为什么视频理解通常比图像理解更难。
总结
计算机视觉的目标是把原始的视觉数据转化为有用的理解。它包含许多任务,从分类、检测到 OCR 和事件推理。