4.1 计算机视觉简介
什么是 CV?
计算机视觉(CV)是人工智能的一个领域,它使计算机能够解释和理解来自世界的视觉信息,例如图像和视频。借助深度学习、模式识别等技术,计算机视觉系统可以高精度地识别物体、检测人脸、跟踪运动并分析场景。它被广泛应用于自动驾驶、医学影像、安防监控、工业检测和增强现实等场景,帮助机器基于自己“看到”的内容做出决策。

学习目标
本节结束时,你应该能够:
- 解释什么是计算机视觉
- 描述该领域试图解决的主要问题
- 识别主要的应用领域
- 理解图像理解与视频理解的区别
- 了解课程其余部分的组织方式
为什么计算机视觉很难
人类之所以能毫不费力地完成许多视觉任务,是因为我们在世界中拥有多年的具身体验。计算机则不具备这一点。现实世界中的视觉问题之所以困难,是因为:
- 光照会变化
- 物体从不同视角看起来不同
- 场景杂乱
- 一些物体很小、模糊或被遮挡
- 相机会引入噪声和失真
- 视频还增加了时间这一维度
正因如此,计算机视觉已经从简单的图像处理演进到深度学习和多模态系统。
计算机视觉的主要任务

该领域可以划分为几大主要任务:
| 任务 | 核心问题 | 示例 |
|---|---|---|
| 分类 | 图像中是什么 | 猫还是狗、缺陷品还是正常品 |
| 检测 | 存在哪些物体以及它们在哪里 | 人、安全帽、车辆 |
| 分割 | 哪些像素属于哪个区域或物体 | 路面区域、背景、产品轮廓 |
| 姿态估计 | 关键点或身体结构是什么 | 人体关节、手部关键点 |
| 跟踪 | 哪个被检测到的物体在时间上是同一个 | 在整段视频中跟踪 17 号人物 |
| OCR | 场景中出现了什么文字 | 车牌、标签、收据 |
| 事件理解 | 场景中发生了什么 | 越线、入侵、跌倒 |
图像与视频
图像捕捉单个瞬间。视频则是随时间演变的帧序列。
这一区别很重要,因为有些任务用单张图像就能解决,而另一些任务则需要时间推理:
- 图像分类作用于单帧
- 物体跟踪需要跨帧的连续性
- 事件分析依赖于运动和时间
标准视觉流水线

尽管实现方式各不相同,但许多计算机视觉系统遵循共同的逻辑:
- 采集数据
- 预处理数据
- 运行算法或模型
- 应用后处理与决策逻辑
- 输出结果或触发动作
常见误解
- “计算机视觉就是物体检测。”
- 检测很重要,但该领域的范围要广得多。
- “模型能跑通一张图像,就可以部署了。”
- 实际部署需要稳定的输入、延迟控制和故障处理。
- “视频不过是许多张图像,所以并不会难太多。”
- 视频引入了时间、连续性和系统约束。
练习 / 思考
- 选择三种你在日常生活中使用的产品或系统,找出其中可能涉及计算机视觉的地方。
- 对于以下每一项,判断它主要属于分类、检测、分割、跟踪还是事件理解任务:
- 手机上的人脸解锁
- 停车场中的车辆计数
- 读取收据
- 检测工人是否佩戴安全帽
- 写一段简短的文字,解释为什么视频理解通常比图像理解更难。
总结
计算机视觉的核心在于把原始的视觉数据转化为有用的理解。它涵盖众多任务,从分类、检测到 OCR 和事件推理。
建议的下一步
继续学习 4.2 计算机如何表示图像。