4.1 Introducción a la Visión por Computadora
¿Qué es CV?
La visión por computadora (CV) es un campo de la inteligencia artificial que permite a las computadoras interpretar y comprender la información visual del mundo, como imágenes y videos. Mediante técnicas como el deep learning y el reconocimiento de patrones, los sistemas de visión por computadora pueden identificar objetos, detectar rostros, rastrear movimiento y analizar escenas con alta precisión. Se utiliza ampliamente en aplicaciones como conducción autónoma, imagenología médica, vigilancia de seguridad, inspección industrial y realidad aumentada, ayudando a las máquinas a tomar decisiones basadas en lo que "ven".

Objetivos de Aprendizaje
Al final de esta sección, deberías ser capaz de:
- explicar qué es la visión por computadora
- describir los principales problemas que el campo intenta resolver
- identificar las principales áreas de aplicación
- comprender la diferencia entre comprensión de imágenes y comprensión de video
- ver cómo está organizado el resto del curso
Por Qué la Visión por Computadora es Difícil
Los humanos resolvemos muchas tareas visuales sin esfuerzo porque tenemos años de experiencia encarnada en el mundo. Las computadoras no. La visión en el mundo real es difícil porque:
- la iluminación cambia
- los objetos se ven diferentes desde distintos puntos de vista
- las escenas están desordenadas
- algunos objetos son pequeños, borrosos u ocluidos
- las cámaras introducen ruido y distorsión
- el video añade el tiempo como otra dimensión
Por esto la visión por computadora ha evolucionado desde el simple procesamiento de imágenes hasta el deep learning y los sistemas multimodales.
Tareas Principales en Visión por Computadora

El campo puede dividirse en varias tareas principales:
| Tarea | Pregunta Central | Ejemplo |
|---|---|---|
| Clasificación | Qué hay en la imagen | gato vs perro, defectuoso vs normal |
| Detección | Qué objetos están presentes y dónde | persona, casco, vehículo |
| Segmentación | Qué píxeles pertenecen a qué región u objeto | área de carretera, fondo, contorno del producto |
| Estimación de Pose | Cuáles son los puntos clave o estructura corporal | articulaciones humanas, puntos de la mano |
| Tracking | Qué objeto detectado es el mismo a lo largo del tiempo | seguir a la persona 17 a través del video |
| OCR | Qué texto aparece en la escena | matrículas, etiquetas, recibos |
| Comprensión de Eventos | Qué ha sucedido en la escena | cruce de línea, intrusión, caída |
Imagen vs Video
Una imagen captura un único momento. Un video es una secuencia de fotogramas que evolucionan en el tiempo.
Esta distinción importa porque algunas tareas pueden resolverse con una sola imagen, mientras que otras requieren razonamiento temporal:
- la clasificación de imágenes funciona en un solo fotograma
- el seguimiento de objetos requiere continuidad entre fotogramas
- el análisis de eventos depende del movimiento y el tiempo
El Pipeline Estándar de Visión

Aunque las implementaciones varían, muchos sistemas de visión por computadora siguen una lógica común:
- adquirir datos
- preprocesar los datos
- ejecutar un algoritmo o modelo
- aplicar postprocesamiento y lógica de decisión
- emitir un resultado o disparar una acción
Malentendidos Comunes
- "La visión por computadora es solo detección de objetos."
- La detección es importante, pero el campo es mucho más amplio.
- "Si un modelo funciona en una imagen, está listo para desplegarse."
- El despliegue real necesita entradas estables, control de latencia y manejo de fallos.
- "El video es solo muchas imágenes, así que no es mucho más difícil."
- El video introduce tiempo, continuidad y restricciones del sistema.
Ejercicios / Reflexión
- Elige tres productos o sistemas que uses en la vida diaria e identifica dónde puede estar involucrada la visión por computadora.
- Para cada uno de los siguientes, decide si es principalmente una tarea de clasificación, detección, segmentación, tracking o comprensión de eventos:
- desbloqueo facial en un teléfono
- contar coches en un estacionamiento
- leer un recibo
- detectar si un trabajador lleva casco
- Escribe un breve párrafo explicando por qué la comprensión de video suele ser más difícil que la comprensión de imágenes.
Resumen
La visión por computadora consiste en convertir los datos visuales en bruto en una comprensión útil. Incluye muchas tareas, desde clasificación y detección hasta OCR y razonamiento de eventos.