4.5 Tareas de Visión por Computadora con Deep Learning
Tareas Principales
La visión por computadora con deep learning cubre muchas tareas que ayudan a las máquinas a comprender imágenes y videos. Las tareas comunes incluyen la clasificación de imágenes (decidir cuál es el objeto principal), la detección de objetos (encontrar objetos y dibujar cajas a su alrededor) y la segmentación (etiquetar cada píxel o separar objetos individuales). También incluye la detección de puntos clave para landmarks tales como articulaciones del cuerpo, el flujo óptico para estimar el movimiento entre fotogramas, y la clasificación de video para entender acciones en videos.
En términos simples, estas tareas pasan de responder "¿qué hay en la imagen?" a "¿dónde está?", "¿qué forma tiene?" y "¿cómo se mueve?".
1. Clasificación de Imágenes
La clasificación de imágenes predice una o más etiquetas para la imagen completa.
Ejemplos:
- gato vs perro
- hoja sana vs hoja enferma
- producto normal vs producto defectuoso

Esta tarea es útil cuando el contenido global importa más que la ubicación del objeto.
2. Detección de Objetos
La detección de objetos predice tanto la categoría como la ubicación.
Ejemplos:
- detección de personas
- detección de cascos
- detección de vehículos

La detección es muy importante porque se convierte en la base de muchas tareas posteriores como contar, hacer tracking y razonamiento de eventos.
3. Segmentación
La segmentación trabaja a nivel de píxel.

Dos formas comunes:
- segmentación semántica: clasifica cada píxel por categoría
- segmentación de instancias: separa objetos individuales de la misma categoría
Ejemplos:
- segmentación del área de la carretera
- extracción del límite del producto
- eliminación del fondo
4. Tracking de Objetos
El tracking conecta detecciones a lo largo del tiempo.

Responde a una pregunta diferente que la detección:
- no solo qué hay aquí ahora
- sino qué objeto sigue siendo el mismo a través de los fotogramas
Esto es esencial para:
- contar personas
- monitorear movimiento
- análisis de comportamiento
5. Estimación de Pose
La estimación de pose predice puntos clave estructurados como articulaciones o landmarks.

Ejemplos:
- estimación de esqueleto humano
- landmarks de la mano
- estimación de pose de animales
Esto es útil cuando la forma y la postura importan más que una simple caja.
6. Reconocimiento Facial
El reconocimiento facial va más allá de detectar un rostro. Intenta identificar o verificar quién es la persona.

Esto suele implicar:
- detección de rostros
- alineación facial
- extracción de características
- comparación o matching
Esta tarea introduce preocupaciones importantes en torno a la privacidad, el sesgo y la seguridad.
7. OCR y Comprensión de Texto en Escena
OCR extrae texto de imágenes o video.

Ejemplos:
- recibos
- etiquetas
- matrículas
- formularios
El OCR es uno de los ejemplos más claros de visión interactuando con el lenguaje.
8. Comprensión de Eventos y Comportamiento
Algunos sistemas prácticos se preocupan menos por los objetos estáticos y más por los eventos:
- cruce de línea
- intrusión
- detección de caídas
- merodeo
Estas tareas a menudo combinan detección, tracking y lógica basada en reglas.
Malentendidos Comunes
- "La detección siempre es suficiente."
- Algunas aplicaciones necesitan segmentación, estimación de pose, OCR o razonamiento temporal.
- "El tracking es solo detección repetida."
- El tracking también requiere continuidad de identidad a través del tiempo.
- "El reconocimiento facial y la detección facial son lo mismo."
- La detección encuentra el rostro. El reconocimiento identifica o verifica a la persona.
Ejercicios / Reflexión
- Elige una aplicación de cada una de las siguientes áreas e identifica la tarea de visión más adecuada:
- retail inteligente
- inspección de fábrica
- análisis de tráfico
- procesamiento de documentos
- Explica cuándo la segmentación es mejor que la detección.
- Explica por qué el tracking es importante en la analítica de video pero no necesario en cada tarea de imagen.
Resumen
La visión por computadora con deep learning incluye muchos tipos de tareas, cada una con sus propias salidas, fortalezas y aplicaciones. Comprender este mapa de tareas ayuda al estudiante a elegir la herramienta correcta para un problema. En la siguiente sección, el curso utiliza YOLO26 como el principal caso práctico para aprender a entrenar y desplegar un modelo personalizado.
Siguiente Paso Sugerido
Continúa a 4.6 Entrena y Despliega Tu Propio Modelo de Visión.
Referencia:
https://github.com/NVIDIA/semantic-segmentation
https://github.com/yehengchen/Object-Detection-and-Tracking
https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation
