4.5 Tareas de Visión por Computadora con Deep Learning

Tareas Principales

La visión por computadora con deep learning cubre muchas tareas que ayudan a las máquinas a comprender imágenes y videos. Las tareas comunes incluyen la clasificación de imágenes (decidir cuál es el objeto principal), la detección de objetos (encontrar objetos y dibujar cajas a su alrededor) y la segmentación (etiquetar cada píxel o separar objetos individuales). También incluye la detección de puntos clave para landmarks tales como articulaciones del cuerpo, el flujo óptico para estimar el movimiento entre fotogramas, y la clasificación de video para entender acciones en videos.

En términos simples, estas tareas pasan de responder "¿qué hay en la imagen?" a "¿dónde está?", "¿qué forma tiene?" y "¿cómo se mueve?".

cv-tasks

1. Clasificación de Imágenes

La clasificación de imágenes predice una o más etiquetas para la imagen completa.

Ejemplos:

  • gato vs perro
  • hoja sana vs hoja enferma
  • producto normal vs producto defectuoso

image-20260402090916279

Esta tarea es útil cuando el contenido global importa más que la ubicación del objeto.

2. Detección de Objetos

La detección de objetos predice tanto la categoría como la ubicación.

Ejemplos:

  • detección de personas
  • detección de cascos
  • detección de vehículos

image-20260402091838482

La detección es muy importante porque se convierte en la base de muchas tareas posteriores como contar, hacer tracking y razonamiento de eventos.

3. Segmentación

La segmentación trabaja a nivel de píxel.

alt text

Dos formas comunes:

  • segmentación semántica: clasifica cada píxel por categoría
  • segmentación de instancias: separa objetos individuales de la misma categoría

Ejemplos:

  • segmentación del área de la carretera
  • extracción del límite del producto
  • eliminación del fondo

4. Tracking de Objetos

El tracking conecta detecciones a lo largo del tiempo.

img

Responde a una pregunta diferente que la detección:

  • no solo qué hay aquí ahora
  • sino qué objeto sigue siendo el mismo a través de los fotogramas

Esto es esencial para:

  • contar personas
  • monitorear movimiento
  • análisis de comportamiento

5. Estimación de Pose

La estimación de pose predice puntos clave estructurados como articulaciones o landmarks.

img

Ejemplos:

  • estimación de esqueleto humano
  • landmarks de la mano
  • estimación de pose de animales

Esto es útil cuando la forma y la postura importan más que una simple caja.

6. Reconocimiento Facial

El reconocimiento facial va más allá de detectar un rostro. Intenta identificar o verificar quién es la persona.

img

Esto suele implicar:

  • detección de rostros
  • alineación facial
  • extracción de características
  • comparación o matching

Esta tarea introduce preocupaciones importantes en torno a la privacidad, el sesgo y la seguridad.

7. OCR y Comprensión de Texto en Escena

OCR extrae texto de imágenes o video.

Demo

Ejemplos:

  • recibos
  • etiquetas
  • matrículas
  • formularios

El OCR es uno de los ejemplos más claros de visión interactuando con el lenguaje.

8. Comprensión de Eventos y Comportamiento

Algunos sistemas prácticos se preocupan menos por los objetos estáticos y más por los eventos:

  • cruce de línea
  • intrusión
  • detección de caídas
  • merodeo

Estas tareas a menudo combinan detección, tracking y lógica basada en reglas.

Malentendidos Comunes

  • "La detección siempre es suficiente."
    • Algunas aplicaciones necesitan segmentación, estimación de pose, OCR o razonamiento temporal.
  • "El tracking es solo detección repetida."
    • El tracking también requiere continuidad de identidad a través del tiempo.
  • "El reconocimiento facial y la detección facial son lo mismo."
    • La detección encuentra el rostro. El reconocimiento identifica o verifica a la persona.

Ejercicios / Reflexión

  1. Elige una aplicación de cada una de las siguientes áreas e identifica la tarea de visión más adecuada:
    • retail inteligente
    • inspección de fábrica
    • análisis de tráfico
    • procesamiento de documentos
  2. Explica cuándo la segmentación es mejor que la detección.
  3. Explica por qué el tracking es importante en la analítica de video pero no necesario en cada tarea de imagen.

Resumen

La visión por computadora con deep learning incluye muchos tipos de tareas, cada una con sus propias salidas, fortalezas y aplicaciones. Comprender este mapa de tareas ayuda al estudiante a elegir la herramienta correcta para un problema. En la siguiente sección, el curso utiliza YOLO26 como el principal caso práctico para aprender a entrenar y desplegar un modelo personalizado.

Siguiente Paso Sugerido

Continúa a 4.6 Entrena y Despliega Tu Propio Modelo de Visión.

Referencia:

https://github.com/NVIDIA/semantic-segmentation

https://github.com/yehengchen/Object-Detection-and-Tracking

https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation

https://github.com/ageitgey/face_recognition

https://github.com/RapidAI/RapidOCR