4.1 Introducción a la Visión por Computadora

¿Qué es CV?

La visión por computadora (CV) es un campo de la inteligencia artificial que permite a las computadoras interpretar y comprender la información visual del mundo, como imágenes y videos. Mediante técnicas como el deep learning y el reconocimiento de patrones, los sistemas de visión por computadora pueden identificar objetos, detectar rostros, rastrear movimiento y analizar escenas con alta precisión. Se utiliza ampliamente en aplicaciones como conducción autónoma, imagenología médica, vigilancia de seguridad, inspección industrial y realidad aumentada, ayudando a las máquinas a tomar decisiones basadas en lo que "ven".

img

Objetivos de Aprendizaje

Al final de esta sección, deberías ser capaz de:

  • explicar qué es la visión por computadora
  • describir los principales problemas que el campo intenta resolver
  • identificar las principales áreas de aplicación
  • comprender la diferencia entre comprensión de imágenes y comprensión de video
  • ver cómo está organizado el resto del curso

Por Qué la Visión por Computadora es Difícil

Los humanos resolvemos muchas tareas visuales sin esfuerzo porque tenemos años de experiencia encarnada en el mundo. Las computadoras no. La visión en el mundo real es difícil porque:

  • la iluminación cambia
  • los objetos se ven diferentes desde distintos puntos de vista
  • las escenas están desordenadas
  • algunos objetos son pequeños, borrosos u ocluidos
  • las cámaras introducen ruido y distorsión
  • el video añade el tiempo como otra dimensión

Por esto la visión por computadora ha evolucionado desde el simple procesamiento de imágenes hasta el deep learning y los sistemas multimodales.

Tareas Principales en Visión por Computadora

img

El campo puede dividirse en varias tareas principales:

TareaPregunta CentralEjemplo
ClasificaciónQué hay en la imagengato vs perro, defectuoso vs normal
DetecciónQué objetos están presentes y dóndepersona, casco, vehículo
SegmentaciónQué píxeles pertenecen a qué región u objetoárea de carretera, fondo, contorno del producto
Estimación de PoseCuáles son los puntos clave o estructura corporalarticulaciones humanas, puntos de la mano
TrackingQué objeto detectado es el mismo a lo largo del tiemposeguir a la persona 17 a través del video
OCRQué texto aparece en la escenamatrículas, etiquetas, recibos
Comprensión de EventosQué ha sucedido en la escenacruce de línea, intrusión, caída

Imagen vs Video

Una imagen captura un único momento. Un video es una secuencia de fotogramas que evolucionan en el tiempo.

Esta distinción importa porque algunas tareas pueden resolverse con una sola imagen, mientras que otras requieren razonamiento temporal:

  • la clasificación de imágenes funciona en un solo fotograma
  • el seguimiento de objetos requiere continuidad entre fotogramas
  • el análisis de eventos depende del movimiento y el tiempo

El Pipeline Estándar de Visión

image-20260330175514717

Aunque las implementaciones varían, muchos sistemas de visión por computadora siguen una lógica común:

  1. adquirir datos
  2. preprocesar los datos
  3. ejecutar un algoritmo o modelo
  4. aplicar postprocesamiento y lógica de decisión
  5. emitir un resultado o disparar una acción

Malentendidos Comunes

  • "La visión por computadora es solo detección de objetos."
    • La detección es importante, pero el campo es mucho más amplio.
  • "Si un modelo funciona en una imagen, está listo para desplegarse."
    • El despliegue real necesita entradas estables, control de latencia y manejo de fallos.
  • "El video es solo muchas imágenes, así que no es mucho más difícil."
    • El video introduce tiempo, continuidad y restricciones del sistema.

Ejercicios / Reflexión

  1. Elige tres productos o sistemas que uses en la vida diaria e identifica dónde puede estar involucrada la visión por computadora.
  2. Para cada uno de los siguientes, decide si es principalmente una tarea de clasificación, detección, segmentación, tracking o comprensión de eventos:
    • desbloqueo facial en un teléfono
    • contar coches en un estacionamiento
    • leer un recibo
    • detectar si un trabajador lleva casco
  3. Escribe un breve párrafo explicando por qué la comprensión de video suele ser más difícil que la comprensión de imágenes.

Resumen

La visión por computadora consiste en convertir los datos visuales en bruto en una comprensión útil. Incluye muchas tareas, desde clasificación y detección hasta OCR y razonamiento de eventos.