4.2 Cómo los Computadores Representan Imágenes
¿Qué es una imagen?
Si quieres entender cómo los computadores reconocen e interpretan imágenes, primero debes saber qué es realmente una imagen desde el punto de vista de un computador.

Para los humanos, una imagen puede parecer una escena llena de significado con objetos, colores y emociones. Pero para un computador, una imagen es simplemente una rejilla de datos numéricos compuesta por píxeles, donde cada píxel almacena valores que representan brillo o color. Al procesar estos números con modelos matemáticos y algoritmos, los computadores pueden empezar a detectar patrones, identificar formas, distinguir objetos y, finalmente, tomar decisiones sobre lo que contiene una imagen. Comprender esta diferencia entre la percepción humana y la representación de la máquina es el primer paso para entender cómo funciona la visión por computadora.
Las Imágenes como Arreglos de Números

Una imagen digital es una rejilla de valores. Cada ubicación en la rejilla se llama píxel.
- En una imagen en escala de grises, cada píxel suele almacenar un valor.
- En una imagen en color, cada píxel almacena varios valores, uno por cada canal.
Para un computador, una imagen no es "un gato" o "un coche". Es un arreglo con forma, tipo de dato y contenido numérico.
Canales

Un canal es un tipo de valor almacenado en cada píxel. Por ejemplo, una imagen en escala de grises tiene 1 canal, mientras que una imagen en color suele tener 3 canales como RGB. En otras palabras, un computador ve una imagen como números organizados por canal, no directamente como objetos del mundo real. OpenCV también suele usar el orden BGR en lugar de RGB. Muchos principiantes conocen primero las imágenes como imágenes RGB. Pero diferentes tareas usan distintas distribuciones de canales.
| Representación | Significado |
|---|---|
| Escala de grises | un valor de intensidad por píxel |
| RGB / BGR | tres canales de color por píxel |
| HSV | tono, saturación, valor |
OpenCV comúnmente usa el orden BGR en lugar de RGB, lo cual es un detalle práctico importante.
Resolución
La resolución describe cuántos píxeles contiene la imagen, como 640 x 480 o 1920 x 1080.

Una mayor resolución generalmente proporciona más detalle, pero también aumenta:
- el uso de memoria
- el costo de procesamiento
- el tiempo de entrenamiento e inferencia
Video como Secuencia de Fotogramas
Un video es un flujo de imágenes ordenado en el tiempo.

Esto significa que el video introduce dos capas de complejidad:
- estructura visual por fotograma
- cambio temporal entre fotogramas
Desafíos

La entrada real de la cámara puede verse afectada por:
- desenfoque por movimiento
- poca luz
- ruido
- distorsión de la lente
- artefactos de compresión
- pérdida de fotogramas
Por eso un buen trabajo en visión por computadora depende no solo de los modelos, sino también de la calidad de los datos.
Inténtalo
Operar una Imagen con OpenCV
#clone the source code
git clone https://github.com/Seeed-Projects/reComputer-Jetson-for-Beginners
cd reComputer-Jetson-for-Beginners/4-Computer-Vision/4.2-How-Computers-Represent-Images/code
# Install opencv if you don't install before
pip install opencv-python
#run the script
python show_img.pyVerás la salida:

Leer Video
python show_video.pyVerás la salida:

Ejercicios / Reflexión
- Carga una imagen e imprime su
shapeydtype. - Convierte la misma imagen a escala de grises y HSV. Describe lo que cambia visualmente.
- Redimensiona una imagen a dos resoluciones diferentes y compara el tamaño del archivo o el tiempo de procesamiento.
- Abre un video corto y cuenta aproximadamente cuántos fotogramas se muestran en 10 segundos.
Resumen
Las imágenes son datos numéricos estructurados, no solo dibujos. Comprender los píxeles, los canales, la resolución y los fotogramas de video es esencial porque cada algoritmo posterior, desde la umbralización hasta los CNN, opera sobre estas representaciones.
Siguiente Paso Sugerido
Continúa a 4.3 Visión por Computadora Clásica.