4.2 Comment les Ordinateurs Représentent les Images
Qu'est-ce qu'une image ?
Si vous voulez comprendre comment les ordinateurs reconnaissent et interprètent les images, vous devez d'abord savoir ce qu'est réellement une image du point de vue d'un ordinateur.

Pour les humains, une image peut ressembler à une scène significative remplie d'objets, de couleurs et d'émotions. Mais pour un ordinateur, une image n'est qu'une grille de données numériques composée de pixels, où chaque pixel stocke des valeurs représentant la luminosité ou la couleur. En traitant ces nombres avec des modèles mathématiques et des algorithmes, les ordinateurs peuvent commencer à détecter des motifs, à identifier des formes, à distinguer des objets et, finalement, à prendre des décisions sur ce que contient une image. Comprendre cette différence entre la perception humaine et la représentation machine est la première étape pour comprendre comment fonctionne la vision par ordinateur.
Les Images Comme Tableaux de Nombres

Une image numérique est une grille de valeurs. Chaque emplacement dans la grille s'appelle un pixel.
- Dans une image en niveaux de gris, chaque pixel stocke généralement une valeur.
- Dans une image couleur, chaque pixel stocke plusieurs valeurs, une pour chaque canal.
Pour un ordinateur, une image n'est ni « un chat » ni « une voiture ». C'est un tableau avec une forme, un type de données et un contenu numérique.
Canaux

Un canal est un type de valeur stocké à chaque pixel. Par exemple, une image en niveaux de gris a 1 canal, alors qu'une image couleur a souvent 3 canaux tels que RGB. Autrement dit, un ordinateur voit une image comme des nombres organisés par canal, et non directement comme des objets du monde réel. OpenCV utilise aussi souvent l'ordre BGR au lieu de RGB. Beaucoup de débutants rencontrent d'abord les images comme des images RGB. Mais différentes tâches utilisent différentes dispositions de canaux.
| Représentation | Signification |
|---|---|
| Niveaux de gris | une valeur d'intensité par pixel |
| RGB / BGR | trois canaux de couleur par pixel |
| HSV | teinte, saturation, valeur |
OpenCV utilise généralement l'ordre BGR au lieu de RGB, ce qui est un détail pratique important.
Résolution
La résolution décrit combien de pixels contient l'image, par exemple 640 x 480 ou 1920 x 1080.

Une résolution plus élevée donne généralement plus de détails, mais elle augmente également :
- l'utilisation de la mémoire
- le coût de traitement
- le temps d'entraînement et d'inférence
La Vidéo Comme Séquence de Trames
Une vidéo est un flux d'images ordonné dans le temps.

Cela signifie que la vidéo introduit deux couches de complexité :
- la structure visuelle par trame
- les changements temporels entre les trames
Défis

L'entrée réelle de la caméra peut être affectée par :
- le flou de mouvement
- la faible luminosité
- le bruit
- la distorsion de l'objectif
- les artefacts de compression
- la perte de trames
C'est pourquoi un bon travail en vision par ordinateur dépend non seulement des modèles, mais aussi de la qualité des données.
Essayez
Manipuler une Image avec OpenCV
#clone the source code
git clone https://github.com/Seeed-Projects/reComputer-Jetson-for-Beginners
cd reComputer-Jetson-for-Beginners/4-Computer-Vision/4.2-How-Computers-Represent-Images/code
# Install opencv if you don't install before
pip install opencv-python
#run the script
python show_img.pyVous verrez la sortie :

Lecture Vidéo
python show_video.pyVous verrez la sortie :

Exercices / Réflexion
- Chargez une image et affichez son
shapeet sondtype. - Convertissez la même image en niveaux de gris et en HSV. Décrivez ce qui change visuellement.
- Redimensionnez une image à deux résolutions différentes et comparez la taille du fichier ou le temps de traitement.
- Ouvrez une courte vidéo et comptez approximativement combien de trames sont affichées en 10 secondes.
Résumé
Les images sont des données numériques structurées, et non simplement des dessins. Comprendre les pixels, les canaux, la résolution et les trames vidéo est essentiel parce que tous les algorithmes ultérieurs, du seuillage aux CNN, opèrent sur ces représentations.
Étape Suivante Suggérée
Continuez à 4.3 Vision par Ordinateur Classique.