4.1 Introduction à la Vision par Ordinateur
Qu'est-ce que la CV ?
La vision par ordinateur (CV) est un domaine de l'intelligence artificielle qui permet aux ordinateurs d'interpréter et de comprendre les informations visuelles du monde, telles que des images et des vidéos. En utilisant des techniques comme le deep learning et la reconnaissance de motifs, les systèmes de vision par ordinateur peuvent identifier des objets, détecter des visages, suivre des mouvements et analyser des scènes avec une grande précision. Elle est largement utilisée dans des applications telles que la conduite autonome, l'imagerie médicale, la vidéosurveillance, l'inspection industrielle et la réalité augmentée, aidant les machines à prendre des décisions basées sur ce qu'elles « voient ».

Objectifs d'Apprentissage
À la fin de cette section, vous devriez être capable de :
- expliquer ce qu'est la vision par ordinateur
- décrire les principaux problèmes que le domaine cherche à résoudre
- identifier les principaux domaines d'application
- comprendre la différence entre la compréhension d'image et la compréhension de vidéo
- voir comment le reste du cours est organisé
Pourquoi la Vision par Ordinateur est Difficile
Les humains résolvent de nombreuses tâches visuelles sans effort parce que nous avons des années d'expérience incarnée dans le monde. Les ordinateurs, non. La vision dans le monde réel est difficile parce que :
- l'éclairage change
- les objets ont une apparence différente selon le point de vue
- les scènes sont encombrées
- certains objets sont petits, flous ou occultés
- les caméras introduisent du bruit et des distorsions
- la vidéo ajoute le temps comme dimension supplémentaire
C'est pourquoi la vision par ordinateur est passée du simple traitement d'image au deep learning et aux systèmes multimodaux.
Tâches Principales en Vision par Ordinateur

Le domaine peut être divisé en plusieurs tâches principales :
| Tâche | Question Centrale | Exemple |
|---|---|---|
| Classification | Qu'y a-t-il dans l'image | chat vs chien, défectueux vs normal |
| Détection | Quels objets sont présents et où | personne, casque, véhicule |
| Segmentation | Quels pixels appartiennent à quelle région ou objet | zone de route, arrière-plan, contour du produit |
| Estimation de pose | Quels sont les points clés ou la structure corporelle | articulations humaines, points de repère de la main |
| Tracking | Quel objet détecté reste le même au fil du temps | suivre la personne 17 à travers la vidéo |
| OCR | Quel texte apparaît dans la scène | plaques d'immatriculation, étiquettes, reçus |
| Compréhension d'événement | Que s'est-il passé dans la scène | franchissement de ligne, intrusion, chute |
Image vs Vidéo
Une image capture un instant unique. Une vidéo est une séquence de trames évoluant dans le temps.
Cette distinction est importante car certaines tâches peuvent être résolues à partir d'une seule image, tandis que d'autres nécessitent un raisonnement temporel :
- la classification d'image fonctionne sur une seule trame
- le suivi d'objet nécessite une continuité entre les trames
- l'analyse d'événement dépend du mouvement et du temps
Le Pipeline de Vision Standard

Bien que les implémentations varient, de nombreux systèmes de vision par ordinateur suivent une logique commune :
- acquérir les données
- prétraiter les données
- exécuter un algorithme ou un modèle
- appliquer un post-traitement et une logique de décision
- produire un résultat ou déclencher une action
Malentendus Courants
- « La vision par ordinateur n'est que de la détection d'objets. »
- La détection est importante, mais le domaine est bien plus large.
- « Si un modèle fonctionne sur une image, il est prêt pour le déploiement. »
- Un déploiement réel nécessite une entrée stable, un contrôle de la latence et la gestion des défaillances.
- « La vidéo n'est qu'un ensemble d'images, ce n'est donc pas beaucoup plus difficile. »
- La vidéo introduit le temps, la continuité et des contraintes système.
Exercices / Réflexion
- Choisissez trois produits ou systèmes que vous utilisez au quotidien et identifiez où la vision par ordinateur peut être impliquée.
- Pour chacun des suivants, décidez s'il s'agit principalement d'une tâche de classification, détection, segmentation, tracking ou compréhension d'événement :
- le déverrouillage facial sur un téléphone
- compter les voitures dans un parking
- lire un reçu
- détecter si un travailleur porte un casque
- Écrivez un court paragraphe expliquant pourquoi la compréhension de vidéo est généralement plus difficile que la compréhension d'image.
Résumé
La vision par ordinateur consiste à transformer des données visuelles brutes en une compréhension utile. Elle inclut de nombreuses tâches, de la classification et la détection à l'OCR et au raisonnement sur les événements.