4.1 Introduction à la Vision par Ordinateur

Qu'est-ce que la CV ?

La vision par ordinateur (CV) est un domaine de l'intelligence artificielle qui permet aux ordinateurs d'interpréter et de comprendre les informations visuelles du monde, telles que des images et des vidéos. En utilisant des techniques comme le deep learning et la reconnaissance de motifs, les systèmes de vision par ordinateur peuvent identifier des objets, détecter des visages, suivre des mouvements et analyser des scènes avec une grande précision. Elle est largement utilisée dans des applications telles que la conduite autonome, l'imagerie médicale, la vidéosurveillance, l'inspection industrielle et la réalité augmentée, aidant les machines à prendre des décisions basées sur ce qu'elles « voient ».

img

Objectifs d'Apprentissage

À la fin de cette section, vous devriez être capable de :

  • expliquer ce qu'est la vision par ordinateur
  • décrire les principaux problèmes que le domaine cherche à résoudre
  • identifier les principaux domaines d'application
  • comprendre la différence entre la compréhension d'image et la compréhension de vidéo
  • voir comment le reste du cours est organisé

Pourquoi la Vision par Ordinateur est Difficile

Les humains résolvent de nombreuses tâches visuelles sans effort parce que nous avons des années d'expérience incarnée dans le monde. Les ordinateurs, non. La vision dans le monde réel est difficile parce que :

  • l'éclairage change
  • les objets ont une apparence différente selon le point de vue
  • les scènes sont encombrées
  • certains objets sont petits, flous ou occultés
  • les caméras introduisent du bruit et des distorsions
  • la vidéo ajoute le temps comme dimension supplémentaire

C'est pourquoi la vision par ordinateur est passée du simple traitement d'image au deep learning et aux systèmes multimodaux.

Tâches Principales en Vision par Ordinateur

img

Le domaine peut être divisé en plusieurs tâches principales :

TâcheQuestion CentraleExemple
ClassificationQu'y a-t-il dans l'imagechat vs chien, défectueux vs normal
DétectionQuels objets sont présents et oùpersonne, casque, véhicule
SegmentationQuels pixels appartiennent à quelle région ou objetzone de route, arrière-plan, contour du produit
Estimation de poseQuels sont les points clés ou la structure corporellearticulations humaines, points de repère de la main
TrackingQuel objet détecté reste le même au fil du tempssuivre la personne 17 à travers la vidéo
OCRQuel texte apparaît dans la scèneplaques d'immatriculation, étiquettes, reçus
Compréhension d'événementQue s'est-il passé dans la scènefranchissement de ligne, intrusion, chute

Image vs Vidéo

Une image capture un instant unique. Une vidéo est une séquence de trames évoluant dans le temps.

Cette distinction est importante car certaines tâches peuvent être résolues à partir d'une seule image, tandis que d'autres nécessitent un raisonnement temporel :

  • la classification d'image fonctionne sur une seule trame
  • le suivi d'objet nécessite une continuité entre les trames
  • l'analyse d'événement dépend du mouvement et du temps

Le Pipeline de Vision Standard

image-20260330175514717

Bien que les implémentations varient, de nombreux systèmes de vision par ordinateur suivent une logique commune :

  1. acquérir les données
  2. prétraiter les données
  3. exécuter un algorithme ou un modèle
  4. appliquer un post-traitement et une logique de décision
  5. produire un résultat ou déclencher une action

Malentendus Courants

  • « La vision par ordinateur n'est que de la détection d'objets. »
    • La détection est importante, mais le domaine est bien plus large.
  • « Si un modèle fonctionne sur une image, il est prêt pour le déploiement. »
    • Un déploiement réel nécessite une entrée stable, un contrôle de la latence et la gestion des défaillances.
  • « La vidéo n'est qu'un ensemble d'images, ce n'est donc pas beaucoup plus difficile. »
    • La vidéo introduit le temps, la continuité et des contraintes système.

Exercices / Réflexion

  1. Choisissez trois produits ou systèmes que vous utilisez au quotidien et identifiez où la vision par ordinateur peut être impliquée.
  2. Pour chacun des suivants, décidez s'il s'agit principalement d'une tâche de classification, détection, segmentation, tracking ou compréhension d'événement :
    • le déverrouillage facial sur un téléphone
    • compter les voitures dans un parking
    • lire un reçu
    • détecter si un travailleur porte un casque
  3. Écrivez un court paragraphe expliquant pourquoi la compréhension de vidéo est généralement plus difficile que la compréhension d'image.

Résumé

La vision par ordinateur consiste à transformer des données visuelles brutes en une compréhension utile. Elle inclut de nombreuses tâches, de la classification et la détection à l'OCR et au raisonnement sur les événements.