4.5 Tâches de Vision par Ordinateur en Deep Learning

Tâches Principales

La vision par ordinateur en deep learning couvre de nombreuses tâches qui aident les machines à comprendre les images et les vidéos. Les tâches courantes comprennent la classification d'images (décider quel est l'objet principal), la détection d'objets (trouver les objets et dessiner des cadres autour d'eux) et la segmentation (étiqueter chaque pixel ou séparer des objets individuels). Elle inclut aussi la détection de points clés pour des repères tels que les articulations du corps, le flot optique pour estimer le mouvement entre les trames, et la classification de vidéos pour comprendre les actions dans les vidéos.

En termes simples, ces tâches passent de répondre à « qu'y a-t-il dans l'image ? » à « où est-ce ? », « quelle est sa forme ? », et « comment cela bouge-t-il ? ».

cv-tasks

1. Classification d'Images

La classification d'images prédit une ou plusieurs étiquettes pour l'image entière.

Exemples :

  • chat vs chien
  • feuille saine vs feuille malade
  • produit normal vs produit défectueux

image-20260402090916279

Cette tâche est utile lorsque le contenu global compte plus que la position de l'objet.

2. Détection d'Objets

La détection d'objets prédit à la fois la catégorie et la position.

Exemples :

  • détection de personnes
  • détection de casques
  • détection de véhicules

image-20260402091838482

La détection est très importante car elle constitue la base de nombreuses tâches en aval telles que le comptage, le tracking et le raisonnement sur les événements.

3. Segmentation

La segmentation travaille au niveau du pixel.

alt text

Deux formes courantes :

  • segmentation sémantique : classer chaque pixel par catégorie
  • segmentation d'instance : séparer les objets individuels de la même catégorie

Exemples :

  • segmentation de la zone de route
  • extraction de contour de produit
  • suppression d'arrière-plan

4. Tracking d'Objets

Le tracking relie les détections au fil du temps.

img

Il répond à une question différente de la détection :

  • non seulement ce qu'il y a ici maintenant
  • mais quel objet reste le même au fil des trames

C'est essentiel pour :

  • compter les personnes
  • surveiller les mouvements
  • analyser le comportement

5. Estimation de Pose

L'estimation de pose prédit des points clés structurés tels que des articulations ou des repères.

img

Exemples :

  • estimation du squelette humain
  • repères de la main
  • estimation de pose animale

C'est utile lorsque la forme et la posture comptent plus qu'un simple cadre.

6. Reconnaissance Faciale

La reconnaissance faciale va au-delà de la détection d'un visage. Elle tente d'identifier ou de vérifier qui est la personne.

img

Cela implique généralement :

  • la détection de visages
  • l'alignement facial
  • l'extraction de caractéristiques
  • la comparaison ou le matching

Cette tâche introduit des préoccupations importantes concernant la vie privée, les biais et la sécurité.

7. OCR et Compréhension du Texte de Scène

L'OCR extrait du texte à partir d'images ou de vidéos.

Demo

Exemples :

  • reçus
  • étiquettes
  • plaques d'immatriculation
  • formulaires

L'OCR est l'un des exemples les plus clairs de vision interagissant avec le langage.

8. Compréhension d'Événements et de Comportements

Certains systèmes pratiques se soucient moins des objets statiques que des événements :

  • franchissement de ligne
  • intrusion
  • détection de chute
  • rôder

Ces tâches combinent souvent détection, tracking et logique basée sur des règles.

Malentendus Courants

  • « La détection suffit toujours. »
    • Certaines applications ont besoin de segmentation, d'estimation de pose, d'OCR ou de raisonnement temporel.
  • « Le tracking n'est que de la détection répétée. »
    • Le tracking nécessite aussi une continuité d'identité dans le temps.
  • « La reconnaissance faciale et la détection de visage sont la même chose. »
    • La détection trouve le visage. La reconnaissance identifie ou vérifie la personne.

Exercices / Réflexion

  1. Choisissez une application dans chacun des domaines suivants et identifiez la tâche de vision la plus appropriée :
    • retail intelligent
    • inspection en usine
    • analyse de trafic
    • traitement de documents
  2. Expliquez quand la segmentation est meilleure que la détection.
  3. Expliquez pourquoi le tracking est important dans l'analytique vidéo mais pas nécessaire dans chaque tâche d'image.

Résumé

La vision par ordinateur en deep learning comprend de nombreux types de tâches, chacun avec ses propres sorties, forces et applications. Comprendre cette carte des tâches aide l'apprenant à choisir le bon outil pour un problème. Dans la section suivante, le cours utilise YOLO26 comme cas pratique principal pour apprendre à entraîner et déployer un modèle personnalisé.

Étape Suivante Suggérée

Continuez vers 4.6 Entraîner et Déployer Votre Propre Modèle de Vision.

Référence :

https://github.com/NVIDIA/semantic-segmentation

https://github.com/yehengchen/Object-Detection-and-Tracking

https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation

https://github.com/ageitgey/face_recognition

https://github.com/RapidAI/RapidOCR