4.10 Technologies de vision d'avant-garde et perspectives
Pourquoi c'est important
La vision par ordinateur avance vite. Chaque année voit apparaître de nouvelles familles de modèles, de nouveaux jeux de données et de nouveaux flux de travail de déploiement, et ce qui est de pointe aujourd'hui devient souvent l'outillage standard de demain. Plutôt que de courir après chaque nouvelle version, il est plus utile de comprendre où se dirige le domaine et comment cela se rattache à ce que vous avez déjà appris.
Concrètement, la vision par ordinateur évolue de la perception à tâche fixe vers des systèmes de raisonnement multimodal plus riches. Cette section finale regarde au-delà du flux de travail principal et introduit des directions de pointe telles que :
VLM— des modèles qui voient les images et en parlent, par exemple Exécuter un VLM sur reComputer avec Jetson Platform ServicesVLA— des modèles qui relient la perception et le langage à l'action physique, par exemple Affiner GR00T N1.5 pour le bras LeRobot SO-101 et déployer sur Jetson Thor- détection à vocabulaire ouvert — détecter des concepts décrits par des prompts texte plutôt que par des classes fixes, par exemple les alertes de comportement basées sur un VLM dans la démo Industrial Vision Monitoring de Seeed
- compréhension de vidéo — raisonner sur des flux et des archives plutôt que sur des images isolées, par exemple construire un AI NVR avec Jetson
- interaction multimodale — combiner vision, langage et contrôle dans un même système, par exemple Contrôler un SO-Arm avec un agent IA local sur Jetson Thor
Elle sert également de section de synthèse et de perspectives pour le cours.
Objectifs d'apprentissage
À la fin de cette section, vous devriez être capable de :
- expliquer ce que signifient généralement
VLMetVLA - comprendre pourquoi les systèmes à vocabulaire ouvert et multimodaux sont importants
- relier les méthodes de pointe aux fondations étudiées dans les sections précédentes
- reconnaître où les techniques de pointe sont déjà déployées sur du matériel edge
- identifier de possibles prochaines directions d'apprentissage après ce cours
Concepts clés / Théorie
Modèles vision-langage (VLMs)
Un VLM combine la compréhension visuelle avec la capacité langagière.
Au lieu de seulement produire des boîtes ou des étiquettes, un VLM peut être capable de :
- répondre à des questions sur une image ou une vidéo
- décrire des scènes en langage naturel
- produire des résumés de longues vidéos
- répondre à des instructions basées sur des prompts
Les VLM deviennent également utilisables sur les appareils edge. Des modèles ouverts et compacts peuvent désormais s'exécuter sur du matériel de la classe Jetson, et vous pouvez essayer le flux de travail vous-même : Exécuter un VLM sur reComputer avec Jetson Platform Services diffuse de la vidéo vers un service VLM que vous pouvez interroger en langage naturel, et Live VLM WebUI connecte une caméra USB à un VLM pour répondre à des questions sur la scène en temps réel.
Vision-Langage-Action (VLA)
Un système VLA va un cran plus loin. Il connecte la perception et le langage à l'action.
Cela est particulièrement pertinent en robotique et en IA incarnée, où le système peut avoir besoin de :
- interpréter une scène visuelle
- comprendre une instruction de haut niveau
- décider de l'action à entreprendre
La famille ouverte Isaac GR00T de NVIDIA est un modèle de fondation VLA représentatif : il prend en entrée le flux d'une caméra et une description de tâche en langage naturel, et produit les actions du robot. Seeed publie des guides complets de bout en bout, comme Affiner GR00T N1.5 pour le bras LeRobot SO-101 et Affiner GR00T N1.7 pour le bras reBot et déployer sur reComputer Robotics J601.
Détection à vocabulaire ouvert
Les détecteurs traditionnels sont entraînés sur des ensembles de classes fixes. Les systèmes à vocabulaire ouvert tentent de détecter des concepts spécifiés par des prompts texte ou une compréhension sémantique plus large.
C'est important car cela réduit la dépendance aux ensembles d'étiquettes fermés, mais cela introduit aussi des défis en matière de cohérence, de vitesse et de complexité de déploiement. En production, les équipes combinent souvent les deux : un détecteur rapide gère les classes connues, tandis qu'un VLM ajoute un raisonnement au niveau de la scène par-dessus. La démo Industrial Vision Monitoring de Seeed suit exactement ce schéma, en associant la détection YOLO des personnes et des PPE à des alertes de comportement par VLM en edge.
Compréhension de vidéo
L'avenir de la vision ne se limite pas aux images uniques. Il s'agit de plus en plus de :
- raisonnement temporel sur le long terme
- interprétation d'événements
- synthèse
- interaction homme-machine autour de la vidéo
Ces capacités arrivent déjà dans les produits edge. Par exemple, l'AI NVR avec reServer Jetson de Seeed combine l'enregistrement et l'analyse en temps réel, et le service VLM de Jetson Platform Services permet de poser des questions en langage naturel sur des flux vidéo en direct.
Des démos aux systèmes
Un même schéma se répète dans toutes ces directions : les modèles d'avant-garde ne suppriment pas le besoin de construire des systèmes — ils élèvent le niveau d'exigence. Le streaming, le suivi, le stockage, les alertes, la supervision et les limites matérielles comptent toujours, et ce sont précisément les sujets couverts dans les sections 4.7 à 4.9. Si un VLM est le « cerveau » d'un nouveau type de système, tout ce que ce cours vous a appris en reste le corps.
Termes clés
VLM: Modèle Vision-Langage (Visual Language Model)VLA: Vision-Langage-Action (Vision-Language-Action)Open-Vocabulary: non restreint à un ensemble d'étiquettes fixe et ferméMultimodal: combinant plus d'une modalité de données telle qu'image et texteVideo Understanding: raisonnement sur des données visuelles temporellesEmbodied AI/Physical AI: systèmes d'IA qui perçoivent et agissent dans le monde physique
Idées reçues fréquentes
- « Les modèles de pointe remplacent tous les détecteurs standard. »
- Dans de nombreux systèmes pratiques, les détecteurs standard restent plus efficaces et stables.
- « Si un VLM peut décrire une scène, la détection n'est plus importante. »
- La détection, le suivi et la segmentation restent des briques fondamentales.
- « Plus récent signifie toujours mieux pour le déploiement. »
- Les systèmes de pointe sont peut-être plus flexibles, mais ils sont souvent plus coûteux et plus difficiles à exécuter en temps réel.
Exercices / Réflexion
- Comparez un détecteur standard avec un VLM. Que peut faire l'un que l'autre ne peut pas ?
- Expliquez pourquoi la détection à vocabulaire ouvert est attrayante, mais aussi difficile à déployer.
- Réfléchissez à une application où VLA pourrait être plus utile qu'une simple perception.
- Choisissez un projet dans « Continuer à apprendre avec Seeed » ci-dessous et expliquez quels concepts d'avant-garde il utilise et comment ils se rattachent aux fondations de ce cours.
- Rédigez un court résumé sur la façon dont le cours est passé de la représentation d'image basique aux systèmes multimodaux de pointe.
Résumé
La vision par ordinateur s'étend au-delà des tâches fixes vers des systèmes multimodaux et orientés action plus riches. Même si ces directions de pointe se développent, les fondations de la représentation d'image, du traitement classique, du deep learning, de l'entraînement, de l'évaluation et du déploiement restent essentielles.
Étape suivante suggérée
Explorez l'annexe AI NVR sur reComputer pour un projet complet, ou revisitez n'importe quelle section antérieure pour approfondir votre compréhension.
Continuer à apprendre avec Seeed
Si vous voulez continuer à construire après ce cours, les tutoriels et dépôts open source suivants sont de bons points de départ.
La vision d'avant-garde sur Jetson
- Exécuter un VLM sur reComputer avec Jetson Platform Services — déployez un service VLM et interrogez la vidéo en direct en langage naturel.
- Déployer Live VLM WebUI sur reComputer Jetson — connectez une caméra à un VLM pour une compréhension de scène en temps réel.
- AI NVR avec reServer Jetson — construisez un enregistreur vidéo réseau IA avec Jetson Platform Services et DeepStream.
- Industrial Vision Monitoring — combinez la détection YOLO avec l'analyse de comportement par VLM pour la supervision de sécurité en edge.
IA physique et robotique
- Affiner GR00T N1.5 pour le bras LeRobot SO-101 et déployer sur Jetson Thor — un guide VLA complet : collecte de données, fine-tuning et déploiement en edge.
- Bras reBot B601 RS avec LeRobot — téléopérez le bras reBot et collectez des jeux de données avec LeRobot.
- Contrôler SO-Arm avec OpenClaw sur Jetson Thor — orchestrez un agent LLM local pour contrôler un bras robotique.
Dépôts open source
- reComputer-Jetson-for-Beginners — le dépôt source de ce cours.
- jetson-examples — déploiement en une commande d'applications de vision et d'IA générative sur Jetson.
- Industrial-security-demo — supervision de sécurité edge multi-caméras avec détection TensorRT, suivi et règles de zone.
Conclusion du cours
Ce module a suivi un arc d'apprentissage délibéré :
- comprendre le domaine
- comprendre la représentation de l'image
- apprendre les méthodes classiques
- apprendre l'intuition des réseaux de neurones
- cartographier les principales tâches de vision en deep learning
- entraîner et évaluer un modèle
- exporter et déployer sur du matériel edge
- comprendre les pipelines temps réel
- comprendre l'intégration système DeepStream et Jetson
- regarder vers les technologies de vision de pointe
Si un apprenant peut suivre cette séquence avec compréhension, il ne sait pas seulement faire tourner une démo. Il a commencé à penser comme un ingénieur en vision par ordinateur.