4.10 Tecnologías de visión de frontera y perspectivas
Por qué esto importa
La visión por computadora avanza rápido. Cada año aparecen nuevas familias de modelos, conjuntos de datos y flujos de trabajo de despliegue, y la frontera de hoy suele convertirse en las herramientas estándar de mañana. Más que perseguir cada lanzamiento, resulta más útil entender hacia dónde se dirige el campo y cómo se conecta con lo que ya has aprendido.
En concreto, la visión por computadora está evolucionando de la percepción de tareas fijas hacia sistemas de razonamiento multimodal más ricos. Esta sección final mira más allá del flujo de trabajo principal e introduce direcciones de frontera como:
VLM— modelos que ven imágenes y hablan sobre ellas, por ejemplo ejecutar un VLM en reComputer con Jetson Platform ServicesVLA— modelos que conectan la percepción y el lenguaje con la acción física, por ejemplo ajustar GR00T N1.5 para el brazo LeRobot SO-101 y desplegarlo en Jetson Thor- detección de vocabulario abierto — detectar conceptos descritos por prompts de texto en lugar de clases fijas, por ejemplo las alertas de comportamiento basadas en VLM de la demo Industrial Vision Monitoring de Seeed
- comprensión de vídeo — razonar sobre transmisiones y archivos en lugar de fotogramas individuales, por ejemplo construir un AI NVR con Jetson
- interacción multimodal — combinar visión, lenguaje y control en un solo sistema, por ejemplo controlar un SO-Arm con un agente de IA local en Jetson Thor
Esta sección también sirve como sección de resumen y perspectivas del curso.
Objetivos de aprendizaje
Al final de esta sección, deberías ser capaz de:
- explicar qué significan generalmente
VLMyVLA - entender por qué los sistemas de vocabulario abierto y multimodales son importantes
- conectar los métodos de frontera con los fundamentos estudiados en secciones anteriores
- reconocer dónde se están desplegando ya las técnicas de frontera en hardware edge
- identificar posibles direcciones de aprendizaje siguientes después de este curso
Conceptos clave / Teoría
Modelos de visión y lenguaje (VLMs)
Un VLM combina la comprensión visual con la capacidad lingüística.
En lugar de solo emitir cajas o etiquetas, un VLM puede ser capaz de:
- responder preguntas sobre una imagen o vídeo
- describir escenas en lenguaje natural
- producir resúmenes de vídeos largos
- responder a instrucciones basadas en prompts
Los VLM también se están volviendo prácticos en dispositivos edge. Los modelos abiertos y compactos ya pueden ejecutarse en hardware de la clase Jetson, así que puedes probar el flujo de trabajo tú mismo: Ejecutar un VLM en reComputer con Jetson Platform Services transmite vídeo a un servicio VLM al que puedes consultar en lenguaje natural, y Live VLM WebUI conecta una cámara USB a un VLM para responder preguntas sobre la escena en tiempo real.
Visión-Lenguaje-Acción (VLA)
Un sistema VLA va un paso más allá. Conecta la percepción y el lenguaje con la acción.
Esto es especialmente relevante en robótica e IA encarnada, donde el sistema puede necesitar:
- interpretar una escena visual
- entender una instrucción de alto nivel
- decidir qué acción tomar
La familia abierta Isaac GR00T de NVIDIA es un modelo base VLA representativo: toma la entrada de cámara y una descripción de la tarea en lenguaje natural, y produce acciones del robot. Seeed publica guías completas de extremo a extremo, como Ajustar GR00T N1.5 para el brazo LeRobot SO-101 y Ajustar GR00T N1.7 para el brazo reBot y desplegar en reComputer Robotics J601.
Detección de vocabulario abierto
Los detectores tradicionales se entrenan con conjuntos de clases fijos. Los sistemas de vocabulario abierto intentan detectar conceptos especificados por prompts de texto o por una comprensión semántica más amplia.
Esto es importante porque reduce la dependencia de conjuntos de etiquetas cerrados, pero también introduce desafíos en consistencia, velocidad y complejidad de despliegue. En producción, los equipos suelen combinar ambos enfoques: un detector rápido se encarga de las clases conocidas, mientras que un VLM añade razonamiento a nivel de escena encima. La demo Industrial Vision Monitoring de Seeed sigue exactamente este patrón, combinando la detección de personas y PPE con YOLO con alertas de comportamiento basadas en VLM en el edge.
Comprensión de vídeo
El futuro de la visión no se trata solo de fotogramas individuales. Cada vez más se trata de:
- razonamiento temporal a largo plazo
- interpretación de eventos
- resumen
- interacción humano-máquina en torno al vídeo
Estas capacidades ya están llegando a los productos edge. Por ejemplo, el AI NVR con reServer Jetson de Seeed combina la grabación con el análisis en tiempo real, y el servicio VLM de Jetson Platform Services permite hacer preguntas en lenguaje natural sobre transmisiones de vídeo en vivo.
De las demos a los sistemas
Un patrón se repite en todas estas direcciones: los modelos de frontera no eliminan la necesidad de construir sistemas; más bien elevan el nivel de exigencia. El streaming, el seguimiento, el almacenamiento, las alertas, la monitorización y los límites del hardware siguen importando, y son exactamente los temas tratados en las secciones 4.7 a 4.9. Si un VLM es el "cerebro" de un nuevo tipo de sistema, todo lo que este curso te ha enseñado sigue siendo el cuerpo.
Términos clave
VLM: Visual Language ModelVLA: Vision-Language-ActionOpen-Vocabulary: no restringido a un conjunto de etiquetas fijo y cerradoMultimodal: que combina más de una modalidad de datos como imagen y textoVideo Understanding: razonamiento sobre datos visuales temporalesEmbodied AI/Physical AI: sistemas de IA que perciben y actúan en el mundo físico
Errores comunes
- "Los modelos de frontera reemplazan a todos los detectores estándar."
- En muchos sistemas prácticos, los detectores estándar siguen siendo más eficientes y estables.
- "Si un VLM puede describir una escena, la detección ya no es importante."
- La detección, el seguimiento y la segmentación siguen siendo bloques de construcción centrales.
- "Lo más nuevo siempre es mejor para el despliegue."
- Los sistemas de frontera pueden ser más flexibles, pero suelen ser más caros y más difíciles de ejecutar en tiempo real.
Ejercicios / Reflexión
- Compara un detector estándar con un VLM. ¿Qué puede hacer uno que el otro no?
- Explica por qué la detección de vocabulario abierto es atractiva, pero también difícil de desplegar.
- Reflexiona sobre una aplicación donde VLA podría ser más útil que la percepción simple.
- Elige uno de los proyectos de Sigue aprendiendo con Seeed más abajo y explica qué conceptos de frontera utiliza y cómo se relacionan con los fundamentos de este curso.
- Escribe un breve resumen de cómo el curso pasó de la representación básica de imágenes a los sistemas multimodales de frontera.
Resumen
La visión por computadora se está expandiendo más allá de las tareas fijas hacia sistemas multimodales y orientados a la acción más ricos. Aunque estas direcciones de frontera crezcan, los fundamentos de representación de imágenes, procesamiento clásico, deep learning, entrenamiento, evaluación y despliegue siguen siendo esenciales.
Siguiente paso sugerido
Explora el apéndice AI NVR en reComputer para un proyecto completo, o vuelve a cualquier sección anterior para profundizar tu comprensión.
Sigue aprendiendo con Seeed
Si quieres seguir construyendo después de este curso, los siguientes tutoriales y repositorios de código abierto son buenos puntos de partida.
Visión de frontera en Jetson
- Ejecutar un VLM en reComputer con Jetson Platform Services — despliega un servicio VLM y consulta vídeo en vivo en lenguaje natural.
- Desplegar Live VLM WebUI en reComputer Jetson — conecta una cámara a un VLM para comprender la escena en tiempo real.
- AI NVR con reServer Jetson — construye un grabador de vídeo en red con IA usando Jetson Platform Services y DeepStream.
- Industrial Vision Monitoring — combina la detección con YOLO con el análisis de comportamiento con VLM para la monitorización de seguridad en el edge.
IA física y robótica
- Ajustar GR00T N1.5 para el brazo LeRobot SO-101 y desplegar en Jetson Thor — una guía completa de VLA: recolección de datos, ajuste fino y despliegue en el edge.
- Brazo reBot B601 RS con LeRobot — teleopera el brazo reBot y recolecta conjuntos de datos con LeRobot.
- Controlar SO-Arm con OpenClaw en Jetson Thor — orquesta un agente LLM local para controlar un brazo robótico.
Repositorios de código abierto
- reComputer-Jetson-for-Beginners — el repositorio de origen de este curso.
- jetson-examples — despliegue con un solo comando de aplicaciones de visión e IA generativa en Jetson.
- Industrial-security-demo — monitorización de seguridad en el edge con varias cámaras, con detección TensorRT, seguimiento y reglas de zona.
Cierre del curso
Este módulo ha seguido un arco de aprendizaje deliberado:
- comprender el campo
- comprender la representación de la imagen
- aprender métodos clásicos
- aprender la intuición de las redes neuronales
- mapear las principales tareas de visión en deep learning
- entrenar y evaluar un modelo
- exportar y desplegar a hardware edge
- comprender los pipelines en tiempo real
- comprender la integración de sistema con DeepStream y Jetson
- mirar hacia las tecnologías de visión de frontera
Si un alumno puede seguir esa secuencia con comprensión, no solo sabe ejecutar una demo. Ha empezado a pensar como un ingeniero de visión por computadora.