Construyendo el Pipeline ASR + LLM + TTS
Introducción
Imagina hablar con tu dispositivo Jetson y recibir respuestas habladas — tal como hablar con un amigo. Un pipeline ASR + LLM + TTS hace esto posible combinando tres capacidades de IA en un completo asistente de voz que funciona completamente sin conexión:
- ASR (Reconocimiento Automático del Habla): Escucha tu voz y conviértela a texto
- LLM (Modelo de Lenguaje Grande): Entiende y genera respuestas inteligentes
- TTS (Texto a Voz): Convierte la respuesta de texto de vuelta a habla natural
Micrófono --> [ASR] --> Texto --> [LLM] --> Texto --> [TTS] --> Altavoz
(Whisper) (Ollama) (Coqui/Riva)
Requisitos del Sistema
| Componente | Mínimo | Recomendado |
|---|---|---|
| Dispositivo | Jetson Orin Nano 8GB | Jetson Orin NX 16GB / AGX Orin 32GB |
| Audio | Micrófono USB | Micrófono USB + altavoces |
| SO | JetPack 6.2+ | Último JetPack 6.x |
| Almacenamiento | 50GB libre | 100GB+ |
Práctica: Dos Proyectos Listos para Ejecutar
A continuación se presentan dos proyectos completos y probados que implementan el pipeline ASR + LLM + TTS en Jetson. Elige el que coincida con tu configuración y sigue la guía.
Proyecto 1: Voice LLM en reComputer + Reachy Mini

Un asistente robótico de voz interactivo completamente local y de baja latencia construido sobre reComputer Mini J501 junto con el robot de código abierto Reachy Mini Lite.
| Componente | Tecnología |
|---|---|
| ASR | FunASR (ModelScope) |
| LLM | Ollama — Qwen2.5 7B |
| TTS | Coqui TTS — Tacotron2-DDC-GST |
| Hardware | reComputer Mini J501 + Reachy Mini Lite |
Inicio Rápido:
# Paso 1: Instalar Ollama y descargar el LLM
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
# Paso 2: Clonar el proyecto e instalar dependencias
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"
# Paso 3: Iniciar el demonio de Reachy Mini (Terminal 1)
reachy-mini-daemon
# Paso 4: Lanzar el asistente de voz (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.pyPresiona R para iniciar la grabación, S para detener. El sistema procesará tu voz y responderá con una respuesta hablada.
Para el tutorial completo, consulta: Desplegar Voice LLM Local en reComputer Jetson para Reachy Mini
Proyecto 2: Chatbot de Voz Local con NVIDIA Riva + Llama2

Un chatbot de voz completo usando NVIDIA Riva para ASR/TTS y Llama2 7B para generación de lenguaje, ejecutándose enteramente en un Jetson AGX Orin sin dependencia de la nube.
| Componente | Tecnología |
|---|---|
| ASR + TTS | NVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS |
| LLM | Llama2 7B Chat via text-generation-inference |
| Audio | ReSpeaker USB Mic Array |
| Hardware | Jetson AGX Orin 32GB |
Inicio Rápido:
# Paso 1: Instalar Riva Server (requiere NGC CLI + clave API)
# Descargar y configurar riva_quickstart_arm64:2.13.1
# Editar config.sh: habilitar ASR + TTS, deshabilitar NLP/NMT
sudo bash riva_init.sh # Descargar modelos (~5 min)
sudo bash riva_start.sh # Iniciar servidor Riva (mantener ejecutándose)
# Paso 2: Iniciar servidor de inferencia LLM (Terminal 2)
# Usando dusty-nv/jetson-containers + text-generation-inference
# Modelo servido en puerto 8899
# Paso 3: Ejecutar demo del chatbot (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Usa --list-input-devices / --list-output-devices para encontrar tus IDs de dispositivo de audioTres terminales se ejecutan simultáneamente: servidor Riva, servidor LLM y demo del chatbot.

Para el tutorial completo, consulta: Chatbot de Voz Local: Desplegar Riva y Llama2 en reComputer
Comparación
| Proyecto 1 (Reachy Mini) | Proyecto 2 (Riva + Llama2) | |
|---|---|---|
| ASR | FunASR | NVIDIA Riva |
| TTS | Coqui TTS | NVIDIA Riva |
| LLM | Qwen2.5 7B (Ollama) | Llama2 7B (TGI) |
| RAM Mín. | 8GB | 16GB |
| HW Especial | Robot Reachy Mini Lite | ReSpeaker USB Mic Array |
| Idioma | Chino (configurable) | Inglés |
| Dificultad | Fácil | Intermedio |
Referencias
- Jetson AI Lab — Plataforma oficial de NVIDIA para IA en Jetson
- FunASR — Kit de herramientas de reconocimiento de voz
- Coqui TTS — Texto a voz de código abierto
- NVIDIA Riva — SDK de IA de voz acelerado por GPU
- Ollama — Motor de inferencia LLM local
¡Felicitaciones! Has completado el Módulo 5 y has aprendido a ejecutar LLMs sin conexión en tu dispositivo Jetson y construir un pipeline completo de asistente de voz.
Siguiente: Avanza a Capítulo 6: Aplicaciones de IA Generativa o vuelve a la Descripción del Capítulo 5.