Construyendo el Pipeline ASR + LLM + TTS

Introducción

Imagina hablar con tu dispositivo Jetson y recibir respuestas habladas — tal como hablar con un amigo. Un pipeline ASR + LLM + TTS hace esto posible combinando tres capacidades de IA en un completo asistente de voz que funciona completamente sin conexión:

  • ASR (Reconocimiento Automático del Habla): Escucha tu voz y conviértela a texto
  • LLM (Modelo de Lenguaje Grande): Entiende y genera respuestas inteligentes
  • TTS (Texto a Voz): Convierte la respuesta de texto de vuelta a habla natural
Code
Micrófono --> [ASR] --> Texto --> [LLM] --> Texto --> [TTS] --> Altavoz
               (Whisper)          (Ollama)          (Coqui/Riva)

voice-pipeline

Requisitos del Sistema

ComponenteMínimoRecomendado
DispositivoJetson Orin Nano 8GBJetson Orin NX 16GB / AGX Orin 32GB
AudioMicrófono USBMicrófono USB + altavoces
SOJetPack 6.2+Último JetPack 6.x
Almacenamiento50GB libre100GB+

Práctica: Dos Proyectos Listos para Ejecutar

A continuación se presentan dos proyectos completos y probados que implementan el pipeline ASR + LLM + TTS en Jetson. Elige el que coincida con tu configuración y sigue la guía.


Proyecto 1: Voice LLM en reComputer + Reachy Mini

reachy

Un asistente robótico de voz interactivo completamente local y de baja latencia construido sobre reComputer Mini J501 junto con el robot de código abierto Reachy Mini Lite.

ComponenteTecnología
ASRFunASR (ModelScope)
LLMOllama — Qwen2.5 7B
TTSCoqui TTS — Tacotron2-DDC-GST
HardwarereComputer Mini J501 + Reachy Mini Lite

Inicio Rápido:

bash
# Paso 1: Instalar Ollama y descargar el LLM
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b

# Paso 2: Clonar el proyecto e instalar dependencias
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"

# Paso 3: Iniciar el demonio de Reachy Mini (Terminal 1)
reachy-mini-daemon

# Paso 4: Lanzar el asistente de voz (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.py

Presiona R para iniciar la grabación, S para detener. El sistema procesará tu voz y responderá con una respuesta hablada.

Para el tutorial completo, consulta: Desplegar Voice LLM Local en reComputer Jetson para Reachy Mini


Proyecto 2: Chatbot de Voz Local con NVIDIA Riva + Llama2

riva

Un chatbot de voz completo usando NVIDIA Riva para ASR/TTS y Llama2 7B para generación de lenguaje, ejecutándose enteramente en un Jetson AGX Orin sin dependencia de la nube.

ComponenteTecnología
ASR + TTSNVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS
LLMLlama2 7B Chat via text-generation-inference
AudioReSpeaker USB Mic Array
HardwareJetson AGX Orin 32GB

Inicio Rápido:

bash
# Paso 1: Instalar Riva Server (requiere NGC CLI + clave API)
# Descargar y configurar riva_quickstart_arm64:2.13.1
# Editar config.sh: habilitar ASR + TTS, deshabilitar NLP/NMT
sudo bash riva_init.sh    # Descargar modelos (~5 min)
sudo bash riva_start.sh   # Iniciar servidor Riva (mantener ejecutándose)

# Paso 2: Iniciar servidor de inferencia LLM (Terminal 2)
# Usando dusty-nv/jetson-containers + text-generation-inference
# Modelo servido en puerto 8899

# Paso 3: Ejecutar demo del chatbot (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Usa --list-input-devices / --list-output-devices para encontrar tus IDs de dispositivo de audio

Tres terminales se ejecutan simultáneamente: servidor Riva, servidor LLM y demo del chatbot.

jetson-agx

Para el tutorial completo, consulta: Chatbot de Voz Local: Desplegar Riva y Llama2 en reComputer


Comparación

Proyecto 1 (Reachy Mini)Proyecto 2 (Riva + Llama2)
ASRFunASRNVIDIA Riva
TTSCoqui TTSNVIDIA Riva
LLMQwen2.5 7B (Ollama)Llama2 7B (TGI)
RAM Mín.8GB16GB
HW EspecialRobot Reachy Mini LiteReSpeaker USB Mic Array
IdiomaChino (configurable)Inglés
DificultadFácilIntermedio

Referencias

  • Jetson AI Lab — Plataforma oficial de NVIDIA para IA en Jetson
  • FunASR — Kit de herramientas de reconocimiento de voz
  • Coqui TTS — Texto a voz de código abierto
  • NVIDIA Riva — SDK de IA de voz acelerado por GPU
  • Ollama — Motor de inferencia LLM local

¡Felicitaciones! Has completado el Módulo 5 y has aprendido a ejecutar LLMs sin conexión en tu dispositivo Jetson y construir un pipeline completo de asistente de voz.

Siguiente: Avanza a Capítulo 6: Aplicaciones de IA Generativa o vuelve a la Descripción del Capítulo 5.