Construction d'un Pipeline ASR + LLM + TTS

Introduction

Imaginez parler à votre appareil Jetson et recevoir des réponses parlées — comme parler à un ami. Un pipeline ASR + LLM + TTS rend cela possible en combinant trois capacités d'IA en un assistant vocal complet qui fonctionne entièrement hors ligne :

  • ASR (Reconnaissance Automatique de la Parole) : Écoutez votre voix et convertissez-la en texte
  • LLM (Grand Modèle de Langage) : Comprenez et générez des réponses intelligentes
  • TTS (Synthèse Vocale) : Convertissez la réponse textuelle en parole naturelle
Code
Microphone --> [ASR] --> Texte --> [LLM] --> Texte --> [TTS] --> Haut-parleur
                (Whisper)          (Ollama)          (Coqui/Riva)

voice-pipeline

Configuration Requise

ComposantMinimumRecommandé
AppareilJetson Orin Nano 8GBJetson Orin NX 16GB / AGX Orin 32GB
AudioMicrophone USBMicrophone USB + haut-parleurs
OSJetPack 6.2+Dernier JetPack 6.x
Stockage50GB libre100GB+

Pratique : Deux Projets Prêts à Lancer

Voici deux projets complets et testés qui implémentent le pipeline ASR + LLM + TTS sur Jetson. Choisissez celui qui correspond à votre configuration et suivez le guide.


Projet 1 : Voice LLM sur reComputer + Reachy Mini

reachy

Un assistant robotique vocal interactif entièrement local et à faible latence, construit sur reComputer Mini J501 associé au robot open-source Reachy Mini Lite.

ComposantTechnologie
ASRFunASR (ModelScope)
LLMOllama — Qwen2.5 7B
TTSCoqui TTS — Tacotron2-DDC-GST
MatérielreComputer Mini J501 + Reachy Mini Lite

Démarrage Rapide :

bash
# Étape 1 : Installer Ollama et télécharger le LLM
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b

# Étape 2 : Cloner le projet et installer les dépendances
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"

# Étape 3 : Démarrer le démon Reachy Mini (Terminal 1)
reachy-mini-daemon

# Étape 4 : Lancer l'assistant vocal (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.py

Appuyez sur R pour démarrer l'enregistrement, S pour arrêter. Le système traitera votre parole et répondra avec une réponse parlée.

Pour le tutoriel complet, consultez : Déployer Voice LLM Local sur reComputer Jetson pour Reachy Mini


Projet 2 : Chatbot Vocal Local avec NVIDIA Riva + Llama2

riva

Un chatbot vocal complet utilisant NVIDIA Riva pour ASR/TTS et Llama2 7B pour la génération de langage, fonctionnant entièrement sur un Jetson AGX Orin sans dépendance au cloud.

ComposantTechnologie
ASR + TTSNVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS
LLMLlama2 7B Chat via text-generation-inference
AudioReSpeaker USB Mic Array
MatérielJetson AGX Orin 32GB

Démarrage Rapide :

bash
# Étape 1 : Installer Riva Server (nécessite NGC CLI + clé API)
# Télécharger et configurer riva_quickstart_arm64:2.13.1
# Modifier config.sh : activer ASR + TTS, désactiver NLP/NMT
sudo bash riva_init.sh    # Télécharger les modèles (~5 min)
sudo bash riva_start.sh   # Démarrer le serveur Riva (garder actif)

# Étape 2 : Démarrer le serveur d'inférence LLM (Terminal 2)
# Utilisant dusty-nv/jetson-containers + text-generation-inference
# Modèle servi sur le port 8899

# Étape 3 : Exécuter la démo du chatbot (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Utilisez --list-input-devices / --list-output-devices pour trouver vos IDs de périphérique audio

Trois terminaux fonctionnent simultanément : serveur Riva, serveur LLM et démo du chatbot.

jetson-agx

Pour le tutoriel complet, consultez : Chatbot Vocal Local : Déployer Riva et Llama2 sur reComputer


Comparaison

Projet 1 (Reachy Mini)Projet 2 (Riva + Llama2)
ASRFunASRNVIDIA Riva
TTSCoqui TTSNVIDIA Riva
LLMQwen2.5 7B (Ollama)Llama2 7B (TGI)
RAM Min.8GB16GB
HW SpécialRobot Reachy Mini LiteReSpeaker USB Mic Array
LangueChinois (configurable)Anglais
DifficultéFacileIntermédiaire

Références

  • Jetson AI Lab — Plateforme officielle NVIDIA pour l'IA sur Jetson
  • FunASR — Boîte à outils de reconnaissance vocale
  • Coqui TTS — Synthèse vocale open-source
  • NVIDIA Riva — SDK d'IA vocale accéléré par GPU
  • Ollama — Moteur d'inférence LLM local

Félicitations ! Vous avez terminé le Module 5 et appris à exécuter des LLMs hors ligne sur votre appareil Jetson et à construire un pipeline complet d'assistant vocal !

Suivant : Passez au Chapitre 6 : Applications d'IA Générative ou retournez à la Vue d'ensemble du Chapitre 5.