Construction d'un Pipeline ASR + LLM + TTS
Introduction
Imaginez parler à votre appareil Jetson et recevoir des réponses parlées — comme parler à un ami. Un pipeline ASR + LLM + TTS rend cela possible en combinant trois capacités d'IA en un assistant vocal complet qui fonctionne entièrement hors ligne :
- ASR (Reconnaissance Automatique de la Parole) : Écoutez votre voix et convertissez-la en texte
- LLM (Grand Modèle de Langage) : Comprenez et générez des réponses intelligentes
- TTS (Synthèse Vocale) : Convertissez la réponse textuelle en parole naturelle
Microphone --> [ASR] --> Texte --> [LLM] --> Texte --> [TTS] --> Haut-parleur
(Whisper) (Ollama) (Coqui/Riva)
Configuration Requise
| Composant | Minimum | Recommandé |
|---|---|---|
| Appareil | Jetson Orin Nano 8GB | Jetson Orin NX 16GB / AGX Orin 32GB |
| Audio | Microphone USB | Microphone USB + haut-parleurs |
| OS | JetPack 6.2+ | Dernier JetPack 6.x |
| Stockage | 50GB libre | 100GB+ |
Pratique : Deux Projets Prêts à Lancer
Voici deux projets complets et testés qui implémentent le pipeline ASR + LLM + TTS sur Jetson. Choisissez celui qui correspond à votre configuration et suivez le guide.
Projet 1 : Voice LLM sur reComputer + Reachy Mini

Un assistant robotique vocal interactif entièrement local et à faible latence, construit sur reComputer Mini J501 associé au robot open-source Reachy Mini Lite.
| Composant | Technologie |
|---|---|
| ASR | FunASR (ModelScope) |
| LLM | Ollama — Qwen2.5 7B |
| TTS | Coqui TTS — Tacotron2-DDC-GST |
| Matériel | reComputer Mini J501 + Reachy Mini Lite |
Démarrage Rapide :
# Étape 1 : Installer Ollama et télécharger le LLM
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
# Étape 2 : Cloner le projet et installer les dépendances
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"
# Étape 3 : Démarrer le démon Reachy Mini (Terminal 1)
reachy-mini-daemon
# Étape 4 : Lancer l'assistant vocal (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.pyAppuyez sur R pour démarrer l'enregistrement, S pour arrêter. Le système traitera votre parole et répondra avec une réponse parlée.
Pour le tutoriel complet, consultez : Déployer Voice LLM Local sur reComputer Jetson pour Reachy Mini
Projet 2 : Chatbot Vocal Local avec NVIDIA Riva + Llama2

Un chatbot vocal complet utilisant NVIDIA Riva pour ASR/TTS et Llama2 7B pour la génération de langage, fonctionnant entièrement sur un Jetson AGX Orin sans dépendance au cloud.
| Composant | Technologie |
|---|---|
| ASR + TTS | NVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS |
| LLM | Llama2 7B Chat via text-generation-inference |
| Audio | ReSpeaker USB Mic Array |
| Matériel | Jetson AGX Orin 32GB |
Démarrage Rapide :
# Étape 1 : Installer Riva Server (nécessite NGC CLI + clé API)
# Télécharger et configurer riva_quickstart_arm64:2.13.1
# Modifier config.sh : activer ASR + TTS, désactiver NLP/NMT
sudo bash riva_init.sh # Télécharger les modèles (~5 min)
sudo bash riva_start.sh # Démarrer le serveur Riva (garder actif)
# Étape 2 : Démarrer le serveur d'inférence LLM (Terminal 2)
# Utilisant dusty-nv/jetson-containers + text-generation-inference
# Modèle servi sur le port 8899
# Étape 3 : Exécuter la démo du chatbot (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Utilisez --list-input-devices / --list-output-devices pour trouver vos IDs de périphérique audioTrois terminaux fonctionnent simultanément : serveur Riva, serveur LLM et démo du chatbot.

Pour le tutoriel complet, consultez : Chatbot Vocal Local : Déployer Riva et Llama2 sur reComputer
Comparaison
| Projet 1 (Reachy Mini) | Projet 2 (Riva + Llama2) | |
|---|---|---|
| ASR | FunASR | NVIDIA Riva |
| TTS | Coqui TTS | NVIDIA Riva |
| LLM | Qwen2.5 7B (Ollama) | Llama2 7B (TGI) |
| RAM Min. | 8GB | 16GB |
| HW Spécial | Robot Reachy Mini Lite | ReSpeaker USB Mic Array |
| Langue | Chinois (configurable) | Anglais |
| Difficulté | Facile | Intermédiaire |
Références
- Jetson AI Lab — Plateforme officielle NVIDIA pour l'IA sur Jetson
- FunASR — Boîte à outils de reconnaissance vocale
- Coqui TTS — Synthèse vocale open-source
- NVIDIA Riva — SDK d'IA vocale accéléré par GPU
- Ollama — Moteur d'inférence LLM local
Félicitations ! Vous avez terminé le Module 5 et appris à exécuter des LLMs hors ligne sur votre appareil Jetson et à construire un pipeline complet d'assistant vocal !
Suivant : Passez au Chapitre 6 : Applications d'IA Générative ou retournez à la Vue d'ensemble du Chapitre 5.