ASR + LLM + TTS Pipeline Bouwen

Introductie

Stel je voor dat je tegen je Jetson-apparaat praat en gesproken antwoorden ontvangt — net zoals praten met een vriend. Een ASR + LLM + TTS pipeline maakt dit mogelijk door drie AI-mogelijkheden te combineren in een complete spraakassistent die volledig offline werkt:

  • ASR (Automatische Spraakherkenning): Luister naar je stem en zet het om naar tekst
  • LLM (Large Language Model): Begrijp en genereer slimme antwoorden
  • TTS (Tekst-naar-Spraak): Zet de tekstreactie terug om naar natuurlijke spraak
Code
Microfoon --> [ASR] --> Tekst --> [LLM] --> Tekst --> [TTS] --> Luidspreker
               (Whisper)          (Ollama)          (Coqui/Riva)

voice-pipeline

Systeemvereisten

ComponentMinimumAanbevolen
ApparaatJetson Orin Nano 8GBJetson Orin NX 16GB / AGX Orin 32GB
AudioUSB-microfoonUSB-microfoon + luidsprekers
OSJetPack 6.2+Nieuwste JetPack 6.x
Opslag50GB vrij100GB+

Praktijk: Twee Direct Uitvoerbare Projecten

Hieronder staan twee complete, geteste projecten die de ASR + LLM + TTS pipeline op Jetson implementeren. Kies degene die bij je setup past en volg de handleiding.


Project 1: Voice LLM op reComputer + Reachy Mini

reachy

Een volledig lokale, laag-latentie spraak-interactieve robotassistent gebouwd op reComputer Mini J501 gecombineerd met de open-source robot Reachy Mini Lite.

ComponentTechnologie
ASRFunASR (ModelScope)
LLMOllama — Qwen2.5 7B
TTSCoqui TTS — Tacotron2-DDC-GST
HardwarereComputer Mini J501 + Reachy Mini Lite

Snelstart:

bash
# Stap 1: Installeer Ollama en download de LLM
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b

# Stap 2: Clone het project en installeer afhankelijkheden
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"

# Stap 3: Start de Reachy Mini daemon (Terminal 1)
reachy-mini-daemon

# Stap 4: Start de spraakassistent (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.py

Druk op R om opname te starten, S om te stoppen. Het systeem zal je spraak verwerken en met een gesproken antwoord reageren.

Voor de volledige walkthrough, zie: Lokale Voice LLM op reComputer Jetson voor Reachy Mini


Project 2: Lokale Spraakchatbot met NVIDIA Riva + Llama2

riva

Een complete spraakchatbot die NVIDIA Riva gebruikt voor ASR/TTS en Llama2 7B voor taalgeneratie, volledig draaiend op een Jetson AGX Orin zonder cloud-afhankelijkheid.

ComponentTechnologie
ASR + TTSNVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS
LLMLlama2 7B Chat via text-generation-inference
AudioReSpeaker USB Mic Array
HardwareJetson AGX Orin 32GB

Snelstart:

bash
# Stap 1: Installeer Riva Server (vereist NGC CLI + API-sleutel)
# Download en configureer riva_quickstart_arm64:2.13.1
# Bewerk config.sh: schakel ASR + TTS in, NLP/NMT uit
sudo bash riva_init.sh    # Download modellen (~5 min)
sudo bash riva_start.sh   # Start Riva server (blijf draaien)

# Stap 2: Start LLM inferentie server (Terminal 2)
# Met dusty-nv/jetson-containers + text-generation-inference
# Model geserveerd op poort 8899

# Stap 3: Voer de chatbot demo uit (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Gebruik --list-input-devices / --list-output-devices om je audio-apparaat-ID's te vinden

Drie terminals draaien tegelijk: Riva server, LLM server en de chatbot demo.

jetson-agx

Voor de volledige walkthrough, zie: Lokale Spraakchatbot: Riva en Llama2 op reComputer


Vergelijking

Project 1 (Reachy Mini)Project 2 (Riva + Llama2)
ASRFunASRNVIDIA Riva
TTSCoqui TTSNVIDIA Riva
LLMQwen2.5 7B (Ollama)Llama2 7B (TGI)
Min RAM8GB16GB
Spec. HWReachy Mini Lite robotReSpeaker USB Mic Array
TaalChinees (configureerbaar)Engels
MoeilijkheidGemakkelijkGemiddeld

Referenties

  • Jetson AI Lab — NVIDIA's officiële platform voor AI op Jetson
  • FunASR — Spraakherkennings toolkit
  • Coqui TTS — Open-source tekst-naar-spraak
  • NVIDIA Riva — GPU-versnelde spraak AI SDK
  • Ollama — Lokale LLM inferentie engine

Gefeliciteerd! Je hebt Module 5 voltooid en geleerd hoe je LLMs offline op je Jetson-apparaat kunt draaien en een complete spraakassistent-pipeline kunt bouwen!

Volgende: Ga naar Hoofdstuk 6: Generatieve AI-toepassingen of ga terug naar Hoofdstuk 5 Overzicht.