Aufbau einer ASR + LLM + TTS Pipeline
Einführung
Stellen Sie sich vor, Sie sprechen mit Ihrem Jetson-Gerät und erhalten gesprochene Antworten – genau wie mit einem Freund. Eine ASR + LLM + TTS Pipeline macht dies möglich, indem drei KI-Fähigkeiten zu einem vollständigen Sprachassistenten kombiniert werden, der vollständig offline läuft:
- ASR (Automatische Spracherkennung): Hören Sie Ihre Stimme und wandeln Sie sie in Text um
- LLM (Großes Sprachmodell): Verstehen und generieren Sie intelligente Antworten
- TTS (Text-zu-Sprache): Wandeln Sie die Textantwort zurück in natürliche Sprache um
Mikrofon --> [ASR] --> Text --> [LLM] --> Text --> [TTS] --> Lautsprecher
(Whisper) (Ollama) (Coqui/Riva)
Systemanforderungen
| Komponente | Minimum | Empfohlen |
|---|---|---|
| Gerät | Jetson Orin Nano 8GB | Jetson Orin NX 16GB / AGX Orin 32GB |
| Audio | USB-Mikrofon | USB-Mikrofon + Lautsprecher |
| OS | JetPack 6.2+ | Neuestes JetPack 6.x |
| Speicher | 50GB frei | 100GB+ |
Praktische Übung: Zwei direkt lauffähige Projekte
Im Folgenden finden Sie zwei vollständige, getestete Projekte, die die ASR + LLM + TTS Pipeline auf Jetson implementieren. Wählen Sie das zu Ihrer Konfiguration passende Projekt und folgen Sie der Anleitung.
Projekt 1: Voice LLM auf reComputer + Reachy Mini

Ein vollständig lokaler, latenzarmer sprachinteraktiver Roboterassistent, basierend auf reComputer Mini J501 gepaart mit dem Open-Source-Roboter Reachy Mini Lite.
| Komponente | Technologie |
|---|---|
| ASR | FunASR (ModelScope) |
| LLM | Ollama — Qwen2.5 7B |
| TTS | Coqui TTS — Tacotron2-DDC-GST |
| Hardware | reComputer Mini J501 + Reachy Mini Lite |
Schnellstart:
# Schritt 1: Ollama installieren und LLM herunterladen
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
# Schritt 2: Projekt klonen und Abhängigkeiten installieren
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"
# Schritt 3: Reachy Mini Daemon starten (Terminal 1)
reachy-mini-daemon
# Schritt 4: Sprachassistent starten (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.pyDrücken Sie R um die Aufnahme zu starten, S um sie zu stoppen. Das System verarbeitet Ihre Sprache und antwortet mit einer gesprochenen Antwort.
Die vollständige Anleitung finden Sie hier: Lokales Voice LLM auf reComputer Jetson für Reachy Mini bereitstellen
Projekt 2: Lokaler Sprach-Chatbot mit NVIDIA Riva + Llama2

Ein vollständiger Sprach-Chatbot, der NVIDIA Riva für ASR/TTS und Llama2 7B für die Sprachgenerierung verwendet, vollständig auf einem Jetson AGX Orin ohne Cloud-Abhängigkeit.
| Komponente | Technologie |
|---|---|
| ASR + TTS | NVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS |
| LLM | Llama2 7B Chat via text-generation-inference |
| Audio | ReSpeaker USB Mic Array |
| Hardware | Jetson AGX Orin 32GB |
Schnellstart:
# Schritt 1: Riva Server installieren (erfordert NGC CLI + API-Schlüssel)
# riva_quickstart_arm64:2.13.1 herunterladen und konfigurieren
# config.sh bearbeiten: ASR + TTS aktivieren, NLP/NMT deaktivieren
sudo bash riva_init.sh # Modelle herunterladen (~5 Min)
sudo bash riva_start.sh # Riva Server starten (weiterlaufen lassen)
# Schritt 2: LLM-Inferenzserver starten (Terminal 2)
# Mit dusty-nv/jetson-containers + text-generation-inference
# Modell wird auf Port 8899 bereitgestellt
# Schritt 3: Chatbot-Demo ausführen (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Verwenden Sie --list-input-devices / --list-output-devices um Ihre Audio-Geräte-IDs zu findenDrei Terminals laufen gleichzeitig: Riva Server, LLM Server und die Chatbot-Demo.

Die vollständige Anleitung finden Sie hier: Lokaler Sprach-Chatbot: Riva und Llama2 auf reComputer bereitstellen
Vergleich
| Projekt 1 (Reachy Mini) | Projekt 2 (Riva + Llama2) | |
|---|---|---|
| ASR | FunASR | NVIDIA Riva |
| TTS | Coqui TTS | NVIDIA Riva |
| LLM | Qwen2.5 7B (Ollama) | Llama2 7B (TGI) |
| Min. RAM | 8GB | 16GB |
| Spezial-HW | Reachy Mini Lite Roboter | ReSpeaker USB Mic Array |
| Sprache | Chinesisch (konfigurierbar) | Englisch |
| Schwierigkeit | Einfach | Mittel |
Referenzen
- Jetson AI Lab — NVIDIA's offizielle Plattform für KI auf Jetson
- FunASR — Spracherkennung-Toolkit
- Coqui TTS — Open-Source Text-zu-Sprache
- NVIDIA Riva — GPU-beschleunigtes Sprach-KI-SDK
- Ollama — Lokale LLM-Inferenz-Engine
Herzlichen Glückwunsch! Sie haben Modul 5 abgeschlossen und gelernt, wie man LLMs offline auf Ihrem Jetson-Gerät ausführt und eine vollständige Sprachassistent-Pipeline baut!
Weiter: Fahren Sie mit Kapitel 6: Generative KI-Anwendungen fort oder kehren Sie zur Übersicht von Kapitel 5 zurück.