Aufbau einer ASR + LLM + TTS Pipeline

Einführung

Stellen Sie sich vor, Sie sprechen mit Ihrem Jetson-Gerät und erhalten gesprochene Antworten – genau wie mit einem Freund. Eine ASR + LLM + TTS Pipeline macht dies möglich, indem drei KI-Fähigkeiten zu einem vollständigen Sprachassistenten kombiniert werden, der vollständig offline läuft:

  • ASR (Automatische Spracherkennung): Hören Sie Ihre Stimme und wandeln Sie sie in Text um
  • LLM (Großes Sprachmodell): Verstehen und generieren Sie intelligente Antworten
  • TTS (Text-zu-Sprache): Wandeln Sie die Textantwort zurück in natürliche Sprache um
Code
Mikrofon --> [ASR] --> Text --> [LLM] --> Text --> [TTS] --> Lautsprecher
                (Whisper)          (Ollama)          (Coqui/Riva)

voice-pipeline

Systemanforderungen

KomponenteMinimumEmpfohlen
GerätJetson Orin Nano 8GBJetson Orin NX 16GB / AGX Orin 32GB
AudioUSB-MikrofonUSB-Mikrofon + Lautsprecher
OSJetPack 6.2+Neuestes JetPack 6.x
Speicher50GB frei100GB+

Praktische Übung: Zwei direkt lauffähige Projekte

Im Folgenden finden Sie zwei vollständige, getestete Projekte, die die ASR + LLM + TTS Pipeline auf Jetson implementieren. Wählen Sie das zu Ihrer Konfiguration passende Projekt und folgen Sie der Anleitung.


Projekt 1: Voice LLM auf reComputer + Reachy Mini

reachy

Ein vollständig lokaler, latenzarmer sprachinteraktiver Roboterassistent, basierend auf reComputer Mini J501 gepaart mit dem Open-Source-Roboter Reachy Mini Lite.

KomponenteTechnologie
ASRFunASR (ModelScope)
LLMOllama — Qwen2.5 7B
TTSCoqui TTS — Tacotron2-DDC-GST
HardwarereComputer Mini J501 + Reachy Mini Lite

Schnellstart:

bash
# Schritt 1: Ollama installieren und LLM herunterladen
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b

# Schritt 2: Projekt klonen und Abhängigkeiten installieren
git clone https://github.com/Seeed-Projects/reachy-mini-loacl-conversation.git
cd reachy-mini-loacl-conversation
pip install -r requirements.txt -i https://pypi.jetson-ai-lab.io/
pip install "reachy-mini"

# Schritt 3: Reachy Mini Daemon starten (Terminal 1)
reachy-mini-daemon

# Schritt 4: Sprachassistent starten (Terminal 2)
export OLLAMA_HOST="http://localhost:11434"
export OLLAMA_MODEL="qwen2.5:7b"
export COQUI_MODEL_NAME="tts_models/zh-CN/baker/tacotron2-DDC-GST"
export DEFAULT_VOLUME="1.5"
python main.py

Drücken Sie R um die Aufnahme zu starten, S um sie zu stoppen. Das System verarbeitet Ihre Sprache und antwortet mit einer gesprochenen Antwort.

Die vollständige Anleitung finden Sie hier: Lokales Voice LLM auf reComputer Jetson für Reachy Mini bereitstellen


Projekt 2: Lokaler Sprach-Chatbot mit NVIDIA Riva + Llama2

riva

Ein vollständiger Sprach-Chatbot, der NVIDIA Riva für ASR/TTS und Llama2 7B für die Sprachgenerierung verwendet, vollständig auf einem Jetson AGX Orin ohne Cloud-Abhängigkeit.

KomponenteTechnologie
ASR + TTSNVIDIA Riva — Conformer ASR + FastPitch/HiFiGAN TTS
LLMLlama2 7B Chat via text-generation-inference
AudioReSpeaker USB Mic Array
HardwareJetson AGX Orin 32GB

Schnellstart:

bash
# Schritt 1: Riva Server installieren (erfordert NGC CLI + API-Schlüssel)
# riva_quickstart_arm64:2.13.1 herunterladen und konfigurieren
# config.sh bearbeiten: ASR + TTS aktivieren, NLP/NMT deaktivieren
sudo bash riva_init.sh    # Modelle herunterladen (~5 Min)
sudo bash riva_start.sh   # Riva Server starten (weiterlaufen lassen)

# Schritt 2: LLM-Inferenzserver starten (Terminal 2)
# Mit dusty-nv/jetson-containers + text-generation-inference
# Modell wird auf Port 8899 bereitgestellt

# Schritt 3: Chatbot-Demo ausführen (Terminal 3)
python3 local_chatbot.py --input-device <id> --output-device <id>
# Verwenden Sie --list-input-devices / --list-output-devices um Ihre Audio-Geräte-IDs zu finden

Drei Terminals laufen gleichzeitig: Riva Server, LLM Server und die Chatbot-Demo.

jetson-agx

Die vollständige Anleitung finden Sie hier: Lokaler Sprach-Chatbot: Riva und Llama2 auf reComputer bereitstellen


Vergleich

Projekt 1 (Reachy Mini)Projekt 2 (Riva + Llama2)
ASRFunASRNVIDIA Riva
TTSCoqui TTSNVIDIA Riva
LLMQwen2.5 7B (Ollama)Llama2 7B (TGI)
Min. RAM8GB16GB
Spezial-HWReachy Mini Lite RoboterReSpeaker USB Mic Array
SpracheChinesisch (konfigurierbar)Englisch
SchwierigkeitEinfachMittel

Referenzen

  • Jetson AI Lab — NVIDIA's offizielle Plattform für KI auf Jetson
  • FunASR — Spracherkennung-Toolkit
  • Coqui TTS — Open-Source Text-zu-Sprache
  • NVIDIA Riva — GPU-beschleunigtes Sprach-KI-SDK
  • Ollama — Lokale LLM-Inferenz-Engine

Herzlichen Glückwunsch! Sie haben Modul 5 abgeschlossen und gelernt, wie man LLMs offline auf Ihrem Jetson-Gerät ausführt und eine vollständige Sprachassistent-Pipeline baut!

Weiter: Fahren Sie mit Kapitel 6: Generative KI-Anwendungen fort oder kehren Sie zur Übersicht von Kapitel 5 zurück.