Modul 5: Offline-Großmodell-Entwicklung
In diesem Kapitel lernen Sie, wie Sie Large Language Models (LLMs) vollständig auf Ihrem Jetson-Gerät ausführen können – ohne Cloud, ohne API-Schlüssel, ohne dass Daten Ihr Gerät verlassen. Sie werden die Kernkonzepte von LLMs verstehen und dann praktisch mit drei beliebten Inferenz-Frameworks arbeiten: Ollama, llama.cpp und vLLM. Am Ende haben Sie einen vollständig offlinefähigen Sprachassistenten gebaut, der zuhört, denkt und spricht.

Was Sie lernen werden
- LLM-Grundlagen — was Modelle sind, wie Quantisierung funktioniert und was „Tokens" wirklich bedeuten
- Ollama — Ein-Befehl-Modellbereitstellung für schnelles Experimentieren
- llama.cpp — Leichtgewichtige C/C++-Inferenz mit feinkörniger Kontrolle über die Quantisierung
- vLLM — Produktionsreife Bereitstellung mit kontinuierlichem Batching und OpenAI-kompatibler API
- jetson-examples — Bereitstellung vorgefertigter AI-Demos mit einem einzigen Befehl
- Sprach-Pipeline — ASR + LLM + TTS zu einem vollständigen offline Sprachassistenten kombinieren
Kursübersicht
| Modul | Thema | Schwierigkeit |
|---|---|---|
| 5.1 | Einführung in Large Language Models | Anfänger |
| 5.2 | Erste Schritte mit Ollama | Anfänger |
| 5.3 | LLMs mit llama.cpp ausführen | Fortgeschritten |
| 5.4 | Hochleistungs-Inferenz mit vLLM | Experte |
| 5.5 | Jetson Examples Schnellstart | Anfänger |
| 5.6 | ASR + LLM + TTS Pipeline erstellen | Fortgeschritten |
Empfohlene Lernpfade
Wählen Sie einen Pfad basierend auf Ihrem Ziel:
Schnellstart — Starten Sie heute ein Modell
- 5.1 — Einführung in LLMs — Mentales Modell aufbauen
- 5.2 — Erste Schritte mit Ollama — Erster Chat in zwei Befehlen
- 5.5 — Jetson Examples Schnellstart — Vorgefertigte Demos erkunden
Framework-Tiefgang — Inferenz-Engines vergleichen
- 5.1 — Einführung in LLMs
- 5.2 — Ollama — Einfache Einrichtung
- 5.3 — llama.cpp — Leichtgewichtig & anpassbar
- 5.4 — vLLM — Hochdurchsatz-Bereitstellung
Sprachassistent — Bauen Sie etwas, das antwortet
- 5.1 — Einführung in LLMs
- 5.2 — Ollama oder 5.5 — jetson-examples — Modell zum Laufen bringen
- 5.6 — ASR + LLM + TTS Pipeline — Die vollständige Sprachschleife zusammenbauen
Hardware & Voraussetzungen
Mindestanforderungen an die Hardware
| Komponente | Minimum | Empfohlen |
|---|---|---|
| Gerät | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| Speicher | 64 GB frei | 128 GB+ SSD |
| Swap | 8 GB | 16 GB+ für größere Modelle |
Bevor Sie beginnen
- Kapitel 2 — reComputer Jetson Plattformübersicht
- Kapitel 3 — Grundlegende Tools und erste Schritte
- Docker installiert und konfiguriert (für Container-Beispiele)
- Grundlegende Vertrautheit mit dem Linux-Terminal
Die richtige Modellgröße wählen
Nicht sicher, welches Modell zu Ihrem Gerät passt? Starten Sie hier:
| Modellgröße | Benötigter RAM | Funktioniert auf | Typische Geschwindigkeit |
|---|---|---|---|
| 1–3B | 4–6 GB | Orin Nano 4 GB+ | Schnell, interaktiv |
| 7–8B | 8–12 GB | Orin Nano 8 GB+ | Moderat, praktisch |
| 13–14B | 16–24 GB | Orin NX 16 GB+ | Langsamer, höhere Qualität |
| 35B+ | 48 GB+ | Nicht empfohlen für einzelnes Gerät | Sehr langsam |
Tipp: Beginnen Sie klein (3B), um den Workflow zu lernen, und skalieren Sie dann hoch, wenn Sie sich wohlfühlen.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| LLM | Large Language Model — ein neuronales Netz, das auf massiven Textdaten trainiert wurde, um Sprache zu verstehen und zu generieren |
| Inferenz | Ausführung eines trainierten Modells zur Erzeugung von Ausgaben aus neuen Eingaben |
| Quantisierung | Komprimierung von Modellgewichten (z.B. 16-bit → 4-bit) um weniger Speicher zu benötigen |
| Kontextfenster | Die maximale Anzahl von Tokens, die ein Modell gleichzeitig berücksichtigen kann |
| Token | Ein Textstück (Wort, Subwort oder Zeichen), das das Modell verarbeitet |
| GGUF | Ein Dateiformat zur Speicherung quantisierter Modelle, optimiert für llama.cpp |
| ASR | Automatische Spracherkennung — Sprache zu Text |
| TTS | Text-zu-Sprache — Text zu gesprochener Audio |
Referenzen
- jetson-examples — Vorgefertigte AI-Demos für Jetson
- Ollama — Lokaler LLM-Runner
- llama.cpp — C/C++ Inferenz-Engine
- vLLM — Hochdurchsatz LLM-Bereitstellung
Bereit zu starten? Beginnen Sie mit Modul 5.1: Einführung in Large Language Models um die Grundlagen zu verstehen, oder gehen Sie direkt zu Modul 5.2: Erste Schritte mit Ollama wenn Sie Ihr erstes Modell sofort ausführen möchten.