Modul 5: Offline-Großmodell-Entwicklung

In diesem Kapitel lernen Sie, wie Sie Large Language Models (LLMs) vollständig auf Ihrem Jetson-Gerät ausführen können – ohne Cloud, ohne API-Schlüssel, ohne dass Daten Ihr Gerät verlassen. Sie werden die Kernkonzepte von LLMs verstehen und dann praktisch mit drei beliebten Inferenz-Frameworks arbeiten: Ollama, llama.cpp und vLLM. Am Ende haben Sie einen vollständig offlinefähigen Sprachassistenten gebaut, der zuhört, denkt und spricht.

5-banner

Was Sie lernen werden

  • LLM-Grundlagen — was Modelle sind, wie Quantisierung funktioniert und was „Tokens" wirklich bedeuten
  • Ollama — Ein-Befehl-Modellbereitstellung für schnelles Experimentieren
  • llama.cpp — Leichtgewichtige C/C++-Inferenz mit feinkörniger Kontrolle über die Quantisierung
  • vLLM — Produktionsreife Bereitstellung mit kontinuierlichem Batching und OpenAI-kompatibler API
  • jetson-examples — Bereitstellung vorgefertigter AI-Demos mit einem einzigen Befehl
  • Sprach-Pipeline — ASR + LLM + TTS zu einem vollständigen offline Sprachassistenten kombinieren

Kursübersicht

Empfohlene Lernpfade

Wählen Sie einen Pfad basierend auf Ihrem Ziel:

Schnellstart — Starten Sie heute ein Modell

  1. 5.1 — Einführung in LLMs — Mentales Modell aufbauen
  2. 5.2 — Erste Schritte mit Ollama — Erster Chat in zwei Befehlen
  3. 5.5 — Jetson Examples Schnellstart — Vorgefertigte Demos erkunden

Framework-Tiefgang — Inferenz-Engines vergleichen

  1. 5.1 — Einführung in LLMs
  2. 5.2 — Ollama — Einfache Einrichtung
  3. 5.3 — llama.cpp — Leichtgewichtig & anpassbar
  4. 5.4 — vLLM — Hochdurchsatz-Bereitstellung

Sprachassistent — Bauen Sie etwas, das antwortet

  1. 5.1 — Einführung in LLMs
  2. 5.2 — Ollama oder 5.5 — jetson-examples — Modell zum Laufen bringen
  3. 5.6 — ASR + LLM + TTS Pipeline — Die vollständige Sprachschleife zusammenbauen

Hardware & Voraussetzungen

Mindestanforderungen an die Hardware

KomponenteMinimumEmpfohlen
GerätJetson Orin Nano 8GBJetson Orin NX 16GB Super
Speicher64 GB frei128 GB+ SSD
Swap8 GB16 GB+ für größere Modelle

Bevor Sie beginnen

  1. Kapitel 2 — reComputer Jetson Plattformübersicht
  2. Kapitel 3 — Grundlegende Tools und erste Schritte
  3. Docker installiert und konfiguriert (für Container-Beispiele)
  4. Grundlegende Vertrautheit mit dem Linux-Terminal

Die richtige Modellgröße wählen

Nicht sicher, welches Modell zu Ihrem Gerät passt? Starten Sie hier:

ModellgrößeBenötigter RAMFunktioniert aufTypische Geschwindigkeit
1–3B4–6 GBOrin Nano 4 GB+Schnell, interaktiv
7–8B8–12 GBOrin Nano 8 GB+Moderat, praktisch
13–14B16–24 GBOrin NX 16 GB+Langsamer, höhere Qualität
35B+48 GB+Nicht empfohlen für einzelnes GerätSehr langsam

Tipp: Beginnen Sie klein (3B), um den Workflow zu lernen, und skalieren Sie dann hoch, wenn Sie sich wohlfühlen.

Wichtige Begriffe

BegriffBedeutung
LLMLarge Language Model — ein neuronales Netz, das auf massiven Textdaten trainiert wurde, um Sprache zu verstehen und zu generieren
InferenzAusführung eines trainierten Modells zur Erzeugung von Ausgaben aus neuen Eingaben
QuantisierungKomprimierung von Modellgewichten (z.B. 16-bit → 4-bit) um weniger Speicher zu benötigen
KontextfensterDie maximale Anzahl von Tokens, die ein Modell gleichzeitig berücksichtigen kann
TokenEin Textstück (Wort, Subwort oder Zeichen), das das Modell verarbeitet
GGUFEin Dateiformat zur Speicherung quantisierter Modelle, optimiert für llama.cpp
ASRAutomatische Spracherkennung — Sprache zu Text
TTSText-zu-Sprache — Text zu gesprochener Audio

Referenzen


Bereit zu starten? Beginnen Sie mit Modul 5.1: Einführung in Large Language Models um die Grundlagen zu verstehen, oder gehen Sie direkt zu Modul 5.2: Erste Schritte mit Ollama wenn Sie Ihr erstes Modell sofort ausführen möchten.