Module 5: Offline Grote Model Ontwikkeling
Dit hoofdstuk begeleidt je door het volledig offline uitvoeren van Large Language Models (LLMs) op je Jetson-apparaat — geen cloud, geen API-sleutels, geen data die je hardware verlaten. Je leert de kernconcepten achter LLMs en gaat vervolgens praktisch aan de slag met drie populaire inferentie-frameworks: Ollama, llama.cpp en vLLM. Aan het eind heb je een volledig offline spraakassistent gebouwd die luistert, denkt en spreekt.

Wat Je Zult Leren
- LLM-fundamenten — wat modellen zijn, hoe kwantisatie werkt en wat "tokens" werkelijk betekenen
- Ollama — modelimplementatie met één commando voor snelle experimentatie
- llama.cpp — lichtgewicht C/C++-inferentie met fijnmazige controle over kwantisatie
- vLLM — productieklasse serving met continue batching en OpenAI-compatibele API
- jetson-examples — implementeer vooraf gebouwde AI-demos met één commando
- Spraak-pipeline — combineer ASR + LLM + TTS tot een complete offline spraakassistent
Cursusoverzicht
| Module | Onderwerp | Moeilijkheid |
|---|---|---|
| 5.1 | Introductie tot Large Language Models | Beginner |
| 5.2 | Aan de Slag met Ollama | Beginner |
| 5.3 | LLMs Uitvoeren met llama.cpp | Gevorderd |
| 5.4 | High-Performance Inferentie met vLLM | Expert |
| 5.5 | Jetson Examples Snelstart | Beginner |
| 5.6 | ASR + LLM + TTS Pipeline Bouwen | Gevorderd |
Voorgestelde Leerpaden
Kies een pad op basis van je doel:
Snelstart — Laat vandaag een model draaien
- 5.1 — Introductie tot LLMs — bouw het mentale model
- 5.2 — Aan de Slag met Ollama — eerste chat in twee commando's
- 5.5 — Jetson Examples Snelstart — verken vooraf gebouwde demos
Framework Diepgang — Vergelijk inferentiemotoren
- 5.1 — Introductie tot LLMs
- 5.2 — Ollama — eenvoudige setup
- 5.3 — llama.cpp — lichtgewicht & aanpasbaar
- 5.4 — vLLM — high-throughput serving
Spraakassistent — Bouw iets dat praat
- 5.1 — Introductie tot LLMs
- 5.2 — Ollama of 5.5 — jetson-examples — laat een model draaien
- 5.6 — ASR + LLM + TTS Pipeline — bouw de complete spraaklus
Hardware & Vereisten
Minimale Hardware
| Component | Minimum | Aanbevolen |
|---|---|---|
| Apparaat | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| Opslag | 64 GB vrij | 128 GB+ SSD |
| Swap | 8 GB | 16 GB+ voor grotere modellen |
Voordat Je Begint
- Hoofdstuk 2 — reComputer Jetson Platform Overzicht
- Hoofdstuk 3 — Basisgereedschap en Aan de Slag
- Docker geïnstalleerd en geconfigureerd (voor container-voorbeelden)
- Basisbekendheid met de Linux-terminal
De Juiste Modelgrootte Kiezen
Niet zeker welk model bij je apparaat past? Begin hier:
| Modelgrootte | Benodigde RAM | Werkt Op | Typische Snelheid |
|---|---|---|---|
| 1–3B | 4–6 GB | Orin Nano 4 GB+ | Snel, interactief |
| 7–8B | 8–12 GB | Orin Nano 8 GB+ | Matig, praktisch |
| 13–14B | 16–24 GB | Orin NX 16 GB+ | Langzamer, hogere kwaliteit |
| 35B+ | 48 GB+ | Niet aanbevolen voor één apparaat | Zeer langzaam |
Tip: Begin klein (3B) om de workflow te leren, schaal daarna omhoog als je je comfortabel voelt.
Belangrijke Termen
| Term | Wat Het Betekent |
|---|---|
| LLM | Large Language Model — een neuraal netwerk getraind op massieve tekstgegevens om taal te begrijpen en te genereren |
| Inferentie | Een getraind model uitvoeren om uitvoer te produceren uit nieuwe invoer |
| Kwantisatie | Modelgewichten comprimeren (bijv. 16-bit → 4-bit) om minder geheugen te gebruiken |
| Contextvenster | Het maximale aantal tokens dat een model tegelijk kan overwegen |
| Token | Een tekstfragment (woord, subwoord of teken) dat het model verwerkt |
| GGUF | Een bestandsformaat voor het opslaan van gekwantiseerde modellen, geoptimaliseerd voor llama.cpp |
| ASR | Automatische Spraakherkenning — spraak naar tekst |
| TTS | Tekst-naar-Spraak — tekst naar gesproken audio |
Referenties
- jetson-examples — Vooraf gebouwde AI-demos voor Jetson
- Ollama — Lokale LLM-runner
- llama.cpp — C/C++ inferentiemotor
- vLLM — High-throughput LLM serving
Klaar om te beginnen? Duik in Module 5.1: Introductie tot Large Language Models om de fundamenten te begrijpen, of ga direct naar Module 5.2: Aan de Slag met Ollama als je je eerste model meteen wilt draaien.