Module 5: Offline Grote Model Ontwikkeling

Dit hoofdstuk begeleidt je door het volledig offline uitvoeren van Large Language Models (LLMs) op je Jetson-apparaat — geen cloud, geen API-sleutels, geen data die je hardware verlaten. Je leert de kernconcepten achter LLMs en gaat vervolgens praktisch aan de slag met drie populaire inferentie-frameworks: Ollama, llama.cpp en vLLM. Aan het eind heb je een volledig offline spraakassistent gebouwd die luistert, denkt en spreekt.

5-banner

Wat Je Zult Leren

  • LLM-fundamenten — wat modellen zijn, hoe kwantisatie werkt en wat "tokens" werkelijk betekenen
  • Ollama — modelimplementatie met één commando voor snelle experimentatie
  • llama.cpp — lichtgewicht C/C++-inferentie met fijnmazige controle over kwantisatie
  • vLLM — productieklasse serving met continue batching en OpenAI-compatibele API
  • jetson-examples — implementeer vooraf gebouwde AI-demos met één commando
  • Spraak-pipeline — combineer ASR + LLM + TTS tot een complete offline spraakassistent

Cursusoverzicht

Voorgestelde Leerpaden

Kies een pad op basis van je doel:

Snelstart — Laat vandaag een model draaien

  1. 5.1 — Introductie tot LLMs — bouw het mentale model
  2. 5.2 — Aan de Slag met Ollama — eerste chat in twee commando's
  3. 5.5 — Jetson Examples Snelstart — verken vooraf gebouwde demos

Framework Diepgang — Vergelijk inferentiemotoren

  1. 5.1 — Introductie tot LLMs
  2. 5.2 — Ollama — eenvoudige setup
  3. 5.3 — llama.cpp — lichtgewicht & aanpasbaar
  4. 5.4 — vLLM — high-throughput serving

Spraakassistent — Bouw iets dat praat

  1. 5.1 — Introductie tot LLMs
  2. 5.2 — Ollama of 5.5 — jetson-examples — laat een model draaien
  3. 5.6 — ASR + LLM + TTS Pipeline — bouw de complete spraaklus

Hardware & Vereisten

Minimale Hardware

ComponentMinimumAanbevolen
ApparaatJetson Orin Nano 8GBJetson Orin NX 16GB Super
Opslag64 GB vrij128 GB+ SSD
Swap8 GB16 GB+ voor grotere modellen

Voordat Je Begint

  1. Hoofdstuk 2 — reComputer Jetson Platform Overzicht
  2. Hoofdstuk 3 — Basisgereedschap en Aan de Slag
  3. Docker geïnstalleerd en geconfigureerd (voor container-voorbeelden)
  4. Basisbekendheid met de Linux-terminal

De Juiste Modelgrootte Kiezen

Niet zeker welk model bij je apparaat past? Begin hier:

ModelgrootteBenodigde RAMWerkt OpTypische Snelheid
1–3B4–6 GBOrin Nano 4 GB+Snel, interactief
7–8B8–12 GBOrin Nano 8 GB+Matig, praktisch
13–14B16–24 GBOrin NX 16 GB+Langzamer, hogere kwaliteit
35B+48 GB+Niet aanbevolen voor één apparaatZeer langzaam

Tip: Begin klein (3B) om de workflow te leren, schaal daarna omhoog als je je comfortabel voelt.

Belangrijke Termen

TermWat Het Betekent
LLMLarge Language Model — een neuraal netwerk getraind op massieve tekstgegevens om taal te begrijpen en te genereren
InferentieEen getraind model uitvoeren om uitvoer te produceren uit nieuwe invoer
KwantisatieModelgewichten comprimeren (bijv. 16-bit → 4-bit) om minder geheugen te gebruiken
ContextvensterHet maximale aantal tokens dat een model tegelijk kan overwegen
TokenEen tekstfragment (woord, subwoord of teken) dat het model verwerkt
GGUFEen bestandsformaat voor het opslaan van gekwantiseerde modellen, geoptimaliseerd voor llama.cpp
ASRAutomatische Spraakherkenning — spraak naar tekst
TTSTekst-naar-Spraak — tekst naar gesproken audio

Referenties


Klaar om te beginnen? Duik in Module 5.1: Introductie tot Large Language Models om de fundamenten te begrijpen, of ga direct naar Module 5.2: Aan de Slag met Ollama als je je eerste model meteen wilt draaien.