Aan de Slag met Ollama
Introductie
Ollama is de eenvoudigste manier om Large Language Models (LLMs) lokaal uit te voeren. Denk eraan als "Docker voor LLMs" — het handelt modeldownloads, opslag en inferentie af met een schone command-line interface. Geen complexe setup, geen afhankelijkheidsproblemen — één commando om te installeren, één commando om te beginnen met chatten.
In deze module leer je:
- Ollama op je Jetson-apparaat installeren
- Je eerste LLM downloaden en uitvoeren
- Verschillende modellen en hun mogelijkheden verkennen
- Een webgebaseerde chatinterface instellen met Open WebUI


Waarom Ollama?
| Functie | Beschrijving |
|---|---|
| Eén-regel installatie | Enkel commando om te starten |
| Automatisch modelbeheer | Downloadt en beheert automatisch modelbestanden |
| Eenvoudige commando's | ollama run modelnaam om te beginnen met chatten |
| REST API | Ingebouwde HTTP-server voor integratie |
| Meerdere modellen | Verschillende modellen parallel uitvoeren |
| OpenAI-compatibel | API compatibel met OpenAI-interface |
Systeemvereisten
Voordat je Ollama installeert, zorg ervoor dat je Jetson-apparaat aan deze vereisten voldoet:
| Vereiste | Minimum | Aanbevolen |
|---|---|---|
| JetPack | 5.1+ | 6.0+ |
| RAM | 8GB | 16GB+ |
| Opslag | 10GB vrij | 50GB+ (voor meerdere modellen) |
| Swap | 8GB | 16GB |
Eerste gebruikers: Als je nog geen swap-ruimte op je Jetson hebt ingesteld, bekijk dan Hoofdstuk 3: Swap-configuratie
Ollama Installeren
Methode 1: Directe Installatie (Aanbevolen)
Open een terminal op je Jetson-apparaat en voer uit:
# Ollama downloaden en installeren
curl -fsSL https://ollama.com/install.sh | shHet installatiescript zal:
- Je systeemarchitectuur detecteren (ARM64)
- De juiste Ollama-binary downloaden
- De systemd-service instellen
- De installatie verifiëren
Installatie Verifiëren
# Ollama-versie controleren
ollama --version
# Controleren of de service draait
systemctl status ollamaJe Eerste LLM-interactie
Laten we nu je eerste LLM uitvoeren. Ollama zal het model automatisch downloaden bij de eerste keer draaien.
Je kunt de ondersteunde modellen van Ollama hier vinden. Selecteer het model dat je op je apparaat wilt deployen.
Een Model Uitvoeren
# Bijvoorbeeld
ollama run qwen3.5:2bZodra gedownload, zie je een chat-prompt:
What is NVIDIA Jetson?Nuttige Chat-commando's
| Commando | Beschrijving |
|---|---|
/? | Hulp weergeven |
/bye | Gesprek beëindigen |
Ctrl+D | Gesprek beëindigen |
/clear | Conversatiegeschiedenis wissen |
/history | Conversatiegeschiedenis weergeven |
Verschillende Modellen Verkennen
Vision-Language Models (Multimodaal)
# Qwen3.5 - Afbeeldingen en tekst begrijpen
ollama run qwen3.5:2b
#Je kunt een afbeelding specificeren en het model de inhoud ervan laten beschrijven.
What can you see in /home/seeed/test.jpg
De REST API Gebruiken
Ollama draait een lokale HTTP-server op poort 11434, waardoor integratie met andere applicaties gemakkelijk wordt.
Een Chat-verzoek Verzenden
# Eenvoudige tekstgeneratie
curl http://localhost:11434/api/generate -d '{
"model": "qwen3.5:2b",
"prompt": "What is edge computing?",
"stream": false
}'
Python-integratie
import requests
def chat_with_ollama(prompt, model="qwen3.5:2b"):
"""Een prompt naar Ollama sturen en een antwoord krijgen."""
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": model,
"prompt": prompt,
"stream": False
}
)
return response.json()["response"]
# Voorbeeldgebruik
response = chat_with_ollama("Write a simple Python function to calculate factorial")
print(response)OpenAI-compatibele API
# openai sdk installeren
pip install openaiOllama biedt een OpenAI-compatibel eindpunt, waardoor je bestaande OpenAI-clientbibliotheken kunt gebruiken:
from openai import OpenAI
# Verbinding maken met lokale Ollama
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="not-needed" # Ollama heeft geen API-sleutel nodig
)
response = client.chat.completions.create(
model="qwen3.5:4b",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Explain quantum computing in simple terms."}
]
)
print(response.choices[0].message.content)VLM vindt objecten in afbeelding
pip install ollama
git clone https://github.com/Seeed-Projects/reComputer-Jetson-for-Beginners
cd reComputer-Jetson-for-Beginners/5-Offline-Large-Model-Development/code
python vlm_object_detector.pywacht een minuut en je kunt het resultaat in de img-map zien

Open WebUI Instellen
Open WebUI (voorheen Ollama WebUI) biedt een ChatGPT-achtige interface voor interactie met je lokale modellen.
Installatie via Docker
# Open WebUI-image ophalen
docker pull ghcr.io/open-webui/open-webui:main
# Datamap maken
sudo mkdir -p /opt/seeed/open-webui/data
# Container uitvoeren
docker run -d \
--restart always \
--name open-webui \
--network host \
-v /opt/seeed/open-webui/data:/app/backend/data \
-e OLLAMA_BASE_URL=http://127.0.0.1:11434 \
ghcr.io/open-webui/open-webui:main
# Containerstatus controleren
docker logs -f open-webuiToegang tot Open WebUI
Zodra de container draait:
- Open een browser op je Jetson (of een ander apparaat op hetzelfde netwerk)
- Navigeer naar
http://localhost:8080(ofhttp://<jetson-ip>:8080) - Maak een admin-account aan bij de eerste toegang
- Selecteer je model uit het dropdown-menu en begin met chatten!

Functies van Open WebUI
- Modelbeheer: Schakelen tussen verschillende Ollama-modellen
- Conversatiegeschiedenis: Chatgeschiedenissen opslaan en doorzoeken
- Multi-user ondersteuning: Accounts aanmaken voor verschillende gebruikers
- RAG-ondersteuning: Documenten uploaden en ermee chatten
- Afbeeldinggeneratie: Integreren met afbeeldinggeneratiemodellen
- Plugin-systeem: Functionaliteit uitbreiden met community-plugins
Tips voor Betere Prestaties
- Gebruik geschikte modelgroottes: Begin met 1B-3B-modellen op Jetson Orin Nano
- Vergroot swap-ruimte: Voeg meer swap toe voor grotere modellen
- Sluit onnodige applicaties: Maak GPU-geheugen vrij
- Gebruik gekwantiseerde modellen: GGUF-gekwantiseerde modellen (Q4_K_M) bieden de beste snelheid/kwaliteit-afweging
- Monitor temperatuur: Jetson kan thermisch vertragen onder aanhoudende belasting — zorg voor voldoende koeling
Veelvoorkomende Problemen en Oplossingen
Probleem 1: Modeldownload Mislukt
Probleem: Error: pull model manifest: Get https://registry.ollama.ai/...
Oplossing:
# Internetverbinding controleren
ping google.com
# Opnieuw proberen met uitgebreide output
OLLAMA_DEBUG=1 ollama pull llama3.2:3bProbleem 2: Geen Geheugen
Probleem: Error: model requires more system memory (8.0 GiB) than is available (6.0 GiB)
Oplossing:
# Beschikbaar geheugen controleren
free -h
# Swap vergroten (als nog niet geconfigureerd)
sudo fallocate -l 16G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile
# Een kleiner model gebruiken
ollama run qwen3.5:2bProbleem 3: Trage Responstijden
Probleem: Zeer trage token-generatie (< 5 tokens/seconde)
Oplossing:
# Een kleiner model gebruiken
ollama run qwen3.5:0.8b
# Contextvenster verkleinen
ollama run qwen3.5:0.8b --num-ctx 2048
# Controleren of GPU wordt gebruikt (nvidia-smi controleren tijdens inferentie)Probleem 4: Ollama-service Start Niet
Probleem: System has not been booted with systemd as init system
Oplossing (voor Docker-omgevingen):
# Ollama handmatig starten
ollama serve &
# Of op de achtergrond draaien
nohup ollama serve > ollama.log 2>&1 &Oefening
Voltooi deze stappen om je setup te verifiëren:
- Installeer Ollama en verifieer de installatie
- Voer een model uit:
ollama run qwen3.5:2b - Voer een gesprek: Vraag het over Jetson-platforms
- Probeer een ander model: Schakel naar
qwen3:4b - Gebruik de API: Stuur een verzoek via curl
- Optioneel: Stel Open WebUI in en open het vanuit een browser
Referenties
Volgende: Ga door naar Module 5.3: LLMs Uitvoeren met llama.cpp om lichtgewicht LLM-inferentie te verkennen!