Erste Schritte mit Ollama
Einführung
Ollama ist der einfachste Weg, um Large Language Models (LLMs) lokal auszuführen. Stellen Sie es sich als „Docker für LLMs" vor — es übernimmt das Herunterladen, Speichern und die Inferenz von Modellen mit einer sauberen Kommandozeilen-Schnittstelle. Keine komplexen Setups, keine Abhängigkeitsprobleme — ein Befehl zur Installation, ein Befehl zum Starten des Chats.
In diesem Modul lernen Sie:
- Ollama auf Ihrem Jetson-Gerät installieren
- Ihr erstes LLM herunterladen und ausführen
- Verschiedene Modelle und ihre Fähigkeiten erkunden
- Eine webbasierte Chat-Schnittstelle mit Open WebUI einrichten


Warum Ollama?
| Feature | Beschreibung |
|---|---|
| Ein-Zeilen-Installation | Einzelner Befehl zum Starten |
| Automatisches Modellmanagement | Automatischer Download und Verwaltung von Modelldateien |
| Einfache Befehle | ollama run Modellname zum Starten des Chats |
| REST API | Integrierter HTTP-Server für Integration |
| Mehrere Modelle | Verschiedene Modelle parallel ausführen |
| OpenAI-kompatibel | API kompatibel mit OpenAI-Schnittstelle |
Systemanforderungen
Bevor Sie Ollama installieren, stellen Sie sicher, dass Ihr Jetson-Gerät diese Anforderungen erfüllt:
| Anforderung | Minimum | Empfohlen |
|---|---|---|
| JetPack | 5.1+ | 6.0+ |
| RAM | 8GB | 16GB+ |
| Speicher | 10GB frei | 50GB+ (für mehrere Modelle) |
| Swap | 8GB | 16GB |
Erstbenutzer: Wenn Sie noch kein Swap auf Ihrem Jetson eingerichtet haben, lesen Sie Kapitel 3: Swap-Konfiguration
Ollama installieren
Methode 1: Direkte Installation (Empfohlen)
Öffnen Sie ein Terminal auf Ihrem Jetson-Gerät und führen Sie aus:
# Ollama herunterladen und installieren
curl -fsSL https://ollama.com/install.sh | shDas Installationsskript wird:
- Ihre Systemarchitektur erkennen (ARM64)
- Die passende Ollama-Binärdatei herunterladen
- Den systemd-Dienst einrichten
- Die Installation verifizieren
Installation verifizieren
# Ollama-Version prüfen
ollama --version
# Prüfen ob der Dienst läuft
systemctl status ollamaIhre erste LLM-Interaktion
Lassen Sie uns nun Ihr erstes LLM ausführen. Ollama lädt das Modell beim ersten Lauf automatisch herunter.
Sie können die unterstützten Modelle von Ollama hier finden. Wählen Sie das Modell, das Sie auf Ihrem Gerät bereitstellen möchten.
Ein Modell ausführen
# Zum Beispiel
ollama run qwen3.5:2bNach dem Download sehen Sie einen Chat-Prompt:
What is NVIDIA Jetson?Nützliche Chat-Befehle
| Befehl | Beschreibung |
|---|---|
/? | Hilfe anzeigen |
/bye | Konversation beenden |
Ctrl+D | Konversation beenden |
/clear | Konversationsverlauf löschen |
/history | Konversationsverlauf anzeigen |
Verschiedene Modelle erkunden
Vision-Language Models (Multimodal)
# Qwen3.5 - Bilder und Text verstehen
ollama run qwen3.5:2b
#Sie können ein Bild angeben und das Modell den Inhalt beschreiben lassen.
What can you see in /home/seeed/test.jpg
Die REST API verwenden
Ollama führt einen lokalen HTTP-Server auf Port 11434 aus, was die Integration mit anderen Anwendungen erleichtert.
Chat-Anfrage senden
# Einfache Textgenerierung
curl http://localhost:11434/api/generate -d '{
"model": "qwen3.5:2b",
"prompt": "What is edge computing?",
"stream": false
}'
Python-Integration
import requests
def chat_with_ollama(prompt, model="qwen3.5:2b"):
"""Einen Prompt an Ollama senden und eine Antwort erhalten."""
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": model,
"prompt": prompt,
"stream": False
}
)
return response.json()["response"]
# Beispielverwendung
response = chat_with_ollama("Write a simple Python function to calculate factorial")
print(response)OpenAI-kompatible API
# openai sdk installieren
pip install openaiOllama bietet einen OpenAI-kompatiblen Endpunkt, der die Verwendung bestehender OpenAI-Clientbibliotheken ermöglicht:
from openai import OpenAI
# Mit lokaler Ollama verbinden
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="not-needed" # Ollama benötigt keinen API-Schlüssel
)
response = client.chat.completions.create(
model="qwen3.5:4b",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Explain quantum computing in simple terms."}
]
)
print(response.choices[0].message.content)VLM findet Objekte in Bildern
pip install ollama
git clone https://github.com/Seeed-Projects/reComputer-Jetson-for-Beginners
cd reComputer-Jetson-for-Beginners/5-Offline-Large-Model-Development/code
python vlm_object_detector.pyNach einer Minute können Sie das Ergebnis im img-Ordner sehen

Open WebUI einrichten
Open WebUI (ehemals Ollama WebUI) bietet eine ChatGPT-ähnliche Schnittstelle für die Interaktion mit Ihren lokalen Modellen.
Installation via Docker
# Open WebUI-Image pullen
docker pull ghcr.io/open-webui/open-webui:main
# Datenverzeichnis erstellen
sudo mkdir -p /opt/seeed/open-webui/data
# Container ausführen
docker run -d \
--restart always \
--name open-webui \
--network host \
-v /opt/seeed/open-webui/data:/app/backend/data \
-e OLLAMA_BASE_URL=http://127.0.0.1:11434 \
ghcr.io/open-webui/open-webui:main
# Containerstatus prüfen
docker logs -f open-webuiAuf Open WebUI zugreifen
Sobald der Container läuft:
- Öffnen Sie einen Browser auf Ihrem Jetson (oder einem anderen Gerät im selben Netzwerk)
- Navigieren Sie zu
http://localhost:8080(oderhttp://<jetson-ip>:8080) - Erstellen Sie beim ersten Zugriff ein Admin-Konto
- Wählen Sie Ihr Modell aus dem Dropdown und beginnen Sie zu chatten!

Funktionen von Open WebUI
- Modellverwaltung: Zwischen verschiedenen Ollama-Modellen wechseln
- Konversationsverlauf: Chat-Verläufe speichern und durchsuchen
- Multi-User-Unterstützung: Konten für verschiedene Benutzer erstellen
- RAG-Unterstützung: Dokumente hochladen und damit chatten
- Bildgenerierung: Mit Bildgenerierungsmodellen integrieren
- Plugin-System: Funktionalität mit Community-Plugins erweitern
Tipps für bessere Leistung
- Angemessene Modellgrößen verwenden: Beginnen Sie mit 1B-3B-Modellen auf Jetson Orin Nano
- Swap-Speicher erhöhen: Mehr Swap für größere Modelle hinzufügen
- Unnötige Anwendungen schließen: GPU-Speicher freigeben
- Quantisierte Modelle verwenden: GGUF quantisierte Modelle (Q4_K_M) bieten das beste Geschwindigkeit/Qualität-Verhältnis
- Temperatur überwachen: Jetson kann bei dauerhafter Last thermisch drosseln — für ausreichende Kühlung sorgen
Häufige Probleme und Lösungen
Problem 1: Modell-Download schlägt fehl
Problem: Error: pull model manifest: Get https://registry.ollama.ai/...
Lösung:
# Internetverbindung prüfen
ping google.com
# Erneut mit detaillierter Ausgabe versuchen
OLLAMA_DEBUG=1 ollama pull llama3.2:3bProblem 2: Speicher voll
Problem: Error: model requires more system memory (8.0 GiB) than is available (6.0 GiB)
Lösung:
# Verfügbaren Speicher prüfen
free -h
# Swap erhöhen (falls noch nicht konfiguriert)
sudo fallocate -l 16G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile
# Ein kleineres Modell verwenden
ollama run qwen3.5:2bProblem 3: Langsame Antwortzeiten
Problem: Sehr langsame Token-Generierung (< 5 Tokens/Sekunde)
Lösung:
# Ein kleineres Modell verwenden
ollama run qwen3.5:0.8b
# Kontextfenster reduzieren
ollama run qwen3.5:0.8b --num-ctx 2048
# Sicherstellen, dass GPU verwendet wird (nvidia-smi während Inferenz prüfen)Problem 4: Ollama-Dienst startet nicht
Problem: System has not been booted with systemd as init system
Lösung (für Docker-Umgebungen):
# Ollama manuell starten
ollama serve &
# Oder im Hintergrund ausführen
nohup ollama serve > ollama.log 2>&1 &Übungsaufgabe
Führen Sie diese Schritte aus, um Ihr Setup zu verifizieren:
- Ollama installieren und die Installation verifizieren
- Ein Modell ausführen:
ollama run qwen3.5:2b - Eine Konversation führen: Fragen Sie nach Jetson-Plattformen
- Ein anderes Modell ausprobieren: Zu
qwen3:4bwechseln - Die API verwenden: Eine Anfrage via curl senden
- Optional: Open WebUI einrichten und vom Browser aus darauf zugreifen
Referenzen
- Ollama Offizielle Dokumentation
- Ollama GitHub Repository
- Ollama Modellbibliothek
- Open WebUI Dokumentation
Weiter: Fahren Sie mit Modul 5.3: LLMs mit llama.cpp ausführen fort, um leichte LLM-Inferenz zu erkunden!