High-Performance inferentie met vLLM

Introductie

vLLM is een hoogwaardige LLM-serving engine ontworpen voor productie-deployments. Waar Ollama en llama.cpp uitstekend zijn voor individueel gebruik, schittert vLLM wanneer je LLMs als API-backend moet serveren met hoge doorvoer en efficiënt geheugenbeheer.

Denk aan het verschil是这样:

  • Ollama/llama.cpp = persoonlijke ontwikkeltools (één gebruiker)
  • vLLM = productieserver (meerdere gebruikers, hoge doorvoer)

vllm

Installatie

NVIDIA Jetson AI Lab biedt officieel geoptimaliseerde Docker-images en samengestelde modelrecepten voor vLLM op Jetson Orin — alle afhankelijkheden zijn vooraf gebouwd en getest, geen versieconflicten.

Stap 1: Haal het vLLM Docker-image op

bash
sudo docker pull ghcr.io/nvidia-ai-iot/vllm:latest-jetson-orin

Stap 2: Start een modelserver

bash
sudo docker run -it --rm --pull always \
  --runtime=nvidia --network host \
  -e HF_ENDPOINT=https://hf-mirror.com \
  -v $HOME/.cache/huggingface:/root/.cache/huggingface \
  ghcr.io/nvidia-ai-iot/vllm:latest-jetson-orin \
  vllm serve cyankiwi/Qwen3.5-4B-AWQ-4bit \
  --gpu-memory-utilization 0.8 \
  --enable-prefix-caching \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Stap 3: Test de API

Zodra de server up is (je ziet Uvicorn running on http://0.0.0.0:8000), open een nieuwe terminal en test:

bash
# Lijst beschikbare modellen
curl http://localhost:8000/v1/models

# Verstuur een chatverzoek
curl -s http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "cyankiwi/Qwen3.5-4B-AWQ-4bit",
    "messages": [{"role": "user", "content": "What is edge computing?"}]
  }'

vllm-test

Probeer meer modellen

Alle volgende zijn geverifieerd en klaar om te draaien op Jetson Orin met hetzelfde Docker-image. Vervang gewoon de modelnaam in de bovenstaande opdracht:

ModelOpdracht
Qwen3.5 2Bvllm serve Qwen/Qwen3.5-2B
Qwen3.5 9Bvllm serve Qwen/Qwen3.5-9B
Qwen3 8Bvllm serve Qwen/Qwen3-8B
Gemma 4 E4Bvllm serve google/gemma-4-E4B-it
Gemma 4 E2Bvllm serve google/gemma-4-E2B-it
Gemma 3 4Bvllm serve google/gemma-3-4b-it
Gemma 4 26B-A4B (AWQ)vllm serve cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit
Nemotron Nano 9B v2vllm serve nvidia/Nemotron-Nano-9B-v2
Nemotron3 Nano 30B-A3Bvllm serve nvidia/Nemotron3-Nano-30B-A3B

Grotere modellen (Qwen3.5 9B+) of AWQ-gekwantiseerde modellen hebben meer VRAM nodig. Op Orin Nano 8GB, gebruik 2B–4B modellen. Op Orin NX 16GB of AGX Orin 32GB/64GB, kun je comfortabel 8B–30B (MoE) modellen draaien.

Blader door de volledige lijst en kopieer kant-en-klare opdrachten op: jetson-ai-lab.com/models

Python-voorbeelden

Basisch chatten

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.5-2B",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Explain edge computing in 3 sentences."}
    ],
    temperature=0.7,
    max_tokens=150
)

print(response.choices[0].message.content)

Streaming-antwoorden

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

stream = client.chat.completions.create(
    model="Qwen/Qwen3.5-2B",
    messages=[{"role": "user", "content": "Write a haiku about robots."}],
    stream=True,
    max_tokens=100
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
print()

vllm-stream

Referenties


Volgende: Ga verder naar Module 5.5: Jetson Voorbeelden Snelstart om LLMs met één commando te deployen!