LLM / Gemma 4

Gemma 4 E2B IT

Veröffentlichte RKLLM-Images von Gemma 4 E2B IT mit einer OpenAI-kompatiblen API. Wählen Sie nach Auswahl des Zielgeräts eine Quantisierung (W4A16-G128 / W8A8).

19 Downloads
Größe
5.54GB

Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.

Erste Schritte

Bereitstellen
sudo docker run --rm -d \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/gemma-4-e2b-it:rk3576-w4a16-g128

Modelldetails

LLM-Bereitstellung auf reComputer RK

Diese allgemeine Anleitung gilt für jedes im Katalog aufgeführte LLM. Wählen Sie auf der Modellseite die Modellfamilie und Quantisierung aus und verwenden Sie anschließend das entsprechende veröffentlichte Image-Tag.

Format veröffentlichter Images

text
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>

Veröffentlichte LLM-Images enthalten das konvertierte .rkllm-Modell, die RKLLM-Laufzeitumgebung und einen OpenAI-kompatiblen Server. Die verfügbaren Tags sind in den Katalogeinträgen der jeweiligen Modellfamilie aufgeführt. W4A16-/W4A16-G128-Images sind grundsätzlich nur für RK3576 vorgesehen; RK3588-Einträge verwenden W8A8.

Voraussetzungen

  • reComputer RK3576 oder RK3588 mit einem 64-Bit-Linux-Image
  • Docker und Docker Buildx installiert
  • NPU-Zugriff über /dev
  • Port 8001 auf dem Gerät verfügbar

Die Beispiele verwenden --privileged und -v /dev:/dev für den NPU-Zugriff. Die lokale API verfügt weder über Authentifizierung noch über TLS; verwenden Sie sie nur in einem vertrauenswürdigen Netzwerk.

Ein veröffentlichtes LLM ausführen

Ersetzen Sie <model-id> und <platform>-<quantization> durch die auf der ausgewählten Modellseite angegebenen Werte.

RK3576

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8

Der angegebene Befehl aktiviert den interaktiven Chat im Terminal. Ändern Sie für den Hintergrundmodus -it in -d und entfernen Sie INTERACTIVE_CHAT=true.

Systemzustand und Dokumentation

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs

Der Dienst ist bereit, sobald der Endpunkt zur Zustandsprüfung erfolgreich antwortet.

OpenAI-kompatible API

Nicht streamende Anfrage:

bash
curl http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
    "max_tokens": 128,
    "stream": false
  }'

Streamende Anfrage:

bash
curl -N http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
    "max_tokens": 128,
    "stream": true
  }'

Python-Client:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-model",
    messages=[{"role": "user", "content": "Hello from reComputer RK."}],
    max_tokens=128,
)
print(response.choices[0].message.content)

Ollama-kompatible API

bash
curl http://localhost:8001/api/chat \
  -H 'Content-Type: application/json' \
  -d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'

Beenden und Fehler beheben

bash
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llm

Wenn die Plattformerkennung fehlschlägt, legen Sie TARGET_PLATFORM=rk3576 oder TARGET_PLATFORM=rk3588 fest. Wenn Port 8001 belegt ist, ändern Sie die hostseitige Portzuordnung und verwenden Sie die neue API-URL.

Eingaben und Ausgaben

Eingabe: Text-Prompt oder Chat-Nachrichten. Ausgabe: generierter Text über eine OpenAI-kompatible API.