LLM / Gemma 4

Gemma 4 E2B IT

Gepubliceerde RKLLM-images van Gemma 4 E2B IT met een OpenAI-compatibele API. Kies na het selecteren van het doelapparaat een kwantisatie (W4A16-G128 / W8A8).

19 downloads
Grootte
5.54GB

Kies het apparaat dat je gebruikt. De installatiehandleiding en documentatie worden dienovereenkomstig bijgewerkt.

Aan de slag

Implementeren
sudo docker run --rm -d \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/gemma-4-e2b-it:rk3576-w4a16-g128

Modeldetails

LLM-implementatie op reComputer RK

Deze gedeelde handleiding is van toepassing op elke LLM die in de catalogus wordt vermeld. Selecteer de modelfamilie en quantization op de modelpagina en gebruik vervolgens de bijbehorende gepubliceerde image-tag.

Indeling van gepubliceerde images

text
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>

Gepubliceerde LLM-images bevatten het geconverteerde .rkllm-model, de RKLLM-runtime en een OpenAI-compatibele server. De beschikbare tags worden vermeld in de catalogusrecords van elke modelfamilie. W4A16/W4A16-G128-images zijn over het algemeen alleen voor RK3576; RK3588-records gebruiken W8A8.

Vereisten

  • reComputer RK3576 of RK3588 met een 64-bits Linux-image
  • Docker en Docker Buildx geïnstalleerd
  • NPU-toegang via /dev
  • Poort 8001 beschikbaar op het board

De voorbeelden gebruiken --privileged en -v /dev:/dev voor NPU-toegang. De lokale API heeft geen authenticatie of TLS; houd deze op een vertrouwd netwerk.

Een gepubliceerde LLM uitvoeren

Vervang <model-id> en <platform>-<quantization> door de waarden die op de geselecteerde modelpagina worden weergegeven.

RK3576

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8

Met het bijgevoegde commando wordt interactieve chat in de terminal ingeschakeld. Wijzig voor de achtergrondmodus -it in -d en verwijder INTERACTIVE_CHAT=true.

Status en documentatie

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs

De service is gereed wanneer het health-endpoint succesvol antwoordt.

OpenAI-compatibele API

Niet-streamend verzoek:

bash
curl http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
    "max_tokens": 128,
    "stream": false
  }'

Streamend verzoek:

bash
curl -N http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
    "max_tokens": 128,
    "stream": true
  }'

Python-client:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-model",
    messages=[{"role": "user", "content": "Hello from reComputer RK."}],
    max_tokens=128,
)
print(response.choices[0].message.content)

Ollama-compatibele API

bash
curl http://localhost:8001/api/chat \
  -H 'Content-Type: application/json' \
  -d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'

Stoppen en problemen oplossen

bash
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llm

Als platformdetectie mislukt, stelt u TARGET_PLATFORM=rk3576 of TARGET_PLATFORM=rk3588 in. Als poort 8001 bezet is, wijzigt u de poorttoewijzing aan de hostzijde en gebruikt u de nieuwe API-URL.

Invoer en uitvoer

Invoer: tekstprompt of chatberichten. Uitvoer: gegenereerde tekst via een OpenAI-compatibele API.