LLM / Gemma 4
Gemma 4 E2B IT
Gepubliceerde RKLLM-images van Gemma 4 E2B IT met een OpenAI-compatibele API. Kies na het selecteren van het doelapparaat een kwantisatie (W4A16-G128 / W8A8).
Kies het apparaat dat je gebruikt. De installatiehandleiding en documentatie worden dienovereenkomstig bijgewerkt.
Aan de slag
sudo docker run --rm -d \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/gemma-4-e2b-it:rk3576-w4a16-g128Modeldetails
LLM-implementatie op reComputer RK
Deze gedeelde handleiding is van toepassing op elke LLM die in de catalogus wordt vermeld. Selecteer de modelfamilie en quantization op de modelpagina en gebruik vervolgens de bijbehorende gepubliceerde image-tag.
Indeling van gepubliceerde images
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>Gepubliceerde LLM-images bevatten het geconverteerde .rkllm-model, de RKLLM-runtime en een OpenAI-compatibele server. De beschikbare tags worden vermeld in de catalogusrecords van elke modelfamilie. W4A16/W4A16-G128-images zijn over het algemeen alleen voor RK3576; RK3588-records gebruiken W8A8.
Vereisten
- reComputer RK3576 of RK3588 met een 64-bits Linux-image
- Docker en Docker Buildx geïnstalleerd
- NPU-toegang via
/dev - Poort 8001 beschikbaar op het board
De voorbeelden gebruiken --privileged en -v /dev:/dev voor NPU-toegang. De lokale API heeft geen authenticatie of TLS; houd deze op een vertrouwd netwerk.
Een gepubliceerde LLM uitvoeren
Vervang <model-id> en <platform>-<quantization> door de waarden die op de geselecteerde modelpagina worden weergegeven.
RK3576
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>RK3588
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8Met het bijgevoegde commando wordt interactieve chat in de terminal ingeschakeld. Wijzig voor de achtergrondmodus -it in -d en verwijder INTERACTIVE_CHAT=true.
Status en documentatie
curl http://localhost:8001/health
curl http://localhost:8001/docsDe service is gereed wanneer het health-endpoint succesvol antwoordt.
OpenAI-compatibele API
Niet-streamend verzoek:
curl http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
"max_tokens": 128,
"stream": false
}'Streamend verzoek:
curl -N http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
"max_tokens": 128,
"stream": true
}'Python-client:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-model",
messages=[{"role": "user", "content": "Hello from reComputer RK."}],
max_tokens=128,
)
print(response.choices[0].message.content)Ollama-compatibele API
curl http://localhost:8001/api/chat \
-H 'Content-Type: application/json' \
-d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'Stoppen en problemen oplossen
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llmAls platformdetectie mislukt, stelt u TARGET_PLATFORM=rk3576 of TARGET_PLATFORM=rk3588 in. Als poort 8001 bezet is, wijzigt u de poorttoewijzing aan de hostzijde en gebruikt u de nieuwe API-URL.
Invoer en uitvoer
Invoer: tekstprompt of chatberichten. Uitvoer: gegenereerde tekst via een OpenAI-compatibele API.