LLM / deepseek-r1-distill-qwen
DeepSeek R1 Distill Qwen 1.5B
Veröffentlichte RKLLM-Images von DeepSeek R1 Distill Qwen 1.5B mit einer OpenAI-kompatiblen API. Wählen Sie nach der Auswahl des Zielgeräts eine Quantisierung (W4A16-G128 / W8A8).
Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.
Erste Schritte
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/deepseek-r1-distill-qwen-1.5b:rk3576-w4a16-g128Modelldetails
LLM-Bereitstellung auf reComputer RK
Diese allgemeine Anleitung gilt für jedes im Katalog aufgeführte LLM. Wählen Sie auf der Modellseite die Modellfamilie und Quantisierung aus und verwenden Sie anschließend das entsprechende veröffentlichte Image-Tag.
Format veröffentlichter Images
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>Veröffentlichte LLM-Images enthalten das konvertierte .rkllm-Modell, die RKLLM-Laufzeitumgebung und einen OpenAI-kompatiblen Server. Die verfügbaren Tags sind in den Katalogeinträgen der jeweiligen Modellfamilie aufgeführt. W4A16-/W4A16-G128-Images sind grundsätzlich nur für RK3576 vorgesehen; RK3588-Einträge verwenden W8A8.
Voraussetzungen
- reComputer RK3576 oder RK3588 mit einem 64-Bit-Linux-Image
- Docker und Docker Buildx installiert
- NPU-Zugriff über
/dev - Port 8001 auf dem Gerät verfügbar
Die Beispiele verwenden --privileged und -v /dev:/dev für den NPU-Zugriff. Die lokale API verfügt weder über Authentifizierung noch über TLS; verwenden Sie sie nur in einem vertrauenswürdigen Netzwerk.
Ein veröffentlichtes LLM ausführen
Ersetzen Sie <model-id> und <platform>-<quantization> durch die auf der ausgewählten Modellseite angegebenen Werte.
RK3576
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>RK3588
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8Der angegebene Befehl aktiviert den interaktiven Chat im Terminal. Ändern Sie für den Hintergrundmodus -it in -d und entfernen Sie INTERACTIVE_CHAT=true.
Systemzustand und Dokumentation
curl http://localhost:8001/health
curl http://localhost:8001/docsDer Dienst ist bereit, sobald der Endpunkt zur Zustandsprüfung erfolgreich antwortet.
OpenAI-kompatible API
Nicht streamende Anfrage:
curl http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
"max_tokens": 128,
"stream": false
}'Streamende Anfrage:
curl -N http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
"max_tokens": 128,
"stream": true
}'Python-Client:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-model",
messages=[{"role": "user", "content": "Hello from reComputer RK."}],
max_tokens=128,
)
print(response.choices[0].message.content)Ollama-kompatible API
curl http://localhost:8001/api/chat \
-H 'Content-Type: application/json' \
-d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'Beenden und Fehler beheben
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llmWenn die Plattformerkennung fehlschlägt, legen Sie TARGET_PLATFORM=rk3576 oder TARGET_PLATFORM=rk3588 fest. Wenn Port 8001 belegt ist, ändern Sie die hostseitige Portzuordnung und verwenden Sie die neue API-URL.
Eingaben und Ausgaben
Eingabe: Text-Prompt oder Chatnachrichten. Ausgabe: generierter Text über eine OpenAI-kompatible API.