LLM / deepseek-r1-distill-qwen
DeepSeek R1 Distill Qwen 1.5B
OpenAI互換APIを備えたDeepSeek R1 Distill Qwen 1.5Bの公開済みRKLLMイメージ。対象デバイスを選択した後、量子化(W4A16-G128 / W8A8)を選択してください。
使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。
はじめる
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/deepseek-r1-distill-qwen-1.5b:rk3576-w4a16-g128モデル詳細
reComputer RK への LLM デプロイ
この共有ガイドは、カタログに掲載されているすべての LLM に適用されます。モデルページでモデルファミリーと量子化を選択し、対応する公開済みイメージタグを使用してください。
公開済みイメージの形式
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>公開済み LLM イメージには、変換済みの .rkllm モデル、RKLLM runtime、および OpenAI 互換サーバーが含まれています。利用可能なタグは、各モデルファミリーのカタログレコードに記載されています。W4A16/W4A16-G128 イメージは通常 RK3576 専用です。RK3588 のレコードでは W8A8 が使用されます。
要件
- 64-bit Linux イメージを実行している reComputer RK3576 または RK3588
- Docker および Docker Buildx がインストールされていること
/dev経由での NPU アクセス- ボード上でポート 8001 が利用可能であること
例では、NPU にアクセスするために --privileged と -v /dev:/dev を使用します。ローカル API には認証も TLS もありません。信頼できるネットワーク上で使用してください。
公開済み LLM を実行する
選択したモデルページに表示されている値で、<model-id> と <platform>-<quantization> を置き換えてください。
RK3576
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>RK3588
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8付属のコマンドでは、ターミナルでの対話型チャットが有効になっています。バックグラウンドモードにするには、-it を -d に変更し、INTERACTIVE_CHAT=true を削除してください。
ヘルスチェックとドキュメント
curl http://localhost:8001/health
curl http://localhost:8001/docsヘルスエンドポイントが正常に応答すると、サービスの準備が完了しています。
OpenAI 互換 API
非ストリーミングリクエスト:
curl http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
"max_tokens": 128,
"stream": false
}'ストリーミングリクエスト:
curl -N http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
"max_tokens": 128,
"stream": true
}'Python クライアント:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-model",
messages=[{"role": "user", "content": "Hello from reComputer RK."}],
max_tokens=128,
)
print(response.choices[0].message.content)Ollama 互換 API
curl http://localhost:8001/api/chat \
-H 'Content-Type: application/json' \
-d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'停止とトラブルシューティング
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llmプラットフォームの検出に失敗した場合は、TARGET_PLATFORM=rk3576 または TARGET_PLATFORM=rk3588 を設定してください。ポート 8001 が使用中の場合は、ホスト側のポートマッピングを変更し、新しい API URL を使用してください。
入力と出力
入力:テキストプロンプトまたはチャットメッセージ。出力:OpenAI互換APIを介して生成されたテキスト。