LLM / deepseek-r1-distill-qwen

DeepSeek R1 Distill Qwen 1.5B

OpenAI互換APIを備えたDeepSeek R1 Distill Qwen 1.5Bの公開済みRKLLMイメージ。対象デバイスを選択した後、量子化(W4A16-G128 / W8A8)を選択してください。

119 ダウンロード
サイズ
1.26GB

使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。

はじめる

デプロイ
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/deepseek-r1-distill-qwen-1.5b:rk3576-w4a16-g128

モデル詳細

reComputer RK への LLM デプロイ

この共有ガイドは、カタログに掲載されているすべての LLM に適用されます。モデルページでモデルファミリーと量子化を選択し、対応する公開済みイメージタグを使用してください。

公開済みイメージの形式

text
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>

公開済み LLM イメージには、変換済みの .rkllm モデル、RKLLM runtime、および OpenAI 互換サーバーが含まれています。利用可能なタグは、各モデルファミリーのカタログレコードに記載されています。W4A16/W4A16-G128 イメージは通常 RK3576 専用です。RK3588 のレコードでは W8A8 が使用されます。

要件

  • 64-bit Linux イメージを実行している reComputer RK3576 または RK3588
  • Docker および Docker Buildx がインストールされていること
  • /dev 経由での NPU アクセス
  • ボード上でポート 8001 が利用可能であること

例では、NPU にアクセスするために --privileged-v /dev:/dev を使用します。ローカル API には認証も TLS もありません。信頼できるネットワーク上で使用してください。

公開済み LLM を実行する

選択したモデルページに表示されている値で、<model-id><platform>-<quantization> を置き換えてください。

RK3576

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8

付属のコマンドでは、ターミナルでの対話型チャットが有効になっています。バックグラウンドモードにするには、-it-d に変更し、INTERACTIVE_CHAT=true を削除してください。

ヘルスチェックとドキュメント

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs

ヘルスエンドポイントが正常に応答すると、サービスの準備が完了しています。

OpenAI 互換 API

非ストリーミングリクエスト:

bash
curl http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
    "max_tokens": 128,
    "stream": false
  }'

ストリーミングリクエスト:

bash
curl -N http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
    "max_tokens": 128,
    "stream": true
  }'

Python クライアント:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-model",
    messages=[{"role": "user", "content": "Hello from reComputer RK."}],
    max_tokens=128,
)
print(response.choices[0].message.content)

Ollama 互換 API

bash
curl http://localhost:8001/api/chat \
  -H 'Content-Type: application/json' \
  -d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'

停止とトラブルシューティング

bash
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llm

プラットフォームの検出に失敗した場合は、TARGET_PLATFORM=rk3576 または TARGET_PLATFORM=rk3588 を設定してください。ポート 8001 が使用中の場合は、ホスト側のポートマッピングを変更し、新しい API URL を使用してください。

入力と出力

入力:テキストプロンプトまたはチャットメッセージ。出力:OpenAI互換APIを介して生成されたテキスト。