VLM / Qwen3.5

Qwen3.5 4B

この公開VLMイメージは、Qwen3.5 4B言語モデルとRKNNビジョンエンコーダーを、OpenAI互換のマルチモーダルAPIと組み合わせています。

23 ダウンロード
サイズ
3.81GB

使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。

はじめる

デプロイ
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/qwen3.5-4b:rk3576-w4a16-g128

モデル詳細

reComputer RK での VLM デプロイ

この共通ガイドは、Qwen3.5 を含む、カタログに掲載されているすべての VLM に適用されます。公開されている各 VLM イメージには、選択したボードと量子化に対応する RKLLM 言語モデルおよび RKNN ビジョンエンコーダーが含まれています。

公開イメージ形式

text
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:<platform>-<quantization>

W4A16-G128 イメージは通常、RK3576 専用です。RK3588 の VLM レコードでは W8A8 を使用します。

要件

  • 64 ビット Linux イメージを実行する reComputer RK3576 または RK3588
  • Docker および Docker Buildx がインストールされていること
  • /dev 経由で NPU にアクセスできること
  • ボード上でポート 8001 が使用可能であること

VLM イメージは OpenAI 互換 API を使用し、ターミナルでのインタラクティブチャットは提供しません。

公開済み VLM の実行

<model-id><quantization> を、選択したカタログレコードの値に置き換えます。

RK3576

bash
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3588-w8a8

ヘルスチェックと API ドキュメント

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs
curl http://localhost:8001/redoc

OpenAI マルチモーダルリクエスト

サーバーは 1 リクエストにつき 1 枚の画像を受け付けます。公開 HTTP(S) URL または base64 データ URL を使用してください。

bash
curl -X POST http://localhost:8001/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "rkllm-vision",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe this image in detail."},
        {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
      ]
    }],
    "stream": false
  }'

ローカル画像の場合は、image_url.url にデータ URL を指定します。

text
data:image/jpeg;base64,<base64-encoded-image>

ストリーミングマルチモーダルリクエスト

bash
curl -N -X POST http://localhost:8001/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "rkllm-vision",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "List the objects visible in this image."},
        {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
      ]
    }],
    "stream": true
  }'

Python クライアント:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-vision",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Describe this image."},
            {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}},
        ],
    }],
    max_tokens=128,
)
print(response.choices[0].message.content)

Cherry Studio

カスタム OpenAI 互換プロバイダーを設定します。

  • API ホスト:http://<board-ip>:8001/v1
  • API キー:rkllm-local など、任意の値
  • モデル:rkllm-vision

プロバイダーを選択した後、画像を添付します。

トラブルシューティング

  • 異なるボードまたはタグの言語モデルアーティファクトとビジョンエンコーダーアーティファクトを混在させないでください。
  • サーバーがビジョンモデルの欠落を報告した場合は、MODEL_KIND=vlm と公開済みイメージタグを確認してください。
  • sudo docker logs recomputer-rk-vlm で起動時の出力を確認します。

入力と出力

入力:画像とテキストプロンプト。出力:OpenAI互換APIを介して生成される、画像に基づくテキスト。