VLM / Qwen3.5
Qwen3.5 4B
この公開VLMイメージは、Qwen3.5 4B言語モデルとRKNNビジョンエンコーダーを、OpenAI互換のマルチモーダルAPIと組み合わせています。
23 ダウンロード
サイズ
3.81GB使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。
はじめる
デプロイ
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/qwen3.5-4b:rk3576-w4a16-g128モデル詳細
reComputer RK での VLM デプロイ
この共通ガイドは、Qwen3.5 を含む、カタログに掲載されているすべての VLM に適用されます。公開されている各 VLM イメージには、選択したボードと量子化に対応する RKLLM 言語モデルおよび RKNN ビジョンエンコーダーが含まれています。
公開イメージ形式
text
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:<platform>-<quantization>W4A16-G128 イメージは通常、RK3576 専用です。RK3588 の VLM レコードでは W8A8 を使用します。
要件
- 64 ビット Linux イメージを実行する reComputer RK3576 または RK3588
- Docker および Docker Buildx がインストールされていること
/dev経由で NPU にアクセスできること- ボード上でポート 8001 が使用可能であること
VLM イメージは OpenAI 互換 API を使用し、ターミナルでのインタラクティブチャットは提供しません。
公開済み VLM の実行
<model-id> と <quantization> を、選択したカタログレコードの値に置き換えます。
RK3576
bash
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3576-<quantization>RK3588
bash
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3588-w8a8ヘルスチェックと API ドキュメント
bash
curl http://localhost:8001/health
curl http://localhost:8001/docs
curl http://localhost:8001/redocOpenAI マルチモーダルリクエスト
サーバーは 1 リクエストにつき 1 枚の画像を受け付けます。公開 HTTP(S) URL または base64 データ URL を使用してください。
bash
curl -X POST http://localhost:8001/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "rkllm-vision",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image in detail."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
]
}],
"stream": false
}'ローカル画像の場合は、image_url.url にデータ URL を指定します。
text
data:image/jpeg;base64,<base64-encoded-image>ストリーミングマルチモーダルリクエスト
bash
curl -N -X POST http://localhost:8001/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "rkllm-vision",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "List the objects visible in this image."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
]
}],
"stream": true
}'Python クライアント:
python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-vision",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}},
],
}],
max_tokens=128,
)
print(response.choices[0].message.content)Cherry Studio
カスタム OpenAI 互換プロバイダーを設定します。
- API ホスト:
http://<board-ip>:8001/v1 - API キー:
rkllm-localなど、任意の値 - モデル:
rkllm-vision
プロバイダーを選択した後、画像を添付します。
トラブルシューティング
- 異なるボードまたはタグの言語モデルアーティファクトとビジョンエンコーダーアーティファクトを混在させないでください。
- サーバーがビジョンモデルの欠落を報告した場合は、
MODEL_KIND=vlmと公開済みイメージタグを確認してください。 sudo docker logs recomputer-rk-vlmで起動時の出力を確認します。
入力と出力
入力:画像とテキストプロンプト。出力:OpenAI互換APIを介して生成される、画像に基づくテキスト。