CV / YOLO-World
YOLO-World
Change detection categories at runtime with English natural-language prompts without rebuilding the model.
使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。
はじめる
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
python3 web_detection.py --platform rk3576 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt --class_path /app/model/detect_classes.txt \
--camera_id -1 --host 0.0.0.0 --port 8000REST API
REST API を使用して推論を実行します。以下のコマンドをコピーしてください。
curl http://localhost:8080/v1/chat/completions -d '{
"model": "yolo-world-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "yolo-world-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())モデル詳細
reComputer RK3576およびRK3588でYOLO-Worldを実行する
このプロジェクトはreComputer-RK-CVのオープン語彙検出を提供します。INT8 YOLO-World検出器とFP16 CLIPテキストエンコーダはどちらもNPU上で動作するため、検出器を再ビルドせずに検出カテゴリを変更できます。
同梱CLIPモデルは主に英語で学習されています。
person、red bus、traffic lightのような短い英語の名詞句を推奨します。
モデル情報
| コンポーネント | ファイル |
|---|---|
| 検出器 | /app/model/yolo_world_v2s_i8.rknn |
| テキストエンコーダ | /app/model/clip_text_fp16.rknn |
| 初期COCO特徴量 | /app/model/coco_text_outp.npy |
| BPE語彙 | /app/model/clip_vocab.txt |
| デフォルトラベル | /app/model/detect_classes.txt |
サービスを実行する
ボードに一致するイメージを使用し、--platformを同じ値に設定します。
RK3576
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
python3 web_detection.py --platform rk3576 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt \
--class_path /app/model/detect_classes.txt \
--video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000RK3588
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-yolo_world:latest \
python3 web_detection.py --platform rk3588 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt \
--class_path /app/model/detect_classes.txt \
--video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000http://<BOARD_IP>:8000を開きます。起動プロンプトの設定には--prompts "person|red bus|bicycle"を使用します。パイプ区切りの空でないプロンプトを1個から80個まで指定でき、各プロンプトは20 CLIPトークンに切り詰められます。
起動引数
| 引数 | デフォルト | 説明 |
|---|---|---|
--platform | 必須 | 対象NPU、rk3576またはrk3588。 |
--model_path | 必須 | 量子化YOLO-World検出器。 |
--text_model | model/clip_text_fp16.rknn | 動的プロンプト用CLIPテキストエンコーダ。 |
--text_features | model/coco_text_outp.npy | 初期(1,80,512) COCO特徴量。 |
--vocab_path | model/clip_vocab.txt | オフラインCLIP BPE語彙。 |
--class_path | 組み込みCOCOラベル | 初期特徴量の行に対応するラベル。 |
--prompts | COCO 80クラス | パイプ区切りの初期プロンプト句。 |
--video_path | なし | ループ再生するローカルMP4。カメラより優先されます。 |
--camera_id | 1 | カメラインデックス。-1は解析専用モードを有効にします。 |
--host / --port | 0.0.0.0 / 8000 | サービスアドレスとポート。 |
プロンプトと予測API
curl -X POST "http://<BOARD_IP>:8000/api/prompts" \
-H "Content-Type: application/json" \
-d '{"text":"person|red bus|traffic light"}'
curl -X POST "http://<BOARD_IP>:8000/api/models/yolo_world/predict" \
-F "file=@bus.jpg" -F "text=person|bus|red vehicle" \
-F "conf=0.25" -F "iou=0.45"textフィールドはその予測だけのプロンプトを変更し、/api/promptsはアクティブなストリームプロンプトを変更します。プロンプト埋め込みはメモリにキャッシュされます。動的埋め込みは検出器の固定80行テキスト入力の先頭行へ入り、パディング行は後処理で無視されます。
GET /api/promptsはアクティブなプロンプトを読み取ります。ヘルス、しきい値設定、MJPEG、動画アップロード、非同期解析、状態、一覧、ダウンロードの各エンドポイントもあります。オフラインBPE語彙を使うため、ランタイムはHugging Faceからトークナイザ資産をダウンロードしません。
モデル置換の制約
検出器とテキストエンコーダは対応するパイプラインです。置き換えでは、検出器の80行テキスト特徴入力、CLIP埋め込み幅、互換トークン化、後処理コードが期待する出力レイアウトを維持する必要があります。
ローカルでビルドする
docker build -f docker/rk3576/yolo_world.dockerfile \
-t rk3576-yolo-world:local src/rk3576_yolo_world
docker build -f docker/rk3588/yolo_world.dockerfile \
-t rk3588-yolo-world:local src/rk3588_yolo_world入力と出力
Input: image, video frame, or camera frame plus up to 80 prompts. Output: prompt-matched boxes and confidence scores.