CV / YOLO-World

YOLO-World

Change detection categories at runtime with English natural-language prompts without rebuilding the model.

4 Downloads
Präzision
INT8 detector / FP16 text encoder

Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.

Erste Schritte

Bereitstellen
sudo docker run --rm --privileged -p 8000:8000 \
  -v /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
  python3 web_detection.py --platform rk3576 \
  --model_path /app/model/yolo_world_v2s_i8.rknn \
  --text_model /app/model/clip_text_fp16.rknn \
  --text_features /app/model/coco_text_outp.npy \
  --vocab_path /app/model/clip_vocab.txt --class_path /app/model/detect_classes.txt \
  --camera_id -1 --host 0.0.0.0 --port 8000

REST API

Verwende die REST API für die Inferenz. Kopiere die folgenden Befehle.

Curl
curl http://localhost:8080/v1/chat/completions -d '{
  "model": "yolo-world-rknn",
  "messages": [{"role": "user", "content": "Hello"}]
}'
Python
import requests

resp = requests.post(
    "http://localhost:8080/v1/chat/completions",
    json={"model": "yolo-world-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())

Modelldetails

YOLO-World auf reComputer RK3576 und RK3588

Dieses Projekt bietet offene Vokabularerkennung aus reComputer-RK-CV. INT8-YOLO-World-Detektor und FP16-CLIP-Textencoder laufen auf der NPU, sodass Kategorien ohne Neubau des Detektors geändert werden können.

Das enthaltene CLIP-Modell wurde hauptsächlich mit Englisch trainiert. Kurze englische Nominalphrasen wie person, red bus und traffic light werden empfohlen.

Modellinformationen

KomponenteDatei
Detektor/app/model/yolo_world_v2s_i8.rknn
Textencoder/app/model/clip_text_fp16.rknn
Anfängliche COCO-Merkmale/app/model/coco_text_outp.npy
BPE-Vokabular/app/model/clip_vocab.txt
Standardlabels/app/model/detect_classes.txt

Dienst starten

Verwenden Sie das zur Platine passende Image und setzen Sie --platform auf denselben Wert.

RK3576

bash
sudo docker run --rm --privileged -p 8000:8000 \
  -v /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
  python3 web_detection.py --platform rk3576 \
  --model_path /app/model/yolo_world_v2s_i8.rknn \
  --text_model /app/model/clip_text_fp16.rknn \
  --text_features /app/model/coco_text_outp.npy \
  --vocab_path /app/model/clip_vocab.txt \
  --class_path /app/model/detect_classes.txt \
  --video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000

RK3588

bash
sudo docker run --rm --privileged -p 8000:8000 \
  -v /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-yolo_world:latest \
  python3 web_detection.py --platform rk3588 \
  --model_path /app/model/yolo_world_v2s_i8.rknn \
  --text_model /app/model/clip_text_fp16.rknn \
  --text_features /app/model/coco_text_outp.npy \
  --vocab_path /app/model/clip_vocab.txt \
  --class_path /app/model/detect_classes.txt \
  --video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000

Öffnen Sie http://<BOARD_IP>:8000. Mit --prompts "person|red bus|bicycle" setzen Sie Start-Prompts. Unterstützt werden 1 bis 80 nicht leere, durch senkrechte Striche getrennte Prompts; jeder wird auf 20 CLIP-Tokens gekürzt.

Startargumente

ArgumentStandardBeschreibung
--platformErforderlichZiel-NPU, rk3576 oder rk3588.
--model_pathErforderlichQuantisierter YOLO-World-Detektor.
--text_modelmodel/clip_text_fp16.rknnCLIP-Textencoder für dynamische Prompts.
--text_featuresmodel/coco_text_outp.npyAnfängliche (1,80,512)-COCO-Merkmale.
--vocab_pathmodel/clip_vocab.txtOffline-CLIP-BPE-Vokabular.
--class_pathEingebaute COCO-LabelsLabels passend zu den anfänglichen Merkmalszeilen.
--prompts80 COCO-KlassenAnfängliche Prompt-Phrasen mit senkrechtem Strich als Trenner.
--video_pathKein WertLokale MP4-Schleife; überschreibt die Kamera.
--camera_id1Kameraindex; -1 aktiviert reinen Analysebetrieb.
--host / --port0.0.0.0 / 8000Dienstadresse und Port.

Prompt- und Vorhersage-APIs

bash
curl -X POST "http://<BOARD_IP>:8000/api/prompts" \
  -H "Content-Type: application/json" \
  -d '{"text":"person|red bus|traffic light"}'

curl -X POST "http://<BOARD_IP>:8000/api/models/yolo_world/predict" \
  -F "file=@bus.jpg" -F "text=person|bus|red vehicle" \
  -F "conf=0.25" -F "iou=0.45"

Das Feld text ändert Prompts nur für diese Vorhersage; /api/prompts ändert die aktiven Stream-Prompts. Prompt-Embeddings werden im Speicher zwischengespeichert. Dynamische Embeddings füllen die ersten Zeilen der festen 80-zeiligen Texteingabe; Auffüllzeilen werden in der Nachverarbeitung ignoriert.

GET /api/prompts liest aktive Prompts. Zusätzlich gibt es Zustands-, Schwellenwert-, MJPEG-, Upload-, asynchrone Analyse-, Status-, Listen- und Download-Endpunkte. Durch das Offline-BPE-Vokabular lädt die Laufzeit keine Tokenizer-Ressourcen von Hugging Face.

Einschränkungen beim Modellersatz

Detektor und Textencoder bilden eine abgestimmte Pipeline. Ersatzmodelle müssen die 80-zeilige Texteingabe, die CLIP-Embedding-Breite, kompatible Tokenisierung und das erwartete Ausgabelayout beibehalten.

Lokal bauen

bash
docker build -f docker/rk3576/yolo_world.dockerfile \
  -t rk3576-yolo-world:local src/rk3576_yolo_world

docker build -f docker/rk3588/yolo_world.dockerfile \
  -t rk3588-yolo-world:local src/rk3588_yolo_world

Eingaben und Ausgaben

Input: image, video frame, or camera frame plus up to 80 prompts. Output: prompt-matched boxes and confidence scores.