CV / YOLO-World
YOLO-World
Open-vocabulary YOLO-World detection with RKNN detector and CLIP text encoder.
Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.
Erste Schritte
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
python3 web_detection.py --platform rk3576 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt --class_path /app/model/detect_classes.txt \
--camera_id -1 --host 0.0.0.0 --port 8000REST API
Verwende die REST API für die Inferenz. Kopiere die folgenden Befehle.
curl http://localhost:8080/v1/chat/completions -d '{
"model": "yolo-world-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "yolo-world-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())Modelldetails
Schnellstart
1. Docker installieren
Führen Sie auf dem Entwicklungsboard die folgenden Befehle aus, um Docker zu installieren:
# Docker
curl -fsSL https://get.docker.com -o get-docker.sh
# Aliyun
sudo sh get-docker.sh --mirror Aliyun
# systemd
sudo systemctl enable docker
sudo systemctl start docker2. Projekt ausführen (ein Befehl, Vorschau in zwei Modi)
Dieses Projekt bietet offene Vokabularerkennung aus reComputer-RK-CV. INT8-YOLO-World-Detektor und FP16-CLIP-Textencoder laufen auf der NPU, sodass Kategorien ohne Neubau des Detektors geändert werden können.
Das enthaltene CLIP-Modell wurde hauptsächlich mit Englisch trainiert. Kurze englische Nominalphrasen wie
person,red busundtraffic lightwerden empfohlen.
Modellinformationen
| Komponente | Datei |
|---|---|
| Detektor | /app/model/yolo_world_v2s_i8.rknn |
| Textencoder | /app/model/clip_text_fp16.rknn |
| Anfängliche COCO-Merkmale | /app/model/coco_text_outp.npy |
| BPE-Vokabular | /app/model/clip_vocab.txt |
| Standardlabels | /app/model/detect_classes.txt |
Schritt A: Images abrufen
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-yolo_world:latest
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latestSchritt B: Mit einem Klick ausführen
Verwenden Sie das zur Platine passende Image und setzen Sie --platform auf denselben Wert.
Für RK3576:
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-yolo_world:latest \
python3 web_detection.py --platform rk3576 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt \
--class_path /app/model/detect_classes.txt \
--video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000Für RK3588:
sudo docker run --rm --privileged -p 8000:8000 \
-v /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-yolo_world:latest \
python3 web_detection.py --platform rk3588 \
--model_path /app/model/yolo_world_v2s_i8.rknn \
--text_model /app/model/clip_text_fp16.rknn \
--text_features /app/model/coco_text_outp.npy \
--vocab_path /app/model/clip_vocab.txt \
--class_path /app/model/detect_classes.txt \
--video_path /app/video/test.mp4 --host 0.0.0.0 --port 8000Öffnen Sie http://<BOARD_IP>:8000. Mit --prompts "person|red bus|bicycle" setzen Sie Start-Prompts. Unterstützt werden 1 bis 80 nicht leere, durch senkrechte Striche getrennte Prompts; jeder wird auf 20 CLIP-Tokens gekürzt.
🔌 API-Dokumentation
1. Prompt-Konfiguration
Endpunkt: POST /api/prompts
Anfrageparameter (JSON):
text: Ein bis 80 nicht leere, durch|getrennte Prompt-Phrasen.
Anwendungsbeispiele:
curl -X POST "http://<BOARD_IP>:8000/api/prompts" \
-H "Content-Type: application/json" \
-d '{"text":"person|red bus|traffic light"}'
2. Modellinferenz-Schnittstelle (Predict)
Endpunkt: POST /api/models/yolo_world/predict
Anfrageparameter (Multipart/Form-Data):
Verfügbar sind file, video, timestamp, realtime, conf und iou; die Standardschwellen sind 0.25 und 0.45.
Anwendungsbeispiele:
curl -X POST "http://<BOARD_IP>:8000/api/models/yolo_world/predict" \
-F "file=@bus.jpg" -F "text=person|bus|red vehicle" \
-F "conf=0.25" -F "iou=0.45"Das Feld text ändert Prompts nur für diese Vorhersage; /api/prompts ändert die aktiven Stream-Prompts. Prompt-Embeddings werden im Speicher zwischengespeichert. Dynamische Embeddings füllen die ersten Zeilen der festen 80-zeiligen Texteingabe; Auffüllzeilen werden in der Nachverarbeitung ignoriert.
GET /api/prompts liest aktive Prompts. Zusätzlich gibt es Zustands-, Schwellenwert-, MJPEG-, Upload-, asynchrone Analyse-, Status-, Listen- und Download-Endpunkte. Durch das Offline-BPE-Vokabular lädt die Laufzeit keine Tokenizer-Ressourcen von Hugging Face.
3. Schnittstelle zur Systemkonfiguration (Config)
GET /api/config / POST /api/config.
4. Befehlszeilenargumente
| Argument | Standard | Beschreibung |
|---|---|---|
--platform | Erforderlich | Ziel-NPU, rk3576 oder rk3588. |
--model_path | Erforderlich | Quantisierter YOLO-World-Detektor. |
--text_model | model/clip_text_fp16.rknn | CLIP-Textencoder für dynamische Prompts. |
--text_features | model/coco_text_outp.npy | Anfängliche (1,80,512)-COCO-Merkmale. |
--vocab_path | model/clip_vocab.txt | Offline-CLIP-BPE-Vokabular. |
--class_path | Eingebaute COCO-Labels | Labels passend zu den anfänglichen Merkmalszeilen. |
--prompts | 80 COCO-Klassen | Anfängliche Prompt-Phrasen mit senkrechtem Strich als Trenner. |
--video_path | Kein Wert | Lokale MP4-Schleife; überschreibt die Kamera. |
--camera_id | 1 | Kameraindex; -1 aktiviert reinen Analysebetrieb. |
--host / --port | 0.0.0.0 / 8000 | Dienstadresse und Port. |
Echtzeit-Videostream (Video Feed)
Rufen Sie den neuesten annotierten MJPEG-Stream für die Browservorschau ab:
- Endpunkt:
GET /api/video_feed - Beispiel:
<img src="http://<BOARD_IP>:8000/api/video_feed">
🛠️ Entwicklerleitfaden (Empfehlungen für den Produktionseinsatz)
Einschränkungen beim Modellersatz
Detektor und Textencoder bilden eine abgestimmte Pipeline. Ersatzmodelle müssen die 80-zeilige Texteingabe, die CLIP-Embedding-Breite, kompatible Tokenisierung und das erwartete Ausgabelayout beibehalten.
Lokal bauen
docker build -f docker/rk3576/yolo_world.dockerfile \
-t rk3576-yolo-world:local src/rk3576_yolo_world
docker build -f docker/rk3588/yolo_world.dockerfile \
-t rk3588-yolo-world:local src/rk3588_yolo_worldEingaben und Ausgaben
Input: image, video frame, or camera frame plus up to 80 prompts. Output: prompt-matched boxes and confidence scores.