CV / ViTPose
ViTPose-Small
2D-Einzelpersonen-Pose-Schätzung mit 17 COCO-Keypoints durch ViTPose-Small auf der reComputer R Series mit Hailo-8.
53 Downloads
Größe
31 MBSpeicher
4GB+Präzision
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.
Erste Schritte
Bereitstellen
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4REST API
Verwende die REST API für die Inferenz. Kopiere die folgenden Befehle.
Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"Python
import requests
response = requests.post(
"http://<Board_IP>:8000/api/models/vit_pose_small/predict",
files={"file": open("test.jpg", "rb")},
timeout=30,
)
print(response.json())Modelldetails
reComputer R Series (CM5 + Hailo-8)ViTPose-Small auf reComputer R Series (CM5 + Hailo-8)
ViTPose-Small schätzt die 2D-Pose einer Person und gibt 17 COCO-Körperpunkte aus. Das HEF erzeugt eine 64x48x17-Heatmap; die App ermittelt das Maximum je Kanal, skaliert in den Eingaberaum und zeichnet das Skelett.
Öffnen Sie http://<Board_IP>:8000 für die Webvorschau.
Modellinformationen
| Eigenschaft | Wert |
|---|---|
| Architektur | ViT-Small (ViTPose) |
| Aufgabe | Single-person pose estimation |
| Eingabe | 256x192x3 RGB (normalize_in_net ImageNet RGB) |
| Ausgabe | Heatmap 64x48x17 (17 COCO keypoints) |
| Parameter | 24.29M |
| Operationen | 17.17G |
| HEF | Hailo Model Zoo v2.19.0, Hailo-8 |
Hardware- und Host-Einrichtung
bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0Mit Demovideo ausführen
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4USB-Kameramodus
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
--device /dev/video0:/dev/video0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0REST-API
text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predictbash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"| Endpunkt | Methode | Zweck |
|---|---|---|
/ | GET | Webvorschau |
/api/models/vit_pose_small/predict | POST | 17 Keypoints (JSON) |
/api/video_feed | GET | MJPEG-Vorschau mit Skelett |
Implementierungshinweise
- Einzelperson: Das Modell setzt eine mittig im Ausschnitt platzierte Person voraus. Bei mehreren Personen muss ein Detektor (YOLO) zuerst jede Person ausschneiden.
- Nachverarbeitung: Argmax je Heatmap-Kanal → 64×48-Koordinaten → Skalierung auf 256×192 → Rückabbildung ohne Letterbox auf das Originalbild. Keine DARK-Subpixel-Verfeinerung.
normalize_in_netmit ImageNet-RGB-Mittelwert/Standardabweichung; ohne input_conversion wird nach dem Letterboxing rohes uint8-RGB eingespeist.
Entwicklungshinweise
- Quellmodul:
src/rpi5_hailo8_vit_pose_small/ - Dockerfile:
docker/hailo8/vit_pose_small.dockerfile - Container:
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest - Familie: vit_pose (vit_pose_small / vit_pose_small_bn)
Eingaben und Ausgaben
Eingabe: Bild, Video oder USB-Kamerabild. Ausgabe: 17 COCO-Keypoints (x, y, Score) und MJPEG-Vorschau mit Skelett.