CV / ViTPose

ViTPose-Small

2D-houdingsschatting voor één persoon met 17 COCO-sleutelpunten via ViTPose-Small op reComputer R Series met Hailo-8.

53 downloads
Grootte
31 MB
Geheugen
4GB+
Precisie
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)

Kies het apparaat dat je gebruikt. De installatiehandleiding en documentatie worden dienovereenkomstig bijgewerkt.

Aan de slag

Implementeren
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

REST API

Gebruik de REST API om inferentie uit te voeren. Kopieer de onderstaande commando's.

Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
Python
import requests
response = requests.post(
    "http://<Board_IP>:8000/api/models/vit_pose_small/predict",
    files={"file": open("test.jpg", "rb")},
    timeout=30,
)
print(response.json())

Modeldetails

reComputer R Series (CM5 + Hailo-8)

ViTPose-Small op reComputer R Series (CM5 + Hailo-8)

ViTPose-Small schat de 2D-houding van één persoon en levert 17 COCO-lichaamspunten. De HEF produceert een heatmap van 64x48x17; de app bepaalt het maximum per kanaal, schaalt naar de invoerruimte en tekent het skelet.

Open http://<Board_IP>:8000 om het webvoorbeeld te bekijken.

Modelinformatie

EigenschapWaarde
ArchitectuurViT-Small (ViTPose)
TaakSingle-person pose estimation
Invoer256x192x3 RGB (normalize_in_net ImageNet RGB)
UitvoerHeatmap 64x48x17 (17 COCO keypoints)
Parameters24.29M
Bewerkingen17.17G
HEFHailo Model Zoo v2.19.0, Hailo-8

Hardware- en hostconfiguratie

bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0

Uitvoeren met demovideo

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

USB-cameramodus

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  --device /dev/video0:/dev/video0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0

REST API

text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predict
bash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
EindpuntMethodeDoel
/GETWebvoorbeeldinterface
/api/models/vit_pose_small/predictPOST17 sleutelpunten (JSON)
/api/video_feedGETMJPEG-voorbeeld met skelet

Implementatie-opmerkingen

  • Eén persoon: het model gaat ervan uit dat de persoon in het midden van de uitsnede staat. Voor meerdere personen moet een detector (YOLO) eerst elke persoon uitsnijden.
  • Nabewerking: argmax per heatmapkanaal → coördinaten in 64×48 → schalen naar invoer 256×192 → letterbox terugdraaien naar origineel frame. Geen DARK-subpixelverfijning.
  • normalize_in_net met ImageNet RGB-gemiddelde/standaardafwijking; zonder input_conversion wordt ruwe uint8-RGB na letterboxing ingevoerd.

Ontwikkelingsnotities

  • Bronmodule: src/rpi5_hailo8_vit_pose_small/
  • Dockerfile: docker/hailo8/vit_pose_small.dockerfile
  • Container: ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest
  • Familie: vit_pose (vit_pose_small / vit_pose_small_bn)

Invoer en uitvoer

Invoer: afbeelding, video of USB-cameraframe. Uitvoer: 17 COCO-sleutelpunten (x, y, score) en MJPEG-voorbeeld met skelet.