CV / ViTPose
ViTPose-Small
Estimación de pose 2D de una persona con 17 puntos COCO mediante ViTPose-Small en reComputer R Series con Hailo-8.
53 descargas
Tamaño
31 MBMemoria
4GB+Precisión
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)Elige el dispositivo que estás usando. La guía de configuración y la documentación se actualizarán en consecuencia.
Primeros pasos
Desplegar
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4API REST
Usa la API REST para ejecutar inferencia. Copia los comandos siguientes.
Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"Python
import requests
response = requests.post(
"http://<Board_IP>:8000/api/models/vit_pose_small/predict",
files={"file": open("test.jpg", "rb")},
timeout=30,
)
print(response.json())Detalles del modelo
reComputer R Series (CM5 + Hailo-8)ViTPose-Small en reComputer R Series (CM5 + Hailo-8)
ViTPose-Small estima la pose 2D de una persona y produce 17 puntos corporales COCO. El HEF genera un mapa de calor 64x48x17; la aplicación calcula el máximo por canal, escala al espacio de entrada y dibuja el esqueleto.
Abra http://<Board_IP>:8000 para ver la vista web.
Información del modelo
| Propiedad | Valor |
|---|---|
| Arquitectura | ViT-Small (ViTPose) |
| Tarea | Single-person pose estimation |
| Entrada | 256x192x3 RGB (normalize_in_net ImageNet RGB) |
| Salida | Heatmap 64x48x17 (17 COCO keypoints) |
| Parámetros | 24.29M |
| Operaciones | 17.17G |
| HEF | Hailo Model Zoo v2.19.0, Hailo-8 |
Configuración del hardware y del sistema
bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0Ejecución con el vídeo de demostración
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4Modo de cámara USB
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
--device /dev/video0:/dev/video0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0API REST
text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predictbash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"| Endpoint | Método | Finalidad |
|---|---|---|
/ | GET | Interfaz de vista previa web |
/api/models/vit_pose_small/predict | POST | 17 puntos (JSON) |
/api/video_feed | GET | Vista MJPEG con esqueleto |
Notas de implementación
- Una persona: el modelo supone que la persona está centrada en el recorte. Para varias personas, un detector (YOLO) debe recortar primero cada una.
- Posprocesado: argmax por canal → coordenadas 64×48 → escala a la entrada 256×192 → eliminación de letterbox hacia el fotograma original. Sin refinamiento subpíxel DARK.
normalize_in_netusa media/desviación RGB de ImageNet; sin input_conversion, se suministra RGB uint8 tras letterbox.
Notas de desarrollo
- Módulo fuente:
src/rpi5_hailo8_vit_pose_small/ - Dockerfile:
docker/hailo8/vit_pose_small.dockerfile - Contenedor:
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest - Familia: vit_pose (vit_pose_small / vit_pose_small_bn)
Entradas y salidas
Entrada: imagen, vídeo o fotograma de cámara USB. Salida: 17 puntos COCO (x, y, puntuación) y vista MJPEG con el esqueleto.