CV / ViTPose

ViTPose-Small

ViTPose-Small 单人二维姿态估计模型,在 reComputer R Series + Hailo-8 上输出 17 个 COCO 关键点。

53 次下载
大小
31 MB
内存
4GB+
精度
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)

选择你正在使用的设备,设置指南和文档将相应更新。

快速开始

部署
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

REST API

使用 REST API 进行推理。复制以下命令。

Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
Python
import requests
response = requests.post(
    "http://<Board_IP>:8000/api/models/vit_pose_small/predict",
    files={"file": open("test.jpg", "rb")},
    timeout=30,
)
print(response.json())

模型详情

reComputer R Series (CM5 + Hailo-8)

reComputer R Series(CM5 + Hailo-8)上的 ViTPose-Small

ViTPose-Small 执行单人二维姿态估计,输出 17 个 COCO 人体关键点。HEF 输出 64x48x17 热力图;应用逐通道取最大值,将坐标缩放至输入空间并绘制骨架。

打开 http://<Board_IP>:8000 查看网页预览。

模型信息

属性值
架构ViT-Small (ViTPose)
任务Single-person pose estimation
输入256x192x3 RGB (normalize_in_net ImageNet RGB)
输出Heatmap 64x48x17 (17 COCO keypoints)
参数量24.29M
运算量17.17G
HEFHailo Model Zoo v2.19.0, Hailo-8

硬件与主机设置

bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0

使用演示视频运行

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

USB 摄像头模式

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  --device /dev/video0:/dev/video0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0

REST API

text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predict
bash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
端点方法用途
/GET网页预览界面
/api/models/vit_pose_small/predictPOST17 个关键点(JSON)
/api/video_feedGET带骨架的 MJPEG 预览

实现说明

  • 单人模式:模型假设人物位于裁剪区域中央。多人场景必须先使用检测器(YOLO)裁剪每个人。
  • 后处理:逐热力图通道取最大值 → 64×48 坐标 → 缩放到 256×192 输入 → 反 letterbox 映射到原始帧。不使用 DARK 亚像素优化。
  • 使用 ImageNet RGB 均值/标准差进行 normalize_in_net;没有 input_conversion,因此 letterbox 后输入原始 uint8 RGB。

开发说明

  • 源模块: src/rpi5_hailo8_vit_pose_small/
  • Dockerfile: docker/hailo8/vit_pose_small.dockerfile
  • 容器: ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest
  • 系列: vit_pose (vit_pose_small / vit_pose_small_bn)

输入与输出

输入:图像、视频或 USB 摄像头帧。输出:17 个 COCO 关键点(x、y、置信度)以及带骨架叠加的 MJPEG 预览。