CV / ViTPose
ViTPose-Small
ViTPose-Small 单人二维姿态估计模型,在 reComputer R Series + Hailo-8 上输出 17 个 COCO 关键点。
53 次下载
大小
31 MB内存
4GB+精度
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)选择你正在使用的设备,设置指南和文档将相应更新。
快速开始
部署
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4REST API
使用 REST API 进行推理。复制以下命令。
Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"Python
import requests
response = requests.post(
"http://<Board_IP>:8000/api/models/vit_pose_small/predict",
files={"file": open("test.jpg", "rb")},
timeout=30,
)
print(response.json())模型详情
reComputer R Series (CM5 + Hailo-8)reComputer R Series(CM5 + Hailo-8)上的 ViTPose-Small
ViTPose-Small 执行单人二维姿态估计,输出 17 个 COCO 人体关键点。HEF 输出 64x48x17 热力图;应用逐通道取最大值,将坐标缩放至输入空间并绘制骨架。
打开 http://<Board_IP>:8000 查看网页预览。
模型信息
| 属性 | 值 |
|---|---|
| 架构 | ViT-Small (ViTPose) |
| 任务 | Single-person pose estimation |
| 输入 | 256x192x3 RGB (normalize_in_net ImageNet RGB) |
| 输出 | Heatmap 64x48x17 (17 COCO keypoints) |
| 参数量 | 24.29M |
| 运算量 | 17.17G |
| HEF | Hailo Model Zoo v2.19.0, Hailo-8 |
硬件与主机设置
bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0使用演示视频运行
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4USB 摄像头模式
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
--device /dev/video0:/dev/video0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0REST API
text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predictbash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"| 端点 | 方法 | 用途 |
|---|---|---|
/ | GET | 网页预览界面 |
/api/models/vit_pose_small/predict | POST | 17 个关键点(JSON) |
/api/video_feed | GET | 带骨架的 MJPEG 预览 |
实现说明
- 单人模式:模型假设人物位于裁剪区域中央。多人场景必须先使用检测器(YOLO)裁剪每个人。
- 后处理:逐热力图通道取最大值 → 64×48 坐标 → 缩放到 256×192 输入 → 反 letterbox 映射到原始帧。不使用 DARK 亚像素优化。
- 使用 ImageNet RGB 均值/标准差进行
normalize_in_net;没有 input_conversion,因此 letterbox 后输入原始 uint8 RGB。
开发说明
- 源模块:
src/rpi5_hailo8_vit_pose_small/ - Dockerfile:
docker/hailo8/vit_pose_small.dockerfile - 容器:
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest - 系列: vit_pose (vit_pose_small / vit_pose_small_bn)
输入与输出
输入:图像、视频或 USB 摄像头帧。输出:17 个 COCO 关键点(x、y、置信度)以及带骨架叠加的 MJPEG 预览。