CV / ViTPose
ViTPose-Small
reComputer R Series + Hailo-8 上で 17 個の COCO キーポイントを出力する ViTPose-Small 単一人物 2D 姿勢推定モデル。
53 ダウンロード
サイズ
31 MBメモリ
4GB+精度
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。
はじめる
デプロイ
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4REST API
REST API を使用して推論を実行します。以下のコマンドをコピーしてください。
Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"Python
import requests
response = requests.post(
"http://<Board_IP>:8000/api/models/vit_pose_small/predict",
files={"file": open("test.jpg", "rb")},
timeout=30,
)
print(response.json())モデル詳細
reComputer R Series (CM5 + Hailo-8)reComputer R Series(CM5 + Hailo-8)上の ViTPose-Small
ViTPose-Small は単一人物の 2D 姿勢を推定し、17 個の COCO 人体キーポイントを出力します。HEF は 64x48x17 ヒートマップを出力し、アプリはチャンネルごとの最大値を求め、入力空間へ拡大して骨格を描画します。
http://<Board_IP>:8000 を開いて Web プレビューを表示します。
モデル情報
| 項目 | 値 |
|---|---|
| アーキテクチャ | ViT-Small (ViTPose) |
| タスク | Single-person pose estimation |
| 入力 | 256x192x3 RGB (normalize_in_net ImageNet RGB) |
| 出力 | Heatmap 64x48x17 (17 COCO keypoints) |
| パラメータ | 24.29M |
| 演算量 | 17.17G |
| HEF | Hailo Model Zoo v2.19.0, Hailo-8 |
ハードウェアとホストの設定
bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0デモ動画で実行
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4USB カメラモード
bash
sudo docker run --rm \
--name cm5-hailo8-vitpose-small \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
--device /dev/video0:/dev/video0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0REST API
text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predictbash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
-F "file=@test.jpg"| エンドポイント | メソッド | 用途 |
|---|---|---|
/ | GET | Web プレビュー UI |
/api/models/vit_pose_small/predict | POST | 17 キーポイント(JSON) |
/api/video_feed | GET | 骨格付き MJPEG プレビュー |
実装上の注意
- 単一人物:人物がクロップ中央にいることを前提とします。複数人物では、先に検出器(YOLO)で各人物をクロップする必要があります。
- 後処理:各ヒートマップチャンネルで argmax → 64×48 座標 → 256×192 入力へ拡大 → 元フレームへ letterbox を逆変換。DARK サブピクセル補正は使用しません。
- ImageNet RGB の平均・標準偏差による
normalize_in_netを使用します。input_conversion はないため、letterbox 後の uint8 RGB をそのまま入力します。
開発情報
- ソースモジュール:
src/rpi5_hailo8_vit_pose_small/ - Dockerfile:
docker/hailo8/vit_pose_small.dockerfile - コンテナ:
ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest - ファミリー: vit_pose (vit_pose_small / vit_pose_small_bn)
入力と出力
入力:画像、動画、または USB カメラフレーム。出力:17 個の COCO キーポイント(x、y、スコア)と骨格を重ねた MJPEG プレビュー。