CV / ViTPose

ViTPose-Small

reComputer R Series + Hailo-8 上で 17 個の COCO キーポイントを出力する ViTPose-Small 単一人物 2D 姿勢推定モデル。

53 ダウンロード
サイズ
31 MB
メモリ
4GB+
精度
Hailo HEF / HailoRT 4.23.x (Hailo-8) / 5.1.1 (Hailo-10H)

使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。

はじめる

デプロイ
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

REST API

REST API を使用して推論を実行します。以下のコマンドをコピーしてください。

Curl
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
Python
import requests
response = requests.post(
    "http://<Board_IP>:8000/api/models/vit_pose_small/predict",
    files={"file": open("test.jpg", "rb")},
    timeout=30,
)
print(response.json())

モデル詳細

reComputer R Series (CM5 + Hailo-8)

reComputer R Series(CM5 + Hailo-8)上の ViTPose-Small

ViTPose-Small は単一人物の 2D 姿勢を推定し、17 個の COCO 人体キーポイントを出力します。HEF は 64x48x17 ヒートマップを出力し、アプリはチャンネルごとの最大値を求め、入力空間へ拡大して骨格を描画します。

http://<Board_IP>:8000 を開いて Web プレビューを表示します。

モデル情報

項目値
アーキテクチャViT-Small (ViTPose)
タスクSingle-person pose estimation
入力256x192x3 RGB (normalize_in_net ImageNet RGB)
出力Heatmap 64x48x17 (17 COCO keypoints)
パラメータ24.29M
演算量17.17G
HEFHailo Model Zoo v2.19.0, Hailo-8

ハードウェアとホストの設定

bash
sudo apt update
sudo apt install hailort hailort-pcie-driver python3-hailort
sudo reboot
hailortcli --version
hailortcli fw-control identify
ls -l /dev/hailo0

デモ動画で実行

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --video_path video/test.mp4

USB カメラモード

bash
sudo docker run --rm \
  --name cm5-hailo8-vitpose-small \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  --device /dev/video0:/dev/video0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest \
  python web_detection.py --model_path model/vit_pose_small.hef --camera_id 0

REST API

text
POST http://<Board_IP>:8000/api/models/vit_pose_small/predict
bash
curl -X POST "http://<Board_IP>:8000/api/models/vit_pose_small/predict" \
  -F "file=@test.jpg"
エンドポイントメソッド用途
/GETWeb プレビュー UI
/api/models/vit_pose_small/predictPOST17 キーポイント(JSON)
/api/video_feedGET骨格付き MJPEG プレビュー

実装上の注意

  • 単一人物:人物がクロップ中央にいることを前提とします。複数人物では、先に検出器(YOLO)で各人物をクロップする必要があります。
  • 後処理:各ヒートマップチャンネルで argmax → 64×48 座標 → 256×192 入力へ拡大 → 元フレームへ letterbox を逆変換。DARK サブピクセル補正は使用しません。
  • ImageNet RGB の平均・標準偏差による normalize_in_net を使用します。input_conversion はないため、letterbox 後の uint8 RGB をそのまま入力します。

開発情報

  • ソースモジュール: src/rpi5_hailo8_vit_pose_small/
  • Dockerfile: docker/hailo8/vit_pose_small.dockerfile
  • コンテナ: ghcr.io/seeed-projects/recomputer-hailo8-cv/vit_pose_small:latest
  • ファミリー: vit_pose (vit_pose_small / vit_pose_small_bn)

入力と出力

入力:画像、動画、または USB カメラフレーム。出力:17 個の COCO キーポイント(x、y、スコア)と骨格を重ねた MJPEG プレビュー。