CV / MobileSAM
MobileSAM
Segment objects using a box or foreground/background point prompts in the Web UI or REST API.
使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。
はじめる
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
--device /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
python web_service.py --platform rk3576 --model_dir /app/model --camera_id -1 --host 0.0.0.0 --port 8000REST API
REST API を使用して推論を実行します。以下のコマンドをコピーしてください。
curl http://localhost:8080/v1/chat/completions -d '{
"model": "mobilesam-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "mobilesam-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())モデル詳細
reComputer RK3576およびRK3588でMobileSAMを実行する
このデプロイはreComputer-RK-CVのMobile Segment Anythingをパッケージ化しています。画像エンコーダと二つのプロンプトに固定されたデコーダはいずれもRKNNモデルとして動作します。
モデル情報
| コンポーネント | ファイル |
|---|---|
| 画像エンコーダ | model/mobilesam_encoder.rknn |
| プロンプトデコーダ | model/mobilesam_decoder.rknn |
| 入力前処理 | 448 x 448 |
| プロンプト | ボックスまたは前景/背景ポイント |
| 出力 | マスク、選択マスクのインデックス、品質スコア、ピクセル数 |
サービスを実行する
RK3576
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
--device /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
python web_service.py --platform rk3576 --model_dir /app/model \
--camera_id -1 --host 0.0.0.0 --port 8000RK3588
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
--device /dev/dri/renderD129:/dev/dri/renderD129 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-mobilesam:latest \
python web_service.py --platform rk3588 --model_dir /app/model \
--camera_id -1 --host 0.0.0.0 --port 8000http://<BOARD_IP>:8000を開き、画像をアップロードしてボックスを描くか、前景/背景ポイントを追加します。現在のプロンプトは変更されるまで、画像、カメラ、ローカル動画、アップロード動画の推論で共有されます。
入力モードと起動引数
| 引数 | デフォルト | 説明 |
|---|---|---|
--platform | 必須 | rk3576またはrk3588。 |
--model_dir | model | エンコーダ、デコーダ、ウォームアップ画像のディレクトリ。 |
--camera_id | -1 | カメラインデックス。-1はアップロードのみを有効にします。 |
--video, --video_path | なし | ループ再生するローカル動画。カメラより優先されます。 |
--host / --port | 0.0.0.0 / 8000 | サービスアドレスとポート。 |
Web UIはドラッグしたボックス、正のポイント、負のポイント、全画像プロンプトに対応します。プロンプトを更新すると、コンテナを再起動せずに後続のストリームおよびアップロード動画フレームへ反映されます。
REST API
エンドポイント: POST /api/models/mobilesam/predict
Multipartリクエストはfile、point_coords、point_labelsを受け付けます。point_coordsには元画像上の座標を正確に二つ含める必要があります。SAMプロンプトラベルは、負のポイントが0、正のポイントが1、ボックス左上が2、右下が3です。
curl -X POST "http://<BOARD_IP>:8000/api/models/mobilesam/predict" \
-F "file=@picture.jpg" \
-F 'point_coords=[[190,70],[460,280]]' \
-F 'point_labels=[2,3]'ランタイムはプロンプト座標をエンコーダ入力へ合わせてスケーリングし、エンコーダとデコーダを実行し、指定された、または最もスコアの高いマスクを選択して元画像へ復元します。ヘルス、設定、MJPEG、非同期動画のインターフェースも利用できます。
レスポンスにはiou_scores、selected_mask、mask_pixels、実際に使用したプロンプトが含まれます。GET /api/configは永続的なストリームプロンプトを返し、POST /api/configはpoint_coordsとpoint_labelsを受け付けます。両方をnullにすると全画像モードへ戻ります。汎用のthresholdとtopkはマスク選択を変更しません。
アップロード動画では解析開始時に有効だった永続プロンプトを使用します。標準の/api/video/*エンドポイントがアップロード、解析、進捗、一覧、ダウンロード操作を提供します。
エンコーダとデコーダはパイプライン段階であり、モデルサイズの選択肢ではありません。どちらかを置き換える場合も両ファイルの互換性が必要です。エンコーダはアスペクト比を維持し、長辺を448にリサイズして448 x 448へパディングします。固定デコーダの契約ではプロンプト座標とラベルが正確に二つ必要です。
ローカルでビルドする
docker build -f docker/rk3576/mobilesam.dockerfile \
-t rk3576-mobilesam:local src/rk3576_mobilesam
docker build -f docker/rk3588/mobilesam.dockerfile \
-t rk3588-mobilesam:local src/rk3588_mobilesam入力と出力
Input: image plus box or point prompts. Output: segmentation mask, mask score, and overlay.