CV / MobileSAM

MobileSAM

Prompt-based MobileSAM image segmentation with RKNN encoder and decoder models.

31 ダウンロード
精度
RKNN

使用しているデバイスを選択してください。セットアップガイドとドキュメントがそれに応じて更新されます。

はじめる

デプロイ
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
  python web_service.py --platform rk3576 --model_dir /app/model --camera_id -1 --host 0.0.0.0 --port 8000

REST API

REST API を使用して推論を実行します。以下のコマンドをコピーしてください。

Curl
curl http://localhost:8080/v1/chat/completions -d '{
  "model": "mobilesam-rknn",
  "messages": [{"role": "user", "content": "Hello"}]
}'
Python
import requests

resp = requests.post(
    "http://localhost:8080/v1/chat/completions",
    json={"model": "mobilesam-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())

モデル詳細

クイックスタート

1. Docker のインストール

開発ボードで次のコマンドを実行して Docker をインストールします:

bash
# Docker
curl -fsSL https://get.docker.com -o get-docker.sh
# Aliyun
sudo sh get-docker.sh --mirror Aliyun
# systemd
sudo systemctl enable docker
sudo systemctl start docker

2. プロジェクトの実行(1コマンド、デュアルモードプレビュー)

このデプロイはreComputer-RK-CVのMobile Segment Anythingをパッケージ化しています。画像エンコーダと二つのプロンプトに固定されたデコーダはいずれもRKNNモデルとして動作します。

モデル情報

コンポーネントファイル
画像エンコーダmodel/mobilesam_encoder.rknn
プロンプトデコーダmodel/mobilesam_decoder.rknn
入力前処理448 x 448
プロンプトボックスまたは前景/背景ポイント
出力マスク、選択マスクのインデックス、品質スコア、ピクセル数

ステップ A:イメージをプル

bash
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-mobilesam:latest
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest

ステップ B:ワンクリックで実行

** RK3576:**

bash
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
  python web_service.py --platform rk3576 --model_dir /app/model \
  --camera_id -1 --host 0.0.0.0 --port 8000

** RK3588:**

bash
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-mobilesam:latest \
  python web_service.py --platform rk3588 --model_dir /app/model \
  --camera_id -1 --host 0.0.0.0 --port 8000

http://<BOARD_IP>:8000を開き、画像をアップロードしてボックスを描くか、前景/背景ポイントを追加します。現在のプロンプトは変更されるまで、画像、カメラ、ローカル動画、アップロード動画の推論で共有されます。


🔌 API ドキュメント

1. プロンプトセグメンテーション(Predict)

エンドポイント: POST /api/models/mobilesam/predict

リクエストパラメータ(Multipart/Form-Data):

fileをアップロードし、point_coordsとpoint_labelsで2つの点またはボックス角を指定します。

使用例:

bash
curl -X POST "http://<BOARD_IP>:8000/api/models/mobilesam/predict" \
  -F "file=@picture.jpg" \
  -F 'point_coords=[[190,70],[460,280]]' \
  -F 'point_labels=[2,3]'

ランタイムはプロンプト座標をエンコーダ入力へ合わせてスケーリングし、エンコーダとデコーダを実行し、指定された、または最もスコアの高いマスクを選択して元画像へ復元します。ヘルス、設定、MJPEG、非同期動画のインターフェースも利用できます。

2. システム設定インターフェース(Config)

レスポンスにはiou_scores、selected_mask、mask_pixels、実際に使用したプロンプトが含まれます。GET /api/configは永続的なストリームプロンプトを返し、POST /api/configはpoint_coordsとpoint_labelsを受け付けます。両方をnullにすると全画像モードへ戻ります。汎用のthresholdとtopkはマスク選択を変更しません。

アップロード動画では解析開始時に有効だった永続プロンプトを使用します。標準の/api/video/*エンドポイントがアップロード、解析、進捗、一覧、ダウンロード操作を提供します。

エンコーダとデコーダはパイプライン段階であり、モデルサイズの選択肢ではありません。どちらかを置き換える場合も両ファイルの互換性が必要です。エンコーダはアスペクト比を維持し、長辺を448にリサイズして448 x 448へパディングします。固定デコーダの契約ではプロンプト座標とラベルが正確に二つ必要です。

3. コマンドライン引数

引数デフォルト説明
--platform必須rk3576またはrk3588。
--model_dirmodelエンコーダ、デコーダ、ウォームアップ画像のディレクトリ。
--camera_id-1カメラインデックス。-1はアップロードのみを有効にします。
--video, --video_pathなしループ再生するローカル動画。カメラより優先されます。
--host / --port0.0.0.0 / 8000サービスアドレスとポート。

Web UIはドラッグしたボックス、正のポイント、負のポイント、全画像プロンプトに対応します。プロンプトを更新すると、コンテナを再起動せずに後続のストリームおよびアップロード動画フレームへ反映されます。


リアルタイム動画ストリーム(Video Feed)

ブラウザプレビュー用の最新の注釈付き MJPEG ストリームを取得します:

  • エンドポイント: GET /api/video_feed
  • 使用例: <img src="http://<BOARD_IP>:8000/api/video_feed">

🛠️ 開発者ガイド(本番環境向け推奨事項)

ローカルでビルドする

bash
docker build -f docker/rk3576/mobilesam.dockerfile \
  -t rk3576-mobilesam:local src/rk3576_mobilesam

docker build -f docker/rk3588/mobilesam.dockerfile \
  -t rk3588-mobilesam:local src/rk3588_mobilesam

入力と出力

Input: image plus box or point prompts. Output: segmentation mask, mask score, and overlay.