CV / MobileSAM

MobileSAM

Prompt-based MobileSAM image segmentation with RKNN encoder and decoder models.

31 次下载
精度
RKNN

选择你正在使用的设备,设置指南和文档将相应更新。

快速开始

部署
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
  python web_service.py --platform rk3576 --model_dir /app/model --camera_id -1 --host 0.0.0.0 --port 8000

REST API

使用 REST API 进行推理。复制以下命令。

Curl
curl http://localhost:8080/v1/chat/completions -d '{
  "model": "mobilesam-rknn",
  "messages": [{"role": "user", "content": "Hello"}]
}'
Python
import requests

resp = requests.post(
    "http://localhost:8080/v1/chat/completions",
    json={"model": "mobilesam-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())

模型详情

快速开始

1. 安装 Docker

在开发板上运行以下命令安装 Docker:

bash
# Docker
curl -fsSL https://get.docker.com -o get-docker.sh
# Aliyun
sudo sh get-docker.sh --mirror Aliyun
# systemd
sudo systemctl enable docker
sudo systemctl start docker

2. 运行项目(单条命令,双模式预览)

此部署打包了 reComputer-RK-CV 中的 Mobile Segment Anything。图像编码器和固定双提示解码器均作为 RKNN 模型运行。

模型信息

组件文件
图像编码器model/mobilesam_encoder.rknn
提示解码器model/mobilesam_decoder.rknn
输入预处理448 x 448
提示边界框或前景/背景点
输出掩码、所选掩码索引、质量分数和像素数

步骤 A:拉取镜像

bash
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-mobilesam:latest
sudo docker pull ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest

步骤 B:一键运行

适用于 RK3576:

bash
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-mobilesam:latest \
  python web_service.py --platform rk3576 --model_dir /app/model \
  --camera_id -1 --host 0.0.0.0 --port 8000

适用于 RK3588:

bash
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  --device /dev/dri/renderD129:/dev/dri/renderD129 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-mobilesam:latest \
  python web_service.py --platform rk3588 --model_dir /app/model \
  --camera_id -1 --host 0.0.0.0 --port 8000

打开 http://<BOARD_IP>:8000 上传图像并绘制边界框,或添加前景/背景点。当前提示会由图像、摄像头、本地视频和上传视频推理共享,直到被修改。


🔌 API 文档

1. 提示分割接口(Predict)

端点: POST /api/models/mobilesam/predict

请求参数(Multipart/Form-Data):

上传 file,并通过 point_coords 和 point_labels 提供两个提示点或边界框角点。

使用示例:

bash
curl -X POST "http://<BOARD_IP>:8000/api/models/mobilesam/predict" \
  -F "file=@picture.jpg" \
  -F 'point_coords=[[190,70],[460,280]]' \
  -F 'point_labels=[2,3]'

运行时会将提示坐标缩放到编码器输入,运行编码器和解码器,选择指定或得分最高的掩码,再将其恢复到源图像。服务还提供健康检查、配置、MJPEG 和异步视频接口。

2. 系统配置接口(Config)

响应包含 iou_scores、selected_mask、mask_pixels 和实际使用的提示。GET /api/config 返回持久化的视频流提示;POST /api/config 接受 point_coords 和 point_labels,或将两者都设为 null 以恢复全图模式。通用 threshold 和 topk 值不会改变掩码选择。

上传视频使用分析开始时生效的持久提示。标准 /api/video/* 端点提供上传、分析、进度、列表和下载操作。

编码器和解码器是流水线阶段,而不是不同模型大小的替代项。替换任一模型时,两个文件必须保持兼容。编码器保持宽高比,将长边缩放到 448,并填充到 448 x 448;固定解码器契约要求正好两个提示坐标和标签。

3. 命令行参数

参数默认值说明
--platform必填rk3576 或 rk3588。
--model_dirmodel编码器、解码器和预热图像目录。
--camera_id-1摄像头索引;-1 表示仅允许上传。
--video, --video_path无循环播放的本地视频;优先级高于摄像头。
--host / --port0.0.0.0 / 8000服务地址和端口。

Web 界面支持拖拽边界框、正点、负点和全图提示。更新提示后,无需重启容器即可影响后续视频流和上传视频帧。


实时视频流接口(Video Feed)

获取带标注的最新 MJPEG 视频流,用于浏览器预览:

  • 端点: GET /api/video_feed
  • 示例用法: <img src="http://<BOARD_IP>:8000/api/video_feed">

🛠️ 开发者指南(生产环境建议)

本地构建

bash
docker build -f docker/rk3576/mobilesam.dockerfile \
  -t rk3576-mobilesam:local src/rk3576_mobilesam

docker build -f docker/rk3588/mobilesam.dockerfile \
  -t rk3588-mobilesam:local src/rk3588_mobilesam

输入与输出

Input: image plus box or point prompts. Output: segmentation mask, mask score, and overlay.