CV / Depth-Anything
Depth-Anything-V2-ViTS
Depth-Anything-V2-Small (ViT-S backbone) outputs a 224x224 relative depth map. The app normalizes it, applies an INFERNO colormap, and alpha-blends onto the original frame. First variant of the depth_anything family.
选择你正在使用的设备,设置指南和文档将相应更新。
快速开始
sudo docker run --rm \
--name cm5-hailo8-depth-anything-v2-vits \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/depth_anything_v2_vits:latest \
python web_detection.py --model_path model/depth_anything_v2_vits.hef --video_path video/test.mp4REST API
使用 REST API 进行推理。复制以下命令。
curl -X POST "http://<Board_IP>:8000/api/models/depth_anything_v2_vits/predict" \
-F "file=@test.jpg"import requests
response = requests.post(
"http://<Board_IP>:8000/api/models/depth_anything_v2_vits/predict",
files={"file": open("test.jpg", "rb")},
timeout=30,
)
print(response.json())模型详情
Depth-Anything-V2-ViTS on reComputer R Series (CM5 + Hailo-8)
Depth-Anything-V2-Small (ViT-S backbone) performs zero-shot monocular depth estimation on Hailo-8. The HEF outputs a 224×224×1 relative depth map; the app normalizes it, applies an INFERNO colormap, and alpha-blends onto the original frame.
Model Info
| Property | Value |
|---|---|
| Architecture | ViT-S (Depth-Anything-V2-Small-hf) |
| Task | Zero-shot depth estimation |
| Input | 224x224x3 RGB |
| Output | Depth map 224x224x1 (relative) |
| Parameters | 24.2M |
| Operations | 16.7G |
| AbsRel | 0.147 |
| HEF | Hailo Model Zoo v2.19.0, Hailo-8 |
Run With Demo Video
sudo docker run --rm \
--name cm5-hailo8-depth-anything-v2-vits \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/depth_anything_v2_vits:latest \
python web_detection.py --model_path model/depth_anything_v2_vits.hef --video_path video/test.mp4Open http://<Board_IP>:8000 to view the depth overlay.
REST API
curl -X POST "http://<Board_IP>:8000/api/models/depth_anything_v2_vits/predict" \
-F "file=@test.jpg"Returns depth_stats (min, max, mean, std) for the predicted depth map.
| Endpoint | Method | Purpose |
|---|---|---|
/api/models/depth_anything_v2_vits/predict | POST | Depth statistics (JSON) |
/api/video_feed | GET | MJPEG with INFERNO depth overlay |
Implementation Notes
- Relative depth: output is per-frame min-max normalized (not metric). Higher = farther. Dark (INFERNO) = close, bright = far.
- Slider controls alpha blend between original frame and depth colormap.
normalize_in_netImageNet RGB; no input_conversion → feed raw uint8 RGB.- No on-chip post-processing — raw FLOAT32 depth map output.
Development Notes
- Source:
src/rpi5_hailo8_depth_anything_v2_vits/ - Container:
ghcr.io/seeed-projects/recomputer-hailo8-cv/depth_anything_v2_vits:latest - Family: depth_anything (variants v2_vits / vits)
输入与输出
Input: image, video, or USB camera frame. Output: relative depth map with INFERNO colormap overlay on MJPEG preview, plus depth statistics (min/max/mean/std) via API.