CV / PaddleOCR
PaddleOCR v5 Mobile Detection
Text-region detection for document images on reComputer R Series with Hailo-8 or Hailo-10H.
Elige el dispositivo que estás usando. La guía de configuración y la documentación se actualizarán en consecuencia.
Primeros pasos
sudo docker run --rm \
--name cm5-hailo8-paddle-ocr-v5-mobile-detection \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo8-cv/paddle_ocr_v5_mobile_detection:latest \
python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --video_path video/test.mp4Detalles del modelo
reComputer R Series (CM5 + Hailo-10H)PaddleOCR v5 Mobile Detection en reComputer R Series (CM5 + Hailo-10H)
PaddleOCR v5 Mobile Detection localiza regiones de texto en imágenes de documentos en Hailo-10H a través de HailoRT 5.1.1. La cabeza DB (binarización diferenciable) emite un mapa de probabilidad; las regiones se extraen en la CPU como polígonos cuadriláteros.
Esta página está dirigida a reComputer R Series (CM5 + Hailo-10H) con un acelerador Hailo-10H PCIe.
Información del modelo
| Propiedad | Valor |
|---|---|
| Arquitectura | PaddleOCR v5 Mobile (detector de texto DB) |
| Tarea | Detección de texto |
| Entrada | 544×960×3 |
| Salida | Mapa de probabilidad de regiones de texto → cuadriláteros |
| Parámetros | 1.2M |
| Operaciones | 6.5G |
| Precisión | 4.60 métrica DB (referencia del Model Zoo) |
| HEF | Hailo Model Zoo v5.4.0, Hailo-10H |
Hardware y configuración del host
| Elemento | Valor |
|---|---|
| Placa | reComputer R Series con Raspberry Pi CM5 |
| Acelerador | Hailo-10H vía PCIe, expuesto como /dev/hailo0 |
| Driver del host | paquete apt hailo-h10-all |
| Runtime | HailoRT 5.1.1 (host y contenedor deben compartir major.minor) |
| Python en contenedor | 3.13, aarch64 |
sudo apt update
sudo apt install hailo-h10-all -y
sudo reboot
# After reboot
hailortcli fw-control identify
ls /dev/hailo0
# Docker
curl -fsSL https://get.docker.com -o get-docker.sh
sudo sh get-docker.sh --mirror Aliyun
sudo systemctl enable docker
sudo systemctl start dockerEjecutar con vídeo de demostración
sudo docker run --rm \
--name hailo10h-paddle-ocr-detection \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
-v /usr/lib/libhailort.so.5.1.1:/usr/lib/libhailort.so.5.1.1:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest \
python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --video_path video/test.mp4Abre http://<Board_IP>:8000 para ver la vista previa web (cuadriláteros
verdes alrededor de las regiones de texto detectadas).
Modo cámara USB
sudo docker run --rm \
--name hailo10h-paddle-ocr-detection \
--privileged \
--net=host \
-e PYTHONUNBUFFERED=1 \
--device /dev/hailo0:/dev/hailo0 \
--device /dev/video0:/dev/video0 \
-v /usr/lib/libhailort.so.5.1.1:/usr/lib/libhailort.so.5.1.1:ro \
-v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest \
python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --camera_id 0REST API
curl -X POST "http://<Board_IP>:8000/api/models/paddle_ocr_v5_mobile_detection/predict" \
-F "file=@test.png"| Endpoint | Método | Propósito |
|---|---|---|
/api/models/paddle_ocr_v5_mobile_detection/predict | POST | Polígonos de regiones de texto (JSON) |
/api/video_feed | GET | Flujo de vista previa MJPEG |
/api/config | GET / POST | Umbrales de puntuación de caja / binarización |
Notas de desarrollo
- Módulo de origen:
src/hailo10h_paddle_ocr_v5_mobile_detection/ - Dockerfile:
docker/hailo10h/paddle_ocr_v5_mobile_detection.dockerfile - Contenedor:
ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest - El posprocesado DB no cambia; el ejecutor es la API
create_infer_modelde HailoRT 5.1.1. - Combínalo con el módulo de reconocimiento a nivel de aplicación para leer el texto dentro de cada región detectada.
Entradas y salidas
Input: full document image or demo video frame. Output: detected text-region polygons, bounding boxes, and annotated MJPEG preview.