CV / PaddleOCR

PaddleOCR v5 Mobile Detection

Text-region detection for document images on reComputer R Series with Hailo-8 or Hailo-10H.

24 descargas
Tamaño
5.49 MB
Memoria
4GB+
Precisión
Hailo HEF / HailoRT

Elige el dispositivo que estás usando. La guía de configuración y la documentación se actualizarán en consecuencia.

Primeros pasos

Desplegar
sudo docker run --rm \
  --name cm5-hailo8-paddle-ocr-v5-mobile-detection \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.4.23.0:/usr/lib/libhailort.so.4.23.0:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo8-cv/paddle_ocr_v5_mobile_detection:latest \
  python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --video_path video/test.mp4

Detalles del modelo

reComputer R Series (CM5 + Hailo-10H)

PaddleOCR v5 Mobile Detection en reComputer R Series (CM5 + Hailo-10H)

PaddleOCR v5 Mobile Detection localiza regiones de texto en imágenes de documentos en Hailo-10H a través de HailoRT 5.1.1. La cabeza DB (binarización diferenciable) emite un mapa de probabilidad; las regiones se extraen en la CPU como polígonos cuadriláteros.

Esta página está dirigida a reComputer R Series (CM5 + Hailo-10H) con un acelerador Hailo-10H PCIe.

Información del modelo

PropiedadValor
ArquitecturaPaddleOCR v5 Mobile (detector de texto DB)
TareaDetección de texto
Entrada544×960×3
SalidaMapa de probabilidad de regiones de texto → cuadriláteros
Parámetros1.2M
Operaciones6.5G
Precisión4.60 métrica DB (referencia del Model Zoo)
HEFHailo Model Zoo v5.4.0, Hailo-10H

Hardware y configuración del host

ElementoValor
PlacareComputer R Series con Raspberry Pi CM5
AceleradorHailo-10H vía PCIe, expuesto como /dev/hailo0
Driver del hostpaquete apt hailo-h10-all
RuntimeHailoRT 5.1.1 (host y contenedor deben compartir major.minor)
Python en contenedor3.13, aarch64
bash
sudo apt update
sudo apt install hailo-h10-all -y
sudo reboot

# After reboot
hailortcli fw-control identify
ls /dev/hailo0

# Docker
curl -fsSL https://get.docker.com -o get-docker.sh
sudo sh get-docker.sh --mirror Aliyun
sudo systemctl enable docker
sudo systemctl start docker

Ejecutar con vídeo de demostración

bash
sudo docker run --rm \
  --name hailo10h-paddle-ocr-detection \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  -v /usr/lib/libhailort.so.5.1.1:/usr/lib/libhailort.so.5.1.1:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest \
  python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --video_path video/test.mp4

Abre http://<Board_IP>:8000 para ver la vista previa web (cuadriláteros verdes alrededor de las regiones de texto detectadas).

Modo cámara USB

bash
sudo docker run --rm \
  --name hailo10h-paddle-ocr-detection \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  --device /dev/hailo0:/dev/hailo0 \
  --device /dev/video0:/dev/video0 \
  -v /usr/lib/libhailort.so.5.1.1:/usr/lib/libhailort.so.5.1.1:ro \
  -v /usr/lib/libhailort.so:/usr/lib/libhailort.so:ro \
  ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest \
  python web_detection.py --model_path model/paddle_ocr_v5_mobile_detection.hef --camera_id 0

REST API

bash
curl -X POST "http://<Board_IP>:8000/api/models/paddle_ocr_v5_mobile_detection/predict" \
  -F "file=@test.png"
EndpointMétodoPropósito
/api/models/paddle_ocr_v5_mobile_detection/predictPOSTPolígonos de regiones de texto (JSON)
/api/video_feedGETFlujo de vista previa MJPEG
/api/configGET / POSTUmbrales de puntuación de caja / binarización

Notas de desarrollo

  • Módulo de origen: src/hailo10h_paddle_ocr_v5_mobile_detection/
  • Dockerfile: docker/hailo10h/paddle_ocr_v5_mobile_detection.dockerfile
  • Contenedor: ghcr.io/seeed-projects/recomputer-hailo10h-cv/paddle_ocr_v5_mobile_detection:latest
  • El posprocesado DB no cambia; el ejecutor es la API create_infer_model de HailoRT 5.1.1.
  • Combínalo con el módulo de reconocimiento a nivel de aplicación para leer el texto dentro de cada región detectada.

Entradas y salidas

Input: full document image or demo video frame. Output: detected text-region polygons, bounding boxes, and annotated MJPEG preview.