CV / CLIP
CLIP ViT-B/32
Correspondencia imagen-texto con OpenAI CLIP ViT-B/32 acelerada mediante RKNN en reComputer RK3576 y RK3588.
Elige el dispositivo que estás usando. La guía de configuración y la documentación se actualizarán en consecuencia.
Primeros pasos
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestAPI REST
Usa la API REST para ejecutar inferencia. Copia los comandos siguientes.
curl http://localhost:8080/v1/chat/completions -d '{
"model": "clip-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "clip-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())Detalles del modelo
Inicio rápido
1. Instalar Docker
Ejecute los siguientes comandos en la placa de desarrollo para instalar Docker:
# Descargar el script de instalación
curl -fsSL https://get.docker.com -o get-docker.sh
# Instalar mediante el mirror de Aliyun
sudo sh get-docker.sh --mirror Aliyun
# Iniciar Docker y habilitar el arranque automático
sudo systemctl enable docker
sudo systemctl start docker2. Ejecutar el proyecto (un comando y vista Web)
Este proyecto ofrece clasificación de imágenes sin ejemplos y recuperación por lenguaje natural; ambos codificadores se ejecutan con RKNN.
Paso A: descargar las imágenes
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-clip:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-clip:latestPaso B: ejecutar con un solo comando
Para RK3588:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-clip:latestAcceso: http://<Board_IP>:8000
Para RK3576:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestAcceso: http://<Board_IP>:8000
3. Inferencia por línea de comandos
python inference.py --platform rk3576 --model_dir model \
+ --file samples/dog_224x224.jpg \
+ --prompts 'a photo of a dog|a photo of a cat'Use --platform rk3588 al ejecutar desde el directorio de código de RK3588.
🔌 Documentación de la API
Endpoint: POST /api/models/clip/predict
Parámetros de la solicitud (Multipart/Form-Data):
file: imagen obligatoria; se preprocesa a224 x 224.prompts: etiquetas obligatorias como matriz JSON, líneas o valores separados por|; máximo 32.topk: cantidad opcional de resultados, de 1 a 32; valor predeterminado 5.
Ejemplo de uso:
curl -X POST "http://127.0.0.1:8000/api/models/clip/predict" \
+ -F 'file=@samples/dog_224x224.jpg' \
+ -F 'prompts=a photo of a dog|a photo of a cat' -F 'topk=2'Formato de respuesta (JSON):
{
"success": true,
"model": "clip",
"platform": "rk3576",
"inference_time_ms": 58.2,
"result": {
"mode": "classification",
"image": {
"width": 224,
"height": 224
},
"candidate_count": 2,
"predictions": [
{
"text": "a photo of a dog",
"score": 0.97
}
]
}
}La entrada de texto está fijada a 20 tokens. POST /api/models/clip/retrieve acepta entre 1 y 32 campos files, text obligatorio y topk opcional. Solo existe un paquete por plataforma, sin selector de cuantización.
2. Interfaz de recuperación de imágenes por lenguaje natural
Endpoint: POST /api/models/clip/retrieve
Parámetros de la solicitud (Multipart/Form-Data):
files: campo repetido obligatorio con entre 1 y 32 imágenes.text: consulta obligatoria en lenguaje natural.topk: cantidad opcional de resultados, entre 1 y 32.
Ejemplo de uso:
curl -X POST "http://127.0.0.1:8000/api/models/clip/retrieve" \
-F 'files=@image1.jpg' -F 'files=@image2.jpg' \
-F 'text=a red car' -F 'topk=2'3. Interfaz de configuración del sistema
Obtener la configuración actual
- Endpoint:
GET /api/config - Response:
{"topk": 5}
Actualizar la configuración
curl -X POST "http://127.0.0.1:8000/api/config" \
+ -H 'Content-Type: application/json' -d '{"topk": 3}'Use GET /api/health para consultar la plataforma activa, el estado del modelo, los archivos RKNN cargados y las capacidades. La documentación OpenAPI está en /docs.
🛠️ Guía para desarrolladores (recomendaciones de producción)
Descripción del código
web_service.py:- API Web: proporciona la interfaz del navegador, inferencia, configuración, estado y validación de solicitudes.
task_runtime.py:- Procesa imágenes e indicaciones, normaliza características y calcula similitudes.
inference.py: Proporciona inferencia puntual desde la línea de comandos.
Archivos del modelo
| Componente | Archivo |
|---|---|
| Image encoder | model/clip_images.rknn |
| Text encoder | model/clip_text.rknn |
| Vocabulary | model/clip_vocab.h |
Modificar los modelos
- Coloque los archivos convertidos compatibles en
model/y conserve los nombres de la tabla. - Mantenga todos los componentes en el mismo paquete de conversión y respete los contratos de entrada, salida y preprocesamiento.
- Antes de publicar, pruebe las rutas Web, REST y de línea de comandos en RK3576 y RK3588.
Crear imágenes locales
Ejecute desde la raíz de reComputer-RK-CV:
docker build -f docker/rk3576/clip.dockerfile \
+ -t rk3576-clip:local src/rk3576_clip
docker build -f docker/rk3588/clip.dockerfile \
+ -t rk3588-clip:local src/rk3588_clipEntradas y salidas
Entrada: una imagen y textos candidatos, o hasta 32 imágenes y una consulta de texto. Salida: puntuaciones de similitud normalizadas y resultados ordenados.