CV / CLIP

CLIP ViT-B/32

OpenAI CLIP ViT-B/32 voor beeld-tekstvergelijking, versneld met RKNN op reComputer RK3576 en RK3588.

6 downloads
Precisie
RKNN

Kies het apparaat dat je gebruikt. De installatiehandleiding en documentatie worden dienovereenkomstig bijgewerkt.

Aan de slag

Implementeren
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latest

REST API

Gebruik de REST API om inferentie uit te voeren. Kopieer de onderstaande commando's.

Curl
curl http://localhost:8080/v1/chat/completions -d '{
  "model": "clip-rknn",
  "messages": [{"role": "user", "content": "Hello"}]
}'
Python
import requests

resp = requests.post(
    "http://localhost:8080/v1/chat/completions",
    json={"model": "clip-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())

Modeldetails

Snel aan de slag

1. Docker installeren

Voer de volgende opdrachten uit op het ontwikkelbord om Docker te installeren:

bash
# Installatiescript downloaden
curl -fsSL https://get.docker.com -o get-docker.sh
# Installeren via de Aliyun-mirror
sudo sh get-docker.sh --mirror Aliyun
# Docker starten en automatisch opstarten inschakelen
sudo systemctl enable docker
sudo systemctl start docker

2. Het project uitvoeren (één opdracht en Webvoorbeeld)

Dit project biedt zero-shot-beeldclassificatie en zoeken met natuurlijke taal; beide encoders draaien met RKNN.

Stap A: images ophalen

bash
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-clip:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-clip:latest

Stap B: met één opdracht starten

Voor RK3588:

bash
sudo docker run --rm --privileged --net=host \
+    -e PYTHONUNBUFFERED=1 \
+    -e RKNN_LOG_LEVEL=0 \
+    -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+    ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-clip:latest

Openen via: http://<Board_IP>:8000


Voor RK3576:

bash
sudo docker run --rm --privileged --net=host \
+    -e PYTHONUNBUFFERED=1 \
+    -e RKNN_LOG_LEVEL=0 \
+    -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+    ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latest

Openen via: http://<Board_IP>:8000

3. Inferentie via de opdrachtregel

bash
python inference.py --platform rk3576 --model_dir model \
+    --file samples/dog_224x224.jpg \
+    --prompts 'a photo of a dog|a photo of a cat'

Gebruik --platform rk3588 wanneer u vanuit de RK3588-bronmap werkt.


🔌 API-documentatie

Endpoint: POST /api/models/clip/predict

Aanvraagparameters (Multipart/Form-Data):

  • file: verplicht afbeeldingsbestand; wordt voorbewerkt naar 224 x 224.
  • prompts: verplichte labels als JSON-array, regels of met | gescheiden waarden; maximaal 32.
  • topk: optioneel aantal resultaten van 1 tot 32; standaard 5.

Gebruiksvoorbeeld:

bash
curl -X POST "http://127.0.0.1:8000/api/models/clip/predict" \
+    -F 'file=@samples/dog_224x224.jpg' \
+    -F 'prompts=a photo of a dog|a photo of a cat' -F 'topk=2'

Antwoordformaat (JSON):

json
{
  "success": true,
  "model": "clip",
  "platform": "rk3576",
  "inference_time_ms": 58.2,
  "result": {
    "mode": "classification",
    "image": {
      "width": 224,
      "height": 224
    },
    "candidate_count": 2,
    "predictions": [
      {
        "text": "a photo of a dog",
        "score": 0.97
      }
    ]
  }
}

De tekstinvoer is vast op 20 tokens. POST /api/models/clip/retrieve accepteert 1–32 files-velden, verplicht text en optioneel topk. Per platform is één bundel beschikbaar, zonder kwantisatiekeuze.

2. Afbeeldingen zoeken met natuurlijke taal

Endpoint: POST /api/models/clip/retrieve

Aanvraagparameters (Multipart/Form-Data):

  • files: verplicht herhaald veld met 1–32 afbeeldingen.
  • text: verplichte zoekvraag in natuurlijke taal.
  • topk: optioneel aantal resultaten van 1 tot 32.

Gebruiksvoorbeeld:

bash
curl -X POST "http://127.0.0.1:8000/api/models/clip/retrieve" \
    -F 'files=@image1.jpg' -F 'files=@image2.jpg' \
    -F 'text=a red car' -F 'topk=2'

3. Interface voor systeemconfiguratie

Huidige configuratie ophalen

  • Endpoint: GET /api/config
  • Response: {"topk": 5}

Configuratie bijwerken

bash
curl -X POST "http://127.0.0.1:8000/api/config" \
+    -H 'Content-Type: application/json' -d '{"topk": 3}'

Gebruik GET /api/health om het actieve platform, de modelstatus, geladen RKNN-bestanden en mogelijkheden te bekijken. OpenAPI-documentatie staat op /docs.


🛠️ Handleiding voor ontwikkelaars (productieadvies)

Beschrijving van de code

  • web_service.py:
    • Web-API: biedt de browserinterface, inferentie, configuratie, status en aanvraagvalidatie.
  • task_runtime.py:
    • Verwerkt afbeeldingen en prompts, normaliseert kenmerken en berekent gelijkenissen.
  • inference.py: Biedt eenmalige inferentie via de opdrachtregel.

Modelbestanden

OnderdeelBestand
Image encodermodel/clip_images.rknn
Text encodermodel/clip_text.rknn
Vocabularymodel/clip_vocab.h

Modellen wijzigen

  1. Plaats compatibele geconverteerde bestanden in model/ en behoud de bestandsnamen uit de tabel.
  2. Houd alle onderdelen uit dezelfde conversiebundel en behoud de contracten voor invoer, uitvoer en voorverwerking.
  3. Test vóór publicatie de Web-, REST- en opdrachtregelroutes op RK3576 en RK3588.

Lokale images bouwen

Voer dit uit vanuit de hoofdmap van reComputer-RK-CV:

bash
docker build -f docker/rk3576/clip.dockerfile \
+    -t rk3576-clip:local src/rk3576_clip

docker build -f docker/rk3588/clip.dockerfile \
+    -t rk3588-clip:local src/rk3588_clip

Invoer en uitvoer

Invoer: afbeelding en kandidaatprompts, of maximaal 32 afbeeldingen en een tekstvraag. Uitvoer: genormaliseerde gelijkenisscores en gerangschikte resultaten.