CV / CLIP

CLIP ViT-B/32

Mit RKNN beschleunigter OpenAI-CLIP-ViT-B/32-Abgleich von Bild und Text auf reComputer RK3576 und RK3588.

6 Downloads
Präzision
RKNN

Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.

Erste Schritte

Bereitstellen
sudo docker run --rm --privileged --net=host \
  -e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latest

REST API

Verwende die REST API für die Inferenz. Kopiere die folgenden Befehle.

Curl
curl http://localhost:8080/v1/chat/completions -d '{
  "model": "clip-rknn",
  "messages": [{"role": "user", "content": "Hello"}]
}'
Python
import requests

resp = requests.post(
    "http://localhost:8080/v1/chat/completions",
    json={"model": "clip-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())

Modelldetails

Schnellstart

1. Docker installieren

Führen Sie zur Installation von Docker folgende Befehle auf dem Entwicklungsboard aus:

bash
# Installationsskript herunterladen
curl -fsSL https://get.docker.com -o get-docker.sh
# Über den Aliyun-Spiegel installieren
sudo sh get-docker.sh --mirror Aliyun
# Docker starten und automatischen Start aktivieren
sudo systemctl enable docker
sudo systemctl start docker

2. Projekt ausführen (ein Befehl und Webvorschau)

Dieses Projekt bietet Zero-Shot-Bildklassifizierung und natürlichsprachliche Bildsuche; beide Encoder laufen mit RKNN.

Schritt A: Images abrufen

bash
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-clip:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-clip:latest

Schritt B: mit einem Befehl starten

Für RK3588:

bash
sudo docker run --rm --privileged --net=host \
+    -e PYTHONUNBUFFERED=1 \
+    -e RKNN_LOG_LEVEL=0 \
+    -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+    ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-clip:latest

Aufruf: http://<Board_IP>:8000


Für RK3576:

bash
sudo docker run --rm --privileged --net=host \
+    -e PYTHONUNBUFFERED=1 \
+    -e RKNN_LOG_LEVEL=0 \
+    -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+    ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latest

Aufruf: http://<Board_IP>:8000

3. Inferenz über die Befehlszeile

bash
python inference.py --platform rk3576 --model_dir model \
+    --file samples/dog_224x224.jpg \
+    --prompts 'a photo of a dog|a photo of a cat'

Verwenden Sie im RK3588-Quellverzeichnis --platform rk3588.


🔌 API-Dokumentation

Endpoint: POST /api/models/clip/predict

Anfrageparameter (Multipart/Form-Data):

  • file: erforderliche Bilddatei; sie wird auf 224 x 224 vorverarbeitet.
  • prompts: erforderliche Kandidaten als JSON-Array, zeilenweise oder mit | getrennt; maximal 32.
  • topk: optionale Trefferzahl von 1 bis 32; Standard 5.

Anwendungsbeispiel:

bash
curl -X POST "http://127.0.0.1:8000/api/models/clip/predict" \
+    -F 'file=@samples/dog_224x224.jpg' \
+    -F 'prompts=a photo of a dog|a photo of a cat' -F 'topk=2'

Antwortformat (JSON):

json
{
  "success": true,
  "model": "clip",
  "platform": "rk3576",
  "inference_time_ms": 58.2,
  "result": {
    "mode": "classification",
    "image": {
      "width": 224,
      "height": 224
    },
    "candidate_count": 2,
    "predictions": [
      {
        "text": "a photo of a dog",
        "score": 0.97
      }
    ]
  }
}

Die Texteingabe ist auf 20 Tokens festgelegt. POST /api/models/clip/retrieve akzeptiert 1–32 files, erforderliches text und optionales topk. Pro Plattform gibt es ein Paket ohne Quantisierungswahl.

2. Natürlichsprachliche Bildsuche

Endpunkt: POST /api/models/clip/retrieve

Anfrageparameter (Multipart/Form-Data):

  • files: erforderliches wiederholtes Feld mit 1–32 Bildern.
  • text: erforderliche natürlichsprachliche Abfrage.
  • topk: optionale Trefferzahl von 1 bis 32.

Anwendungsbeispiel:

bash
curl -X POST "http://127.0.0.1:8000/api/models/clip/retrieve" \
    -F 'files=@image1.jpg' -F 'files=@image2.jpg' \
    -F 'text=a red car' -F 'topk=2'

3. Schnittstelle zur Systemkonfiguration

Aktuelle Konfiguration abrufen

  • Endpoint: GET /api/config
  • Response: {"topk": 5}

Konfiguration aktualisieren

bash
curl -X POST "http://127.0.0.1:8000/api/config" \
+    -H 'Content-Type: application/json' -d '{"topk": 3}'

Mit GET /api/health können Sie Plattform, Modellbereitschaft, geladene RKNN-Dateien und Fähigkeiten prüfen. Die OpenAPI-Dokumentation befindet sich unter /docs.


🛠️ Entwicklerhandbuch (Empfehlungen für den Produktionseinsatz)

Codebeschreibung

  • web_service.py:
    • Web-API: stellt Browseroberfläche, Inferenz, Konfiguration, Systemstatus und Anfragevalidierung bereit.
  • task_runtime.py:
    • Verarbeitet Bilder und Prompts, normalisiert Merkmale und berechnet Ähnlichkeiten.
  • inference.py: Ermöglicht einmalige Inferenz über die Befehlszeile.

Modelldateien

KomponenteDatei
Image encodermodel/clip_images.rknn
Text encodermodel/clip_text.rknn
Vocabularymodel/clip_vocab.h

Modelle ändern

  1. Legen Sie kompatible konvertierte Dateien in model/ ab und behalten Sie die Dateinamen aus der Tabelle bei.
  2. Verwenden Sie Komponenten desselben Konvertierungspakets und behalten Sie Ein-/Ausgabe- sowie Vorverarbeitungsverträge bei.
  3. Testen Sie vor der Veröffentlichung Web-, REST- und Befehlszeilenpfade auf RK3576 und RK3588.

Lokale Images erstellen

Im Stammverzeichnis von reComputer-RK-CV ausführen:

bash
docker build -f docker/rk3576/clip.dockerfile \
+    -t rk3576-clip:local src/rk3576_clip

docker build -f docker/rk3588/clip.dockerfile \
+    -t rk3588-clip:local src/rk3588_clip

Eingaben und Ausgaben

Eingabe: Bild und Kandidaten-Prompts oder bis zu 32 Bilder und eine Textabfrage. Ausgabe: normalisierte Ähnlichkeitswerte und sortierte Treffer.