CV / CLIP
CLIP ViT-B/32
Mit RKNN beschleunigter OpenAI-CLIP-ViT-B/32-Abgleich von Bild und Text auf reComputer RK3576 und RK3588.
Wähle das Gerät, das du verwendest. Die Einrichtungsanleitung und Dokumentation werden entsprechend aktualisiert.
Erste Schritte
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestREST API
Verwende die REST API für die Inferenz. Kopiere die folgenden Befehle.
curl http://localhost:8080/v1/chat/completions -d '{
"model": "clip-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "clip-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())Modelldetails
Schnellstart
1. Docker installieren
Führen Sie zur Installation von Docker folgende Befehle auf dem Entwicklungsboard aus:
# Installationsskript herunterladen
curl -fsSL https://get.docker.com -o get-docker.sh
# Über den Aliyun-Spiegel installieren
sudo sh get-docker.sh --mirror Aliyun
# Docker starten und automatischen Start aktivieren
sudo systemctl enable docker
sudo systemctl start docker2. Projekt ausführen (ein Befehl und Webvorschau)
Dieses Projekt bietet Zero-Shot-Bildklassifizierung und natürlichsprachliche Bildsuche; beide Encoder laufen mit RKNN.
Schritt A: Images abrufen
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-clip:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-clip:latestSchritt B: mit einem Befehl starten
Für RK3588:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-clip:latestAufruf: http://<Board_IP>:8000
Für RK3576:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestAufruf: http://<Board_IP>:8000
3. Inferenz über die Befehlszeile
python inference.py --platform rk3576 --model_dir model \
+ --file samples/dog_224x224.jpg \
+ --prompts 'a photo of a dog|a photo of a cat'Verwenden Sie im RK3588-Quellverzeichnis --platform rk3588.
🔌 API-Dokumentation
Endpoint: POST /api/models/clip/predict
Anfrageparameter (Multipart/Form-Data):
file: erforderliche Bilddatei; sie wird auf224 x 224vorverarbeitet.prompts: erforderliche Kandidaten als JSON-Array, zeilenweise oder mit|getrennt; maximal 32.topk: optionale Trefferzahl von 1 bis 32; Standard 5.
Anwendungsbeispiel:
curl -X POST "http://127.0.0.1:8000/api/models/clip/predict" \
+ -F 'file=@samples/dog_224x224.jpg' \
+ -F 'prompts=a photo of a dog|a photo of a cat' -F 'topk=2'Antwortformat (JSON):
{
"success": true,
"model": "clip",
"platform": "rk3576",
"inference_time_ms": 58.2,
"result": {
"mode": "classification",
"image": {
"width": 224,
"height": 224
},
"candidate_count": 2,
"predictions": [
{
"text": "a photo of a dog",
"score": 0.97
}
]
}
}Die Texteingabe ist auf 20 Tokens festgelegt. POST /api/models/clip/retrieve akzeptiert 1–32 files, erforderliches text und optionales topk. Pro Plattform gibt es ein Paket ohne Quantisierungswahl.
2. Natürlichsprachliche Bildsuche
Endpunkt: POST /api/models/clip/retrieve
Anfrageparameter (Multipart/Form-Data):
files: erforderliches wiederholtes Feld mit 1–32 Bildern.text: erforderliche natürlichsprachliche Abfrage.topk: optionale Trefferzahl von 1 bis 32.
Anwendungsbeispiel:
curl -X POST "http://127.0.0.1:8000/api/models/clip/retrieve" \
-F 'files=@image1.jpg' -F 'files=@image2.jpg' \
-F 'text=a red car' -F 'topk=2'3. Schnittstelle zur Systemkonfiguration
Aktuelle Konfiguration abrufen
- Endpoint:
GET /api/config - Response:
{"topk": 5}
Konfiguration aktualisieren
curl -X POST "http://127.0.0.1:8000/api/config" \
+ -H 'Content-Type: application/json' -d '{"topk": 3}'Mit GET /api/health können Sie Plattform, Modellbereitschaft, geladene RKNN-Dateien und Fähigkeiten prüfen. Die OpenAPI-Dokumentation befindet sich unter /docs.
🛠️ Entwicklerhandbuch (Empfehlungen für den Produktionseinsatz)
Codebeschreibung
web_service.py:- Web-API: stellt Browseroberfläche, Inferenz, Konfiguration, Systemstatus und Anfragevalidierung bereit.
task_runtime.py:- Verarbeitet Bilder und Prompts, normalisiert Merkmale und berechnet Ähnlichkeiten.
inference.py: Ermöglicht einmalige Inferenz über die Befehlszeile.
Modelldateien
| Komponente | Datei |
|---|---|
| Image encoder | model/clip_images.rknn |
| Text encoder | model/clip_text.rknn |
| Vocabulary | model/clip_vocab.h |
Modelle ändern
- Legen Sie kompatible konvertierte Dateien in
model/ab und behalten Sie die Dateinamen aus der Tabelle bei. - Verwenden Sie Komponenten desselben Konvertierungspakets und behalten Sie Ein-/Ausgabe- sowie Vorverarbeitungsverträge bei.
- Testen Sie vor der Veröffentlichung Web-, REST- und Befehlszeilenpfade auf RK3576 und RK3588.
Lokale Images erstellen
Im Stammverzeichnis von reComputer-RK-CV ausführen:
docker build -f docker/rk3576/clip.dockerfile \
+ -t rk3576-clip:local src/rk3576_clip
docker build -f docker/rk3588/clip.dockerfile \
+ -t rk3588-clip:local src/rk3588_clipEingaben und Ausgaben
Eingabe: Bild und Kandidaten-Prompts oder bis zu 32 Bilder und eine Textabfrage. Ausgabe: normalisierte Ähnlichkeitswerte und sortierte Treffer.