CV / CLIP
CLIP ViT-B/32
OpenAI CLIP ViT-B/32 voor beeld-tekstvergelijking, versneld met RKNN op reComputer RK3576 en RK3588.
Kies het apparaat dat je gebruikt. De installatiehandleiding en documentatie worden dienovereenkomstig bijgewerkt.
Aan de slag
sudo docker run --rm --privileged --net=host \
-e PYTHONUNBUFFERED=1 -e RKNN_LOG_LEVEL=0 \
-v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestREST API
Gebruik de REST API om inferentie uit te voeren. Kopieer de onderstaande commando's.
curl http://localhost:8080/v1/chat/completions -d '{
"model": "clip-rknn",
"messages": [{"role": "user", "content": "Hello"}]
}'import requests
resp = requests.post(
"http://localhost:8080/v1/chat/completions",
json={"model": "clip-rknn", "messages": [{"role": "user", "content": "Hello"}]},
)
print(resp.json())Modeldetails
Snel aan de slag
1. Docker installeren
Voer de volgende opdrachten uit op het ontwikkelbord om Docker te installeren:
# Installatiescript downloaden
curl -fsSL https://get.docker.com -o get-docker.sh
# Installeren via de Aliyun-mirror
sudo sh get-docker.sh --mirror Aliyun
# Docker starten en automatisch opstarten inschakelen
sudo systemctl enable docker
sudo systemctl start docker2. Het project uitvoeren (één opdracht en Webvoorbeeld)
Dit project biedt zero-shot-beeldclassificatie en zoeken met natuurlijke taal; beide encoders draaien met RKNN.
Stap A: images ophalen
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-clip:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-clip:latestStap B: met één opdracht starten
Voor RK3588:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-clip:latestOpenen via: http://<Board_IP>:8000
Voor RK3576:
sudo docker run --rm --privileged --net=host \
+ -e PYTHONUNBUFFERED=1 \
+ -e RKNN_LOG_LEVEL=0 \
+ -v /proc/device-tree/compatible:/proc/device-tree/compatible:ro \
+ ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-clip:latestOpenen via: http://<Board_IP>:8000
3. Inferentie via de opdrachtregel
python inference.py --platform rk3576 --model_dir model \
+ --file samples/dog_224x224.jpg \
+ --prompts 'a photo of a dog|a photo of a cat'Gebruik --platform rk3588 wanneer u vanuit de RK3588-bronmap werkt.
🔌 API-documentatie
Endpoint: POST /api/models/clip/predict
Aanvraagparameters (Multipart/Form-Data):
file: verplicht afbeeldingsbestand; wordt voorbewerkt naar224 x 224.prompts: verplichte labels als JSON-array, regels of met|gescheiden waarden; maximaal 32.topk: optioneel aantal resultaten van 1 tot 32; standaard 5.
Gebruiksvoorbeeld:
curl -X POST "http://127.0.0.1:8000/api/models/clip/predict" \
+ -F 'file=@samples/dog_224x224.jpg' \
+ -F 'prompts=a photo of a dog|a photo of a cat' -F 'topk=2'Antwoordformaat (JSON):
{
"success": true,
"model": "clip",
"platform": "rk3576",
"inference_time_ms": 58.2,
"result": {
"mode": "classification",
"image": {
"width": 224,
"height": 224
},
"candidate_count": 2,
"predictions": [
{
"text": "a photo of a dog",
"score": 0.97
}
]
}
}De tekstinvoer is vast op 20 tokens. POST /api/models/clip/retrieve accepteert 1–32 files-velden, verplicht text en optioneel topk. Per platform is één bundel beschikbaar, zonder kwantisatiekeuze.
2. Afbeeldingen zoeken met natuurlijke taal
Endpoint: POST /api/models/clip/retrieve
Aanvraagparameters (Multipart/Form-Data):
files: verplicht herhaald veld met 1–32 afbeeldingen.text: verplichte zoekvraag in natuurlijke taal.topk: optioneel aantal resultaten van 1 tot 32.
Gebruiksvoorbeeld:
curl -X POST "http://127.0.0.1:8000/api/models/clip/retrieve" \
-F 'files=@image1.jpg' -F 'files=@image2.jpg' \
-F 'text=a red car' -F 'topk=2'3. Interface voor systeemconfiguratie
Huidige configuratie ophalen
- Endpoint:
GET /api/config - Response:
{"topk": 5}
Configuratie bijwerken
curl -X POST "http://127.0.0.1:8000/api/config" \
+ -H 'Content-Type: application/json' -d '{"topk": 3}'Gebruik GET /api/health om het actieve platform, de modelstatus, geladen RKNN-bestanden en mogelijkheden te bekijken. OpenAPI-documentatie staat op /docs.
🛠️ Handleiding voor ontwikkelaars (productieadvies)
Beschrijving van de code
web_service.py:- Web-API: biedt de browserinterface, inferentie, configuratie, status en aanvraagvalidatie.
task_runtime.py:- Verwerkt afbeeldingen en prompts, normaliseert kenmerken en berekent gelijkenissen.
inference.py: Biedt eenmalige inferentie via de opdrachtregel.
Modelbestanden
| Onderdeel | Bestand |
|---|---|
| Image encoder | model/clip_images.rknn |
| Text encoder | model/clip_text.rknn |
| Vocabulary | model/clip_vocab.h |
Modellen wijzigen
- Plaats compatibele geconverteerde bestanden in
model/en behoud de bestandsnamen uit de tabel. - Houd alle onderdelen uit dezelfde conversiebundel en behoud de contracten voor invoer, uitvoer en voorverwerking.
- Test vóór publicatie de Web-, REST- en opdrachtregelroutes op RK3576 en RK3588.
Lokale images bouwen
Voer dit uit vanuit de hoofdmap van reComputer-RK-CV:
docker build -f docker/rk3576/clip.dockerfile \
+ -t rk3576-clip:local src/rk3576_clip
docker build -f docker/rk3588/clip.dockerfile \
+ -t rk3588-clip:local src/rk3588_clipInvoer en uitvoer
Invoer: afbeelding en kandidaatprompts, of maximaal 32 afbeeldingen en een tekstvraag. Uitvoer: genormaliseerde gelijkenisscores en gerangschikte resultaten.