4.5 Computer Vision-Taken met Deep Learning

Hoofdtaken

Computer vision met deep learning omvat veel taken die machines helpen beelden en video's te begrijpen. Veelvoorkomende taken zijn beeldclassificatie (beslissen wat het hoofdobject is), objectdetectie (objecten vinden en er kaders omheen tekenen) en segmentatie (elke pixel labelen of individuele objecten scheiden). Het omvat ook keypoint-detectie voor landmarks zoals lichaamsgewrichten, optische stroom voor het schatten van beweging tussen frames, en videoclassificatie voor het begrijpen van acties in video's.

Eenvoudig gezegd gaan deze taken van het beantwoorden van "wat staat er op het beeld?" naar "waar is het?", "welke vorm heeft het?" en "hoe beweegt het?".

cv-tasks

1. Beeldclassificatie

Beeldclassificatie voorspelt een of meer labels voor het hele beeld.

Voorbeelden:

  • kat vs hond
  • gezond blad vs ziek blad
  • normaal product vs defect product

image-20260402090916279

Deze taak is nuttig wanneer de globale inhoud meer telt dan de locatie van het object.

2. Objectdetectie

Objectdetectie voorspelt zowel categorie als locatie.

Voorbeelden:

  • detectie van personen
  • helmdetectie
  • voertuigdetectie

image-20260402091838482

Detectie is zeer belangrijk omdat het de basis vormt voor veel downstream-taken zoals tellen, tracking en event-redenering.

3. Segmentatie

Segmentatie werkt op pixelniveau.

alt text

Twee veelvoorkomende vormen:

  • semantische segmentatie: classificeer elke pixel per categorie
  • instance-segmentatie: scheid individuele objecten van dezelfde categorie

Voorbeelden:

  • segmentatie van weggebied
  • extractie van productgrens
  • achtergrondverwijdering

4. Objecttracking

Tracking verbindt detecties in de tijd.

img

Het beantwoordt een andere vraag dan detectie:

  • niet alleen wat hier nu is
  • maar welk object hetzelfde blijft over frames heen

Dit is essentieel voor:

  • mensen tellen
  • beweging monitoren
  • gedragsanalyse

5. Pose-Estimatie

Pose-estimatie voorspelt gestructureerde keypoints zoals gewrichten of landmarks.

img

Voorbeelden:

  • estimatie van menselijk skelet
  • handlandmarks
  • estimatie van dierenpose

Dit is nuttig wanneer vorm en houding meer tellen dan een simpele box.

6. Gezichtsherkenning

Gezichtsherkenning gaat verder dan het detecteren van een gezicht. Het probeert te identificeren of te verifiëren wie de persoon is.

img

Dat houdt meestal in:

  • gezichtsdetectie
  • gezichtsuitlijning
  • featureextractie
  • vergelijking of matching

Deze taak introduceert belangrijke zorgen rond privacy, bias en beveiliging.

7. OCR en Begrip van Tekst in Scènes

OCR extraheert tekst uit beelden of video.

Demo

Voorbeelden:

  • bonnetjes
  • etiketten
  • kentekenplaten
  • formulieren

OCR is een van de duidelijkste voorbeelden van vision die met taal interageert.

8. Begrip van Gebeurtenissen en Gedrag

Sommige praktische systemen geven minder om statische objecten en meer om gebeurtenissen:

  • lijnoverschrijding
  • indringing
  • valdetectie
  • rondhangen

Deze taken combineren vaak detectie, tracking en regelgebaseerde logica.

Veelvoorkomende Misverstanden

  • "Detectie is altijd genoeg."
    • Sommige toepassingen hebben segmentatie, pose-estimatie, OCR of temporele redenering nodig.
  • "Tracking is gewoon herhaalde detectie."
    • Tracking vereist ook identiteitscontinuïteit door de tijd heen.
  • "Gezichtsherkenning en gezichtsdetectie zijn hetzelfde."
    • Detectie vindt het gezicht. Herkenning identificeert of verifieert de persoon.

Oefeningen / Reflectie

  1. Kies een toepassing uit elk van de volgende gebieden en identificeer de meest geschikte vision-taak:
    • smart retail
    • fabrieksinspectie
    • verkeersanalyse
    • documentverwerking
  2. Leg uit wanneer segmentatie beter is dan detectie.
  3. Leg uit waarom tracking belangrijk is in video-analyse, maar niet noodzakelijk in elke beeldtaak.

Samenvatting

Computer vision met deep learning omvat vele taaktypen, elk met zijn eigen uitvoer, sterke punten en toepassingen. Het begrijpen van deze taakkaart helpt de lerende om het juiste gereedschap voor een probleem te kiezen. In de volgende sectie gebruikt de cursus YOLO26 als het belangrijkste praktijkvoorbeeld voor het leren trainen en implementeren van een aangepast model.

Voorgestelde Volgende Stap

Ga verder naar 4.6 Train en Implementeer Je Eigen Vision-Model.

Referentie:

https://github.com/NVIDIA/semantic-segmentation

https://github.com/yehengchen/Object-Detection-and-Tracking

https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation

https://github.com/ageitgey/face_recognition

https://github.com/RapidAI/RapidOCR