4.1 Introductie tot Computer Vision
Wat is CV?
Computer vision (CV) is een vakgebied binnen de kunstmatige intelligentie waarmee computers visuele informatie uit de wereld, zoals beelden en video's, kunnen interpreteren en begrijpen. Door technieken als deep learning en patroonherkenning te gebruiken, kunnen computer vision-systemen objecten identificeren, gezichten detecteren, beweging volgen en scènes met hoge nauwkeurigheid analyseren. Het wordt veel gebruikt in toepassingen zoals autonoom rijden, medische beeldvorming, beveiligingsbewaking, industriële inspectie en augmented reality, waarbij machines beslissingen kunnen nemen op basis van wat ze "zien".

Leerdoelen
Aan het einde van deze sectie zou je het volgende moeten kunnen:
- uitleggen wat computer vision is
- de belangrijkste problemen beschrijven die het vakgebied probeert op te lossen
- de belangrijkste toepassingsgebieden identificeren
- het verschil begrijpen tussen beeldbegrip en videobegrip
- inzicht krijgen in hoe de rest van de cursus is opgebouwd
Waarom Computer Vision Moeilijk Is
Mensen lossen veel visuele taken moeiteloos op omdat we jarenlange belichaamde ervaring in de wereld hebben. Computers niet. Vision in de echte wereld is moeilijk omdat:
- de belichting verandert
- objecten er vanuit verschillende gezichtspunten anders uitzien
- scènes rommelig zijn
- sommige objecten klein, wazig of afgedekt zijn
- camera's ruis en vervorming introduceren
- video tijd als extra dimensie toevoegt
Dit is waarom computer vision is geëvolueerd van eenvoudige beeldverwerking naar deep learning en multimodale systemen.
Hoofdtaken in Computer Vision

Het vakgebied kan worden verdeeld in verschillende hoofdtaken:
| Taak | Kernvraag | Voorbeeld |
|---|---|---|
| Classificatie | Wat staat er op het beeld | kat versus hond, defect versus normaal |
| Detectie | Welke objecten zijn aanwezig en waar | persoon, helm, voertuig |
| Segmentatie | Welke pixels behoren tot welke regio of welk object | wegoppervlak, achtergrond, productcontour |
| Pose-Estimatie | Wat zijn de keypoints of lichaamsstructuur | menselijke gewrichten, handlandmarks |
| Tracking | Welk gedetecteerd object is hetzelfde over de tijd | volg persoon 17 door de video heen |
| OCR | Welke tekst verschijnt in de scène | kentekenplaten, etiketten, bonnetjes |
| Gebeurtenisbegrip | Wat is er gebeurd in de scène | lijnoverschrijding, indringing, val |
Beeld versus Video
Een beeld vangt één enkel moment. Een video is een tijdsgeordende reeks frames die in de tijd evolueert.
Dit onderscheid is belangrijk omdat sommige taken vanuit één beeld kunnen worden opgelost, terwijl andere tijdsredenering vereisen:
- beeldclassificatie werkt op één enkele frame
- objecttracking vereist continuïteit tussen frames
- gebeurtenisanalyse hangt af van beweging en tijd
De Standaard Vision-Pipeline

Hoewel implementaties verschillen, volgen veel computer vision-systemen een gemeenschappelijke logica:
- data verwerven
- de data voorbewerken
- een algoritme of model uitvoeren
- nabewerking en beslislogica toepassen
- een resultaat uitvoeren of een actie triggeren
Veelvoorkomende Misverstanden
- "Computer vision is gewoon objectdetectie."
- Detectie is belangrijk, maar het vakgebied is veel breder.
- "Als een model op één beeld werkt, is het klaar voor implementatie."
- Een echte implementatie vereist stabiele invoer, latency-controle en foutafhandeling.
- "Video is gewoon veel beelden, dus het is niet veel moeilijker."
- Video introduceert tijd, continuïteit en systeembeperkingen.
Oefeningen / Reflectie
- Kies drie producten of systemen die je in het dagelijks leven gebruikt en identificeer waar computer vision mogelijk bij betrokken is.
- Beslis voor elk van de volgende of het hoofdzakelijk een classificatie-, detectie-, segmentatie-, tracking- of gebeurtenisbegriptaak is:
- gezichtsontgrendeling op een telefoon
- auto's tellen op een parkeerterrein
- een bonnetje lezen
- detecteren of een werknemer een helm draagt
- Schrijf een kort stuk waarin je uitlegt waarom videobegrip meestal moeilijker is dan beeldbegrip.
Samenvatting
Computer vision draait om het omzetten van ruwe visuele data in bruikbaar begrip. Het omvat vele taken, van classificatie en detectie tot OCR en gebeurtenisredenering.