4.1 Einführung in Computer Vision

Was ist CV?

Computer Vision (CV) ist ein Bereich der Künstlichen Intelligenz, der es Computern ermöglicht, visuelle Informationen aus der Welt – wie Bilder und Videos – zu interpretieren und zu verstehen. Mit Techniken wie Deep Learning und Mustererkennung können Computer-Vision-Systeme Objekte erkennen, Gesichter detektieren, Bewegungen verfolgen und Szenen mit hoher Genauigkeit analysieren. Sie wird in Anwendungen wie autonomem Fahren, medizinischer Bildgebung, Sicherheitsüberwachung, industrieller Inspektion und Augmented Reality breit eingesetzt und hilft Maschinen, Entscheidungen auf Grundlage dessen zu treffen, was sie „sehen".

img

Lernziele

Am Ende dieses Abschnitts sollten Sie in der Lage sein:

  • zu erklären, was Computer Vision ist
  • die wichtigsten Probleme zu beschreiben, die das Feld zu lösen versucht
  • die wichtigsten Anwendungsbereiche zu identifizieren
  • den Unterschied zwischen Bildverständnis und Videoverständnis zu verstehen
  • nachzuvollziehen, wie der Rest des Kurses aufgebaut ist

Warum Computer Vision schwer ist

Menschen lösen viele visuelle Aufgaben mühelos, weil wir jahrelange verkörperte Erfahrung in der Welt haben. Computer nicht. Vision in der realen Welt ist schwierig, weil:

  • sich die Beleuchtung ändert
  • Objekte aus unterschiedlichen Blickwinkeln verschieden aussehen
  • Szenen unaufgeräumt sind
  • manche Objekte klein, unscharf oder verdeckt sind
  • Kameras Rauschen und Verzerrungen einführen
  • Video die Zeit als zusätzliche Dimension hinzufügt

Aus diesem Grund hat sich Computer Vision von einfacher Bildverarbeitung zu Deep Learning und multimodalen Systemen weiterentwickelt.

Hauptaufgaben in Computer Vision

img

Das Feld lässt sich in mehrere Hauptaufgaben unterteilen:

AufgabeKernfrageBeispiel
KlassifikationWas ist im BildKatze vs. Hund, defekt vs. normal
DetektionWelche Objekte sind vorhanden und woPerson, Helm, Fahrzeug
SegmentierungWelche Pixel gehören zu welcher Region oder welchem ObjektStraßenfläche, Hintergrund, Produktkontur
Pose-SchätzungWie sehen Keypoints oder Körperstruktur ausmenschliche Gelenke, Hand-Landmarks
TrackingWelches detektierte Objekt bleibt im Zeitverlauf dasselbePerson 17 durch das Video verfolgen
OCRWelcher Text erscheint in der SzeneNummernschilder, Etiketten, Quittungen
EreignisverständnisWas ist in der Szene passiertLinienüberschreitung, Eindringen, Sturz

Bild vs. Video

Ein Bild erfasst einen einzelnen Moment. Ein Video ist eine zeitlich geordnete Folge von Frames.

Diese Unterscheidung ist wichtig, weil manche Aufgaben aus einem Bild gelöst werden können, während andere zeitliches Schließen erfordern:

  • Bildklassifikation funktioniert auf einem einzelnen Frame
  • Objektverfolgung erfordert Kontinuität über Frames hinweg
  • Ereignisanalyse hängt von Bewegung und Zeit ab

Die Standard-Vision-Pipeline

image-20260330175514717

Obwohl die Implementierungen variieren, folgen viele Computer-Vision-Systeme einer gemeinsamen Logik:

  1. Daten erfassen
  2. Daten vorverarbeiten
  3. Algorithmus oder Modell ausführen
  4. Nachverarbeitung und Entscheidungslogik anwenden
  5. Ergebnis ausgeben oder Aktion auslösen

Häufige Missverständnisse

  • „Computer Vision ist nur Objekterkennung."
    • Detektion ist wichtig, aber das Feld ist viel breiter.
  • „Wenn ein Modell auf einem Bild läuft, ist es einsatzbereit."
    • Ein echter Einsatz erfordert stabile Eingaben, Latenzkontrolle und Fehlerbehandlung.
  • „Video ist nur viele Bilder, also ist es nicht viel schwerer."
    • Video bringt Zeit, Kontinuität und Systembeschränkungen mit sich.

Übungen / Reflexion

  1. Wählen Sie drei Produkte oder Systeme, die Sie täglich nutzen, und identifizieren Sie, wo Computer Vision möglicherweise beteiligt ist.
  2. Entscheiden Sie für jeden der folgenden Punkte, ob es sich hauptsächlich um eine Klassifikations-, Detektions-, Segmentierungs-, Tracking- oder Ereignisverständnis-Aufgabe handelt:
    • Gesichtsentsperrung auf einem Telefon
    • Autos auf einem Parkplatz zählen
    • eine Quittung lesen
    • erkennen, ob ein Arbeiter einen Helm trägt
  3. Schreiben Sie einen kurzen Absatz, der erklärt, warum Videoverständnis in der Regel schwerer ist als Bildverständnis.

Zusammenfassung

Bei Computer Vision geht es darum, rohe visuelle Daten in nützliches Verständnis umzuwandeln. Sie umfasst viele Aufgaben, von Klassifikation und Detektion bis zu OCR und Ereignis­überlegungen.