4.1 Einführung in Computer Vision
Was ist CV?
Computer Vision (CV) ist ein Bereich der Künstlichen Intelligenz, der es Computern ermöglicht, visuelle Informationen aus der Welt – wie Bilder und Videos – zu interpretieren und zu verstehen. Mit Techniken wie Deep Learning und Mustererkennung können Computer-Vision-Systeme Objekte erkennen, Gesichter detektieren, Bewegungen verfolgen und Szenen mit hoher Genauigkeit analysieren. Sie wird in Anwendungen wie autonomem Fahren, medizinischer Bildgebung, Sicherheitsüberwachung, industrieller Inspektion und Augmented Reality breit eingesetzt und hilft Maschinen, Entscheidungen auf Grundlage dessen zu treffen, was sie „sehen".

Lernziele
Am Ende dieses Abschnitts sollten Sie in der Lage sein:
- zu erklären, was Computer Vision ist
- die wichtigsten Probleme zu beschreiben, die das Feld zu lösen versucht
- die wichtigsten Anwendungsbereiche zu identifizieren
- den Unterschied zwischen Bildverständnis und Videoverständnis zu verstehen
- nachzuvollziehen, wie der Rest des Kurses aufgebaut ist
Warum Computer Vision schwer ist
Menschen lösen viele visuelle Aufgaben mühelos, weil wir jahrelange verkörperte Erfahrung in der Welt haben. Computer nicht. Vision in der realen Welt ist schwierig, weil:
- sich die Beleuchtung ändert
- Objekte aus unterschiedlichen Blickwinkeln verschieden aussehen
- Szenen unaufgeräumt sind
- manche Objekte klein, unscharf oder verdeckt sind
- Kameras Rauschen und Verzerrungen einführen
- Video die Zeit als zusätzliche Dimension hinzufügt
Aus diesem Grund hat sich Computer Vision von einfacher Bildverarbeitung zu Deep Learning und multimodalen Systemen weiterentwickelt.
Hauptaufgaben in Computer Vision

Das Feld lässt sich in mehrere Hauptaufgaben unterteilen:
| Aufgabe | Kernfrage | Beispiel |
|---|---|---|
| Klassifikation | Was ist im Bild | Katze vs. Hund, defekt vs. normal |
| Detektion | Welche Objekte sind vorhanden und wo | Person, Helm, Fahrzeug |
| Segmentierung | Welche Pixel gehören zu welcher Region oder welchem Objekt | Straßenfläche, Hintergrund, Produktkontur |
| Pose-Schätzung | Wie sehen Keypoints oder Körperstruktur aus | menschliche Gelenke, Hand-Landmarks |
| Tracking | Welches detektierte Objekt bleibt im Zeitverlauf dasselbe | Person 17 durch das Video verfolgen |
| OCR | Welcher Text erscheint in der Szene | Nummernschilder, Etiketten, Quittungen |
| Ereignisverständnis | Was ist in der Szene passiert | Linienüberschreitung, Eindringen, Sturz |
Bild vs. Video
Ein Bild erfasst einen einzelnen Moment. Ein Video ist eine zeitlich geordnete Folge von Frames.
Diese Unterscheidung ist wichtig, weil manche Aufgaben aus einem Bild gelöst werden können, während andere zeitliches Schließen erfordern:
- Bildklassifikation funktioniert auf einem einzelnen Frame
- Objektverfolgung erfordert Kontinuität über Frames hinweg
- Ereignisanalyse hängt von Bewegung und Zeit ab
Die Standard-Vision-Pipeline

Obwohl die Implementierungen variieren, folgen viele Computer-Vision-Systeme einer gemeinsamen Logik:
- Daten erfassen
- Daten vorverarbeiten
- Algorithmus oder Modell ausführen
- Nachverarbeitung und Entscheidungslogik anwenden
- Ergebnis ausgeben oder Aktion auslösen
Häufige Missverständnisse
- „Computer Vision ist nur Objekterkennung."
- Detektion ist wichtig, aber das Feld ist viel breiter.
- „Wenn ein Modell auf einem Bild läuft, ist es einsatzbereit."
- Ein echter Einsatz erfordert stabile Eingaben, Latenzkontrolle und Fehlerbehandlung.
- „Video ist nur viele Bilder, also ist es nicht viel schwerer."
- Video bringt Zeit, Kontinuität und Systembeschränkungen mit sich.
Übungen / Reflexion
- Wählen Sie drei Produkte oder Systeme, die Sie täglich nutzen, und identifizieren Sie, wo Computer Vision möglicherweise beteiligt ist.
- Entscheiden Sie für jeden der folgenden Punkte, ob es sich hauptsächlich um eine Klassifikations-, Detektions-, Segmentierungs-, Tracking- oder Ereignisverständnis-Aufgabe handelt:
- Gesichtsentsperrung auf einem Telefon
- Autos auf einem Parkplatz zählen
- eine Quittung lesen
- erkennen, ob ein Arbeiter einen Helm trägt
- Schreiben Sie einen kurzen Absatz, der erklärt, warum Videoverständnis in der Regel schwerer ist als Bildverständnis.
Zusammenfassung
Bei Computer Vision geht es darum, rohe visuelle Daten in nützliches Verständnis umzuwandeln. Sie umfasst viele Aufgaben, von Klassifikation und Detektion bis zu OCR und Ereignisüberlegungen.