4.5 Computer-Vision-Aufgaben mit Deep Learning
Hauptaufgaben
Computer Vision mit Deep Learning umfasst viele Aufgaben, die Maschinen helfen, Bilder und Videos zu verstehen. Häufige Aufgaben sind Bildklassifikation (entscheiden, was das Hauptobjekt ist), Objekterkennung (Objekte finden und Boxen um sie zeichnen) und Segmentierung (jeden Pixel beschriften oder einzelne Objekte trennen). Sie umfasst auch Keypoint-Detektion für Landmarks wie Körpergelenke, optischen Fluss zur Schätzung von Bewegung zwischen Frames und Videoklassifikation, um Handlungen in Videos zu verstehen.
Einfach gesagt: Diese Aufgaben gehen von der Beantwortung von „Was ist im Bild?" zu „Wo ist es?", „Welche Form hat es?" und „Wie bewegt es sich?".
1. Bildklassifikation
Bildklassifikation sagt ein oder mehrere Labels für das gesamte Bild voraus.
Beispiele:
- Katze vs. Hund
- gesundes Blatt vs. krankes Blatt
- normales Produkt vs. defektes Produkt

Diese Aufgabe ist nützlich, wenn der Gesamtinhalt wichtiger ist als der Standort des Objekts.
2. Objekterkennung
Objekterkennung sagt sowohl Kategorie als auch Standort voraus.
Beispiele:
- Personenerkennung
- Helmerkennung
- Fahrzeugerkennung

Erkennung ist sehr wichtig, weil sie die Grundlage für viele nachgelagerte Aufgaben wie Zählen, Tracking und Ereignisüberlegungen wird.
3. Segmentierung
Segmentierung arbeitet auf Pixelebene.

Zwei gängige Formen:
- semantische Segmentierung: jeden Pixel nach Kategorie klassifizieren
- Instanzsegmentierung: einzelne Objekte derselben Kategorie trennen
Beispiele:
- Segmentierung der Straßenfläche
- Extraktion der Produktbegrenzung
- Hintergrundentfernung
4. Objekt-Tracking
Tracking verbindet Erkennungen über die Zeit hinweg.

Es beantwortet eine andere Frage als die Erkennung:
- nicht nur, was hier jetzt ist
- sondern welches Objekt über Frames hinweg dasselbe bleibt
Das ist wesentlich für:
- Personen zählen
- Bewegung überwachen
- Verhaltensanalyse
5. Pose-Schätzung
Pose-Schätzung sagt strukturierte Keypoints wie Gelenke oder Landmarks voraus.

Beispiele:
- Schätzung des menschlichen Skeletts
- Hand-Landmarks
- Tier-Pose-Schätzung
Das ist nützlich, wenn Form und Haltung wichtiger sind als eine einfache Box.
6. Gesichtserkennung
Gesichtserkennung geht über das Detektieren eines Gesichts hinaus. Sie versucht, die Person zu identifizieren oder zu verifizieren.

Das umfasst meist:
- Gesichtsdetektion
- Gesichtsausrichtung
- Merkmalsextraktion
- Vergleich oder Matching
Diese Aufgabe wirft wichtige Fragen zu Privatsphäre, Verzerrung und Sicherheit auf.
7. OCR und Szenen-Textverständnis
OCR extrahiert Text aus Bildern oder Videos.

Beispiele:
- Quittungen
- Etiketten
- Nummernschilder
- Formulare
OCR ist eines der klarsten Beispiele für die Interaktion zwischen Vision und Sprache.
8. Ereignis- und Verhaltensverständnis
Manche praktischen Systeme kümmern sich weniger um statische Objekte und mehr um Ereignisse:
- Linienüberschreitung
- Eindringen
- Sturzerkennung
- Herumlungern
Diese Aufgaben kombinieren oft Erkennung, Tracking und regelbasierte Logik.
Häufige Missverständnisse
- „Erkennung reicht immer."
- Manche Anwendungen benötigen Segmentierung, Pose-Schätzung, OCR oder zeitliches Schließen.
- „Tracking ist nur wiederholte Erkennung."
- Tracking erfordert auch Identitätskontinuität über die Zeit.
- „Gesichtserkennung und Gesichtsdetektion sind dasselbe."
- Detektion findet das Gesicht. Erkennung identifiziert oder verifiziert die Person.
Übungen / Reflexion
- Wählen Sie eine Anwendung aus jedem der folgenden Bereiche und identifizieren Sie die am besten geeignete Vision-Aufgabe:
- Smart Retail
- Fabrikinspektion
- Verkehrsanalyse
- Dokumentenverarbeitung
- Erklären Sie, wann Segmentierung besser ist als Erkennung.
- Erklären Sie, warum Tracking in der Video-Analytik wichtig, aber nicht in jeder Bildaufgabe notwendig ist.
Zusammenfassung
Computer Vision mit Deep Learning umfasst viele Aufgabentypen, jeder mit eigenen Ausgaben, Stärken und Anwendungen. Diese Aufgabenkarte zu verstehen, hilft Lernenden, das richtige Werkzeug für ein Problem zu wählen. Im nächsten Abschnitt verwendet der Kurs YOLO26 als das wichtigste praktische Beispiel, um zu lernen, wie man ein eigenes Modell trainiert und einsetzt.
Vorgeschlagener nächster Schritt
Fahren Sie fort mit 4.6 Eigenes Vision-Modell trainieren und einsetzen.
Referenz:
https://github.com/NVIDIA/semantic-segmentation
https://github.com/yehengchen/Object-Detection-and-Tracking
https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation
