4.5 Computer-Vision-Aufgaben mit Deep Learning

Hauptaufgaben

Computer Vision mit Deep Learning umfasst viele Aufgaben, die Maschinen helfen, Bilder und Videos zu verstehen. Häufige Aufgaben sind Bildklassifikation (entscheiden, was das Hauptobjekt ist), Objekterkennung (Objekte finden und Boxen um sie zeichnen) und Segmentierung (jeden Pixel beschriften oder einzelne Objekte trennen). Sie umfasst auch Keypoint-Detektion für Landmarks wie Körpergelenke, optischen Fluss zur Schätzung von Bewegung zwischen Frames und Videoklassifikation, um Handlungen in Videos zu verstehen.

Einfach gesagt: Diese Aufgaben gehen von der Beantwortung von „Was ist im Bild?" zu „Wo ist es?", „Welche Form hat es?" und „Wie bewegt es sich?".

cv-tasks

1. Bildklassifikation

Bildklassifikation sagt ein oder mehrere Labels für das gesamte Bild voraus.

Beispiele:

  • Katze vs. Hund
  • gesundes Blatt vs. krankes Blatt
  • normales Produkt vs. defektes Produkt

image-20260402090916279

Diese Aufgabe ist nützlich, wenn der Gesamtinhalt wichtiger ist als der Standort des Objekts.

2. Objekterkennung

Objekterkennung sagt sowohl Kategorie als auch Standort voraus.

Beispiele:

  • Personenerkennung
  • Helmerkennung
  • Fahrzeugerkennung

image-20260402091838482

Erkennung ist sehr wichtig, weil sie die Grundlage für viele nachgelagerte Aufgaben wie Zählen, Tracking und Ereignis­überlegungen wird.

3. Segmentierung

Segmentierung arbeitet auf Pixelebene.

alt text

Zwei gängige Formen:

  • semantische Segmentierung: jeden Pixel nach Kategorie klassifizieren
  • Instanz­segmentierung: einzelne Objekte derselben Kategorie trennen

Beispiele:

  • Segmentierung der Straßenfläche
  • Extraktion der Produkt­begrenzung
  • Hintergrund­entfernung

4. Objekt-Tracking

Tracking verbindet Erkennungen über die Zeit hinweg.

img

Es beantwortet eine andere Frage als die Erkennung:

  • nicht nur, was hier jetzt ist
  • sondern welches Objekt über Frames hinweg dasselbe bleibt

Das ist wesentlich für:

  • Personen zählen
  • Bewegung überwachen
  • Verhaltensanalyse

5. Pose-Schätzung

Pose-Schätzung sagt strukturierte Keypoints wie Gelenke oder Landmarks voraus.

img

Beispiele:

  • Schätzung des menschlichen Skeletts
  • Hand-Landmarks
  • Tier-Pose-Schätzung

Das ist nützlich, wenn Form und Haltung wichtiger sind als eine einfache Box.

6. Gesichts­erkennung

Gesichtserkennung geht über das Detektieren eines Gesichts hinaus. Sie versucht, die Person zu identifizieren oder zu verifizieren.

img

Das umfasst meist:

  • Gesichts­detektion
  • Gesichts­ausrichtung
  • Merkmals­extraktion
  • Vergleich oder Matching

Diese Aufgabe wirft wichtige Fragen zu Privatsphäre, Verzerrung und Sicherheit auf.

7. OCR und Szenen-Text­verständnis

OCR extrahiert Text aus Bildern oder Videos.

Demo

Beispiele:

  • Quittungen
  • Etiketten
  • Nummernschilder
  • Formulare

OCR ist eines der klarsten Beispiele für die Interaktion zwischen Vision und Sprache.

8. Ereignis- und Verhaltens­verständnis

Manche praktischen Systeme kümmern sich weniger um statische Objekte und mehr um Ereignisse:

  • Linienüberschreitung
  • Eindringen
  • Sturzerkennung
  • Herumlungern

Diese Aufgaben kombinieren oft Erkennung, Tracking und regelbasierte Logik.

Häufige Missverständnisse

  • „Erkennung reicht immer."
    • Manche Anwendungen benötigen Segmentierung, Pose-Schätzung, OCR oder zeitliches Schließen.
  • „Tracking ist nur wiederholte Erkennung."
    • Tracking erfordert auch Identitäts­kontinuität über die Zeit.
  • „Gesichtserkennung und Gesichts­detektion sind dasselbe."
    • Detektion findet das Gesicht. Erkennung identifiziert oder verifiziert die Person.

Übungen / Reflexion

  1. Wählen Sie eine Anwendung aus jedem der folgenden Bereiche und identifizieren Sie die am besten geeignete Vision-Aufgabe:
    • Smart Retail
    • Fabrik­inspektion
    • Verkehrs­analyse
    • Dokumenten­verarbeitung
  2. Erklären Sie, wann Segmentierung besser ist als Erkennung.
  3. Erklären Sie, warum Tracking in der Video-Analytik wichtig, aber nicht in jeder Bildaufgabe notwendig ist.

Zusammenfassung

Computer Vision mit Deep Learning umfasst viele Aufgabentypen, jeder mit eigenen Ausgaben, Stärken und Anwendungen. Diese Aufgabenkarte zu verstehen, hilft Lernenden, das richtige Werkzeug für ein Problem zu wählen. Im nächsten Abschnitt verwendet der Kurs YOLO26 als das wichtigste praktische Beispiel, um zu lernen, wie man ein eigenes Modell trainiert und einsetzt.

Vorgeschlagener nächster Schritt

Fahren Sie fort mit 4.6 Eigenes Vision-Modell trainieren und einsetzen.

Referenz:

https://github.com/NVIDIA/semantic-segmentation

https://github.com/yehengchen/Object-Detection-and-Tracking

https://github.com/ZheC/Realtime_Multi-Person_Pose_Estimation

https://github.com/ageitgey/face_recognition

https://github.com/RapidAI/RapidOCR