4.2 Wie Computer Bilder darstellen

Was ist ein Bild?

Wenn Sie verstehen wollen, wie Computer Bilder erkennen und interpretieren, müssen Sie zuerst wissen, was ein Bild aus Sicht eines Computers tatsächlich ist.

image-20260330181553676

Für Menschen mag ein Bild wie eine bedeutungsvolle Szene voller Objekte, Farben und Emotionen wirken. Für einen Computer ist ein Bild jedoch lediglich ein Raster aus numerischen Daten, das aus Pixeln besteht, wobei jeder Pixel Werte speichert, die Helligkeit oder Farbe repräsentieren. Indem diese Zahlen mit mathematischen Modellen und Algorithmen verarbeitet werden, können Computer beginnen, Muster zu erkennen, Formen zu identifizieren, Objekte zu unterscheiden und letztlich Entscheidungen darüber zu treffen, was ein Bild enthält. Diesen Unterschied zwischen menschlicher Wahrnehmung und maschineller Darstellung zu verstehen, ist der erste Schritt, um Computer Vision zu begreifen.

Bilder als Arrays von Zahlen

image-20260331091053228

Ein Digitalbild ist ein Raster aus Werten. Jede Stelle im Raster wird Pixel genannt.

  • In einem Graustufenbild speichert jeder Pixel in der Regel einen Wert.
  • In einem Farbbild speichert jeder Pixel mehrere Werte, einen pro Kanal.

Für einen Computer ist ein Bild keine „Katze" und kein „Auto". Es ist ein Array mit Form, Datentyp und numerischem Inhalt.

Kanäle

image-20260331091848480

Ein Kanal ist eine Art von Wert, der an jedem Pixel gespeichert wird. Beispielsweise hat ein Graustufenbild 1 Kanal, während ein Farbbild oft 3 Kanäle wie RGB hat. Mit anderen Worten: Ein Computer sieht ein Bild als nach Kanälen geordnete Zahlen, nicht direkt als reale Objekte. OpenCV verwendet zudem häufig die Reihenfolge BGR statt RGB. Viele Anfänger begegnen Bildern zuerst als RGB-Bildern. Aber unterschiedliche Aufgaben nutzen unterschiedliche Kanal-Anordnungen.

RepräsentationBedeutung
Graustufenein Intensitätswert pro Pixel
RGB / BGRdrei Farbkanäle pro Pixel
HSVFarbton, Sättigung, Helligkeit

OpenCV verwendet üblicherweise die Reihenfolge BGR statt RGB, was ein wichtiges praktisches Detail ist.

Auflösung

Die Auflösung beschreibt, wie viele Pixel das Bild enthält, beispielsweise 640 x 480 oder 1920 x 1080.

image-20260331093601010

Höhere Auflösung liefert in der Regel mehr Details, erhöht jedoch auch:

  • den Speicherbedarf
  • die Verarbeitungskosten
  • die Trainings- und Inferenzzeit

Video als Folge von Frames

Ein Video ist ein zeitlich geordneter Strom von Bildern.

image-20260331135422667

Das bedeutet, dass Video zwei Komplexitätsebenen einführt:

  • die visuelle Struktur pro Frame
  • die zeitliche Veränderung über Frames hinweg

Herausforderungen

image-20260331135649175

Echte Kameraeingaben können beeinflusst werden durch:

  • Bewegungsunschärfe
  • schlechtes Licht
  • Rauschen
  • Linsenverzerrung
  • Komprimierungsartefakte
  • ausgelassene Frames

Deshalb hängt gute Computer-Vision-Arbeit nicht nur von Modellen, sondern auch von der Datenqualität ab.

Probieren Sie es aus

Ein Bild mit OpenCV bearbeiten

bash
#clone the source code
git clone https://github.com/Seeed-Projects/reComputer-Jetson-for-Beginners
cd reComputer-Jetson-for-Beginners/4-Computer-Vision/4.2-How-Computers-Represent-Images/code
# Install opencv if you don't install before
pip install opencv-python
#run the script
python show_img.py

Sie werden die Ausgabe sehen:

image-20260331113129592

Video lesen

python
python show_video.py

Sie werden die Ausgabe sehen:

video

Übungen / Reflexion

  1. Laden Sie ein Bild und geben Sie seine shape und seinen dtype aus.
  2. Konvertieren Sie dasselbe Bild in Graustufen und HSV. Beschreiben Sie, was sich visuell verändert.
  3. Skalieren Sie ein Bild auf zwei verschiedene Auflösungen und vergleichen Sie Dateigröße oder Verarbeitungszeit.
  4. Öffnen Sie ein kurzes Video und zählen Sie ungefähr, wie viele Frames in 10 Sekunden angezeigt werden.

Zusammenfassung

Bilder sind strukturierte numerische Daten, nicht nur Bilder. Pixel, Kanäle, Auflösung und Video-Frames zu verstehen ist wesentlich, denn jeder spätere Algorithmus – von Schwellwertbildung bis zu CNNs – arbeitet auf diesen Repräsentationen.

Vorgeschlagener nächster Schritt

Fahren Sie fort mit 4.3 Klassische Computer Vision.

Referenzen