Image Segmentation
Eine Computer-Vision-Aufgabe, bei der jeder Pixel eines Bildes einer Klasse oder Instanz zugeordnet wird – präziser als Object Detection und Grundlage für medizinische Bildgebung, autonomes Fahren und Bildbearbeitung.
Computer Vision ist das Teilgebiet der KI, das Computern beibringt, Bilder und Videos zu interpretieren – von der Objekterkennung über Gesichtserkennung bis zur medizinischen Bildanalyse.
Computer Vision (deutsch: maschinelles Sehen) ist das Teilgebiet der Künstlichen Intelligenz, das Computern beibringt, den Inhalt von Bildern und Videos zu verstehen. Für einen Computer ist ein Bild zunächst nur eine Matrix aus Zahlenwerten (Pixel). Computer Vision verwandelt diese Zahlen in Bedeutung: Was ist auf dem Bild zu sehen, wo befindet es sich, und wie hängen die Objekte zusammen?
Während Menschen visuelle Informationen mühelos und blitzschnell verarbeiten, ist das für Maschinen eine enorme Herausforderung – gelöst wird sie heute fast ausschließlich mit Deep Learning.
| Aufgabe | Frage | Ausgabe |
|---|---|---|
| Klassifikation | Was ist auf dem Bild? | eine Kategorie |
| Objekterkennung | Was ist wo? | Kategorien + Begrenzungsrahmen |
| Segmentierung | Welche Pixel gehören zu was? | pixelgenaue Maske |
| Pose Estimation | Wie ist etwas ausgerichtet? | Schlüsselpunkte |
Lange dominierten Convolutional Neural Networks (CNNs) das Feld: Sie erkennen lokale Muster wie Kanten und setzen sie schichtweise zu komplexen Strukturen zusammen. Seit einigen Jahren erreichen Vision Transformer (ViT) – die Transformer-Idee aus dem NLP auf Bildkacheln übertragen – vergleichbare oder bessere Ergebnisse, besonders bei großen Datenmengen.
Modelle wie CLIP verbinden Bild und Sprache: Sie betten Fotos und Texte in denselben Vektorraum ein. Das ermöglicht visuelle Suche per Texteingabe und ist die Grundlage moderner Bildgeneratoren und multimodaler Assistenten.
Computer Vision ist wie das Sehen-Lernen eines Kleinkinds: Anfangs ist ein Bild nur eine Fläche aus Farbpunkten. Durch unzählige Beispiele lernt das System, in diesen Punkten Kanten, Formen und schließlich ganze Objekte zu erkennen – eine Katze, ein Auto, ein Gesicht.
Teilgebiet der KI für das Verstehen und Interpretieren visueller Daten
Aufgaben reichen von Klassifikation über Objekterkennung bis zur Segmentierung
Basiert klassisch auf CNNs, zunehmend auch auf Vision Transformern
Autonomes Fahren
Fahrzeuge erkennen Fahrbahn, Schilder, Fußgänger und andere Autos in Echtzeit
Medizinische Bildanalyse
Auffälligkeiten in Röntgen-, CT- oder MRT-Aufnahmen automatisch markieren
Qualitätskontrolle
Defekte Bauteile in der Produktion per Kamera erkennen
Visuelle Suche
Produkte anhand eines Fotos statt eines Suchbegriffs finden
Bildklassifikation ordnet einem ganzen Bild eine Kategorie zu (‚enthält eine Katze'). Objekterkennung lokalisiert zusätzlich, wo sich Objekte befinden, und zeichnet Begrenzungsrahmen um sie – oft für mehrere Objekte gleichzeitig.
Convolutional Neural Networks sind eine Architektur neuronaler Netze, die besonders gut für Bilder geeignet ist. Sie erkennen lokale Muster wie Kanten und kombinieren sie schichtweise zu komplexeren Strukturen. Lange waren sie der Standard in Computer Vision.
Multimodale Modelle verarbeiten Bild und Text gemeinsam. Modelle wie CLIP lernen, Bilder und ihre Beschreibungen im selben Vektorraum darzustellen. So lassen sich Bilder per Text durchsuchen oder beschreiben – eine Brücke zwischen Computer Vision und NLP.