<EbeneX/>
Bild-KI Grundlagen · Updated 10. Juni 2026

Computer Vision

Definition

Computer Vision ist das Teilgebiet der KI, das Computern beibringt, Bilder und Videos zu interpretieren – von der Objekterkennung über Gesichtserkennung bis zur medizinischen Bildanalyse.

Einsteiger 2 Min. Lesezeit EN: Computer Vision

Einfach erklärt

Computer Vision (deutsch: maschinelles Sehen) ist das Teilgebiet der Künstlichen Intelligenz, das Computern beibringt, den Inhalt von Bildern und Videos zu verstehen. Für einen Computer ist ein Bild zunächst nur eine Matrix aus Zahlenwerten (Pixel). Computer Vision verwandelt diese Zahlen in Bedeutung: Was ist auf dem Bild zu sehen, wo befindet es sich, und wie hängen die Objekte zusammen?

Während Menschen visuelle Informationen mühelos und blitzschnell verarbeiten, ist das für Maschinen eine enorme Herausforderung – gelöst wird sie heute fast ausschließlich mit Deep Learning.

Technischer Deep Dive

Die Aufgaben-Hierarchie

AufgabeFrageAusgabe
KlassifikationWas ist auf dem Bild?eine Kategorie
ObjekterkennungWas ist wo?Kategorien + Begrenzungsrahmen
SegmentierungWelche Pixel gehören zu was?pixelgenaue Maske
Pose EstimationWie ist etwas ausgerichtet?Schlüsselpunkte

Vom CNN zum Vision Transformer

Lange dominierten Convolutional Neural Networks (CNNs) das Feld: Sie erkennen lokale Muster wie Kanten und setzen sie schichtweise zu komplexen Strukturen zusammen. Seit einigen Jahren erreichen Vision Transformer (ViT) – die Transformer-Idee aus dem NLP auf Bildkacheln übertragen – vergleichbare oder bessere Ergebnisse, besonders bei großen Datenmengen.

Multimodale Brücke

Modelle wie CLIP verbinden Bild und Sprache: Sie betten Fotos und Texte in denselben Vektorraum ein. Das ermöglicht visuelle Suche per Texteingabe und ist die Grundlage moderner Bildgeneratoren und multimodaler Assistenten.

Computer Vision ist wie das Sehen-Lernen eines Kleinkinds: Anfangs ist ein Bild nur eine Fläche aus Farbpunkten. Durch unzählige Beispiele lernt das System, in diesen Punkten Kanten, Formen und schließlich ganze Objekte zu erkennen – eine Katze, ein Auto, ein Gesicht.

Teilgebiet der KI für das Verstehen und Interpretieren visueller Daten

Aufgaben reichen von Klassifikation über Objekterkennung bis zur Segmentierung

Basiert klassisch auf CNNs, zunehmend auch auf Vision Transformern

Autonomes Fahren

Fahrzeuge erkennen Fahrbahn, Schilder, Fußgänger und andere Autos in Echtzeit

Medizinische Bildanalyse

Auffälligkeiten in Röntgen-, CT- oder MRT-Aufnahmen automatisch markieren

Qualitätskontrolle

Defekte Bauteile in der Produktion per Kamera erkennen

Visuelle Suche

Produkte anhand eines Fotos statt eines Suchbegriffs finden

Was ist der Unterschied zwischen Bildklassifikation und Objekterkennung?

Bildklassifikation ordnet einem ganzen Bild eine Kategorie zu (‚enthält eine Katze'). Objekterkennung lokalisiert zusätzlich, wo sich Objekte befinden, und zeichnet Begrenzungsrahmen um sie – oft für mehrere Objekte gleichzeitig.

Was sind CNNs?

Convolutional Neural Networks sind eine Architektur neuronaler Netze, die besonders gut für Bilder geeignet ist. Sie erkennen lokale Muster wie Kanten und kombinieren sie schichtweise zu komplexeren Strukturen. Lange waren sie der Standard in Computer Vision.

Wie hängen Computer Vision und multimodale KI zusammen?

Multimodale Modelle verarbeiten Bild und Text gemeinsam. Modelle wie CLIP lernen, Bilder und ihre Beschreibungen im selben Vektorraum darzustellen. So lassen sich Bilder per Text durchsuchen oder beschreiben – eine Brücke zwischen Computer Vision und NLP.

Dein persönliches Share-Bild für Instagram – 1080×1080px, bereit zum Posten.