Computer Vision

Wie Bild- und Videodaten in klar abgegrenzte Aufgaben übersetzt, auf realen Bedingungen geprüft und mit menschlicher Kontrolle eingesetzt werden.

Computer Vision ist das Teilgebiet der KI, das Computern beibringt, Bilder und Videos zu interpretieren – von der Objekterkennung über Gesichtserkennung bis zur medizinischen Bildanalyse.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Teilgebiet der KI für das Verstehen und Interpretieren visueller Daten
  2. Aufgaben reichen von Klassifikation über Objekterkennung bis zur Segmentierung
  3. Basiert klassisch auf CNNs, zunehmend auch auf Vision Transformern

Sofortantwort

Computer Vision einfach erklärt

KI-Teilgebiet, das Maschinen das Interpretieren von Bildern ermöglicht.

Kurz gesagt
Teilgebiet der KI für das Verstehen und Interpretieren visueller Daten
Typischer Einsatz
Autonomes Fahren, Medizinische Bildanalyse, Qualitätskontrolle
Wichtig zu wissen
Basiert klassisch auf CNNs, zunehmend auch auf Vision Transformern

Computer Vision im Überblick

Computer Vision (deutsch: maschinelles Sehen) ist das Teilgebiet der Künstlichen Intelligenz, das Computern beibringt, den Inhalt von Bildern und Videos zu verstehen. Für einen Computer ist ein Bild zunächst nur eine Matrix aus Zahlenwerten (Pixel). Computer Vision verwandelt diese Zahlen in Bedeutung: Was ist auf dem Bild zu sehen, wo befindet es sich, und wie hängen die Objekte zusammen?

Während Menschen visuelle Informationen mühelos und blitzschnell verarbeiten, ist das für Maschinen eine enorme Herausforderung – gelöst wird sie heute fast ausschließlich mit Deep Learning.

Technisch betrachtet

Die Aufgaben-Hierarchie

AufgabeFrageAusgabe
KlassifikationWas ist auf dem Bild?eine Kategorie
ObjekterkennungWas ist wo?Kategorien + Begrenzungsrahmen
SegmentierungWelche Pixel gehören zu was?pixelgenaue Maske
Pose EstimationWie ist etwas ausgerichtet?Schlüsselpunkte

Vom CNN zum Vision Transformer

Lange dominierten Convolutional Neural Networks (CNNs) das Feld: Sie erkennen lokale Muster wie Kanten und setzen sie schichtweise zu komplexen Strukturen zusammen. Seit einigen Jahren erreichen Vision Transformer (ViT) – die Transformer-Idee aus dem NLP auf Bildkacheln übertragen – vergleichbare oder bessere Ergebnisse, besonders bei großen Datenmengen.

Multimodale Brücke

Modelle wie CLIP verbinden Bild und Sprache: Sie betten Fotos und Texte in denselben Vektorraum ein. Das ermöglicht visuelle Suche per Texteingabe und ist die Grundlage moderner Bildgeneratoren und multimodaler Assistenten.

Schritt für Schritt

Computer Vision vom Bild zur nutzbaren Entscheidung

Ein Vision-Modell erkennt Muster in Bilddaten. Ob seine Ausgabe nutzbar ist, entscheidet sich an Datenqualität, Umgebung, Fehlerfolgen und dem Prozess danach.

  1. Aufgabe und Fehlerfolgen präzisieren

    01

    Wähle Klassifikation, Erkennung oder Segmentierung passend zur Frage und beschreibe, was falsche Ergebnisse auslösen würden.

    Frage → Ausgabeform → Fehlerfolge → Fallback
  2. Bilddaten verantwortbar sammeln

    02

    Prüfe Rechte, Personenbezug, Kamerakontext und ob Trainingsbilder die realen Bedingungen ausreichend abdecken.

    Quelle → Berechtigung → Label → Datenprofil
  3. Qualität und Annotation sichern

    03

    Labelregeln, Bildqualität und schwierige Fälle werden dokumentiert, damit Training und Test dieselbe Aufgabe meinen.

    Bild → Annotationsregel → Review → Version
  4. Modell auf realen Bedingungen evaluieren

    04

    Teste Licht, Perspektive, Geräte, Hintergründe und relevante Gruppen getrennt statt nur auf Durchschnittswerten.

    Bedingung → Fehlerprofil → Segmentvergleich
  5. Ausgabe in einen sicheren Prozess einbetten

    05

    Unsichere Fälle werden markiert, Menschen können prüfen und neue Fehler fließen zurück in eine kontrollierte Verbesserung.

    Modellsignal → Confidence → Prüfung / Aktion → Feedback

Konkretes Beispiel

Beispiel: Sichtprüfung in der Fertigung

Ein Kamerasystem markiert mögliche Oberflächenfehler für die zusätzliche Prüfung durch Fachpersonal.

Einsatzfrage

Das System muss bei wechselndem Licht und unterschiedlichen Materialchargen zuverlässig arbeiten, darf aber keine finale Freigabe allein treffen.

Unterstützter Prozess

Repräsentative Bilddaten, Tests über reale Bedingungen, klar markierte Unsicherheit und ein Prüfschritt für kritische Fälle.

Computer Vision ist am stärksten, wenn die Modellgrenzen im Arbeitsprozess sichtbar sind und Fachwissen die Ausgabe sinnvoll ergänzt.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Skalierbare Sichtprüfung: Viele Bilder oder Videoframes lassen sich schnell nach definierten Mustern priorisieren.
  • Konsistente Unterstützung: Wiederkehrende visuelle Aufgaben können mit denselben Kriterien vorbereitet werden.
  • Neue Zugänge: Bildsuche, Qualitätsprüfung und Barrierefreiheit profitieren von automatisch erschlossenen Inhalten.

Das solltest du beachten

  • Empfindlich für Kontext: Licht, Perspektive und Datenlücken können die Leistung stark verändern.
  • Hoher Datenaufwand: Gute Annotationen und repräsentative Bilddaten sind oft teuer und schwierig.
  • Sensible Anwendungen: Personenbezug oder folgenreiche Entscheidungen brauchen besonders strenge Prüfung und menschliche Verantwortung.
Vertiefung · für Fortgeschrittene

Die Vision-Pipeline im Einsatz

Daten, Modell und Folgeprozess müssen zusammenpassen, damit aus Pixeln eine nützliche und überprüfbare Unterstützung entsteht.

Wissenskarte

Ein Modell übersetzt Bildmuster in eine Aufgabe wie Klasse, Objekt oder Maske.

Die Qualität einer Vision-Lösung entsteht aus der vollständigen Kette – nicht allein aus dem Modellscore. Vision-Modell gliedert sich in: Bildquelle, Annotation, Datenqualität, Modelloutput, Unsicherheit, Fachprüfung.

01Einsatzbereiche

Wann ist Computer Vision sinnvoll?

Geeignet für

  • Autonomes FahrenFahrzeuge erkennen Fahrbahn, Schilder, Fußgänger und andere Autos in Echtzeit
  • Medizinische BildanalyseAuffälligkeiten in Röntgen-, CT- oder MRT-Aufnahmen automatisch markieren
  • QualitätskontrolleDefekte Bauteile in der Produktion per Kamera erkennen
  • Visuelle SucheProdukte anhand eines Fotos statt eines Suchbegriffs finden

↑ Inhalt

02Werkzeuge

Womit Computer Vision umgesetzt wird

↑ Inhalt

Merksatz

Computer Vision ist wie das Sehen-Lernen eines Kleinkinds

Anfangs ist ein Bild nur eine Fläche aus Farbpunkten. Durch unzählige Beispiele lernt das System, in diesen Punkten Kanten, Formen und schließlich ganze Objekte zu erkennen – eine Katze, ein Auto, ein Gesicht.

  1. Teilgebiet der KI für das Verstehen und Interpretieren visueller Daten
  2. Aufgaben reichen von Klassifikation über Objekterkennung bis zur Segmentierung
  3. Basiert klassisch auf CNNs, zunehmend auch auf Vision Transformern

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Computer Vision

Was ist der Unterschied zwischen Bildklassifikation und Objekterkennung?

Bildklassifikation ordnet einem ganzen Bild eine Kategorie zu (‚enthält eine Katze'). Objekterkennung lokalisiert zusätzlich, wo sich Objekte befinden, und zeichnet Begrenzungsrahmen um sie – oft für mehrere Objekte gleichzeitig.

Was sind CNNs?

Convolutional Neural Networks sind eine Architektur neuronaler Netze, die besonders gut für Bilder geeignet ist. Sie erkennen lokale Muster wie Kanten und kombinieren sie schichtweise zu komplexeren Strukturen. Lange waren sie der Standard in Computer Vision.

Wie hängen Computer Vision und multimodale KI zusammen?

Multimodale Modelle verarbeiten Bild und Text gemeinsam. Modelle wie CLIP lernen, Bilder und ihre Beschreibungen im selben Vektorraum darzustellen. So lassen sich Bilder per Text durchsuchen oder beschreiben – eine Brücke zwischen Computer Vision und NLP.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Image Segmentation

    Jeder Pixel wird einer Klasse zugeordnet – präziser als Bounding Boxes.

  • Technisch vertiefen

    Object Detection

    KI erkennt und lokalisiert Objekte in Bildern mit Bounding Boxes.

↑ Inhalt