Object Detection

Eine Computer-Vision-Aufgabe, bei der KI-Modelle Objekte in Bildern oder Videos erkennen und mit Bounding Boxes lokalisieren – Grundlage für autonomes Fahren, Videoüberwachung und Robotik.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Kombiniert Klassifikation (Was?) und Lokalisierung (Wo?) in einem Schritt
  2. Ausgabe: Bounding Boxes mit Klassen-Labels und Konfidenz-Scores
  3. YOLO, Faster R-CNN und DETR sind die dominanten Architekturen

Sofortantwort

Object Detection einfach erklärt

KI erkennt und lokalisiert Objekte in Bildern mit Bounding Boxes.

Kurz gesagt
Kombiniert Klassifikation (Was?) und Lokalisierung (Wo?) in einem Schritt
Typischer Einsatz
Autonomes Fahren, Qualitätskontrolle, Retail Analytics
Wichtig zu wissen
YOLO, Faster R-CNN und DETR sind die dominanten Architekturen

Object Detection im Überblick

Object Detection ist eine der grundlegendsten Aufgaben in Computer Vision: Ein Modell bekommt ein Bild und gibt für jedes erkannte Objekt eine Bounding Box (Rechteck mit Koordinaten), ein Klassen-Label (“Auto”, “Person”, “Hund”) und einen Konfidenz-Score zurück. Das klingt einfach, ist aber technisch anspruchsvoll – das Modell muss gleichzeitig erkennen, was im Bild ist und wo genau es sich befindet.

Der Unterschied zur reinen Bildklassifikation ist entscheidend: Klassifikation sagt “Im Bild ist ein Hund”. Object Detection sagt “Im Bild sind 3 Hunde: einer oben links (92% Konfidenz), einer in der Mitte (87%) und einer unten rechts (79%)”. Diese Lokalisierung macht Object Detection zur Grundlage für autonomes Fahren, Robotik, Videoüberwachung und industrielle Qualitätskontrolle.

Technisch betrachtet

Architekturen im Überblick

ArchitekturAnsatzStärke
YOLO (v5–v11)Single-Shot, ein DurchlaufEchtzeit, einfaches Deployment
Faster R-CNNTwo-Stage, Region ProposalsHohe Genauigkeit, langsamer
DETRTransformer-basiertKein Anchor-Design nötig
SSDSingle-Shot, Multi-ScaleGuter Speed/Accuracy-Kompromiss

Metriken

mAP (mean Average Precision): Hauptmetrik für Object Detection
- mAP@0.5: IoU-Schwellwert 50% (lockerer)
- mAP@0.5:0.95: Durchschnitt über IoU 50%–95% (strenger, COCO-Standard)

IoU (Intersection over Union):
IoU = Schnittmenge(predicted, ground_truth) / Vereinigung(predicted, ground_truth)

YOLOv8 Quickstart

from ultralytics import YOLO

# Vortrainiertes Modell laden
model = YOLO('yolov8n.pt')  # nano = kleinste/schnellste Variante

# Inferenz auf Bild
results = model('bild.jpg')

# Ergebnisse ausgeben
for r in results:
    for box in r.boxes:
        print(f"Klasse: {r.names[int(box.cls)]}")
        print(f"Konfidenz: {box.conf:.2f}")
        print(f"Bounding Box: {box.xyxy}")  # x1, y1, x2, y2

Fine-Tuning auf eigene Daten

# Training auf eigenem Datensatz
model = YOLO('yolov8n.pt')
results = model.train(
    data='dataset.yaml',  # Pfad zu Datensatz-Config
    epochs=100,
    imgsz=640,
    batch=16
)

01Einsatzbereiche

Wann ist Object Detection sinnvoll?

Geeignet für

  • Autonomes FahrenErkennung von Fußgängern, Fahrzeugen, Ampeln und Hindernissen in Echtzeit
  • QualitätskontrolleAutomatische Erkennung von Defekten in Produktionslinien
  • Retail AnalyticsZählung von Personen, Analyse von Regalbestückung, Checkout-Automatisierung
  • Medizinische BildgebungLokalisierung von Tumoren, Läsionen und anatomischen Strukturen in Scans

↑ Inhalt

02Werkzeuge

Womit Object Detection umgesetzt wird

↑ Inhalt

Merksatz

Object Detection ist wie ein Sicherheitsbeamter, der in einem Raum nicht nur sagt 'Ich sehe eine Tasche' (Klassifikation), sondern auch zeigt: 'Diese Tasche ist dort in der linken Ecke' – und das für alle Objekte gleichzeitig.

  1. Kombiniert Klassifikation (Was?) und Lokalisierung (Wo?) in einem Schritt
  2. Ausgabe: Bounding Boxes mit Klassen-Labels und Konfidenz-Scores
  3. YOLO, Faster R-CNN und DETR sind die dominanten Architekturen

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Object Detection

Was ist der Unterschied zwischen Object Detection und Image Classification?

Image Classification sagt nur 'Was ist im Bild?' (z.B. 'Hund'). Object Detection sagt 'Was ist wo im Bild?' und gibt für jedes erkannte Objekt eine Bounding Box mit Koordinaten aus. Detection ist komplexer, aber für die meisten Praxis-Anwendungen nötiger.

Was ist YOLO und warum ist es so populär?

YOLO (You Only Look Once) ist eine Architektur, die das gesamte Bild in einem einzigen Durchlauf verarbeitet – im Gegensatz zu zweistufigen Methoden wie Faster R-CNN. Das macht YOLO extrem schnell (Echtzeit auf Consumer-Hardware) bei guter Genauigkeit. YOLOv8 ist heute der Standard für Produktions-Deployments.

Wie viele Trainingsdaten brauche ich für Object Detection?

Für einen guten Start reichen oft 500–2000 annotierte Bilder pro Klasse, wenn man ein vortrainiertes Modell fine-tuned (Transfer Learning). Für sehr spezifische Domänen oder viele Klassen werden mehr Daten benötigt. Daten-Augmentation (Rotation, Flip, Helligkeit) kann die effektive Datenmenge vervielfachen.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt