YOLO Vision 2026:

YOLO12: Auf Attention basierende Objekterkennung#

Übersicht#

YOLO12 wurde Anfang 2025 veröffentlicht und führt eine auf Aufmerksamkeit basierende Architektur ein, die von den traditionellen CNN-basierten Ansätzen früherer YOLO-Modelle abweicht, jedoch die für viele Anwendungen essentielle Echtzeit-Inferenzgeschwindigkeit beibehält. Dieses Modell erreicht eine hohe Objekterkennungsgenauigkeit durch neuartige methodische Innovationen bei Aufmerksamkeitsmechanismen und der gesamten Netzwerkarchitektur und behält dabei die Echtzeitleistung bei. Trotz dieser Vorteile bleibt YOLO12 eine von der Community gesteuerte Veröffentlichung, die aufgrund ihrer schweren Aufmerksamkeitsblöcke Trainingsinstabilität, erhöhten Speicherverbrauch und einen langsameren CPU-Durchsatz aufweisen kann, weshalb Ultralytics für die meisten Produktionsworkloads YOLO11 oder YOLO26 empfiehlt.

Community-Modell

YOLO12 wird primär für Benchmarking und Forschung gewartet. Wenn du ein stabiles Training, einen vorhersehbaren Speicherverbrauch und eine optimierte CPU-Inferenz benötigst, wähle YOLO11 oder YOLO26 für das Deployment.



Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀

Hauptfunktionen#

  • Bereichs-Aufmerksamkeitsmechanismus: Ein neuer Self-Attention-Ansatz, der große rezeptive Felder effizient verarbeitet. Er unterteilt feature maps horizontal oder vertikal in l gleich große Bereiche (Standard ist 4), vermeidet komplexe Operationen und behält ein großes effektives rezeptives Feld bei. Dies reduziert die Rechenkosten im Vergleich zur Standard-Self-Attention erheblich.
  • Residual Efficient Layer Aggregation Networks (R-ELAN): Ein verbessertes Feature-Aggregationsmodul auf Basis von ELAN, das darauf ausgelegt ist, Optimierungsprobleme zu lösen, insbesondere in größeren, auf Attention basierenden Modellen. R-ELAN führt Folgendes ein:
    • Block-level Residual-Verbindungen mit Skalierung (ähnlich wie Layer-Skalierung).
    • Eine neu gestaltete Feature-Aggregationsmethode, die eine engpassartige Struktur erzeugt.
  • Optimized Attention Architecture: YOLO12 rationalisiert den Standard-Attention-Mechanismus für höhere Effizienz und Kompatibilität mit dem YOLO-Framework. Dies beinhaltet:
    • Verwendung von FlashAttention, um den Overhead beim Speicherzugriff zu minimieren.
    • Entfernung der positionsbezogenen Codierung für ein saubereres und schnelleres Modell.
    • Anpassung des MLP-Verhältnisses (von typischerweise 4 auf 1,2 oder 2), um die Berechnung zwischen Attention- und Feed-Forward-Schichten besser auszubalancieren.
    • Reduzierung der Tiefe gestapelter Blöcke für eine verbesserte Optimierung.
    • Nutzung von Faltungsoperationen (wo angemessen) aufgrund ihrer rechnerischen Effizienz.
    • Hinzufügen einer 7x7 separablen Faltung (der "Position Perceiver") zum Attention-Mechanismus, um positionsbezogene Informationen implizit zu codieren.
  • Umfassende Aufgabenunterstützung: YOLO12 unterstützt eine Reihe von Core-Computer-Vision-Aufgaben: Objekterkennung, instance segmentation, image classification, Pose Estimation und orientierte Objekterkennung (OBB).
  • Verbesserte Effizienz: Erzielt eine höhere Genauigkeit mit weniger Parametern im Vergleich zu vielen Vorgängermodellen und demonstriert ein verbessertes Gleichgewicht zwischen Geschwindigkeit und Genauigkeit.
  • Flexible Bereitstellung: Konzipiert für den Einsatz auf verschiedensten Plattformen, von Edge-Geräten bis hin zur Cloud-Infrastruktur.

YOLO12 comparison visualization

Unterstützte Aufgaben und Modi#

YOLO12 unterstützt eine Vielzahl von Computer-Vision-Aufgaben. Die folgende Tabelle zeigt die Aufgabenunterstützung und die für jede Aufgabe aktivierten Betriebsmodi (Inferenz, Validierung, Training und Export):

Verfügbarkeit vortrainierter Gewichte

Nur Erkennungsgewichte (yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt) werden auf ultralytics/assets veröffentlicht. Segmentierungs-, Klassifizierungs-, Posen- und OBB-Architekturen sind in ultralytics/cfg/models/12/ definiert, sodass diese Varianten das Training von Grund auf mit der .yaml-Konfiguration unterstützen, aber derzeit keine vortrainierten .pt-Dateien für sie verfügbar sind. Für vortrainierte Checkpoints für Segmentierung, Pose, Klassifizierung oder OBB empfiehlt Ultralytics YOLO11 oder YOLO26.

ModelltypAufgabeVortrainierte GewichteTrainingValidationInferenceExportieren
YOLO12Detektion
YOLO12-segSegmentation
YOLO12-clsClassification
YOLO12-posePose
YOLO12-obbOBB

Alle YOLO12-Architekturen unterstützen jeden Modus, sobald ein trainierter Checkpoint verfügbar ist. Die Spalte Pretrained Weights gibt nur an, ob Ultralytics ein offizielle vortrainierte .pt auf ultralytics/assets veröffentlicht: Für Segmentierung, Pose, Klassifizierung und OBB musst du vor der Ausführung von Inferenz, Validierung oder Export deinen eigenen Checkpoint aus der entsprechenden .yaml trainieren.

Leistungsmetriken#

YOLO12 zeigt signifikante accuracy-Verbesserungen über alle Modellskalen hinweg, mit einigen Kompromissen bei der Geschwindigkeit im Vergleich zu den schnellsten vorherigen YOLO-Modellen. Unten sind quantitative Ergebnisse für object detection auf dem COCO-Validierungsdatensatz aufgeführt:

Detektionsleistung (COCO val2017)#

Leistung
ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT
(ms)
Parameter
(M)
FLOPs
(B)
Vergleich
(mAP/Geschwindigkeit)
YOLO12n64040.6-1.642.67.6+2.1%/-9% (vs. YOLOv10n)
YOLO12s64048.0-2.619.323.7+0.1%/+42% (vs. RT-DETRv2)
YOLO12m64052.5-4.8620.271.3+1.0%/-3% (vs. YOLO11m)
YOLO12l64053.7-6.7726.496.3+0.4%/-8% (vs. YOLO11l)
YOLO12x64055.2-11.7959.1210.2+0.6%/-4% (vs. YOLO11x)
  • Die Inferenzgeschwindigkeit wurde auf einer NVIDIA T4 GPU mit TensorRT FP16-precision gemessen.
  • Vergleiche zeigen die relative Verbesserung beim mAP und die prozentuale Veränderung der Geschwindigkeit (positiv bedeutet schneller; negativ bedeutet langsamer). Die Vergleiche basieren auf veröffentlichten Ergebnissen für YOLOv10, YOLO11 und RT-DETR, sofern verfügbar.

Anwendungsbeispiele#

Dieser Abschnitt bietet Beispiele für das Training und die Inferenz mit YOLO12. Ausführlichere Dokumentationen zu diesen und anderen Modi (einschließlich Validation und Export) findest du auf den dedizierten Seiten Predict und Train.

Die folgenden Beispiele konzentrieren sich auf YOLO12 Detect-Modelle (für die Objekterkennung). Für andere unterstützte Aufgaben (Segmentierung, Klassifizierung, Pose Estimation und orientierte Objekterkennung) beziehe dich auf die jeweilige aufgabenspezifische Dokumentation: Segment, Classify, Pose und OBB.

Beispiel

Vortrainierte *.pt-Modelle (unter Verwendung von PyTorch) und Konfigurationsdateien *.yaml können an die YOLO()-Klasse übergeben werden, um eine Modellinstanz in Python zu erstellen:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

Wichtige Verbesserungen#

  1. Erweiterte Feature Extraction:

    • Area Attention: Verarbeitet große receptive fields effizient und reduziert die Rechenkosten.
    • Optimiertes Gleichgewicht: Verbessertes Gleichgewicht zwischen Attention- und Feed-Forward-Netzwerkberechnungen.
    • R-ELAN: Verbessert die Feature-Aggregation unter Verwendung der R-ELAN-Architektur.
  2. Optimierungsinnovationen:

    • Residual-Verbindungen: Führt Residual-Verbindungen mit Skalierung ein, um das Training zu stabilisieren, insbesondere bei größeren Modellen.
    • Verfeinerte Feature-Integration: Implementiert eine verbesserte Methode für die Feature-Integration innerhalb von R-ELAN.
    • FlashAttention: Integriert FlashAttention, um den Speicherzugriffs-Overhead zu reduzieren.
  3. Architektonische Effizienz:

    • Reduzierte Parameter: Erreicht eine geringere Parameteranzahl bei gleichbleibender oder verbesserter Genauigkeit im Vergleich zu vielen früheren Modellen.
    • Rationalisierte Attention: Verwendet eine vereinfachte Attention-Implementierung, wobei auf positionsbezogene Codierung verzichtet wird.
    • Optimierte MLP-Verhältnisse: Passt die MLP-Verhältnisse an, um Rechenressourcen effektiver zuzuweisen.

Anforderungen#

Die Ultralytics YOLO12-Implementierung erfordert standardmäßig kein FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden. Zum Kompilieren von FlashAttention ist eine der folgenden NVIDIA-GPUs erforderlich:

Zitate und Danksagungen#

Wenn du YOLO12 in deiner Forschung verwendest, zitiere bitte die Originalarbeit der University at Buffalo und der University of Chinese Academy of Sciences:

Zitat
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

Das YOLO12-Paper wurde im NeurIPS 2025 proceedings veröffentlicht, mit einem Preprint auf arXiv.

FAQ#

  • YOLO12 enthält mehrere wichtige Innovationen, um Geschwindigkeit und Genauigkeit auszubalancieren. Der Area Attention mechanism verarbeitet große rezeptive Felder effizient und reduziert die Rechenkosten im Vergleich zu Standard-Self-Attention. Die Residual Efficient Layer Aggregation Networks (R-ELAN) verbessern die Merkmalsaggregation und adressieren Optimierungsherausforderungen in größeren aufmerksamkeitsbasierten Modellen. Eine optimierte Aufmerksamkeitsarchitektur, einschließlich der Verwendung von FlashAttention und dem Entfernen der Positionskodierung, erhöht die Effizienz weiter. Diese Funktionen ermöglichen es YOLO12, eine Genauigkeit auf dem Stand der Technik (State-of-the-Art) zu erreichen und gleichzeitig die für viele Anwendungen entscheidende Echtzeit-Inferenzgeschwindigkeit beizubehalten.

  • YOLO12 ist ein vielseitiges Modell, das eine breite Palette von Core-Computer-Vision-Aufgaben unterstützt. Es zeichnet sich aus durch Objekterkennung (detection), Instanzsegmentierung (segmentation), Bildklassifizierung (classification), pose estimation und orientierte Objekterkennung (OBB) (see details). Diese umfassende Aufgabenunterstützung macht YOLO12 zu einem leistungsstarken Werkzeug für vielfältige Anwendungen, von robotics und autonomem Fahren bis hin zu medizinischer Bildgebung und industrieller Inspektion. Beachte, dass vortrainierte .pt-Gewichte derzeit nur für die Erkennung veröffentlicht werden; die Architekturen für Segmentierung, Pose, Klassifizierung und OBB werden als .yaml-Konfigurationen für das Training von Grund auf bereitgestellt.

  • YOLO12 zeigt signifikante Genauigkeitsverbesserungen über alle Modellskalen hinweg im Vergleich zu früheren YOLO-Modellen wie YOLOv10 und YOLO11, mit einigen Kompromissen bei der Geschwindigkeit im Vergleich zu den schnellsten Vorgängermodellen. Beispielsweise erreicht YOLO12n eine mAP-Verbesserung von +2,1 % gegenüber YOLOv10n und +1,2 % gegenüber YOLO11n auf dem COCO-val2017-Datensatz. Im Vergleich zu Modellen wie RT-DETR bietet YOLO12s eine mAP-Verbesserung von +1,5 % und eine erhebliche Geschwindigkeitssteigerung von +42 %. Diese Metriken unterstreichen die starke Balance von YOLO12 zwischen Genauigkeit und Effizienz. Detaillierte Vergleiche findest du im performance metrics section.

  • Die Ultralytics YOLO12-Implementierung erfordert standardmäßig kein FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden, um den Speicherzugriffs-Overhead zu minimieren. Zum Kompilieren von FlashAttention ist eine der folgenden NVIDIA-GPUs erforderlich: Turing-GPUs (z. B. T4, Quadro RTX-Serie), Ampere-GPUs (z. B. RTX30-Serie, A30/40/100), Ada Lovelace-GPUs (z. B. RTX40-Serie) oder Hopper-GPUs (z. B. H100/H200). Diese Flexibilität ermöglicht es Nutzern, die Vorteile von FlashAttention zu nutzen, wenn die Hardware-Ressourcen dies erlauben.

  • Diese Seite bietet grundlegende usage examples für Training und Inferenz. Ausführliche Dokumentationen zu diesen und anderen Modi, einschließlich Validation und Export, findest du auf den dedizierten Seiten Predict und Train. Für aufgabenspezifische Informationen (Segmentierung, Klassifizierung, Pose Estimation und orientierte Objekterkennung) beziehe dich auf die jeweilige Dokumentation: Segment, Classify, Pose und OBB. Diese Ressourcen bieten tiefgehende Anleitungen für den effektiven Einsatz von YOLO12 in verschiedenen Szenarien.

Kommentare