Ultralytics YOLO27:

YOLO12: Aufmerksamkeitszentrierte Objekterkennung#

Übersicht#

YOLO12 wurde Anfang 2025 veröffentlicht und führt eine aufmerksamkeitszentrierte Architektur ein, die sich von den traditionellen CNN-basierten Ansätzen früherer YOLO-Modelle unterscheidet, zugleich aber die für viele Anwendungen erforderliche Echtzeit-Inferenzgeschwindigkeit beibehält. Dieses Modell erzielt durch neuartige methodische Innovationen bei Aufmerksamkeitsmechanismen und der Netzarchitektur insgesamt eine hohe Genauigkeit bei der Objekterkennung und bewahrt dabei die Echtzeitleistung. Trotz dieser Vorteile bleibt YOLO12 eine von der Community entwickelte Veröffentlichung, die aufgrund ihrer umfangreichen Aufmerksamkeitsblöcke instabiles Training, einen erhöhten Speicherverbrauch und einen geringeren CPU-Durchsatz aufweisen kann. Daher empfiehlt Ultralytics für die meisten Produktions-Workloads YOLO11 oder YOLO26.

Community-Modell

YOLO12 wird hauptsächlich für Benchmarking und Forschung gepflegt. Wenn du stabiles Training, einen planbaren Speicherverbrauch und eine optimierte CPU-Inferenz benötigst, wähle für die Bereitstellung YOLO11 oder YOLO26.



Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀

Wichtige Funktionen#

  • Bereichsaufmerksamkeitsmechanismus: Ein neuer Ansatz für Selbstaufmerksamkeit, der große rezeptive Felder effizient verarbeitet. Er teilt Feature-Maps in l gleich große Bereiche auf (standardmäßig 4), entweder horizontal oder vertikal, vermeidet komplexe Operationen und erhält ein großes effektives rezeptives Feld. Dadurch werden die Rechenkosten im Vergleich zur standardmäßigen Selbstaufmerksamkeit deutlich reduziert.
  • Residual Efficient Layer Aggregation Networks (R-ELAN): Ein verbessertes Modul zur Feature-Aggregation auf Basis von ELAN, das Optimierungsprobleme insbesondere in größeren aufmerksamkeitszentrierten Modellen lösen soll. R-ELAN führt Folgendes ein:
    • Residualverbindungen auf Blockebene mit Skalierung (ähnlich der Skalierung von Schichten).
    • Eine neu gestaltete Methode zur Feature-Aggregation, die eine bottleneckähnliche Struktur erzeugt.
  • Optimierte Aufmerksamkeitsarchitektur: YOLO12 vereinfacht den standardmäßigen Aufmerksamkeitsmechanismus für höhere Effizienz und bessere Kompatibilität mit dem YOLO-Framework. Dazu gehören:
    • Die Verwendung von FlashAttention zur Minimierung des Speicherzugriffs-Overheads.
    • Der Verzicht auf Positionskodierung für ein übersichtlicheres und schnelleres Modell.
    • Die Anpassung des MLP-Verhältnisses (vom typischen Wert 4 auf 1,2 oder 2), um die Berechnung besser zwischen Aufmerksamkeits- und Feed-forward-Schichten auszubalancieren.
    • Die Verringerung der Tiefe gestapelter Blöcke für eine verbesserte Optimierung.
    • Die Nutzung von Faltungsoperationen (wo sinnvoll) aufgrund ihrer Recheneffizienz.
    • Das Hinzufügen einer separierbaren 7x7-Faltung (des „Position Perceiver“) zum Aufmerksamkeitsmechanismus, um Positionsinformationen implizit zu kodieren.
  • Umfassende Aufgabenunterstützung: YOLO12 unterstützt eine Reihe zentraler Aufgaben der Computer Vision: Objekterkennung, Instanzsegmentierung, Bildklassifizierung, Posenschätzung und Erkennung orientierter Objekte (OBB).
  • Verbesserte Effizienz: Erzielt im Vergleich zu vielen früheren Modellen eine höhere Genauigkeit mit weniger Parametern und zeigt dadurch ein verbessertes Gleichgewicht zwischen Geschwindigkeit und Genauigkeit.
  • Flexible Bereitstellung: Für die Bereitstellung auf verschiedensten Plattformen ausgelegt, von Edge-Geräten bis hin zu Cloud-Infrastrukturen.

Visualisierung des YOLO12-Vergleichs

Unterstützte Aufgaben und Modi#

YOLO12 unterstützt verschiedene Aufgaben der Computer Vision. Die folgende Tabelle zeigt die Aufgabenunterstützung und die für jede Aufgabe aktivierten Betriebsmodi (Inferenz, Validierung, Training und Export):

Verfügbarkeit vortrainierter Gewichte

Nur Gewichte für die Erkennung (yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt) werden unter ultralytics/assets veröffentlicht. Die Architekturen für Segmentierung, Klassifizierung, Posenschätzung und OBB sind in ultralytics/cfg/models/12/ definiert. Daher unterstützen diese Varianten das Training von Grund auf anhand der Konfiguration .yaml, allerdings sind derzeit keine vortrainierten Dateien .pt dafür verfügbar. Für vortrainierte Checkpoints zur Segmentierung, Posenschätzung, Klassifizierung oder OBB empfiehlt Ultralytics YOLO11 oder YOLO26.

ModelltypAufgabeVortrainierte GewichteTrainingValidierungInferenzExport
YOLO12Erkennung
YOLO12-segSegmentierung
YOLO12-clsKlassifizierung
YOLO12-posePose
YOLO12-obbOBB

Alle YOLO12-Architekturen unterstützen jeden Modus, sobald ein trainierter Checkpoint verfügbar ist. Die Spalte Pretrained Weights gibt lediglich an, ob Ultralytics einen offiziellen vortrainierten .pt unter ultralytics/assets veröffentlicht: Für Segmentierung, Posenschätzung, Klassifizierung und OBB musst du zunächst anhand der entsprechenden Konfiguration .yaml einen eigenen Checkpoint trainieren, bevor du Inferenz, Validierung oder Export ausführst.

Leistungsmetriken#

YOLO12 zeigt über alle Modellgrößen hinweg deutliche Verbesserungen bei der Genauigkeit, mit gewissen Geschwindigkeitseinbußen im Vergleich zu den schnellsten früheren YOLO-Modellen. Nachfolgend findest du quantitative Ergebnisse für die Objekterkennung auf dem COCO-Validierungsdatensatz:

Erkennungsleistung (COCO val2017)#

Leistung
ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT
(ms)
Parameter
(M)
FLOPs
(B)
Vergleich
(mAP/Geschwindigkeit)
YOLO12n64040.6-1.642.67.5+2,1 %/-9 % (gegenüber YOLOv10n)
YOLO12s64048.0-2.619.323.3+0,1 %/+42 % (gegenüber RT-DETRv2)
YOLO12m64052.5-4.8620.270.7+1,0 %/-3 % (gegenüber YOLO11m)
YOLO12l64053.7-6.7726.495.4+0,4 %/-8 % (gegenüber YOLO11l)
YOLO12x64055.2-11.7959.1208.9+0,6 %/-4 % (gegenüber YOLO11x)
  • Die Inferenzgeschwindigkeit wurde auf einer NVIDIA T4-GPU mit TensorRT-FP16-Genauigkeit gemessen.
  • Die Vergleiche zeigen die relative Verbesserung bei mAP und die prozentuale Änderung der Geschwindigkeit (positive Werte bedeuten schneller, negative Werte langsamer). Die Vergleiche basieren, sofern verfügbar, auf veröffentlichten Ergebnissen für YOLOv10, YOLO11 und RT-DETR.

Verwendungsbeispiele#

Dieser Abschnitt enthält Beispiele für das Training und die Inferenz mit YOLO12. Eine umfassendere Dokumentation zu diesen und anderen Modi (einschließlich Validierung und Export) findest du auf den entsprechenden Seiten zu Predict und Train.

Die folgenden Beispiele konzentrieren sich auf YOLO12-Detect-Modelle (für die Objekterkennung). Informationen zu anderen unterstützten Aufgaben (Segmentierung, Klassifizierung, Posenschätzung und Erkennung orientierter Objekte) findest du in der jeweiligen aufgabenspezifischen Dokumentation: Segment, Classify, Pose und OBB.

Beispiel

Vortrainierte Modelle *.pt (mit PyTorch) und Konfigurationsdateien *.yaml können an die Klasse YOLO() übergeben werden, um in Python eine Modellinstanz zu erstellen:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

Wichtige Verbesserungen#

  1. Verbesserte Feature-Extraktion:

    • Bereichsaufmerksamkeit: Verarbeitet große rezeptive Felder effizient und reduziert dadurch die Rechenkosten.
    • Optimierte Balance: Verbessertes Gleichgewicht zwischen den Berechnungen der Aufmerksamkeit und des Feed-forward-Netzes.
    • R-ELAN: Verbessert die Feature-Aggregation mithilfe der R-ELAN-Architektur.
  2. Innovationen bei der Optimierung:

    • Residualverbindungen: Führt Residualverbindungen mit Skalierung ein, um das Training insbesondere bei größeren Modellen zu stabilisieren.
    • Verfeinerte Feature-Integration: Implementiert eine verbesserte Methode zur Feature-Integration innerhalb von R-ELAN.
    • FlashAttention: Integriert FlashAttention, um den Speicherzugriffs-Overhead zu reduzieren.
  3. Architekturelle Effizienz:

    • Weniger Parameter: Erzielt im Vergleich zu vielen früheren Modellen eine geringere Parameteranzahl bei gleichbleibender oder verbesserter Genauigkeit.
    • Vereinfachte Aufmerksamkeit: Verwendet eine vereinfachte Implementierung der Aufmerksamkeit und verzichtet auf Positionskodierung.
    • Optimierte MLP-Verhältnisse: Passt die MLP-Verhältnisse an, um Rechenressourcen effektiver zuzuweisen.

Anforderungen#

Die Implementierung von Ultralytics YOLO12 erfordert standardmäßig keine FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden. Zum Kompilieren von FlashAttention wird eine der folgenden NVIDIA-GPUs benötigt:

Zitate und Danksagungen#

Wenn du YOLO12 in deiner Forschung verwendest, zitiere bitte die Originalarbeit der University at Buffalo und der University of Chinese Academy of Sciences:

Zitat
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

Die Arbeit zu YOLO12 wurde in den NeurIPS-2025-Proceedings veröffentlicht; ein Preprint ist auf arXiv verfügbar.

FAQ#

  • YOLO12 integriert mehrere wichtige Innovationen, um Geschwindigkeit und Genauigkeit auszubalancieren. Der Aufmerksamkeitsmechanismus für Bereiche verarbeitet große rezeptive Felder effizient und reduziert die Rechenkosten im Vergleich zur standardmäßigen Selbstaufmerksamkeit. Die Residual Efficient Layer Aggregation Networks (R-ELAN) verbessern die Feature-Aggregation und lösen Optimierungsprobleme in größeren aufmerksamkeitszentrierten Modellen. Eine optimierte Aufmerksamkeitsarchitektur, einschließlich der Verwendung von FlashAttention und des Verzichts auf Positionskodierung, steigert die Effizienz zusätzlich. Diese Funktionen ermöglichen es YOLO12, eine dem aktuellen Stand der Technik entsprechende Genauigkeit zu erzielen und zugleich die für viele Anwendungen entscheidende Echtzeit-Inferenzgeschwindigkeit beizubehalten.

  • YOLO12 ist ein vielseitiges Modell, das ein breites Spektrum zentraler Aufgaben der Computer Vision unterstützt. Es eignet sich besonders für die Erkennung von Objekten, die Instanz-Segmentierung, die Bild-Klassifizierung, die Posenschätzung und die Erkennung orientierter Objekte (OBB) (Details anzeigen). Diese umfassende Aufgabenunterstützung macht YOLO12 zu einem leistungsfähigen Werkzeug für vielfältige Anwendungen, von Robotik und autonomem Fahren bis hin zu medizinischer Bildgebung und industrieller Inspektion. Beachte, dass vortrainierte Gewichte .pt derzeit nur für die Erkennung veröffentlicht werden; die Architekturen für Segmentierung, Posenschätzung, Klassifizierung und OBB werden als .yaml-Konfigurationen für das Training von Grund auf bereitgestellt.

  • YOLO12 zeigt im Vergleich zu früheren YOLO-Modellen wie YOLOv10 und YOLO11 über alle Modellgrößen hinweg deutliche Verbesserungen bei der Genauigkeit, mit gewissen Geschwindigkeitseinbußen gegenüber den schnellsten früheren Modellen. So erzielt YOLO12n auf dem COCO-val2017-Datensatz eine um 2,1 % höhere mAP als YOLOv10n und eine um 1,2 % höhere mAP als YOLO11n. Im Vergleich zu Modellen wie RT-DETR bietet YOLO12s eine um 1,5 % höhere mAP und eine deutliche Geschwindigkeitssteigerung von 42 %. Diese Metriken verdeutlichen das ausgewogene Verhältnis von Genauigkeit und Effizienz bei YOLO12. Ausführliche Vergleiche findest du im Abschnitt zu den Leistungsmetriken.

  • Die Implementierung von Ultralytics YOLO12 erfordert standardmäßig keine FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden, um den Speicherzugriffs-Overhead zu minimieren. Zum Kompilieren von FlashAttention wird eine der folgenden NVIDIA-GPUs benötigt: Turing-GPUs (z. B. T4, Quadro-RTX-Serie), Ampere-GPUs (z. B. RTX30-Serie, A30/40/100), Ada-Lovelace-GPUs (z. B. RTX40-Serie) oder Hopper-GPUs (z. B. H100/H200). Diese Flexibilität ermöglicht es dir, die Vorteile von FlashAttention zu nutzen, sofern die Hardware dies zulässt.

  • Diese Seite enthält grundlegende Anwendungsbeispiele für Training und Inferenz. Eine umfassende Dokumentation dieser und weiterer Modi, einschließlich Validierung und Export, findest du auf den entsprechenden Seiten zu Vorhersage und Training. Informationen zu aufgabenspezifischen Themen (Segmentierung, Klassifizierung, Posenschätzung und orientierte Objekterkennung) findest du in der jeweiligen Dokumentation: Segmentierung, Klassifizierung, Pose und OBB. Diese Ressourcen bieten ausführliche Anleitungen für den effektiven Einsatz von YOLO12 in verschiedenen Szenarien.

Kommentare