Ultralytics YOLO27:
Get Started

YOLO12: Aufmerksamkeitszentrierte Objekterkennung#

Übersicht#

YOLO12 wurde Anfang 2025 veröffentlicht und führt eine auf Aufmerksamkeit ausgerichtete Architektur ein, die sich von den traditionellen CNN-basierten Ansätzen früherer YOLO-Modelle unterscheidet, aber die für viele Anwendungen wichtige Echtzeit-Inferenzgeschwindigkeit beibehält. Durch neuartige methodische Innovationen bei Aufmerksamkeitsmechanismen und der Netzwerkarchitektur insgesamt erreicht dieses Modell eine hohe Genauigkeit bei der Objekterkennung und behält zugleich die Echtzeitleistung bei. Trotz dieser Vorteile ist YOLO12 weiterhin eine Community-Entwicklung und kann beim Training Instabilitäten, einen erhöhten Speicherverbrauch und einen geringeren CPU-Durchsatz aufgrund seiner umfangreichen Aufmerksamkeitsblöcke aufweisen. Daher empfiehlt Ultralytics für die meisten Produktionsanwendungen YOLO11 oder YOLO26.

Community-Modell

YOLO12 wird hauptsächlich für Benchmarking und Forschung gepflegt. Wenn du stabiles Training, einen vorhersehbaren Speicherverbrauch und optimierte CPU-Inferenz benötigst, wähle für die Bereitstellung YOLO11 oder YOLO26.



Ansehen: So verwendest du YOLO12 zur Objekterkennung mit dem Ultralytics-Paket | Ist YOLO12 schnell oder langsam? 🚀

Wichtige Funktionen#

  • Bereichs-Aufmerksamkeitsmechanismus: Ein neuer Selbstaufmerksamkeitsansatz, der große rezeptive Felder effizient verarbeitet. Er unterteilt Merkmalskarten horizontal oder vertikal in l gleich große Bereiche (standardmäßig 4), vermeidet komplexe Operationen und erhält ein großes effektives rezeptives Feld. Dadurch sinkt der Rechenaufwand im Vergleich zu herkömmlicher Selbstaufmerksamkeit deutlich.
  • Residual Efficient Layer Aggregation Networks (R-ELAN): Ein verbessertes Merkmalsaggregationsmodul auf ELAN-Basis, das Optimierungsprobleme insbesondere bei größeren aufmerksamkeitzentrierten Modellen beheben soll. R-ELAN führt Folgendes ein:
    • Residualverbindungen auf Blockebene mit Skalierung (ähnlich der Skalierung von Schichten).
    • Eine neu gestaltete Methode zur Merkmalsaggregation, die eine bottleneckartige Struktur erzeugt.
  • Optimierte Aufmerksamkeitsarchitektur: YOLO12 vereinfacht den standardmäßigen Aufmerksamkeitsmechanismus, um Effizienz und Kompatibilität mit dem YOLO-Framework zu erhöhen. Dazu gehören:
    • FlashAttention zur Minimierung des Speicherzugriffsaufwands.
    • Der Verzicht auf Positionskodierung für ein einfacheres und schnelleres Modell.
    • Die Anpassung des MLP-Verhältnisses (vom üblichen Wert 4 auf 1,2 oder 2), um die Berechnungen zwischen Aufmerksamkeits- und Feedforward-Schichten besser auszubalancieren.
    • Die Verringerung der Tiefe gestapelter Blöcke für eine bessere Optimierung.
    • Die Nutzung von Faltungsoperationen, wo sinnvoll, aufgrund ihrer Recheneffizienz.
    • Das Hinzufügen einer separierbaren 7x7-Faltung (des „Position Perceiver“) zum Aufmerksamkeitsmechanismus, um Positionsinformationen implizit zu kodieren.
  • Umfassende Unterstützung von Aufgaben: YOLO12 unterstützt eine Reihe grundlegender Computer-Vision-Aufgaben: Objekterkennung, Instanzsegmentierung, Bildklassifizierung, Posenschätzung und die Erkennung orientierter Objekte (OBB).
  • Höhere Effizienz: Erzielt im Vergleich zu vielen früheren Modellen eine höhere Genauigkeit mit weniger Parametern und bietet damit eine bessere Balance zwischen Geschwindigkeit und Genauigkeit.
  • Flexible Bereitstellung: Entwickelt für den Einsatz auf verschiedensten Plattformen, von Edge-Geräten bis hin zu Cloud-Infrastrukturen.

Vergleichsdarstellung von YOLO12

Unterstützte Aufgaben und Modi#

YOLO12 unterstützt eine Vielzahl von Computer-Vision-Aufgaben. Die folgende Tabelle zeigt die unterstützten Aufgaben und die für jede Aufgabe verfügbaren Betriebsmodi (Inferenz, Validierung, Training und Export):

Verfügbarkeit vortrainierter Gewichte

Auf ultralytics/assets werden nur Gewichte für die Erkennung (yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt) veröffentlicht. Die Architekturen für Segmentierung, Klassifizierung, Pose und OBB sind in ultralytics/cfg/models/12/ definiert. Diese Varianten können daher anhand der Konfiguration .yaml von Grund auf trainiert werden; vortrainierte Dateien .pt sind dafür derzeit jedoch nicht verfügbar. Für vortrainierte Checkpoints zur Segmentierung, Posenschätzung, Klassifizierung oder OBB empfiehlt Ultralytics YOLO11 oder YOLO26.

ModelltypAufgabeVortrainierte GewichteTrainingValidierungInferenzExportieren
YOLO12Erkennung✅✅✅✅✅
YOLO12-segSegmentierung❌✅✅✅✅
YOLO12-clsKlassifizierung❌✅✅✅✅
YOLO12-posePose❌✅✅✅✅
YOLO12-obbOBB❌✅✅✅✅

Sobald ein trainierter Checkpoint verfügbar ist, unterstützen alle YOLO12-Architekturen sämtliche Modi. Die Spalte Pretrained Weights gibt lediglich an, ob Ultralytics einen offiziellen vortrainierten .pt auf ultralytics/assets veröffentlicht: Für Segmentierung, Pose, Klassifizierung und OBB musst du deinen eigenen Checkpoint anhand der entsprechenden .yaml trainieren, bevor du Inferenz, Validierung oder Export ausführst.

Leistungskennzahlen#

YOLO12 erzielt bei allen Modellgrößen deutliche Verbesserungen der Genauigkeit, geht dabei im Vergleich zu den schnellsten früheren YOLO-Modellen jedoch gewisse Kompromisse bei der Geschwindigkeit ein. Im Folgenden findest du quantitative Ergebnisse für die Objekterkennung auf dem COCO-Validierungsdatensatz:

Erkennungsleistung (COCO val2017)#

Leistung
ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT
(ms)
Parameter
(M)
FLOPs
(B)
Vergleich
(mAP/Geschwindigkeit)
YOLO12n64040.6-1.642.67.5+2.1%/-9% (im Vergleich zu YOLOv10n)
YOLO12s64048.0-2.619.323.3+0.1%/+42% (im Vergleich zu RT-DETRv2)
YOLO12m64052.5-4.8620.270.7+1.0%/-3% (im Vergleich zu YOLO11m)
YOLO12l64053.7-6.7726.495.4+0.4%/-8% (im Vergleich zu YOLO11l)
YOLO12x64055.2-11.7959.1208.9+0.6%/-4% (im Vergleich zu YOLO11x)
  • Die Inferenzgeschwindigkeit wurde auf einer NVIDIA T4 GPU mit TensorRT-FP16-Genauigkeit gemessen.
  • Die Vergleiche zeigen die relative Verbesserung bei mAP und die prozentuale Änderung der Geschwindigkeit (positive Werte stehen für schneller, negative für langsamer). Verglichen wird, sofern verfügbar, mit veröffentlichten Ergebnissen für YOLOv10, YOLO11 und RT-DETR.

Anwendungsbeispiele#

Dieser Abschnitt enthält Beispiele für das Training und die Inferenz mit YOLO12. Ausführlichere Dokumentation zu diesen und weiteren Modi (einschließlich Validierung und Export) findest du auf den entsprechenden Seiten zu Vorhersagen und zum Training.

Die folgenden Beispiele beziehen sich auf YOLO12-Detect-Modelle (für die Objekterkennung). Informationen zu anderen unterstützten Aufgaben (Segmentierung, Klassifizierung, Posenschätzung und Erkennung orientierter Objekte) findest du in der jeweiligen aufgabenspezifischen Dokumentation: Segment, Classify, Pose und OBB.

Beispiel

Vortrainierte Modelle *.pt (mit PyTorch) und Konfigurationsdateien *.yaml können an die Klasse YOLO() übergeben werden, um in Python eine Modellinstanz zu erstellen:

from ultralytics import YOLO

# # Ein mit COCO vortrainiertes YOLO12n-Modell laden
model = YOLO("yolo12n.pt")

# Das Modell 100 Epochen lang mit dem COCO8-Beispieldatensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# # Mit dem YOLO12n-Modell eine Inferenz für das Bild „bus.jpg“ ausführen
results = model("path/to/bus.jpg")

Wichtige Verbesserungen#

  1. Verbesserte Merkmalsextraktion:

    • Bereichsaufmerksamkeit: Verarbeitet große rezeptive Felder effizient und verringert so den Rechenaufwand.
    • Optimierte Balance: Verbesserte Balance zwischen den Berechnungen für Aufmerksamkeit und Feedforward-Netzwerk.
    • R-ELAN: Verbessert die Merkmalsaggregation mithilfe der R-ELAN-Architektur.
  2. Innovationen bei der Optimierung:

    • Residualverbindungen: Führt skalierte Residualverbindungen ein, um das Training insbesondere bei größeren Modellen zu stabilisieren.
    • Verfeinerte Merkmalsintegration: Setzt eine verbesserte Methode zur Merkmalsintegration innerhalb von R-ELAN um.
    • FlashAttention: Integriert FlashAttention, um den Speicherzugriffsaufwand zu verringern.
  3. Architektonische Effizienz:

    • Weniger Parameter: Erreicht im Vergleich zu vielen früheren Modellen eine geringere Parameterzahl bei gleichbleibender oder höherer Genauigkeit.
    • Vereinfachte Aufmerksamkeit: Verwendet eine vereinfachte Implementierung des Aufmerksamkeitsmechanismus und verzichtet auf Positionskodierung.
    • Optimierte MLP-Verhältnisse: Passt die MLP-Verhältnisse an, um Rechenressourcen effektiver zuzuweisen.

Voraussetzungen#

Die Ultralytics-Implementierung von YOLO12 benötigt standardmäßig keine FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden. Zum Kompilieren von FlashAttention wird eine der folgenden NVIDIA-GPUs benötigt:

Zitate und Danksagungen#

Wenn du YOLO12 in deiner Forschung verwendest, zitiere bitte die Originalarbeit der University at Buffalo und der University of Chinese Academy of Sciences:

Zitat
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

Das YOLO12-Paper wurde in den NeurIPS-2025-Proceedings veröffentlicht; ein Preprint ist auf arXiv verfügbar.

Häufig gestellte Fragen#

  • YOLO12 umfasst mehrere wichtige Neuerungen, die Geschwindigkeit und Genauigkeit in Einklang bringen. Der Attention-Mechanismus für Bereiche verarbeitet große rezeptive Felder effizient und senkt im Vergleich zu standardmäßiger Self-Attention den Rechenaufwand. Die effizienten residualen Layer-Aggregationsnetzwerke (R-ELAN) verbessern die Aggregation von Merkmalen und begegnen Optimierungsschwierigkeiten in größeren, auf Attention ausgerichteten Modellen. Eine optimierte Attention-Architektur, einschließlich des Einsatzes von FlashAttention und des Verzichts auf Positionskodierung, steigert die Effizienz zusätzlich. Dadurch erreicht YOLO12 Genauigkeit auf dem neuesten Stand der Technik und behält zugleich die für viele Anwendungen entscheidende Inferenzgeschwindigkeit in Echtzeit bei.

  • YOLO12 ist ein vielseitiges Modell, das eine große Bandbreite zentraler Aufgaben der Computer Vision unterstützt. Es eignet sich hervorragend für Objekterkennung (detection), Instanzsegmentierung (segmentation), Bildklassifizierung (classification), Posenschätzung und orientierte Objekterkennung (OBB) (Details ansehen). Dank dieser umfassenden Aufgabenunterstützung ist YOLO12 ein leistungsstarkes Werkzeug für vielfältige Anwendungen, von Robotik und autonomem Fahren bis hin zu medizinischer Bildgebung und industrieller Inspektion. Beachte, dass vortrainierte .pt-Gewichte derzeit nur für die Objekterkennung veröffentlicht werden; die Architekturen für Segmentierung, Pose, Klassifizierung und OBB werden als .yaml-Konfigurationen für das Training von Grund auf bereitgestellt.

  • YOLO12 erzielt im Vergleich zu früheren YOLO-Modellen wie YOLOv10 und YOLO11 bei allen Modellgrößen deutliche Genauigkeitsverbesserungen, wobei es gegenüber den schnellsten früheren Modellen gewisse Geschwindigkeitseinbußen gibt. So verbessert YOLO12n den mAP auf dem COCO-val2017-Datensatz gegenüber YOLOv10n um +2,1 % und gegenüber YOLO11n um +1,2 %. Im Vergleich zu Modellen wie RT-DETR bietet YOLO12s eine mAP-Verbesserung von +1,5 % und eine erhebliche Geschwindigkeitssteigerung von +42 %. Diese Kennzahlen verdeutlichen, wie gut YOLO12 Genauigkeit und Effizienz vereint. Ausführliche Vergleiche findest du im Abschnitt Leistungskennzahlen.

  • Standardmäßig benötigt die Ultralytics-Implementierung von YOLO12 keine FlashAttention. FlashAttention kann jedoch optional kompiliert und mit YOLO12 verwendet werden, um den Speicherzugriffsaufwand zu minimieren. Zum Kompilieren von FlashAttention wird eine der folgenden NVIDIA-GPUs benötigt: Turing-GPUs (z. B. T4, Quadro-RTX-Serie), Ampere-GPUs (z. B. RTX-30-Serie, A30/40/100), Ada-Lovelace-GPUs (z. B. RTX-40-Serie) oder Hopper-GPUs (z. B. H100/H200). Dank dieser Flexibilität kannst du die Vorteile von FlashAttention nutzen, sofern die Hardware-Ressourcen dies zulassen.

  • Diese Seite enthält grundlegende Anwendungsbeispiele für Training und Inferenz. Eine umfassende Dokumentation zu diesen und weiteren Modi, einschließlich Validierung und Export, findest du auf den entsprechenden Seiten zu Vorhersage und Training. Informationen zu bestimmten Aufgaben (Segmentierung, Klassifizierung, Posenschätzung und orientierte Objekterkennung) findest du in der jeweiligen Dokumentation: Segmentierung, Klassifizierung, Pose und OBB. Diese Ressourcen bieten ausführliche Anleitungen zur effektiven Nutzung von YOLO12 in verschiedenen Szenarien.

Kommentare