Ultralytics YOLO26#
Présentation#
Ultralytics YOLO26 est une famille unifiée de modèles de vision en temps réel décrite dans l'article Ultralytics sur YOLO26. Elle introduit une inférence native de bout en bout, une tête de détection plus légère, une recette d'entraînement mise à jour et des têtes spécifiques aux tâches pour la détection, la segmentation, l'estimation de pose, la classification et la détection orientée.
Sur ses cinq échelles de détection, YOLO26 atteint 40.9-57.5 mAP sur COCO avec une latence TensorRT de 1.7-11.8 ms sur T4. L'article indique également une inférence CPU ONNX jusqu'à 43 % plus rapide pour YOLO26n que pour YOLO11n sur un processeur Intel Xeon @ 2.00 GHz.
Consulte l'aperçu de YOLO27 non publié (https://ultralytics-translation-0.invalid) pour découvrir l'architecture planifiée, les tâches et les benchmarks préliminaires.

from ultralytics import YOLO
model = YOLO("yolo26n.pt") # load a pretrained YOLO26n model
results = model("path/to/bus.jpg") # run inferenceExplore et exécute directement les modèles YOLO26 sur Ultralytics Platform.
La famille de modèles YOLO26 repose sur quatre axes de conception :
- Inférence de bout en bout native : La tête de détection optionnelle un à un produit des prédictions sans suppression des non-maximales (NMS), ce qui simplifie le déploiement et réduit le post-traitement.
- Régression de boîtes plus légère : YOLO26 supprime Distribution Focal Loss (DFL), ce qui réduit la complexité de la tête de détection tout en préservant une plage de régression non contrainte.
- Mises à jour de la recette d'entraînement : le pipeline d'entraînement combine MuSGD (un optimiseur hybride Muon + SGD), Progressive Loss et STAL (attribution d'étiquettes tenant compte des petites cibles) pour améliorer l'optimisation, déplacer la supervision vers la tête utilisée à l'inférence et maintenir une couverture positive des étiquettes pour les petits objets. L'ensemble des hyperparamètres associés aux points de contrôle publiés est documenté dans le guide de la recette d'entraînement YOLO26.
- Têtes et fonctions de perte spécifiques aux tâches : YOLO26 ajoute des conceptions dédiées à la segmentation d'instances, aux variantes de segmentation sémantique, à l'estimation de pose et à la détection orientée, tout en conservant un pipeline de modèle unique pour toutes les tâches.
Ensemble, ces mises à jour améliorent le compromis précision-latence pour les différentes échelles de modèles et cibles de déploiement.
Fonctionnalités clés#
-
Régression sans DFL YOLO26 supprime Distribution Focal Loss (DFL), ce qui réduit la complexité de la tête de détection et simplifie l'exportation.
-
Inférence sans NMS de bout en bout YOLO26 prend en charge l'inférence native de bout en bout avec
nms=False, produisant des prédictions sans passe NMS séparée. Le chemin par défaut un à plusieurs utilise la NMS pour la précision. -
Progressive Loss + STAL Progressive Loss déplace l'accent de l'entraînement vers la tête utilisée à l'inférence, tandis que STAL améliore la couverture positive des étiquettes pour les petits objets.
-
Optimiseur MuSGD Un optimiseur hybride qui combine SGD avec Muon, en adaptant à la vision par ordinateur des idées d'optimisation issues de l'entraînement des grands modèles de langage.
-
Déploiement efficace La tête simplifiée et le chemin optionnel sans NMS réduisent la surcharge d'inférence sur les cibles d'exportation et les profils matériels, y compris l'accélération CPU ONNX rapportée dans l'article pour YOLO26n par rapport à YOLO11n.
-
Améliorations de la segmentation d'instances Introduit une fonction de perte de segmentation sémantique pour améliorer la convergence du modèle ainsi qu'un module proto amélioré qui exploite les informations multi-échelles afin d'obtenir une meilleure qualité des masques. L'article rapporte des gains par rapport à YOLO11 allant jusqu'à +2.5 AP de boîtes et +3.7 AP de masques sur la segmentation d'instances COCO.
-
Estimation précise de la pose Intègre l'estimation de la log-vraisemblance résiduelle (RLE) pour localiser les points clés avec davantage de précision et optimise le processus de décodage afin d'accroître la vitesse d'inférence. L'article rapporte jusqu'à +7.2 AP par rapport à YOLO11 sur l'estimation de pose COCO.
-
Décodage OBB amélioré Introduit une fonction de perte angulaire spécialisée pour améliorer la précision de détection des objets de forme carrée et optimise le décodage OBB afin de résoudre les problèmes de discontinuité aux frontières. L'article rapporte jusqu'à +3.4 mAP par rapport à YOLO11 sur la détection orientée DOTA-v1.0.

Tâches et modes pris en charge#
YOLO26 prend en charge l'ensemble standard des tâches Ultralytics selon cinq échelles de modèles :
| Modèle | Noms de fichiers | Tâche | Entraînement | Validation | Inférence | Exportation |
|---|---|---|---|---|---|---|
| YOLO26 | yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.pt | Détection | ✅ | ✅ | ✅ | ✅ |
| YOLO26-seg | yolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.pt | Segmentation d'instances | ✅ | ✅ | ✅ | ✅ |
| YOLO26-sem | yolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.pt | Segmentation sémantique | ✅ | ✅ | ✅ | ✅ |
| YOLO26-depth | yolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.pt | Estimation de profondeur | ✅ | ✅ | ✅ | ✅ |
| YOLO26-cls | yolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.pt | Classification | ✅ | ✅ | ✅ | ✅ |
| YOLO26-pose | yolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.pt | Pose/points clés | ✅ | ✅ | ✅ | ✅ |
| YOLO26-obb | yolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.pt | Détection orientée | ✅ | ✅ | ✅ | ✅ |
Ce framework unifié couvre la détection en temps réel, la segmentation d'instances, la segmentation sémantique, l'estimation de profondeur monoculaire, la classification, l'estimation de pose et la détection d'objets orientés, avec prise en charge de l'entraînement, de la validation, de l'inférence et de l'exportation.
yolo26-p2.yaml et yolo26-p6.yaml ajoutent une tête de détection P2 (petits objets) ou P6 (grandes entrées) et sont fournis uniquement sous forme d'architectures YAML. Aucun poids yolo26*-p2.pt ou yolo26*-p6.pt spécifique à l'échelle n'est publié. Instancie une configuration mise à l'échelle depuis YAML (par exemple, YOLO("yolo26n-p6.yaml")) et entraîne-la ou ajuste-la selon tes besoins.
Métriques de performance#
Consulte la documentation sur la détection pour voir des exemples d'utilisation de ces modèles entraînés sur COCO, qui comprennent 80 classes préentraînées.
| Modèle | taille (pixels) | mAPval 50-95 | mAPval 50-95(e2e) | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 40.1 | 38.9 ± 0.7 | 1.7 ± 0.0 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 47.8 | 87.2 ± 0.9 | 2.5 ± 0.0 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 52.5 | 220.0 ± 1.4 | 4.7 ± 0.1 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 54.4 | 286.2 ± 2.0 | 6.2 ± 0.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 56.9 | 525.8 ± 4.0 | 11.8 ± 0.2 | 55.7 | 194.4 |
Les valeurs des paramètres et des FLOPs concernent le modèle fusionné après le repliement Conv/BatchNorm et la suppression de la branche de détection inutilisée. Les mesures de vitesse sélectionnent la tête sans NMS avec nms=False. Les points de contrôle pré-entraînés conservent l'architecture d'entraînement complète et peuvent afficher des nombres plus élevés.
Exemples d’utilisation#
Cette section fournit des exemples simples d'entraînement et d'inférence avec YOLO26. Pour la documentation complète sur ces modes et les autres, consulte les pages de documentation Predict, Train, Val et Export.
Note que l'exemple ci-dessous concerne les modèles YOLO26 Detect destinés à la détection d'objets. Pour les autres tâches prises en charge, consulte la documentation Segment, Semantic Segmentation, Depth, Classify, Pose et OBB.
Les modèles *.pt préentraînés avec PyTorch, ainsi que les fichiers de configuration *.yaml, peuvent être transmis à la classe YOLO() pour créer une instance de modèle en Python :
from ultralytics import YOLO
# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")
# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")
# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)Les modèles de détection YOLO26 utilisent une architecture à deux têtes qui offre une flexibilité adaptée aux différents scénarios de déploiement :
- Tête un à plusieurs (Par défaut) : Génère des sorties YOLO traditionnelles nécessitant un post-traitement NMS, produisant
(N, nc + 4, 8400)oùncest le nombre de classes. Cette tête atteint généralement une précision légèrement supérieure au détriment d'un traitement supplémentaire. - Tête un à un (
nms=False) : Produit des prédictions de bout en bout sans NMS, produisant(N, 300, 6)avec un maximum de 300 détections par image. Cette tête est optimisée pour une inférence rapide et un déploiement simplifié.
Tu peux basculer entre les têtes lors de l'exportation, de la prédiction ou de la validation :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Use one-to-many head (default, Ultralytics applies NMS)
results = model.predict("image.jpg") # inference
metrics = model.val(data="coco.yaml") # validation
model.export(format="onnx") # export
# Opt into the NMS-free one-to-one head
results = model.predict("image.jpg", nms=False) # inference
metrics = model.val(data="coco.yaml", nms=False) # validation
model.export(format="onnx", nms=False) # exportLa prédiction et la validation utilisent par défaut la tête un à plusieurs pour plus de précision. Utilise nms=False pour l'inférence sans NMS, ou nms=True pour intégrer la NMS dans une exportation prise en charge. Les deux têtes sont entraînées quel que soit ce choix. Consulte le guide de détection de bout en bout pour connaître les formats de sortie et la compatibilité des exportations.
YOLOE-26 : détection et segmentation à vocabulaire ouvert#
YOLO26 propulse également YOLOE-26, une variante à vocabulaire ouvert qui détecte et segmente des catégories d'objets à partir de text prompts, de visual prompts ou d'un prompt-free mode au lieu d'une liste de classes fixe apprise lors de l'entraînement. YOLOE-26 conserve la tête de traitement de bout en bout (e2e) optionnelle sans NMS de YOLO26, de sorte que l'inférence à vocabulaire ouvert reste suffisamment rapide pour les environnements dynamiques où les catégories cibles changent au fil du temps. YOLOE-26x atteint 40.6 AP sur le jeu de données LVIS minival avec guidage textuel, 38.5 AP avec guidage visuel et 31.1 AP sans guidage — les chiffres Non-E2E de l'article, que la tête de bout en bout talonne de 1.1, 2.3 et 1.2 AP.
Consulte la documentation YOLOE pour les tableaux de performances par échelle, les variantes sans prompt et des exemples d'utilisation complets.
Citations et remerciements#
Pour une description technique complète de l'architecture YOLO26, de la recette d'entraînement, des têtes de tâches et de l'extension YOLOE-26 à vocabulaire ouvert, lis Ultralytics YOLO26 : modèles de vision unifiés de bout en bout en temps réel. Si tu utilises YOLO26 dans tes recherches, merci de citer :
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
year = {2026},
eprint = {2606.03748},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
doi = {10.48550/arXiv.2606.03748},
url = {https://arxiv.org/abs/2606.03748},
}Le code, les modèles et la documentation YOLO26 sont disponibles dans le dépôt GitHub d'Ultralytics et les Docs Ultralytics, sous licences AGPL-3.0 et Entreprise.
FAQ#
- Régression sans DFL : simplifie la tête de détection et le chemin d'exportation
- Inférence sans NMS de bout en bout : Prend en charge l'inférence sans NMS avec
nms=False - Progressive Loss + STAL : améliore l'alignement de l'entraînement et la couverture des étiquettes des petits objets
- Optimiseur MuSGD : combine SGD avec une optimisation inspirée de Muon pour un entraînement stable
- Têtes et fonctions de perte spécifiques aux tâches : améliore la prise en charge de la segmentation, de la pose et de la détection orientée
YOLO26 est une famille de modèles unifiée, qui prend en charge de bout en bout plusieurs tâches de vision par ordinateur :
- Détection d’objets
- Segmentation d'instances
- Segmentation sémantique
- Estimation de profondeur monoculaire
- Classification d’images
- Estimation de pose
- Détection d'objets orientés (OBB)
Chaque variante de taille (n, s, m, l, x) prend en charge toutes les tâches, ainsi que les versions à vocabulaire ouvert via YOLOE-26.
YOLO26 améliore l'efficacité du déploiement grâce à :
- Inférence native de bout en bout optionnelle sans NMS (
nms=False) - Une régression sans DFL et une tête de détection plus légère
- Une exportation du modèle fusionné qui supprime les composants auxiliaires utilisés uniquement pendant l'entraînement
- Une inférence CPU ONNX jusqu'à 43 % plus rapide pour YOLO26n que pour YOLO11n sur un processeur Intel Xeon @ 2.00 GHz
- Des formats d'exportation flexibles, notamment TensorRT, ONNX, CoreML, LiteRT et OpenVINO
- Inférence native de bout en bout optionnelle sans NMS (
Les modèles YOLO26 peuvent être téléchargés via le paquet
ultralytics. Installe ou mets à jour le paquet, puis charge un modèle :Consulte la section Exemples d'utilisation pour les instructions d'entraînement, de validation et d'exportation.