YOLO11 vs YOLO26#
L'évolution rapide de la vision par ordinateur repousse constamment les limites de la vitesse, de la précision et de l'efficacité du déploiement. Dans le domaine de la détection d'objets en temps réel, Ultralytics établit systématiquement la référence. Cette comparaison technique examine la transition de YOLO11, qui a rencontré un grand succès, à YOLO26, à la pointe de la technologie, en analysant leurs architectures, leurs métriques de performance et leurs scénarios de déploiement idéaux.
Que tu construises des systèmes de livraison par drone ou que tu optimises un pipeline de fabrication intelligente mondial, comprendre les différences nuancées entre ces deux modèles t'aidera à concevoir des solutions d'IA robustes et pérennes.
Lignée des modèles et écosystème#
Les deux modèles bénéficient de l'écosystème Ultralytics complet, caractérisé par son API simple, sa maintenance continue et sa communauté dynamique. Ils offrent une polyvalence inégalée, prenant nativement en charge les tâches de détection d'objets, de segmentation d'instances, de classification d'images, d'estimation de pose et de boîtes englobantes orientées (OBB).
YOLO11 : la référence établie#
Sorti fin 2024, YOLO11 a perfectionné les avancées des générations précédentes, confortant sa place de modèle fiable pour les environnements de production.
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : Documentation YOLO11
YOLO26 : une nouvelle frontière#
Introduit début 2026, YOLO26 représente un changement de paradigme pour l'informatique en périphérie et l'architecture de bout en bout, avec des améliorations significatives de la vitesse de traitement et de la facilité d'intégration.
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2026-01-14
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : Documentation de YOLO26
YOLO11 et YOLO26 sont tous deux entièrement intégrés à la plateforme Ultralytics, qui fournit des workflows fluides et sans code pour l'annotation des jeux de données, l'entraînement dans le cloud et la surveillance des flottes.
Innovations architecturales#
Alors que YOLO11 s'appuie sur des méthodes traditionnelles de post-traitement qui font progresser la vision par ordinateur depuis des années, YOLO26 introduit plusieurs avancées structurelles conçues pour éliminer les goulots d'étranglement.
Conception de bout en bout sans NMS#
L'une des améliorations les plus importantes de YOLO26 est son architecture native de bout en bout. Elle élimine le post-traitement par suppression des non-maxima (NMS), un concept d'abord introduit dans YOLOv10. Le contournement de NMS simplifie considérablement le pipeline de déploiement et garantit une latence constante, ce qui est essentiel pour les applications en temps réel comme les algorithmes de conduite autonome.
Suppression de DFL pour l'optimisation en périphérie#
YOLO26 supprime la perte focale de distribution (DFL). Bien que DFL ait été utile dans YOLO11 pour la localisation fine, sa suppression simplifie le graphe d'exportation du réseau. Cette modification garantit une meilleure compatibilité avec les matériels basse consommation, faisant de YOLO26 un véritable concentré de puissance sur les appareils en périphérie comme le Raspberry Pi ou le NVIDIA Jetson.
Optimiseur MuSGD#
S'inspirant des mécanismes d'entraînement des grands modèles de langage (LLM), et plus précisément de Kimi K2 de Moonshot AI, YOLO26 utilise le révolutionnaire optimiseur MuSGD. Cet hybride de la descente de gradient stochastique (SGD) et de Muon fournit des entraînements remarquablement stables et converge bien plus rapidement que les optimiseurs AdamW standard utilisés dans les architectures plus anciennes.
Fonctions de perte avancées#
YOLO26 intègre ProgLoss + STAL (Progressive Loss and Small-Target-Aware Label Assignment). Cette combinaison améliore considérablement la détection d'objets petits et densément regroupés. De plus, YOLO26 introduit des améliorations spécifiques aux tâches : un prototype multi-échelle dédié à la segmentation sémantique, Residual Log-Likelihood Estimation (RLE) pour les estimations complexes de poses humaines, et une perte d'angle spécialisée pour atténuer les problèmes de frontières dans les tâches de détection OBB.
Comparaison des performances#
Lors de l'évaluation de ces modèles, l'équilibre entre le nombre de paramètres, la complexité de calcul (FLOPs) et la vitesse détermine le choix du matériel. YOLO26 cible spécifiquement la vitesse d'inférence sur CPU et atteint une inférence sur CPU jusqu'à 43 % plus rapide que son prédécesseur.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Comme le montre l'exemple, le modèle YOLO26 Nano (YOLO26n) gagne considérablement en précision tout en réduisant le temps d'inférence sur CPU de 56,1 ms à 38,9 ms avec ONNX Runtime.
Cas d'utilisation et applications concrètes#
Le choix entre YOLO11 et YOLO26 dépend largement de ton infrastructure spécifique et des objectifs de ton projet.
Informatique en périphérie et IoT#
Pour les applications limitées par la puissance et le matériel, comme la surveillance de l'agriculture intelligente par drone ou les systèmes d'alarme de sécurité locaux, YOLO26 est le champion incontesté. La suppression de DFL et l'accélération de 43 % de la vitesse sur CPU te permettent d'exécuter des modèles de vision complexes sur des appareils dépourvus de GPU dédiés tout en conservant des fréquences d'images élevées.
Cloud et déploiement à l'échelle de l'entreprise#
YOLO11 reste un choix exceptionnel pour les solutions d'entreprise où de vastes fermes de serveurs sont déjà optimisées pour ses structures de tenseurs. Il convient parfaitement aux analyses vidéo basées sur le cloud et aux pipelines de traitement multimédia à grande échelle qui sont déjà profondément intégrés avec ses formats de sortie spécifiques.
Tâches multiples complexes#
Si ton projet exige une précision extrême sur de minuscules objets, comme la détection de défauts sur une carte de circuit imprimé ou le suivi de véhicules éloignés dans des images aériennes, l'implémentation de ProgLoss + STAL dans YOLO26 offre une amélioration notable du rappel et de la précision pour ces cas limites difficiles.
Efficacité de l'entraînement et besoins en mémoire#
Un avantage majeur du framework Ultralytics est son empreinte mémoire incroyablement faible lors de l'entraînement. Contrairement aux transformers de vision massifs comme RT-DETR, qui peuvent consommer de vastes quantités de mémoire CUDA, YOLO11 et YOLO26 sont tous deux optimisés pour s'entraîner efficacement sur du matériel grand public.
L'intégration de l'optimiseur MuSGD dans YOLO26 améliore encore cela en garantissant que le modèle trouve les poids optimaux plus rapidement, réduisant ainsi les heures globales de calcul GPU et les coûts de cloud computing.
Voici un exemple simple montrant à quel point il est facile d'entraîner le dernier modèle YOLO26 avec l'API Python native :
from ultralytics import YOLO
# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset
# The MuSGD optimizer and efficient memory management are handled automatically
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Run a quick validation to verify the mAP metrics
metrics = model.val()
# Export the trained model to ONNX for fast CPU inference
model.export(format="onnx")Explorer d'autres architectures#
Bien que YOLO26 représente le summum de la détection en temps réel, l'exploration d'autres modèles dans la documentation Ultralytics peut être utile. Pour les utilisateurs liés à des environnements existants, les architectures antérieures comme YOLOv5 offrent toujours des performances robustes. Pour les capacités zero-shot lorsque la définition préalable des classes est impossible, YOLO-World propose une détection à vocabulaire ouvert guidée par des invites textuelles.
Conclusion#
Le passage de YOLO11 à YOLO26 n'est pas une simple mise à jour incrémentale ; il s'agit d'une réinvention structurelle du fonctionnement des modèles de détection d'objets en temps réel en production. En supprimant les étapes complexes de post-traitement et en optimisant l'exécution en priorité sur les appareils en périphérie, YOLO26 s'impose comme le choix de référence pour les développeurs modernes. Soutenu par l'écosystème Ultralytics robuste et une documentation complète, le passage à YOLO26 garantit des déploiements plus rapides, un entraînement stable et une précision SOTA pour pratiquement toute tâche de vision par ordinateur.