YOLO11 contre YOLOv10#
Le paysage de la vision par ordinateur en temps réel évolue constamment, de nouvelles architectures repoussant les limites de ce qui est possible, tant sur les appareils edge que sur l'infrastructure cloud. Dans cette analyse technique détaillée, nous examinons les différences entre deux modèles majeurs du domaine : Ultralytics YOLO11 et YOLOv10. Tous deux représentent des avancées significatives en matière de capacités de détection d'objets, mais adoptent des philosophies architecturales fondamentalement différentes pour atteindre leurs performances.
Découvrir l'architecture de YOLO11#
Détails de YOLO11 :
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : https://docs.ultralytics.com/models/yolo11
Présenté comme une solution polyvalente très performante, YOLO11 s'appuie sur des années de recherche fondamentale en vision par ordinateur et IA. La philosophie de conception fondamentale de YOLO11 repose sur la richesse des caractéristiques et une polyvalence extrême pour de nombreuses tâches de vision par ordinateur.
L'une des améliorations majeures de YOLO11 est l'implémentation du bloc C3k2. Ce module bottleneck optimisé affine le flux des gradients dans tout le réseau, améliorant considérablement l'efficacité des paramètres tout en maintenant une précision élevée. De plus, YOLO11 utilise un mécanisme amélioré d'attention spatiale, essentiel pour identifier les éléments de petite taille ou partiellement masqués. Cela en fait un choix exceptionnel pour les cas d'utilisation d'images aériennes et l'analyse détaillée d'images médicales.
YOLO11 utilise une conception sans ancres qui réduit la complexité du réglage des hyperparamètres, permettant une généralisation robuste sur une vaste gamme de jeux de données personnalisés. En outre, les besoins en mémoire pendant l'entraînement sont nettement inférieurs à ceux des architectures basées sur des Transformer, ce qui permet aux chercheurs d'entraîner efficacement de grands modèles sur du matériel grand public standard.
Explorer l'architecture de YOLOv10#
Détails de YOLOv10 :
- Auteurs : Ao Wang, Hui Chen, Lihao Liu, et al.
- Organisation : Université Tsinghua
- Date : 2024-05-23
- Arxiv : https://arxiv.org/abs/2405.14458
- GitHub : https://github.com/THU-MIG/yolov10
- Docs : https://docs.ultralytics.com/models/yolov10
Développé par des chercheurs de Tsinghua University, YOLOv10 s'est imposé comme un pionnier de bout en bout dans la famille YOLO. La caractéristique principale de YOLOv10 est sa méthodologie d'entraînement sans NMS. En utilisant des assignations doubles cohérentes pendant la phase d'entraînement, le modèle prédit naturellement exactement une boîte englobante par objet. Cette avancée élimine complètement le besoin de suppression des non-maxima (NMS) pendant l'inférence, une étape de post-traitement qui introduisait historiquement des goulots d'étranglement au niveau de la latence dans les pipelines de déploiement.
L'architecture introduit également une stratégie globale de conception conciliant efficacité et précision. Elle intègre un sous-échantillonnage spatial-canal découplé ainsi que des conceptions de blocs guidées par le rang qui réduisent sélectivement la redondance dans les différentes étapes du réseau. Il en résulte moins de FLOPs et une surcharge de calcul réduite, sans sacrifier significativement la précision moyenne (mAP). Pour les applications en temps réel où chaque milliseconde compte, la suppression de NMS fournit un graphe d'inférence déterministe particulièrement adapté aux appareils d'IA edge.
En apprendre davantage sur YOLOv10
Métriques de performance et benchmarks#
Pour évaluer ces deux modèles, nous examinons l'équilibre entre précision, nombre de paramètres et vitesse. Le tableau suivant présente leur comparaison à différentes échelles sur le jeu de données COCO.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
Comme l'indiquent les métriques de performance de YOLO, YOLO11 obtient généralement des scores mAP légèrement supérieurs pour ses différentes variantes, en particulier avec les modèles plus grands. La conception sans NMS de YOLOv10 garantit des temps d'inférence de bout en bout très stables, mais YOLO11 parvient tout de même à atteindre un débit exceptionnel lorsqu'il est optimisé avec TensorRT sur du matériel NVIDIA.
Lors de la préparation de tes modèles pour le déploiement, l'exportation vers des formats optimisés est essentielle. YOLO11 et YOLOv10 peuvent tous deux être exportés facilement vers des formats tels que ONNX et TensorRT à l'aide du framework Ultralytics. Consulte notre guide sur les options de déploiement des modèles pour obtenir des instructions détaillées.
L’avantage de l’écosystème Ultralytics#
Bien que les métriques de performance autonomes soient importantes, le framework qui les entoure détermine le succès pratique d'un projet de machine learning. C'est là que YOLO11, en tant que composant natif de l'écosystème Ultralytics, se démarque véritablement.
La plateforme Ultralytics offre une expérience utilisateur incroyablement fluide. Grâce à une API Python simple et unifiée, les développeurs peuvent gérer des tâches qui vont au-delà des boîtes englobantes élémentaires. YOLO11 prend nativement en charge la segmentation d'instances, l'estimation de pose, la classification d'images et la détection de boîtes englobantes orientées (OBB). Cette polyvalence considérable fait souvent défaut dans les dépôts de recherche spécialisés.
En outre, l'écosystème bénéficie d'une documentation étendue et du soutien actif de la communauté. Les intégrations avec des outils tels que Weights & Biases pour le suivi des expériences et OpenVINO pour l'optimisation sur le matériel Intel sont directement intégrées à la bibliothèque. L'entraînement d'un modèle nécessite très peu de code répétitif et bénéficie de processus d'entraînement particulièrement efficaces, qui nécessitent moins de mémoire CUDA que les modèles Transformer lourds comme RT-DETR.
Exemple de code pratique#
L'entraînement et l'exécution de l'inférence avec Ultralytics sont conçus pour être aussi intuitifs que possible. La même API gère facilement YOLO11 et YOLOv10.
from ultralytics import YOLO
# Initialize the model (YOLO11n or YOLOv10n)
model = YOLO("yolo11n.pt")
# Train the model efficiently on a custom dataset
# Ultralytics automatically handles hyperparameters and memory optimization
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Run inference on an image
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
inference_results[0].show()Cas d'utilisation et recommandations#
Le choix entre YOLO11 et YOLOv10 dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir YOLO11#
YOLO11 est un choix particulièrement adapté pour :
- Déploiement edge en production : applications commerciales sur des appareils tels que Raspberry Pi ou NVIDIA Jetson, pour lesquelles la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l'estimation de pose et les OBB dans un framework unifié unique.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production grâce à l'API Python Ultralytics simplifiée.
Quand choisir YOLOv10#
YOLOv10 est recommandé pour :
- Détection en temps réel sans NMS : les applications qui bénéficient d’une détection de bout en bout sans suppression des non-maxima, réduisant ainsi la complexité du déploiement.
- Compromis équilibré entre vitesse et précision : les projets nécessitant un équilibre solide entre la vitesse d’inférence et la précision de détection pour différentes tailles de modèles.
- Applications à latence constante : les scénarios de déploiement où des temps d’inférence prévisibles sont essentiels, comme la robotique ou les systèmes autonomes.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
La prochaine génération : YOLO26#
Alors que YOLOv10 a introduit le paradigme révolutionnaire sans NMS et que YOLO11 a perfectionné la polyvalence multitâche, le domaine de l'IA évolue rapidement. Pour les développeurs qui lancent aujourd'hui de nouveaux déploiements en production, nous recommandons vivement d'explorer Ultralytics YOLO26.
Sorti en janvier 2026, YOLO26 réunit le meilleur des deux mondes. Il adopte nativement la conception de bout en bout sans NMS mise au point par YOLOv10, ce qui simplifie considérablement le pipeline de déploiement et garantit une latence cohérente. En outre, YOLO26 intègre des optimisations spécialisées pour l'informatique edge. En appliquant la suppression de DFL (suppression de la perte focale de distribution), l'architecture garantit une exportabilité simplifiée et offre une inférence CPU jusqu'à 43 % plus rapide que les modèles historiques, ce qui en fait le choix privilégié pour les appareils IoT basse consommation et les applications mobiles.
YOLO26 apporte également à la vision par ordinateur la stabilité d'entraînement des grands modèles de langage (LLM) grâce à l'innovant optimiseur MuSGD, un hybride inspiré des recherches de pointe en IA. Associé aux fonctions de perte ProgLoss + STAL, YOLO26 offre une précision inégalée sur les petits objets, ce qui est essentiel pour la détection dans les vidéos de trafic détaillées et l'automatisation robotique complexe.
Conclusion#
Le choix du modèle de vision adapté dépend de tes contraintes opérationnelles spécifiques. YOLOv10 constitue une étape importante dans le monde académique, en démontrant qu'il est possible d'éliminer efficacement NMS du pipeline de détection. Cependant, pour un équilibre supérieur entre performance, polyvalence complète des tâches et outils de déploiement fluides, YOLO11 offre une solution robuste, prête pour l'entreprise.
Pour les ingénieurs qui veulent être à la pointe, en combinant simplicité de bout en bout et performances edge fulgurantes, migrer vers le dernier YOLO26 est la recommandation ultime. En tirant parti de la plateforme Ultralytics complète, tu t'assures que tes projets reposent sur une base bien maintenue, très efficace et prête pour l'avenir.