YOLOv10 vs YOLO26#
Ces dernières années, le domaine de la vision par ordinateur a connu des avancées remarquables, passant d’architectures complexes reposant fortement sur le post-traitement à des modèles rationalisés de bout en bout. Cette comparaison technique examine deux étapes majeures de cette évolution : la percée universitaire de YOLOv10 et l’architecture de pointe YOLO26, prête pour l’entreprise. En étudiant leurs architectures, leurs méthodes d’entraînement et leurs capacités de déploiement en conditions réelles, les développeurs peuvent prendre des décisions éclairées pour créer leur prochaine application d’IA de vision.
YOLOv10 : pionnier de la détection d’objets de bout en bout#
- Auteurs : Ao Wang, Hui Chen, Lihao Liu, et al.
- Organisation : Université Tsinghua
- Date : 2024-05-23
- Liens : Article arXiv | Dépôt GitHub
Lancé à la mi-2024, YOLOv10 a marqué une avancée majeure dans la recherche universitaire en vision par ordinateur en s’attaquant à l’un des goulots d’étranglement les plus persistants de la détection d’objets en temps réel : la suppression non maximale (NMS). Les détecteurs d’objets traditionnels dépendaient fortement de la NMS pour éliminer les boîtes englobantes redondantes, ce qui ajoutait une latence variable pendant l’inférence et compliquait le déploiement en périphérie.
L’équipe de l’Université Tsinghua a introduit une stratégie d’assignation double cohérente pour l’entraînement sans NMS. Le modèle a ainsi pu prédire des boîtes englobantes avec précision sans étape de filtrage en post-traitement, ce qui améliore directement la latence d’inférence et facilite le déploiement sur des accélérateurs matériels. Bien qu’il soit très efficace pour les tâches de détection standard, le modèle se concentrait principalement sur la prédiction de boîtes englobantes et ne prenait pas nativement en charge des tâches plus complexes comme la segmentation d’instances ou l’estimation de pose.
YOLO26 : la nouvelle référence pour l’IA de vision en périphérie et dans le cloud#
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2026-01-14
- Liens : Dépôt GitHub | Plateforme Ultralytics
S’appuyant sur les concepts sans NMS introduits auparavant, le tout nouveau YOLO26 représente le summum des performances et de la polyvalence. Conçu aussi bien pour la recherche universitaire que pour les déploiements d’entreprise, il propose une architecture de bout en bout sans NMS grâce à une tête un-à-un facultative (nms=False) qui ignore le post-traitement NMS, pour un déploiement plus rapide et plus simple sur tous les matériels pris en charge.
YOLO26 introduit plusieurs améliorations architecturales révolutionnaires. La suppression de la Distribution Focal Loss (DFL) simplifie considérablement le processus d’exportation du modèle et améliore sa compatibilité avec les appareils périphériques à faible consommation. Grâce à ces changements structurels, YOLO26 accélère jusqu’à 43 % l’inférence sur CPU, ce qui en fait un excellent choix pour les applications IoT et de robotique où l’accélération GPU peut être indisponible.
La stabilité de l’entraînement et la vitesse de convergence ont également été révolutionnées par l’optimiseur MuSGD, un hybride de SGD et Muon inspiré des techniques d’entraînement des LLM. Associé à des fonctions de perte avancées comme ProgLoss + STAL, YOLO26 améliore sensiblement la reconnaissance des petits objets. Il introduit également des améliorations propres à chaque tâche, notamment le prototypage mult échelle pour la segmentation, l’estimation du maximum de vraisemblance résiduelle (RLE) pour l’estimation de pose et une fonction de perte d’angle spécialisée qui résout les problèmes de bord pour la détection par boîtes englobantes orientées (OBB).
Pour les équipes qui souhaitent développer leurs flux de travail en vision par ordinateur, la plateforme Ultralytics s’intègre parfaitement à YOLO26 et propose l’annotation intuitive des données, l’entraînement automatisé dans le cloud et le déploiement en un clic, sans nécessiter une infrastructure MLOps complexe.
Comparaison des performances techniques#
Pour évaluer ces modèles, l’équilibre entre précision, taille du modèle et vitesse d’inférence est essentiel. Le tableau ci-dessous présente les performances des deux familles de modèles à différentes échelles, évaluées sur le jeu de données COCO standard.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Les données montrent clairement l’avantage évolutif de la nouvelle architecture. YOLO26 atteint une mAP (précision moyenne) supérieure dans toutes les catégories de taille, tout en maintenant des vitesses d’inférence très compétitives. La suppression de la DFL dans YOLO26 contribue particulièrement à ses performances exceptionnelles d’inférence sur CPU avec ONNX, un domaine où les générations précédentes éprouvaient souvent des difficultés.
Méthodes d’entraînement et écosystème#
L’utilité d’un modèle dépend aussi de la qualité de l’écosystème qui le prend en charge. YOLOv10 proposait une excellente implémentation universitaire basée sur PyTorch, mais nécessitait souvent une configuration manuelle pour les tâches dépassant la détection de base.
À l’inverse, YOLO26 est entièrement intégré à l’écosystème Ultralytics bien entretenu. Cela réduit considérablement les besoins en mémoire pendant l’entraînement par rapport aux modèles basés sur Transformer comme RT-DETR, ce qui permet aux chercheurs d’entraîner des réseaux de pointe sur du matériel grand public. Sa facilité d’utilisation est inégalée : son API unifiée gère automatiquement l’augmentation des données, le réglage des hyperparamètres et la journalisation.
Exemple de code : entraînement de YOLO26#
L’entraînement d’un modèle polyvalent et très précis ne nécessite que quelques lignes de code Python :
from ultralytics import YOLO
# Charge le modèle YOLO26 small hautement optimisé
model = YOLO("yolo26s.pt")
# Entraîne efficacement le modèle avec la gestion automatique de la mémoire
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# Exporte la tête un-à-un sans NMS vers TensorRT
model.export(format="engine", nms=False)Applications et cas d’utilisation concrets#
Le choix de l’architecture adéquate dépend entièrement des contraintes de déploiement.
Calcul en périphérie à haute vitesse#
Pour les applications nécessitant un déploiement rapide sur des microcontrôleurs, des robots ou des appareils mobiles anciens, l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 en fait le choix par excellence. Son architecture sans NMS ni DFL se convertit facilement dans des formats comme OpenVINO et TensorRT, idéaux pour l’analyse vidéo en temps réel dans les infrastructures de villes intelligentes.
Vision avancée à tâches multiples#
Alors que YOLOv10 excelle dans la détection pure de boîtes englobantes, les projets nécessitant une compréhension visuelle approfondie doivent s’appuyer sur YOLO26. De la segmentation d’instances en imagerie médicale à l’estimation de pose de précision pour l’analyse sportive, YOLO26 fournit des fonctions de perte propres à chaque tâche, qui garantissent une précision supérieure dans des domaines variés.
Si ton projet nécessite une détection robuste à vocabulaire ouvert, pense à explorer YOLO-World. Pour les utilisateurs qui assurent la maintenance de pipelines hérités, YOLO11 reste une solution de remplacement puissante et entièrement prise en charge dans le framework Ultralytics.
Cas d’utilisation et recommandations#
Le choix entre YOLOv10 et YOLO26 dépend des exigences propres à ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLOv10#
YOLOv10 est un excellent choix pour :
- Détection en temps réel sans NMS : les applications qui tirent parti de la détection de bout en bout sans suppression non maximale, ce qui réduit la complexité du déploiement.
- Équilibre entre vitesse et précision : les projets qui nécessitent un bon compromis entre vitesse d’inférence et précision de détection, pour différentes tailles de modèles.
- Applications à latence constante : les scénarios de déploiement où des temps d’inférence prévisibles sont essentiels, comme en robotique ou dans les systèmes autonomes.
Quand choisir YOLO26#
YOLO26 est recommandé pour :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
Conclusion#
La transition de YOLOv10 à YOLO26 met en évidence un changement crucial : on passe de la preuve de concept académique à des solutions d’entreprise prêtes pour la production. En adoptant la conception novatrice sans NMS et en l’améliorant grâce à l’optimiseur MuSGD, à ProgLoss et à une compatibilité accrue avec les appareils en périphérie, YOLO26 établit une nouvelle référence en matière de vision par ordinateur en temps réel. Pour les développeurs qui cherchent le meilleur équilibre entre vitesse, précision et facilité d’utilisation, YOLO26 s’impose comme la recommandation par excellence.