YOLOX contre YOLOv9#
Le paysage de la vision par ordinateur a été façonné par des avancées architecturales continues, qui concilient efficacité de calcul et grande précision. Lorsqu’on évalue des modèles de détection d’objets en temps réel, la comparaison entre YOLOX de Megvii et YOLOv9 de l’Academia Sinica met en lumière deux philosophies distinctes du développement de l’apprentissage profond. L’un a été le pionnier d’un paradigme simplifié sans ancres, tandis que l’autre a introduit des techniques avancées de routage des gradients pour maximiser la conservation de l’information.
Ce guide technique examine les subtilités architecturales, les benchmarks de performance et les cas d’usage idéaux de ces modèles, tout en montrant comment des solutions modernes comme l’Ultralytics Platform et le nouveau modèle YOLO26 offrent de meilleures solutions de remplacement pour les déploiements prêts pour la production.
YOLOX : pionnier du paradigme sans ancres#
Sorti au milieu de l’année 2021, YOLOX a constitué une avancée majeure pour rapprocher la recherche universitaire des applications industrielles. En supprimant le besoin de boîtes d’ancrage prédéfinies, il a considérablement simplifié les réglages heuristiques nécessaires pour les jeux de données personnalisés.
- Auteurs : Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun
- Organisation : Megvii
- Date de sortie : 18 juillet 2021
- Référence : Article Arxiv
- Code source : Dépôt GitHub de YOLOX
- Documentation : Documentation officielle de YOLOX
Innovations architecturales#
YOLOX a apporté plusieurs changements majeurs au pipeline de détection standard. Le modèle a introduit une tête découplée qui sépare les tâches de classification et de régression, réduisant ainsi considérablement le conflit entre l’identification d’un objet et la localisation de ses contours. En outre, YOLOX a adopté SimOTA, une stratégie avancée d’assignation des étiquettes qui attribue dynamiquement les échantillons positifs pendant l’entraînement, accélérant la convergence et améliorant les performances globales sur les jeux de données de référence classiques.
Atouts et limites#
Le principal atout de YOLOX réside dans sa conception simplifiée. Le mécanisme sans ancres permet aux développeurs de passer moins de temps à exécuter des algorithmes de regroupement pour déterminer les tailles d’ancres optimales pour leurs données. Toutefois, en tant qu’architecture plus ancienne, conçue sans les avancées récentes en matière d’auto-attention ou de chemins de gradient, elle peine à égaler l’efficacité en nombre de paramètres des réseaux plus récents. Elle ne prend pas non plus en charge nativement des tâches avancées comme la segmentation d’instances et l’estimation de pose dans une API unifiée.
YOLOv9 : maximiser l’information des gradients#
En 2024, YOLOv9 a introduit une approche très théorique pour résoudre le problème du goulot d’étranglement de l’information inhérent aux réseaux neuronaux convolutifs profonds.
- Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica
- Date de sortie : 21 février 2024
- Référence : Article Arxiv
- Code source : Dépôt GitHub de YOLOv9
- Documentation : Documentation Ultralytics de YOLOv9
Innovations architecturales#
La caractéristique déterminante de YOLOv9 est l’information de gradient programmable (PGI), qui garantit que les données sémantiques essentielles ne sont pas perdues lorsqu’elles traversent les différentes couches du réseau. Associé au réseau d’agrégation de couches efficace généralisé (GELAN), YOLOv9 atteint un rapport paramètres/précision exceptionnel. Le modèle peut ainsi conserver des gradients précis pour mettre à jour les poids, ce qui le rend très efficace même dans ses variantes légères.
Atouts et limites#
YOLOv9 excelle à repousser les limites théoriques de la précision des modèles. Il obtient d’excellents scores mAP sur COCO, ce qui en fait un favori des chercheurs. Malgré son efficacité, YOLOv9 s’appuie toutefois toujours sur la suppression non maximale (NMS) classique pour le post-traitement, ce qui entraîne des pics de latence pendant l’inférence. Pour les ingénieurs qui se concentrent sur le déploiement de l’IA sur des appareils edge, la gestion de la logique NMS ajoute une complexité inutile au pipeline de déploiement.
Les modèles classiques comme YOLOX et YOLOv9 nécessitent une suppression non maximale (NMS) pour filtrer les boîtes englobantes en double. Cette étape est intrinsèquement séquentielle et crée souvent un goulot d’étranglement sur les CPU, ce qui souligne la nécessité des architectures natives de bout en bout des modèles Ultralytics les plus récents.
Comparaison des performances#
La comparaison des métriques de calcul brutes de ces architectures montre clairement que YOLOv9 offre une base plus moderne, tandis que YOLOX reste une option légère pour les configurations existantes. Tu trouveras ci-dessous une analyse détaillée de leurs modèles standard.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
YOLOv9 offre une meilleure précision pour un nombre de paramètres comparable, mais les développeurs qui recherchent l’équilibre ultime entre vitesse, précision et facilité d’utilisation devraient envisager les dernières avancées d’Ultralytics.
L’avantage Ultralytics : découvre YOLO26#
L’évaluation de modèles historiques comme YOLOX et YOLOv9 apporte un éclairage précieux, mais l’état de l’art actuel est représenté par Ultralytics YOLO26. Sorti au début de 2026, YOLO26 repense en profondeur le pipeline de détection pour les environnements d’entreprise modernes.
Des innovations architecturales inégalées#
YOLO26 résout les goulots d’étranglement du post-traitement de ses prédécesseurs grâce à une conception optionnelle de bout en bout sans NMS (nms=False), qui simplifie le déploiement sur tous les types de matériel. En outre, en supprimant la perte focale de distribution (DFL) et en intégrant le nouvel optimiseur MuSGD, un hybride de la descente de gradient stochastique et de Muon, YOLO26 atteint une stabilité d’entraînement sans précédent.
Pour les développeurs qui déploient leurs modèles dans des environnements contraints comme le Raspberry Pi, YOLO26 offre une inférence CPU jusqu’à 43 % plus rapide. Il introduit également ProgLoss + STAL (perte progressive et assignation d’étiquettes tenant compte des petites cibles), qui améliore considérablement la reconnaissance des petits objets, essentielle pour l’imagerie aérienne et l’analyse des images de drones.
Un écosystème de développement simplifié#
Contrairement aux dépôts de recherche autonomes, l’écosystème Ultralytics offre une expérience développeur incomparable. Grâce à l’API Python d’Ultralytics, les ingénieurs peuvent réduire considérablement le code passe-partout. En outre, les besoins en mémoire sont optimisés : tu peux donc entraîner des modèles robustes en utilisant moins de mémoire vidéo GPU que les architectures reposant massivement sur l’attention.
from ultralytics import YOLO
# Charger le modèle YOLO26 small, hautement optimisé et sans NMS
model = YOLO("yolo26s.pt")
# Entraîner le modèle sur un jeu de données personnalisé avec une empreinte mémoire minimale
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporter facilement vers des formats de déploiement optimisés
model.export(format="engine", quantize=16) # Exporte vers TensorRTAu-delà de la détection, YOLO26 prend en charge de nombreuses tâches dans un seul et même framework. Que tu aies besoin de boîtes englobantes orientées (OBB) précises pour l’imagerie satellitaire ou de masques de pixels détaillés pour des applications d’imagerie médicale, le workflow reste identique. Pour les équipes qui utilisent des workflows de la génération précédente, Ultralytics YOLO11 est également disponible et entièrement pris en charge.
Cas d’utilisation idéaux et stratégies de déploiement#
Le choix de l’architecture dépend entièrement de ton environnement de déploiement cible et des exigences de ton projet.
Informatique edge et robotique#
Sur les appareils à faible consommation, les modèles qui nécessitent un post-traitement lourd peuvent gravement nuire aux performances. YOLOX-Nano est extrêmement petit, mais sa précision est souvent insuffisante pour les tâches critiques pour la sécurité. YOLO26 est ici le choix incontournable : sa tête sans DFL et son inférence optionnelle sans NMS lui permettent de fonctionner sans problème sur des threads CPU bruts, ce qui en fait une solution idéale pour la robotique autonome ou la gestion intelligente du stationnement.
Évaluation comparative universitaire#
Si le seul objectif est d’analyser le flux des gradients et d’étudier les goulots d’étranglement des réseaux profonds, YOLOv9 reste un excellent sujet d’étude. Son framework PGI offre des perspectives fascinantes sur la conservation des caractéristiques à travers les couches des réseaux neuronaux profonds, ce qui en fait un outil précieux pour les chercheurs universitaires qui étudient la théorie des convolutions.
Analyse vidéo en entreprise#
Pour les tâches de traitement vidéo à grande échelle, comme les systèmes d’alarme de sécurité ou la surveillance du trafic, la vitesse et la polyvalence des capacités d’export sont essentielles. Les outils d’export natifs du framework Ultralytics permettent aux équipes de compiler YOLO26 directement vers TensorRT ou OpenVINO en une seule commande, ce qui réduit considérablement le délai de mise sur le marché.
En tirant parti des fonctionnalités complètes de l’écosystème Ultralytics, les équipes d’apprentissage automatique peuvent éviter les complexités des bases de code de recherche brutes et se concentrer directement sur la création d’applications d’IA évolutives et concrètes.