YOLOX vs YOLOv5#
Choisir le bon modèle de détection d’objets est une décision cruciale qui détermine la réussite de tout projet de vision par ordinateur. Ce guide propose une comparaison technique approfondie de deux modèles majeurs du paysage de l’IA : YOLOX de Megvii et Ultralytics YOLOv5. En analysant leurs architectures, leurs indicateurs de performance et leurs écosystèmes d’entraînement, nous voulons aider les développeurs et les chercheurs à faire un choix éclairé en fonction de leurs environnements de déploiement.
Présentation des modèles#
Les deux modèles ont vu le jour à une période de progrès rapides dans la détection d’objets en temps réel, mais ils ont adopté des philosophies architecturales différentes pour atteindre leurs performances.
YOLOX : une approche sans ancres#
Publié par les chercheurs Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun de Megvii le 18 juillet 2021, YOLOX a marqué un tournant important en abandonnant les boîtes d’ancrage traditionnelles. Présenté dans leur rapport technique Arxiv, YOLOX associait une conception sans ancres à une tête découplée et à la stratégie d’affectation des étiquettes SimOTA. Cette conception visait à rapprocher la recherche universitaire des applications industrielles, en offrant de solides performances sur les jeux de données de référence.
YOLOv5 : la référence en IA visuelle pour la production#
Créé par Glenn Jocher et publié par Ultralytics le 26 juin 2020, YOLOv5 est rapidement devenu la référence du secteur pour le déploiement de la vision par ordinateur. Fondé nativement sur le framework PyTorch, il a démocratisé l’IA de pointe grâce à une facilité d’utilisation inégalée, à un entraînement exceptionnellement rapide et à un dépôt très abouti. L’architecture de YOLOv5 privilégiait un équilibre parfait entre vitesse, précision et facilité de déploiement, ce qui en a fait un choix de prédilection pour tous les usages, des appareils en périphérie aux déploiements cloud à grande échelle.
Différences architecturales#
Comprendre les principales différences mécaniques entre ces réseaux permet de clarifier leurs performances variables selon les tâches.
Sans ancres ou avec ancres#
La différence la plus marquante réside dans le mécanisme sans ancres de YOLOX. Les modèles traditionnels comme YOLOv5 s’appuient sur des boîtes d’ancrage prédéfinies pour prédire les boîtes englobantes, ce qui nécessite une analyse par regroupement du jeu de données d’entraînement afin de déterminer les tailles d’ancrage optimales. YOLOX élimine cette étape et prédit directement les coordonnées des boîtes englobantes à chaque position spatiale. Si l’approche sans ancres réduit le nombre de paramètres de conception et les réglages heuristiques, l’approche avec ancres perfectionnée de YOLOv5, renforcée par sa fonctionnalité d’ancres automatiques, garantit une convergence de l’entraînement extrêmement stable et prévisible dès le départ.
Tête découplée ou tête couplée#
YOLOX utilise une tête découplée : les tâches de classification et de régression sont séparées en branches distinctes du réseau neuronal. Selon les auteurs, cela permet de résoudre les conflits entre l’apprentissage des caractéristiques spatiales et sémantiques. À l’inverse, YOLOv5 utilisait une tête couplée hautement optimisée (dans ses premières versions), qui maximisait l’efficacité des calculs et réduisait la latence d’inférence, un aspect crucial pour l’informatique en périphérie en temps réel.
Stratégie d’affectation des étiquettes#
YOLOX utilise SimOTA pour l’affectation des étiquettes, en formulant l’association des objets de vérité terrain aux prédictions comme un problème de transport optimal. Cette affectation dynamique améliore le traitement des scènes encombrées. YOLOv5 utilise une affectation robuste fondée sur des règles de forme, garantissant que des échantillons positifs de haute qualité alimentent régulièrement la fonction de perte, ce qui contribue à la stabilité légendaire de son entraînement.
Performances et benchmarks#
Le compromis entre vitesse et précision est le véritable test de ces architectures. Le tableau ci-dessous présente les performances de différentes tailles de modèles sur des benchmarks standards.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
YOLOX obtient des scores mAP compétitifs, surtout dans ses variantes les plus grandes, mais YOLOv5 conserve un avantage remarquable en vitesse d’inférence TensorRT, toutes tailles confondues. Le modèle YOLOv5s, par exemple, offre un rapport vitesse-précision exceptionnel, ce qui le rend très intéressant pour les applications en temps réel où chaque milliseconde compte.
Les atouts d’Ultralytics : entraînement et facilité d’utilisation#
Lorsqu’on passe de la recherche à la production, l’écosystème qui entoure un modèle compte souvent autant que le modèle lui-même. Les avantages de l’écosystème Ultralytics deviennent alors évidents.
Une expérience utilisateur simplifiée#
YOLOv5 est unanimement salué pour son expérience de développement qui fait passer de zéro à expert. L’API Python Ultralytics et la CLI te permettent de charger, d’entraîner et de déployer des modèles en une seule ligne de code. À l’inverse, exécuter YOLOX depuis le dépôt GitHub de Megvii nécessite davantage de configuration manuelle des variables d’environnement, des réglages complexes des chemins Python et une courbe d’apprentissage plus raide, typique des bases de code issues de la recherche universitaire.
Efficacité de l'entraînement et besoins en mémoire#
Les modèles Ultralytics sont conçus avec soin pour minimiser l’utilisation de mémoire pendant l’entraînement. YOLOv5 nécessite beaucoup moins de mémoire CUDA que les modèles Transformer fortement paramétrés comme RT-DETR ou que les modèles de recherche non optimisés. Les développeurs peuvent ainsi entraîner de plus grands lots sur du matériel grand public, ce qui accélère le cycle de développement itératif.
Polyvalence entre les tâches#
YOLOX est exclusivement un framework de détection d’objets, tandis que l’écosystème Ultralytics a fait évoluer YOLOv5 pour prendre en charge plusieurs tâches de vision. Dès l’installation, tu peux effectuer de la classification d’images, de la segmentation d’instances et de la détection d’objets avec exactement la même syntaxe d’API.
Si tu as besoin de tâches encore plus avancées, comme l’estimation de pose ou la détection de boîtes englobantes orientées (OBB), nous te recommandons vivement de passer à la dernière architecture Ultralytics YOLO26, qui prend nativement en charge toutes ces tâches avec une précision de pointe.
Comparaison du code#
Le code illustre le mieux les différences de facilité d’utilisation.
Entraînement avec YOLOv5 :
from ultralytics import YOLO
# Charger un modèle YOLOv5s préentraîné
model = YOLO("yolov5su.pt") # YOLOv5u : poids YOLOv5 sans ancres pour le package ultralytics
# Entraîner le modèle sur le jeu de données d’exemple COCO8
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Effectuer une inférence sur une image
results = model("https://ultralytics.com/images/zidane.jpg")
# Afficher les résultats
results[0].show()Entraînement avec YOLOX : (Nécessite de cloner manuellement le dépôt, d’installer setup.py et d’utiliser des arguments CLI complexes)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oL’approche Ultralytics élimine les obstacles et te permet de te concentrer sur ton jeu de données et la logique de ton application plutôt que de déboguer des fichiers de configuration. En outre, le suivi de tes expériences se fait facilement grâce aux intégrations intégrées pour Weights & Biases et Comet ML.
Cas d’utilisation idéaux et applications concrètes#
Le choix entre ces modèles dépend de l’environnement opérationnel de ton projet.
Les points forts de YOLOX#
YOLOX reste un candidat de choix dans les milieux universitaires où les chercheurs étudient explicitement les approches sans ancres ou les stratégies d’affectation des étiquettes. Il convient aussi aux scénarios où la détection des scènes encombrées est le critère prioritaire absolu et où la vitesse de déploiement en périphérie est secondaire.
Les points forts de YOLOv5#
YOLOv5 est incontestablement le champion du déploiement pratique.
- Fabrication à haute cadence : pour la détection de défauts sur une chaîne de montage, la latence d’inférence minimale de YOLOv5 sur les GPU en périphérie permet d’inspecter les produits sans ralentir le tapis roulant.
- Drones et images aériennes : son empreinte mémoire réduite lui permet de fonctionner sur des ordinateurs compagnons légers embarqués sur des drones, pour des tâches comme le suivi agricole et le suivi de la faune.
- Commerce de détail intelligent : de l’encaissement automatisé à la gestion des stocks, YOLOv5 s’exporte facilement vers TensorRT et ONNX pour un déploiement à grande échelle sur des milliers de caméras en magasin.
Perspectives : l’avantage de YOLO26#
YOLOv5 est un modèle légendaire, mais le domaine de l’IA évolue rapidement. Si tu démarres un nouveau projet aujourd’hui, nous te conseillons vivement d’examiner la dernière génération de modèles Ultralytics.
Sorti en 2026, Ultralytics YOLO26 représente une avancée majeure. Il propose une architecture de bout en bout sans NMS facultative (nms=False), qui élimine le besoin de post-traitement par suppression non maximale et simplifie considérablement la logique de déploiement. En supprimant la perte focale de distribution (DFL) et en utilisant l’optimiseur MuSGD de pointe, YOLO26 offre une inférence CPU jusqu’à 43 % plus rapide que les générations précédentes, tout en maintenant une meilleure précision, en particulier sur les petits objets, grâce à ProgLoss + STAL (perte progressive et affectation des étiquettes tenant compte des petites cibles).
Que tu choisisses la fiabilité éprouvée de YOLOv5 ou les performances de pointe de YOLO26, la plateforme Ultralytics te donne accès aux meilleurs outils pour faire passer sans difficulté tes solutions de vision par ordinateur du concept à la production. Consulte la documentation Ultralytics complète pour exploiter tout le potentiel de ton pipeline d’IA.