YOLOX contre YOLOv5#
Sélectionner le bon modèle de détection d’objets est une décision cruciale qui détermine la réussite de tout projet de vision par ordinateur. Ce guide propose une comparaison technique complète entre deux modèles majeurs du paysage de l’IA : YOLOX de Megvii et Ultralytics YOLOv5. En analysant leurs architectures, leurs métriques de performance et leurs écosystèmes d’entraînement, nous souhaitons aider les développeurs et les chercheurs à faire un choix éclairé pour leurs environnements de déploiement spécifiques.
Introduction aux modèles#
Les deux modèles ont émergé pendant une période de progrès rapides dans la détection d’objets en temps réel, mais ils ont adopté des philosophies architecturales différentes pour atteindre leurs performances.
YOLOX : une approche sans ancres#
Publié par les chercheurs Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun de Megvii le 18 juillet 2021, YOLOX a introduit un changement majeur en abandonnant les boîtes d’ancrage traditionnelles. Présenté dans leur rapport technique Arxiv, YOLOX a intégré une conception sans ancres avec une tête découplée et la stratégie d’affectation des étiquettes SimOTA. Cette conception visait à combler l’écart entre la recherche universitaire et les applications industrielles, en offrant de solides performances sur des jeux de données standard.
YOLOv5 : la référence de l’IA de vision en production#
Créé par Glenn Jocher et publié par Ultralytics le 26 juin 2020, YOLOv5 est rapidement devenu la référence du secteur pour la vision par ordinateur déployée. Conçu nativement sur le framework PyTorch, il a démocratisé l’IA de pointe en offrant une facilité d’utilisation inégalée, un entraînement exceptionnellement rapide et un dépôt très soigné. L’architecture de YOLOv5 privilégiait un équilibre optimal entre vitesse, précision et facilité de déploiement, ce qui en a fait un modèle très apprécié, des appareils edge aux déploiements cloud de grande ampleur.
Différences architecturales#
Comprendre les différences mécaniques fondamentales entre ces réseaux permet de mieux comprendre pourquoi ils obtiennent des performances différentes selon les tâches.
Sans ancres contre avec ancres#
Le contraste le plus caractéristique réside dans le mécanisme sans ancres de YOLOX. Les modèles traditionnels comme YOLOv5 s’appuient sur des boîtes d’ancrage prédéfinies pour prédire les boîtes englobantes, ce qui nécessite une analyse par regroupement sur le jeu de données d’entraînement afin de déterminer les tailles d’ancres optimales. YOLOX élimine cette étape et prédit directement les coordonnées de la boîte englobante à chaque emplacement spatial. Si l’approche sans ancres réduit le nombre de paramètres de conception et le réglage heuristique, l’approche avec ancres affinée de YOLOv5, aidée par sa fonctionnalité auto-anchor, assure une convergence de l’entraînement extrêmement stable et prévisible dès la première utilisation.
Tête découplée contre tête couplée#
YOLOX utilise une tête découplée, ce qui signifie que les tâches de classification et de régression sont séparées en branches distinctes du réseau neuronal. Les auteurs ont affirmé que cela résolvait les conflits entre l’apprentissage des caractéristiques spatiales et sémantiques. À l’inverse, YOLOv5 utilisait une tête couplée hautement optimisée (dans ses premières versions), qui maximisait l’efficacité des calculs et réduisait la latence d’inférence, un point crucial pour l’informatique edge en temps réel.
Stratégie d’affectation des étiquettes#
YOLOX utilise SimOTA pour l’affectation des étiquettes, en formulant l’appariement des objets de vérité terrain aux prédictions comme un problème de transport optimal. Cette affectation dynamique améliore la gestion des scènes encombrées. YOLOv5 utilise une affectation robuste fondée sur des règles de forme, garantissant que des échantillons positifs de haute qualité alimentent systématiquement la fonction de perte, ce qui contribue à sa stabilité d’entraînement légendaire.
Performances et benchmarks#
Le compromis entre vitesse et précision constitue le test ultime pour ces architectures. Le tableau ci-dessous illustre les performances de différentes tailles de modèles sur des benchmarks standard.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Bien que YOLOX obtienne des scores mAP compétitifs, en particulier dans ses variantes les plus grandes, YOLOv5 conserve un avantage remarquable en vitesse d’inférence TensorRT sur l’ensemble des modèles. Le modèle YOLOv5s, par exemple, offre un rapport vitesse-précision exceptionnel, ce qui le rend particulièrement intéressant pour les applications en temps réel où chaque milliseconde compte.
L’avantage Ultralytics : entraînement et facilité d’utilisation#
Lors du passage de la recherche à la production, l’écosystème qui entoure un modèle est souvent aussi important que le modèle lui-même. Ici, les avantages de l’écosystème Ultralytics deviennent particulièrement évidents.
Expérience utilisateur simplifiée#
YOLOv5 est unanimement reconnu pour son expérience développeur qui permet de passer « de zéro à héros ». L’API Python Ultralytics et la CLI te permettent de charger, d’entraîner et de déployer des modèles en une seule ligne de code. En revanche, exécuter YOLOX depuis le dépôt GitHub de Megvii nécessite une configuration plus manuelle des variables d’environnement, des configurations complexes des chemins Python et une courbe d’apprentissage plus raide, typique des bases de code de recherche universitaire.
Efficacité de l'entraînement et besoins en mémoire#
Les modèles Ultralytics sont conçus avec soin pour réduire au minimum l’utilisation de la mémoire pendant l’entraînement. YOLOv5 nécessite beaucoup moins de mémoire CUDA que les modèles Transformer fortement paramétrés comme RT-DETR ou que les modèles de recherche non optimisés. Cela permet aux développeurs d’entraîner des lots plus volumineux sur du matériel grand public, accélérant ainsi le cycle de développement itératif.
Polyvalence entre les tâches#
Alors que YOLOX est strictement un framework de détection d’objets, l’écosystème Ultralytics a fait évoluer YOLOv5 pour prendre en charge plusieurs tâches de vision. Dès la sortie de boîte, tu peux effectuer de la classification d’images, de la segmentation d’instances et de la détection d’objets en utilisant exactement la même syntaxe d’API.
Si tu as besoin de tâches encore plus avancées, comme l’estimation de pose ou la détection de boîtes englobantes orientées (OBB), nous te recommandons vivement de passer à la dernière architecture Ultralytics YOLO26, qui prend en charge toutes ces tâches nativement avec une précision de pointe.
Comparaison du code#
La différence de facilité d’utilisation se démontre le mieux avec du code.
Entraînement avec YOLOv5 :
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")
# Display results
results[0].show()Entraînement avec YOLOX : (Nécessite le clonage manuel du dépôt, l’installation avec setup.py et des arguments CLI complexes)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oL’approche Ultralytics supprime les obstacles, ce qui te permet de te concentrer sur ton jeu de données et la logique de ton application plutôt que de déboguer des fichiers de configuration. De plus, le suivi de tes expériences est fluide grâce aux intégrations intégrées de Weights & Biases et de Comet ML.
Cas d’utilisation idéaux et applications concrètes#
Le choix entre ces modèles dépend de l’environnement opérationnel de ton projet.
Là où YOLOX excelle#
YOLOX reste un candidat solide dans les contextes universitaires où les chercheurs étudient explicitement les paradigmes sans ancres ou les stratégies d’affectation des étiquettes. Il est également utile dans les scénarios où la détection dans les scènes encombrées constitue la métrique absolument prioritaire et où la vitesse de déploiement edge est secondaire.
Les points forts de YOLOv5#
YOLOv5 est le champion incontesté du déploiement pratique.
- Fabrication à grande vitesse : pour la détection des défauts sur une chaîne d’assemblage, la latence d’inférence minimale de YOLOv5 sur les GPU edge garantit l’inspection des produits sans ralentir le tapis.
- Drones et imagerie aérienne : son empreinte mémoire réduite lui permet de fonctionner sur des ordinateurs compagnons légers embarqués sur des drones pour des tâches comme le suivi agricole et le suivi de la faune.
- Commerce intelligent : du paiement automatisé à la gestion des stocks, YOLOv5 s’exporte facilement vers TensorRT et ONNX pour un déploiement à grande échelle sur des milliers de caméras de magasins.
Perspectives : l'avantage de YOLO26#
Bien que YOLOv5 soit un modèle légendaire, le domaine de l’IA évolue rapidement. Si tu démarres un nouveau projet aujourd’hui, nous te conseillons vivement d’examiner la dernière génération de modèles Ultralytics.
Publié en 2026, Ultralytics YOLO26 représente un bond en avant majeur. Il intègre une conception de bout en bout sans NMS, supprimant complètement le besoin de post-traitement par suppression des non-maxima, ce qui simplifie considérablement la logique de déploiement. En supprimant Distribution Focal Loss (DFL) et en utilisant l’optimiseur MuSGD de pointe, YOLO26 atteint une inférence CPU jusqu’à 43 % plus rapide que les générations précédentes tout en conservant une précision supérieure, notamment sur les petits objets grâce aux nouvelles fonctions de perte ProgLoss + STAL.
Que tu choisisses la fiabilité éprouvée de YOLOv5 ou les performances de pointe de YOLO26, la plateforme Ultralytics garantit que tu disposes des meilleurs outils pour faire passer tes solutions de vision par ordinateur du concept à la production en toute fluidité. Pense à consulter la documentation Ultralytics complète pour exploiter tout le potentiel de ton pipeline d’IA.