YOLO Vision 2026 :

YOLOX vs YOLOv5#

Sélectionner le bon modèle de détection d'objets est une décision critique qui dicte le succès de tout projet de vision par ordinateur. Ce guide fournit une comparaison technique complète entre deux modèles cruciaux du paysage de l'IA : YOLOX de Megvii et Ultralytics YOLOv5. En analysant leurs architectures, leurs métriques de performance et leurs écosystèmes d'entraînement, nous visons à aider les développeurs et les chercheurs à faire un choix éclairé pour leurs environnements de déploiement spécifiques.

Introduction aux modèles#

Les deux modèles ont émergé pendant une période d'avancée rapide dans la détection d'objets en temps réel, mais ils ont adopté des philosophies architecturales différentes pour atteindre leurs performances.

YOLOX : Une approche sans ancres#

Publié par les chercheurs Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun chez Megvii le 18 juillet 2021, YOLOX a introduit un changement significatif en s'éloignant des boîtes d'ancrage traditionnelles. Documenté dans leur rapport technique Arxiv, YOLOX intègre une conception sans ancrage avec une tête découplée et la stratégie d'attribution d'étiquettes SimOTA. Cette conception visait à combler le fossé entre la recherche académique et l'application industrielle, offrant de solides performances sur des ensembles de données standard.

En savoir plus sur YOLOX

YOLOv5 : La norme pour l'IA de vision en production#

Créé par Glenn Jocher et publié par Ultralytics le 26 juin 2020, YOLOv5 est rapidement devenu la norme industrielle pour la vision par ordinateur déployée. Construit nativement sur le framework PyTorch, il a démocratisé l'IA de pointe en offrant une facilité d'utilisation inégalée, un entraînement exceptionnellement rapide et un dépôt hautement poli. L'architecture de YOLOv5 s'est concentrée sur un équilibre parfait entre vitesse, précision et facilité de déploiement, en faisant le favori pour tout, des appareils périphériques aux déploiements cloud massifs.

En savoir plus sur YOLOv5

Différences architecturales#

Comprendre les différences mécaniques fondamentales entre ces réseaux permet de clarifier pourquoi leurs performances diffèrent selon les tâches.

Sans ancres vs Avec ancres#

Le contraste le plus marquant est le mécanisme sans ancres de YOLOX. Les modèles traditionnels comme YOLOv5 s'appuient sur des boîtes d'ancrage prédéfinies pour prédire les boîtes englobantes, ce qui nécessite une analyse de clustering sur le jeu de données d'entraînement pour déterminer les tailles d'ancrage optimales. YOLOX élimine cela, en prédisant les coordonnées de la boîte englobante directement à chaque emplacement spatial. Bien que l'approche sans ancres réduise le nombre de paramètres de conception et le réglage heuristique, l'approche raffinée basée sur les ancres de YOLOv5, aidée par sa fonctionnalité auto-anchor, assure une convergence d'entraînement incroyablement stable et prévisible dès le départ.

Tête découplée vs Tête couplée#

YOLOX utilise une tête découplée, ce qui signifie que les tâches de classification et de régression sont séparées en branches distinctes au sein du réseau de neurones. Les auteurs ont soutenu que cela résout les conflits entre l'apprentissage des caractéristiques spatiales et sémantiques. À l'inverse, YOLOv5 utilisait une tête couplée hautement optimisée (dans ses premières versions) qui maximisait l'efficacité computationnelle et réduisait la latence d'inférence, ce qui est crucial pour le calcul en périphérie en temps réel.

Évolution architecturale

Alors que YOLOX a défendu la tête découplée en 2021, Ultralytics a plus tard adopté et perfectionné les architectures découplées dans des modèles ultérieurs comme YOLOv8 et le modèle de pointe YOLO26, combinant le meilleur des deux mondes.

Stratégie d'assignation d'étiquettes#

YOLOX utilise SimOTA pour l'assignation d'étiquettes, qui formule le jumelage des objets de vérité terrain avec les prédictions comme un problème de Transport Optimal. Cette assignation dynamique améliore la gestion des scènes encombrées. YOLOv5 utilise une assignation robuste basée sur des règles de forme, garantissant que des échantillons positifs de haute qualité sont systématiquement injectés dans la fonction de perte, ce qui contribue à sa stabilité d'entraînement légendaire.

Performances et benchmarks#

Le compromis entre vitesse et précision est le test ultime pour ces architectures. Le tableau ci-dessous illustre les performances de diverses tailles de modèles sur des benchmarks standards.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Bien que YOLOX atteigne des scores mAP compétitifs, surtout dans ses variantes plus grandes, YOLOv5 conserve un avantage remarquable en vitesse d'inférence TensorRT sur toute la ligne. Le modèle YOLOv5s, par exemple, offre des ratios vitesse-précision exceptionnels, le rendant hautement souhaitable pour les applications en temps réel où chaque milliseconde compte.

L'avantage Ultralytics : Entraînement et Utilisabilité#

Lors de la transition de la recherche à la production, l'écosystème entourant un modèle est souvent aussi important que le modèle lui-même. Ici, les avantages de l'écosystème Ultralytics deviennent flagrants.

Expérience utilisateur simplifiée#

YOLOv5 est universellement salué pour son expérience développeur "de zéro à héros". L'API Python d'Ultralytics et la CLI te permettent de charger, d'entraîner et de déployer des modèles avec de simples lignes de code. En revanche, exécuter YOLOX depuis le dépôt GitHub de Megvii nécessite une configuration plus manuelle des variables d'environnement, des configurations de chemins Python complexes et une courbe d'apprentissage plus raide typique des bases de code de recherche académique.

Efficacité de l'entraînement et exigences en mémoire#

Les modèles Ultralytics sont méticuleusement conçus pour minimiser l'utilisation de la mémoire pendant l'entraînement. YOLOv5 nécessite nettement moins de mémoire CUDA par rapport aux modèles de transformateurs lourdement paramétrisés comme RT-DETR ou aux modèles de recherche non optimisés. Cela permet aux développeurs d'entraîner des tailles de batch plus grandes sur du matériel grand public, accélérant ainsi le cycle de développement itératif.

Polyvalence des tâches#

Alors que YOLOX est strictement un framework de détection d'objets, l'écosystème Ultralytics a fait évoluer YOLOv5 pour prendre en charge plusieurs tâches de vision. Dès la sortie de la boîte, tu peux effectuer de la classification d'images, de la segmentation d'instances et de la détection d'objets en utilisant exactement la même syntaxe d'API.

Innovation continue

Si tu as besoin de tâches encore plus avancées comme l'estimation de pose ou la détection de boîtes englobantes orientées (OBB), nous te recommandons vivement de passer à la toute dernière architecture Ultralytics YOLO26, qui prend en charge toutes ces fonctionnalités nativement avec une précision de pointe.

Comparaison de code#

La différence d'utilisabilité est mieux démontrée par le code.

Entraînement avec YOLOv5 :

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

Entraînement avec YOLOX : (Nécessite le clonage manuel du dépôt, l'installation via setup.py et des arguments CLI complexes)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

L'approche Ultralytics supprime les frictions, te permettant de te concentrer sur ton jeu de données et ta logique applicative plutôt que de déboguer des fichiers de configuration. De plus, le suivi de tes expériences est fluide grâce aux intégrations natives pour Weights & Biases et Comet ML.

Cas d'utilisation idéaux et applications réelles#

Le choix entre ces modèles dépend de l'environnement opérationnel de ton projet.

Où YOLOX excelle#

YOLOX reste un candidat solide dans les cadres académiques où les chercheurs étudient explicitement les paradigmes sans ancres ou les stratégies d'assignation d'étiquettes. Il est également utile dans les scénarios où la détection de scènes encombrées est la métrique principale absolue et où les vitesses de déploiement en périphérie sont secondaires.

Là où YOLOv5 excelle#

YOLOv5 est le champion incontesté du déploiement pratique.

  • Fabrication à grande vitesse : Pour la détection de défauts sur les lignes d'assemblage, la latence d'inférence minimale de YOLOv5 sur les GPU edge garantit que les produits sont inspectés sans ralentir le tapis.
  • Drones et imagerie aérienne : Son empreinte mémoire efficace lui permet de s'exécuter sur des ordinateurs compagnons légers à bord des drones pour des tâches telles que la surveillance agricole et le suivi de la faune.
  • Commerce de détail intelligent : Du paiement automatisé à la gestion des stocks, YOLOv5 s'exporte facilement vers TensorRT et ONNX pour un déploiement massif sur des milliers de caméras de magasin.

Regarder vers l'avenir : l'avantage de YOLO26#

Bien que YOLOv5 soit un modèle légendaire, le domaine de l'IA progresse rapidement. Si tu commences un nouveau projet aujourd'hui, nous te conseillons vivement de regarder la dernière génération de modèles Ultralytics.

Sorti en 2026, Ultralytics YOLO26 représente un bond en avant massif. Il intègre une conception de bout en bout sans NMS, supprimant complètement le besoin de post-traitement par suppression non maximale, ce qui simplifie radicalement la logique de déploiement. En éliminant la perte focale de distribution (DFL) et en utilisant l'optimiseur de pointe MuSGD Optimizer, YOLO26 atteint jusqu'à 43 % d'inférence CPU plus rapide que les générations précédentes tout en maintenant une plus grande précision, en particulier sur les petits objets grâce aux nouvelles fonctions de perte ProgLoss + STAL.

Que tu choisisses la fiabilité éprouvée au combat de YOLOv5 ou les performances de pointe de YOLO26, la plateforme Ultralytics te garantit d'avoir les meilleurs outils disponibles pour mener tes solutions de vision par ordinateur de la conception à la production en toute transparence. Assure-toi d'explorer la documentation Ultralytics complète pour libérer tout le potentiel de ton pipeline d'IA.

Commentaires