Ultralytics YOLO27 :
Get Started

YOLOv5 et RTDETRv2#

Le domaine de la vision par ordinateur s’est considérablement développé ces dernières années, offrant aux développeurs un vaste choix d’architectures pour accomplir des tâches visuelles complexes. Parmi les paradigmes les plus populaires figurent les réseaux neuronaux convolutionnels (CNN) et les Transformers de détection (DETR).

Ce guide propose une comparaison technique approfondie entre deux modèles clés de ces catégories : Ultralytics YOLOv5, un modèle basé sur les CNN très efficace et largement adopté, et RTDETRv2, un détecteur d’objets en temps réel basé sur les Transformers et à la pointe de la technologie.

Ultralytics YOLOv5 : la référence du secteur en matière d’efficacité#

Depuis son lancement, Ultralytics YOLOv5 est devenu un pilier de la communauté de l’IA et est utilisé dans des milliers d’applications commerciales et de projets de recherche partout dans le monde. Entièrement conçu avec le framework PyTorch, il privilégie une expérience développeur intuitive sans compromettre les performances en temps réel.

Caractéristiques principales :

Architecture et points forts#

YOLOv5 utilise une architecture CNN rationalisée, conçue pour optimiser l’efficacité de l’extraction de caractéristiques tout en conservant une empreinte mémoire extrêmement réduite. Il utilise un backbone CSPDarknet et un neck PANet, formant ainsi une puissante combinaison pour la fusion de caractéristiques à plusieurs échelles.

L’un des principaux avantages de YOLOv5 est son équilibre des performances. Il offre un compromis exceptionnel entre vitesse et précision, ce qui en fait un choix idéal pour le déploiement de modèles sur du matériel aux ressources limitées, comme les appareils NVIDIA Jetson et les smartphones.

De plus, YOLOv5 offre une polyvalence inégalée. Contrairement aux modèles limités strictement aux prédictions de boîtes englobantes, YOLOv5 prend nativement en charge la classification d’images et la segmentation d’instances, fournissant un framework unifié pour diverses tâches visuelles. Son efficacité d’entraînement est également remarquable : il nécessite beaucoup moins de mémoire CUDA pendant l’entraînement que les architectures basées sur les Transformers.

Points faibles#

Comme il repose sur un framework CNN plus ancien, YOLOv5 dépend intrinsèquement de la suppression non maximale (NMS) pendant le post-traitement afin d’éliminer les boîtes englobantes en double. Bien qu’optimisée au sein du framework Ultralytics, la NMS peut parfois créer des goulets d’étranglement de latence sur des NPU spécialisés pour l’informatique en périphérie.

RTDETRv2 : les Transformers en temps réel de Baidu#

RTDETRv2 (Transformer de détection en temps réel v2) représente un progrès important dans l’application des architectures Transformer à la détection d’objets en temps réel et remédie aux inefficacités de calcul qui ont longtemps affecté les DETR classiques.

Caractéristiques principales :

Architecture et points forts#

RTDETRv2 s’appuie sur son prédécesseur en utilisant un encodeur hybride et un décodeur flexible pour traiter les images. Le mécanisme d’attention personnelle du Transformer donne au modèle une compréhension globale du contexte de l’image, ce qui lui permet d’obtenir d’excellents résultats dans les scènes complexes où les objets sont fortement occultés.

Une caractéristique déterminante de RTDETRv2 est sa conception de bout en bout, sans NMS. En prédisant directement les requêtes d’objets sans nécessiter de boîtes d’ancrage ni de post-traitement NMS, le modèle simplifie le pipeline d’inférence. Cette architecture obtient un mAP (précision moyenne) impressionnant sur des jeux de données de référence comme COCO.

Points faibles#

Malgré ses capacités en temps réel, RTDETRv2 présente des besoins en mémoire nettement supérieurs à ceux des modèles YOLO. La complexité des mécanismes d’attention des Transformers augmente de façon quadratique avec la longueur de la séquence, ce qui peut entraîner des erreurs de mémoire insuffisante pendant l’entraînement à haute résolution, à moins d’utiliser d’immenses grappes de GPU. De plus, le modèle n’offre pas la polyvalence native de l’écosystème Ultralytics et se concentre principalement sur la détection d’objets en 2D, sans prise en charge native de la segmentation ni de l’estimation de pose.

En savoir plus sur RTDETRv2

Tableau comparatif des performances#

Pour évaluer objectivement ces architectures, nous avons compilé leurs métriques de performance. Les valeurs en gras correspondent aux métriques les plus efficaces ou les plus performantes parmi les différentes échelles testées.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Contexte des performances

RTDETRv2-x obtient le mAP absolu le plus élevé, mais nécessite environ 40 fois plus de paramètres que YOLOv5n. Pour les applications à haute vitesse exécutées sur du matériel limité, les modèles Ultralytics offrent systématiquement la meilleure efficacité de calcul.

Les avantages de l’écosystème Ultralytics#

Lorsqu'on fait passer un modèle d'un notebook de recherche à un environnement de production, les logiciels qui l'entourent sont aussi importants que l'architecture du réseau neuronal. L'écosystème bien maintenu proposé par Ultralytics accélère considérablement le cycle de développement.

Une simplicité d'utilisation inégalée#

Les modèles Ultralytics privilégient une expérience utilisateur incroyablement fluide. Que tu souhaites entraîner un modèle personnalisé, effectuer une validation ou exporter vers des formats spécifiques au matériel comme TensorRT ou ONNX, l'API Python Ultralytics te permet d'y parvenir en quelques lignes de code.

Voici un exemple de code pratique qui montre à quel point il est simple d'entraîner un modèle Ultralytics et d'effectuer des inférences avec celui-ci :

from ultralytics import YOLO

# Initialiser le modèle (télécharge automatiquement les poids)
model = YOLO("yolov5su.pt")  # YOLOv5u : poids YOLOv5 sans ancres pour le package ultralytics

# Entraîner le modèle sur le jeu de données COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Effectuer une inférence sur une image en ligne
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Afficher l'image obtenue avec les boîtes englobantes
inference_results[0].show()

Cette API simple et unifiée prend en charge nativement les intégrations de suivi des expériences avec des outils comme Weights & Biases et Comet, permettant aux développeurs de consigner facilement les métriques sans écrire de code passe-partout complexe.

Cas d’utilisation et recommandations#

Le choix entre YOLOv5 et RT-DETR dépend de tes exigences de projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOv5#

YOLOv5 est un excellent choix pour :

  • Systèmes de production éprouvés : les déploiements existants où la longue expérience de stabilité de YOLOv5, sa documentation exhaustive et le soutien important de sa communauté sont appréciés.
  • Entraînement avec des ressources limitées : les environnements disposant de ressources GPU limitées, où le pipeline d’entraînement efficace de YOLOv5 et ses besoins en mémoire réduits sont avantageux.
  • Prise en charge étendue des formats d’exportation : les projets qui nécessitent un déploiement dans de nombreux formats, notamment ONNX, TensorRT, CoreML et LiteRT.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

Perspectives : YOLO11 et YOLO26#

Si tu démarres aujourd'hui un nouveau projet de vision, il est fortement recommandé d'explorer les dernières générations de modèles Ultralytics.

Bien que YOLOv5 reste extrêmement fiable, YOLO11 offre une meilleure précision et prend en charge davantage de tâches, notamment la détection de boîtes englobantes orientées (OBB).

Plus important encore, le YOLO26 de pointe réunit le meilleur des deux mondes. Il met en œuvre une conception de bout en bout sans NMS (une approche lancée pour la première fois avec YOLOv10), qui élimine le surcoût du post-traitement tout en préservant l'efficacité d'un CNN. YOLO26 introduit également l'optimiseur MuSGD, inspiré des innovations en matière d'entraînement des LLM, pour une convergence plus rapide. Grâce à la suppression de DFL (Distribution Focal Loss supprimée pour simplifier l'exportation et améliorer la compatibilité avec les appareils périphériques et à faible consommation), YOLO26 offre une inférence CPU jusqu'à 43 % plus rapide, ce qui en fait le meilleur choix pour l'IA en périphérie. De plus, ProgLoss + STAL fournit des fonctions de perte améliorées, qui optimisent notablement la reconnaissance des petits objets, essentielle pour l'IoT, la robotique et l'imagerie aérienne.

Conclusion#

Le choix entre YOLOv5 et RTDETRv2 dépend fortement de tes contraintes de déploiement. RTDETRv2 repousse les limites du mAP grâce à de puissants mécanismes d'attention de type Transformer, mais son coût en mémoire et en calcul est élevé.

À l'inverse, Ultralytics YOLOv5 est une solution éprouvée, hautement optimisée et polyvalente, qui fonctionne partout sans difficulté, des serveurs cloud aux microcontrôleurs. Pour les équipes qui recherchent la plus grande précision possible et des outils de déploiement fluides, passer à YOLO26 au sein de l'écosystème Ultralytics constitue la solution de pointe par excellence pour les applications modernes d'IA pour la vision.

Commentaires