Ultralytics YOLO27 :

YOLOv5 vs RTDETRv2#

Le domaine de la vision par ordinateur s’est considérablement développé au cours des dernières années, offrant aux développeurs un large éventail d’architectures pour traiter des tâches visuelles complexes. Parmi les paradigmes les plus populaires figurent les réseaux neuronaux convolutifs (CNNs) et les Transformers de détection (DETRs).

Ce guide propose une comparaison technique approfondie de deux modèles essentiels de ces catégories : Ultralytics YOLOv5, un modèle basé sur les CNNs très efficace et largement adopté, et RTDETRv2, un détecteur d’objets en temps réel basé sur un Transformer de pointe.

Ultralytics YOLOv5 : la référence du secteur en matière d’efficacité#

Depuis sa sortie, Ultralytics YOLOv5 est devenu un pilier de la communauté de l’IA, alimentant des milliers d’applications commerciales et de projets de recherche dans le monde entier. Entièrement conçu sur le framework PyTorch, il a donné la priorité à une expérience développeur intuitive sans compromettre les performances en temps réel.

Caractéristiques principales :

Architecture et atouts#

YOLOv5 utilise une architecture CNN rationalisée conçue pour maximiser l’efficacité de l’extraction de caractéristiques tout en conservant une empreinte mémoire extrêmement faible. Il emploie un backbone CSPDarknet et un neck PANet, formant une combinaison puissante pour la fusion de caractéristiques multi-échelles.

L’un des principaux avantages de YOLOv5 est son équilibre des performances. Il offre un compromis exceptionnel entre vitesse et précision, ce qui en fait un choix idéal pour le déploiement de modèles sur du matériel aux ressources limitées, comme les appareils NVIDIA Jetson et les smartphones.

De plus, YOLOv5 se distingue par sa polyvalence inégalée. Contrairement aux modèles strictement limités aux prédictions de boîtes englobantes, YOLOv5 prend nativement en charge la classification d’images et la segmentation d’instances, offrant un framework unifié pour diverses tâches visuelles. Son efficacité d’entraînement est également remarquable : il nécessite beaucoup moins de mémoire CUDA pendant l’entraînement que les architectures basées sur des Transformers.

Points faibles#

Comme il repose sur un framework CNN plus ancien, YOLOv5 dépend intrinsèquement de la suppression des non-maxima (NMS) lors du post-traitement afin d’éliminer les boîtes englobantes en double. Bien que hautement optimisée au sein du framework Ultralytics, la NMS peut parfois créer des goulots d’étranglement en matière de latence sur les NPU edge spécialisées.

RTDETRv2 : les Transformers en temps réel de Baidu#

RTDETRv2 (Transformer de détection en temps réel v2) représente une avancée majeure dans l’application des architectures Transformer à la détection d’objets en temps réel, en remédiant aux inefficacités de calcul qui ont historiquement affecté les DETRs standards.

Caractéristiques principales :

Architecture et atouts#

RTDETRv2 s’appuie sur son prédécesseur en utilisant un encodeur hybride et une conception flexible du décodeur pour traiter les images. Le mécanisme d’auto-attention du Transformer offre au modèle une compréhension globale du contexte de l’image, ce qui lui permet d’être particulièrement performant dans les scènes complexes présentant une forte occlusion des objets.

Une caractéristique déterminante de RTDETRv2 est sa conception de bout en bout, sans NMS. En prédisant directement les requêtes d’objets, sans nécessiter de boîtes d’ancrage ni de post-traitement NMS, il simplifie le pipeline d’inférence. Cette architecture atteint un niveau impressionnant de mAP (précision moyenne) sur des jeux de données de référence comme COCO.

Points faibles#

Malgré ses capacités en temps réel, RTDETRv2 présente des besoins en mémoire nettement supérieurs à ceux des modèles YOLO. Les mécanismes d’attention des Transformers évoluent de manière quadratique avec la longueur de séquence, ce qui peut entraîner des erreurs de mémoire insuffisante lors de l’entraînement en haute résolution, sauf en utilisant d’immenses grappes de GPU. De plus, il ne possède pas la polyvalence prête à l’emploi de l’écosystème Ultralytics, se concentrant principalement sur la détection d’objets 2D, sans prise en charge native de la segmentation ou de l’estimation de pose.

ultralytics-translation-0

Tableau comparatif des performances#

Pour évaluer objectivement ces architectures, nous avons compilé leurs métriques de performance. Les valeurs mises en gras représentent les métriques les plus efficaces ou les plus performantes parmi les échelles testées.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Contexte des performances

Bien que RTDETRv2-x atteigne le mAP absolu le plus élevé, il nécessite près de 30 fois plus de paramètres que YOLOv5n. Pour les applications à grande vitesse fonctionnant sur du matériel limité, les modèles Ultralytics offrent systématiquement la meilleure efficacité de calcul.

L’avantage de l’écosystème Ultralytics#

Lorsqu’un modèle passe d’un notebook de recherche à un environnement de production, les logiciels qui l’entourent sont tout aussi importants que l’architecture du réseau neuronal. L’écosystème bien maintenu fourni par Ultralytics accélère considérablement le cycle de développement.

Une simplicité d’utilisation inégalée#

Les modèles Ultralytics privilégient une expérience utilisateur extrêmement rationalisée. Que tu souhaites entraîner un modèle personnalisé, exécuter une validation ou exporter vers des formats spécifiques au matériel comme TensorRT ou ONNX, l’API Python d’Ultralytics te permet de le faire en quelques lignes de code seulement.

Voici un exemple de code pratique montrant à quel point il est simple d’entraîner un modèle Ultralytics et d’exécuter une inférence avec celui-ci :

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

Cette API simple et unifiée prend nativement en charge les intégrations de suivi des expériences avec des outils comme Weights & Biases et Comet, ce qui permet aux développeurs d’enregistrer les métriques de manière fluide sans écrire de code passe-partout complexe.

Cas d'utilisation et recommandations#

Le choix entre YOLOv5 et RT-DETR dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir YOLOv5#

YOLOv5 est un excellent choix pour :

  • Systèmes éprouvés en production : les déploiements existants qui accordent de l'importance à la longue expérience de YOLOv5 en matière de stabilité, à sa documentation étendue et au soutien massif de sa communauté.
  • Entraînement avec des ressources limitées : les environnements disposant de ressources GPU limitées, où le pipeline d'entraînement efficace de YOLOv5 et ses besoins en mémoire réduits constituent des avantages.
  • Prise en charge étendue des formats d'exportation : les projets nécessitant un déploiement dans de nombreux formats, notamment ONNX, TensorRT, CoreML et TFLite.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
  • Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
  • Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :

  • Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.

Perspectives : YOLO11 et YOLO26#

Si tu démarres aujourd’hui un nouveau projet de vision, il est vivement recommandé d’explorer les dernières générations de modèles Ultralytics.

Bien que YOLOv5 reste extrêmement fiable, YOLO11 offre une précision améliorée et un ensemble élargi de tâches, notamment la détection de boîtes englobantes orientées (OBB).

Plus important encore, le YOLO26 de pointe réunit le meilleur des deux mondes. Il implémente une conception de bout en bout sans NMS (développée pour la première fois dans YOLOv10), éliminant la surcharge du post-traitement tout en conservant l’efficacité d’un CNN. YOLO26 introduit également l’optimiseur MuSGD, inspiré des innovations de l’entraînement des LLM, pour une convergence plus rapide. Grâce à la suppression de DFL (Distribution Focal Loss supprimée pour simplifier l’exportation et améliorer la compatibilité avec les appareils edge et basse consommation), YOLO26 offre une inférence CPU jusqu’à 43 % plus rapide, ce qui en fait le meilleur choix absolu pour l’IA edge. De plus, ProgLoss + STAL fournit des fonctions de perte améliorées, avec des progrès notables dans la reconnaissance des petits objets, essentielle pour l’IoT, la robotique et l’imagerie aérienne.

Conclusion#

Le choix entre YOLOv5 et RTDETRv2 dépend fortement de tes contraintes de déploiement. RTDETRv2 repousse les limites du mAP grâce à de puissants mécanismes d’attention des Transformers, mais cela implique un coût élevé en mémoire et en ressources de calcul.

À l’inverse, Ultralytics YOLOv5 offre une solution éprouvée, hautement optimisée et polyvalente qui fonctionne de manière fluide partout, des serveurs cloud aux microcontrôleurs. Pour les équipes qui recherchent la meilleure précision possible ainsi que des outils de déploiement fluides, la mise à niveau au sein de l’écosystème Ultralytics vers YOLO26 constitue la solution de pointe définitive pour les applications modernes de vision par IA.

Commentaires