Ultralytics YOLO27 :
Get Started

YOLOv5 vs YOLO11#

Pour choisir l’architecture de vision par ordinateur adaptée à un nouveau projet, il est essentiel de comprendre l’évolution des modèles de pointe. Le passage des premières architectures aux frameworks unifiés modernes illustre des progrès importants en matière d’efficacité algorithmique et d’expérience développeur. Ce guide propose une comparaison technique approfondie de deux modèles marquants développés par Ultralytics : YOLOv5, le précurseur, et YOLO11, son successeur hautement abouti.

Présentation des modèles#

Ces deux architectures représentent des étapes importantes dans le domaine de la détection d’objets en temps réel et présentent des avantages distincts selon l’environnement de déploiement et les exigences liées aux systèmes existants.

YOLOv5 : le pilier du secteur#

Lancé à l’été 2020, YOLOv5 est rapidement devenu une référence du secteur grâce à son implémentation native en PyTorch, qui a considérablement facilité l’accès à l’entraînement et au déploiement. Il s’est éloigné des frameworks C Darknet complexes de ses prédécesseurs pour proposer une approche Pythonique de la création de modèles.

YOLOv5 a établi une solide référence en matière de simplicité d’utilisation et introduit des méthodes d’entraînement puissantes, notamment l’augmentation avancée des données par mosaïque et l’ajustement automatique des ancres. Il reste très populaire auprès des chercheurs qui s’appuient sur une base de code bien documentée et largement éprouvée.

YOLO11 : le framework visuel unifié#

Fruit de plusieurs années de retours et de recherche architecturale, YOLO11 a été lancé dans le cadre d’un framework unifié, capable de gérer nativement plusieurs tâches de vision. Conçu dès le départ pour offrir un maximum de polyvalence et d’efficacité, il ne se limite pas aux boîtes englobantes.

YOLO11 offre une expérience utilisateur simplifiée grâce au package Python ultralytics, qui propose une API simple unifiant la détection d’objets, la segmentation d’instances, la classification, l’estimation de pose et les boîtes englobantes orientées (OBB). Son compromis entre vitesse et précision est très avantageux, ce qui le rend idéal pour divers scénarios de déploiement réels.

Plateforme intégrée

Les deux modèles tirent parti de l’écosystème bien maintenu de la plateforme Ultralytics. Cet environnement intégré simplifie l’annotation des jeux de données, l’entraînement dans le cloud et l’exportation des modèles vers différentes cibles matérielles.

Comparaison des performances et des métriques#

Une comparaison directe de ces modèles montre comment les améliorations architecturales se traduisent par des gains de performance concrets. Le tableau ci-dessous présente la précision moyenne (mAP) mesurée sur le jeu de données COCO, ainsi que les vitesses d’inférence sur CPU et GPU et le nombre de paramètres.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Analyse des résultats#

Les indicateurs révèlent un net progrès dans l’équilibre des performances atteint par YOLO11. Par exemple, le modèle YOLO11n (nano) obtient un score de 39.5 % mAP, contre 28.0 % pour YOLOv5n, soit un gain de 11.5 points pour seulement 0.7M de paramètres supplémentaires. De plus, YOLO11 nécessite beaucoup moins de mémoire à l’entraînement que les modèles lourds fondés sur Transformer, ce qui le rend très accessible pour un déploiement sur du matériel grand public et des appareils périphériques.

Différences architecturales#

Les améliorations des performances de YOLO11 découlent de plusieurs évolutions architecturales clés. Alors que YOLOv5 utilisait un backbone CSPNet standard avec des modules C3, les modèles Ultralytics plus récents ont introduit des blocs d’extraction de caractéristiques plus efficaces, comme C2f (YOLOv8) et C3k2 (YOLO11), qui optimisent la circulation des gradients et réduisent la charge de calcul.

YOLO11 dispose également d’une tête considérablement perfectionnée. En délaissant la conception à ancres des anciens modèles, les architectures Ultralytics plus récentes adoptent une approche sans ancres. Cela réduit le nombre de prédictions de boîtes, simplifie le pipeline de post-traitement et améliore la capacité du modèle à généraliser à différentes échelles et proportions. De plus, ces modèles offrent une efficacité d’entraînement supérieure et des poids préentraînés facilement accessibles, qui accélèrent la convergence lors de l’affinage sur les jeux de données.

Implémentation et exemples de code#

La simplicité est l’un des principaux atouts de l’écosystème Ultralytics. Alors que YOLOv5 a popularisé l’utilisation de torch.hub pour effectuer rapidement des inférences, YOLO11 va encore plus loin avec le package Python unifié ultralytics.

Entraînement avec YOLO11#

Le chargement, l’entraînement et la validation d’un modèle nécessitent très peu de code passe-partout. L’API gère facilement le réglage des hyperparamètres et la gestion des modèles.

from ultralytics import YOLO

# Charger un modèle YOLO11 préentraîné
model = YOLO("yolo11s.pt")

# Entraîner sur un jeu de données personnalisé pendant 50 époques
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Effectuer rapidement une inférence et afficher les résultats
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Exporter facilement le modèle vers TensorRT pour accélérer le matériel
model.export(format="engine")

Inférence avec YOLOv5 pour les systèmes existants#

Si tu maintiens un ancien pipeline, YOLOv5 s’intègre directement au mécanisme de chargement natif de PyTorch, ce qui permet de l’insérer facilement dans les scripts d’inférence existants.

import torch

# Charger un modèle YOLOv5 personnalisé ou préentraîné depuis PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# Effectuer une inférence sur une URL d’image
results = model("https://ultralytics.com/images/zidane.jpg")

# Afficher les détails des prédictions dans la console
results.print()
Flexibilité du déploiement

Les deux modèles prennent en charge de nombreux formats d’exportation. Que tu cibles un NVIDIA Jetson avec TensorRT ou une application iOS avec CoreML, le processus de déploiement est entièrement documenté et bénéficie du soutien de la communauté.

Cas d’utilisation idéaux#

Le choix entre ces modèles dépend surtout de l’étape du cycle de vie de ton projet et de tes besoins spécifiques.

Quand choisir YOLOv5#

  • Maintenance de bases de code existantes : si ton environnement de production est fortement personnalisé autour de la structure du dépôt YOLOv5 ou de techniques spécifiques d’évolution des hyperparamètres.
  • Références universitaires : pour publier des recherches nécessitant une comparaison directe avec les références établies en vision par ordinateur de 2020 à 2022.

Quand choisir YOLO11#

  • Projets multitâches : si ton application nécessite une combinaison de tâches comme l’estimation de pose et la segmentation d’instances à l’aide d’une API unifiée.
  • Déploiements en périphérie : pour les scénarios d’informatique en périphérie où il est essentiel d’obtenir le mAP maximal dans un budget de calcul donné (FLOPs).
  • Solutions d’IA commerciales : idéales pour les applications d’entreprise dans le commerce de détail et la sécurité, grâce à l’assistance robuste de la plateforme Ultralytics.

La prochaine génération : Ultralytics YOLO26#

YOLO11 offre un excellent équilibre entre vitesse et précision, mais le domaine de l’intelligence artificielle évolue rapidement. Pour les développeurs qui démarrent de nouveaux projets aujourd’hui, nous recommandons vivement d’explorer la dernière référence en IA visuelle : Ultralytics YOLO26.

Lancé en janvier 2026, YOLO26 introduit des avancées qui changent la donne et répondent spécifiquement aux besoins de déploiement modernes :

  • Conception de bout en bout sans NMS : s’appuyant sur des concepts inaugurés dans YOLOv10, YOLO26 fonctionne nativement de bout en bout. Sa tête optionnelle un-à-un (nms=False) élimine le post-traitement par suppression non maximale (NMS), ce qui simplifie considérablement les pipelines de déploiement et réduit la latence.
  • Optimiseur MuSGD : inspiré des innovations en matière d’entraînement des grands modèles de langage (LLM), notamment de modèles comme Kimi K2 de Moonshot AI, cet hybride de SGD et de Muon garantit un entraînement extrêmement stable et une convergence beaucoup plus rapide.
  • Vitesse CPU sans précédent : en supprimant la perte focale de distribution (DFL), YOLO26 atteint une inférence sur CPU jusqu’à 43 % plus rapide, ce qui en fait le meilleur choix pour les appareils périphériques et les environnements sans GPU dédié.
  • Fonctions de perte avancées : l’intégration de ProgLoss et de STAL améliore sensiblement la reconnaissance des petits objets, un point essentiel pour l’analyse par drone, l’IoT et la robotique.
  • Améliorations propres aux tâches : le modèle introduit des optimisations spécialisées, comme l’estimation résiduelle du log-vraisemblance (RLE) pour la pose et une fonction de perte d’angle dédiée aux boîtes englobantes orientées, afin d’offrir des performances supérieures pour toutes les tâches de vision par ordinateur.

Si tu t’intéresses à des architectures spécialisées au-delà de la détection d’objets standard, tu peux aussi découvrir des modèles comme RT-DETR pour la détection fondée sur Transformer, ou YOLO-World pour le suivi et la détection à vocabulaire ouvert. En adoptant ces outils bien maintenus et hautement optimisés, tu veilles à ce que tes pipelines de vision par ordinateur restent efficaces, évolutifs et à la pointe.

Commentaires