YOLO Vision 2026 :

YOLOv5 vs YOLOv9#

Le paysage de la vision par ordinateur et de la détection d'objets en temps réel a connu des avancées remarquables au cours des dernières années. Naviguer entre le choix de modèles éprouvés et robustes et celui d'architectures de recherche plus récentes est un défi courant pour les ingénieurs en apprentissage automatique. Ce guide propose une comparaison technique complète entre deux modèles très influents de la famille YOLO : YOLOv5 et YOLOv9.

Que tu déployettes sur des appareils de périphérie contraints, que tu recherches une extraction de caractéristiques haute fidélité ou que tu construises des pipelines de object detection complexes, comprendre les nuances architecturales, les métriques de performance et les différences d'écosystème de ces modèles est crucial.

Aperçus des modèles#

Avant de plonger dans les comparaisons architecturales, il est utile de comprendre les origines et les objectifs principaux de chaque modèle.

Ultralytics YOLOv5#

Développé par Glenn Jocher et publié par Ultralytics le 26 juin 2020, YOLOv5 a marqué un changement de paradigme dans la façon dont les développeurs interagissent avec les modèles de vision. En adoptant pleinement le framework PyTorch, YOLOv5 a troqué les étapes de compilation complexes des anciens modèles basés sur Darknet contre une expérience utilisateur intuitive, conçue d'abord pour Python.

YOLOv5 est réputé pour sa facilité d'utilisation et ses performances stables dans divers environnements matériels. Il prend en charge non seulement la détection, mais aussi la image classification et la instance segmentation.

En savoir plus sur YOLOv5

YOLOv9#

Introduit par Chien-Yao Wang et Hong-Yuan Mark Liao de l'Institute of Information Science à l'Academia Sinica, à Taïwan, YOLOv9 se concentre fortement sur la théorie architecturale pour atténuer les problèmes de goulot d'étranglement de l'information dans les réseaux de neurones profonds.

Le cœur de YOLOv9 repose sur deux innovations théoriques majeures : Programmable Gradient Information (PGI) et le Generalized Efficient Layer Aggregation Network (GELAN). Ces concepts aident le modèle à conserver des caractéristiques spatiales critiques à travers les couches profondes du réseau.

En savoir plus sur YOLOv9

Pérennise tes déploiements

Bien que YOLOv5 et YOLOv9 soient puissants, le nouveau YOLO26 représente l'équilibre ultime entre vitesse et précision. Doté d'une conception de bout en bout sans NMS et d'une inférence sur CPU jusqu'à 43 % plus rapide, YOLO26 est fortement recommandé pour l'informatique de périphérie moderne et les déploiements en production.

Différences architecturales et techniques#

Comprendre ce qui alimente ces modèles de vision sous le capot est essentiel pour optimiser les stratégies de model deployment.

Extraction de caractéristiques et rétention de l'information#

YOLOv5 utilise un backbone Cross Stage Partial Network (CSPNet), qui réduit efficacement la surcharge de calcul tout en maintenant un flux de gradient précis lors de la rétropropagation. Cette conception est hautement optimisée pour les GPU operations traditionnelles et garantit des exigences de mémoire inférieures pendant l'entraînement par rapport aux alternatives Transformer lourdes.

YOLOv9 introduit GELAN, une architecture générique qui étend les principes de CSPNet. Couplé au PGI — une branche réversible auxiliaire —, YOLOv9 garantit que les couches profondes ne perdent pas les données sémantiques nécessaires à des fonctions objectives précises. Cela permet à YOLOv9 d'atteindre une haute accuracy, en particulier sur les petits objets, bien que le branchement auxiliaire complexe puisse parfois compliquer les pipelines d'exportation vers du matériel de périphérie profondément contraint.

Besoins en mémoire et efficacité de l'entraînement#

En matière d'efficacité d'entraînement, YOLOv5 reste incroyablement robuste. L'Ultralytics ecosystem bien entretenu garantit que les modèles YOLOv5 consomment nettement moins de mémoire CUDA, permettant aux chercheurs de maximiser les batch sizes sur des GPU grand public. Bien que YOLOv9 offre une excellente efficacité en termes de paramètres (précision élevée par rapport à sa taille), son processus d'entraînement peut être plus gourmand en ressources si tu n'utilises pas de frameworks optimisés. Heureusement, l'intégration de YOLOv9 dans l'API Ultralytics le rapproche de la parité avec la gestion rationalisée des ressources de YOLOv5.

Performances et mesures#

Pour évaluer objectivement ces architectures, nous comparons leurs performances sur des jeux de données standard comme COCO. Tu trouveras ci-dessous une analyse détaillée des mesures telles que le mAP (Mean Average Precision), la vitesse d'inférence et le nombre de paramètres.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Comme le montre le tableau, YOLOv9 atteint une précision brute plus élevée à des niveaux équivalents, ce qui reflète son architecture plus récente. Cependant, YOLOv5n maintient une latence TensorRT incroyablement basse de 1,12 ms, soulignant sa force durable pour les applications d'edge computing à haute vitesse et localisées.

Méthodologies d'entraînement et facilité d'utilisation#

Le véritable avantage de tirer parti de la computer vision aujourd'hui réside dans l'accessibilité de la chaîne d'outils.

L'avantage Ultralytics#

Bien que les dépôts de recherche originaux pour des modèles comme YOLOv9 soient fondamentaux, ils s'accompagnent souvent de matrices de dépendances complexes et de scripts génériques. L'Ultralytics Python API abstrait complètement cette complexité. Avec l'écosystème Ultralytics, tu peux entraîner, évaluer et exporter à la fois YOLOv5 et YOLOv9 avec une syntaxe unifiée et identique.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 model for fast deployment
model_v5 = YOLO("yolov5s.pt")

# Or leverage a YOLOv9 model for high-fidelity accuracy
model_v9 = YOLO("yolov9c.pt")

# Train seamlessly on custom data with automatic MLflow logging
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX
model_v9.export(format="onnx")

Cette approche à API unique offre une versatilité immense, prenant en charge non seulement la détection, mais aussi l'pose estimation et les oriented bounding boxes (OBB) selon le modèle choisi. De plus, des intégrations robustes avec des outils comme Comet ML et Weights & Biases sont directement intégrées dans la boucle d'entraînement.

Cas d'utilisation idéaux et applications réelles#

Choisir entre ces architectures dépend en grande partie des contraintes de ton matériel et de la précision requise par ton domaine d'application.

Quand choisir YOLOv5#

YOLOv5 est un vétéran aguerri qui brille dans les déploiements privilégiant la stabilité, une faible empreinte mémoire et une compatibilité d'exportation extrême.

  • Déploiements mobiles : L'exportation de YOLOv5 vers TFLite ou CoreML pour une inférence sur l'appareil sur des smartphones plus anciens est incroyablement transparente.
  • Matériel de périphérie existant : Pour des appareils comme le Raspberry Pi ou les NVIDIA Jetson Nano de première génération, les convolutions simples de YOLOv5 garantissent des fréquences d'images constantes pour des applications telles que la smart parking management.
  • Prototypage rapide : La grande disponibilité de tutoriels communautaires, de pre-trained weights personnalisés et la compatibilité avec des jeux de données massifs en font le moyen le plus rapide de valider un prototype.

Quand choisir YOLOv9#

YOLOv9 est idéal pour les scénarios où capturer des détails complexes et minimiser les faux négatifs est absolument critique, même si cela nécessite un peu plus de surcharge de calcul.

  • Imagerie aérienne et satellitaire : Le framework PGI est très habile à maintenir la fidélité des petits objets, ce qui rend YOLOv9 excellent pour l'agricultural monitoring par drone.
  • Diagnostics par imagerie médicale : Lors de la détection d'anomalies ou de lésions minuscules dans des scans haute résolution, le flux de gradient précis de GELAN offre un avantage nécessaire en termes de rappel.
  • Analytique de vente au détail haut de gamme : Le suivi des produits qui se chevauchent sur des étagères denses bénéficie considérablement des capacités supérieures de rétention des caractéristiques de YOLOv9.

Élargis tes horizons#

Bien que la comparaison entre YOLOv5 et YOLOv9 offre une vision claire de l'évolution des architectures de 2020 à 2024, le domaine de l'IA avance plus vite que jamais. Pour les développeurs cherchant la toute dernière pointe de la performance, explorer les derniers YOLO26 models est fortement encouragé. En remplaçant la suppression non maximale traditionnelle par une conception native End-to-End NMS-Free Design et en utilisant l'optimiseur avancé MuSGD Optimizer, YOLO26 comble le fossé entre la précision de niveau recherche et la vitesse de niveau production. Avec DFL Removal (suppression de la perte focale de distribution pour une export simplifiée et une meilleure compatibilité avec les appareils de périphérie/faible consommation), YOLO26 atteint jusqu'à 43 % d'inférence CPU plus rapide, ce qui le rend idéal pour l'edge computing. De plus, ProgLoss + STAL fournit des fonctions de perte améliorées avec des améliorations notables de la reconnaissance des petits objets, cruciale pour l'IoT, la robotique et l'imagerie aérienne.

Tu pourrais également t'intéresser à la comparaison de ces architectures avec d'autres modèles de pointe comme RT-DETR ou le très performant YOLO11. L'utilisation du framework unifié Ultralytics garantit que, peu importe le modèle que tu choisis, ton pipeline de développement reste propre, efficace et prêt à évoluer.

Commentaires