Ultralytics YOLO27 :

DAMO-YOLO contre YOLOv7#

L’évolution rapide de la vision par ordinateur a produit des modèles de détection d’objets très efficaces, conçus pour équilibrer la précision et le coût de calcul. Deux modèles remarquables introduits en 2022 sont DAMO-YOLO et YOLOv7. Bien que tous deux visent à repousser les limites des tâches de vision en temps réel, ils obtiennent leurs résultats grâce à des paradigmes architecturaux et des méthodologies d’entraînement très différents.

Cette comparaison technique complète examine les approches distinctes des deux modèles, en analysant leurs architectures, leur potentiel de déploiement et leurs métriques de performance afin d’aider les ingénieurs en machine learning à choisir l’outil adapté à leurs applications de vision par ordinateur.

Origines et métadonnées des modèles#

Avant d’aborder l’analyse technique approfondie, il est essentiel de contextualiser les origines de ces deux modèles de vision par ordinateur.

DAMO-YOLO#

Développé par des chercheurs d’Alibaba Group, DAMO-YOLO a été introduit pour optimiser à la fois la vitesse et la précision grâce à la recherche automatisée d’architecture et à la distillation.

YOLOv7#

Présenté comme une solution à l’état de l’art à la mi-2022, YOLOv7 a encore amélioré l’inférence en temps réel en introduisant des « bag-of-freebies » entraînables sans augmenter les coûts de déploiement.

En apprends plus sur YOLOv7

Écosystème pris en charge

YOLOv7 est officiellement pris en charge au sein de l’écosystème Ultralytics, ce qui permet d’effectuer de manière fluide l’entraînement, la validation et l’exportation avec une API unifiée.

Innovations architecturales#

DAMO-YOLO : NAS et distillation#

DAMO-YOLO intègre plusieurs techniques de pointe visant une efficacité maximale :

  • Backbones NAS : utilise la recherche d’architecture neuronale (NAS) pour concevoir automatiquement des backbones optimaux (MAE-NAS), adaptés aux environnements où la latence est critique.
  • Efficient RepGFPN : réseau pyramidal de caractéristiques généralisé modifié qui améliore considérablement l’efficacité de la fusion des caractéristiques à plusieurs échelles.
  • ZeroHead et AlignedOTA : intègre une tête de détection légère et une stratégie optimisée d’affectation des étiquettes (AlignedOTA) afin de réduire la charge de calcul.
  • Amélioration par distillation : exploite largement la distillation des connaissances pendant l’entraînement afin d’améliorer les performances des variantes de modèles plus petites sans augmenter leur nombre de paramètres.

YOLOv7 : E-ELAN et Bag-of-Freebies#

YOLOv7 a adopté une approche d’ingénierie plus structurelle, axée sur l’optimisation des chemins de gradient et sur des stratégies d’entraînement robustes.

  • Architecture E-ELAN : le réseau d’agrégation de couches efficace étendu permet au modèle d’apprendre des caractéristiques plus diversifiées en contrôlant les chemins de gradient les plus courts et les plus longs, garantissant ainsi une convergence efficace de l’apprentissage.
  • Mise à l’échelle du modèle : introduit une méthode de mise à l’échelle composée adaptée aux modèles fondés sur la concaténation, en augmentant simultanément la profondeur et la largeur pour assurer un alignement structurel.
  • Bag-of-Freebies entraînables : utilise des techniques telles que les convolutions reparamétrées (RepConv) sans connexions d’identité et des stratégies dynamiques d’affectation des étiquettes, qui améliorent l’exactitude pendant l’entraînement sans affecter la vitesse d’inférence.

Analyse des performances#

Lorsqu’on évalue la précision moyenne (mAP), la vitesse et l’efficacité, les deux modèles affichent des métriques impressionnantes, bien qu’ils ciblent des segments légèrement différents. YOLOv7 se concentre fortement sur le déploiement sur GPU à haute précision, tandis que les structures issues de la NAS de DAMO-YOLO visent un déploiement agressif à faible latence sur CPU et en périphérie.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Comme le montrent les métriques, bien que DAMO-YOLO propose des variantes extrêmement légères, comme le modèle tiny avec seulement 8,5 M de paramètres, YOLOv7 atteint un pic de précision global supérieur, YOLOv7x atteignant un impressionnant score de 53,1 mAP sur le jeu de données COCO.

L’avantage de l’écosystème Ultralytics#

Bien que l’architecture théorique soit importante, l’aspect pratique d’un modèle dépend de son écosystème. Les modèles pris en charge par Ultralytics, comme YOLOv7, bénéficient d’un écosystème bien maintenu et d’une grande facilité d’utilisation.

  • Équilibre des performances : les modèles Ultralytics offrent systématiquement un compromis optimal entre vitesse d’inférence et précision de détection, ce qui les rend idéaux à la fois pour les appareils périphériques et pour le déploiement de modèles dans le cloud.
  • Besoins en mémoire : contrairement aux modèles plus lourds fondés sur des Transformers, les modèles YOLO d’Ultralytics nécessitent peu de mémoire CUDA pendant l’entraînement. Cela permet d’utiliser des tailles de lot plus importantes et de simplifier le processus d’entraînement, même sur du matériel grand public.
  • Polyvalence : le framework Ultralytics va au-delà de la détection d’objets et prend en charge des tâches telles que la segmentation d’instances et l’estimation de pose, offrant ainsi aux développeurs une boîte à outils complète pour la vision par ordinateur.
Efficacité de l’entraînement

Le package Ultralytics te permet de passer facilement des jeux de données à un modèle entièrement entraîné en seulement quelques minutes, grâce à des chargeurs de données hautement optimisés et à des poids préentraînés.

Exemple de code : entraîner YOLOv7 avec Ultralytics#

L’intégration de YOLOv7 dans ton pipeline de vision par ordinateur est extrêmement simple grâce à l’API Python d’Ultralytics.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

La nouvelle référence : présentation de YOLO26#

Bien que YOLOv7 et DAMO-YOLO aient représenté des avancées majeures en 2022, le domaine de l’IA appliquée à la vision évolue rapidement. Pour les équipes qui lancent de nouveaux projets aujourd’hui, le modèle recommandé est l’Ultralytics YOLO26, à la pointe de la technologie et sorti en janvier 2026.

YOLO26 apporte un bond générationnel en matière de performances et d’ergonomie, en intégrant des innovations à l’état de l’art :

  • Conception de bout en bout sans NMS : YOLO26 est nativement de bout en bout. En éliminant le post-traitement de suppression des non-maxima (NMS), il offre une logique de déploiement plus rapide et plus simple : un changement de paradigme initialement introduit par YOLOv10.
  • Optimiseur MuSGD : inspiré d’innovations issues des grands modèles de langage, comme Kimi K2 de Moonshot AI, YOLO26 utilise une combinaison de SGD et de Muon. Cet optimiseur garantit une dynamique d’entraînement très stable et des taux de convergence nettement plus rapides.
  • Inférence CPU jusqu’à 43 % plus rapide : grâce à la suppression ciblée de la perte focale de distribution (DFL) et à de profondes améliorations structurelles, YOLO26 est fortement optimisé pour l’informatique périphérique basse consommation et surpasse les générations précédentes sur le matériel dépourvu de GPU.
  • ProgLoss + STAL : intègre de nouvelles fonctions de perte avancées qui ciblent et améliorent explicitement la reconnaissance des petits objets, une capacité essentielle pour les applications d’imagerie aérienne, de robotique et de surveillance de sécurité.
  • Améliorations spécifiques aux tâches : au-delà de la détection standard, YOLO26 propose des améliorations adaptées à diverses tâches, notamment le prototypage multi-échelle pour la segmentation, le RLE pour l’estimation de pose et des pertes angulaires spécifiques pour les boîtes englobantes orientées (OBB).

Cas d’utilisation idéaux#

Le choix de la bonne architecture dépend entièrement de ton environnement de déploiement cible et des contraintes de ton projet.

Quand choisir DAMO-YOLO :

  • Tu travailles dans des environnements périphériques fortement contraints et disposant de ressources limitées, où le nombre brut de paramètres doit être extrêmement faible, par exemple sur des microcontrôleurs.
  • Tu utilises des pipelines de machine learning automatisés spécifiquement intégrés aux services cloud propriétaires d’Alibaba.

Quand choisir YOLOv7 :

  • Tu disposes déjà de pipelines GPU hérités optimisés pour l’inférence fondée sur des ancres et privilégiant une haute précision.
  • Tu opères dans des environnements où la précision en temps réel est primordiale, comme les véhicules autonomes à grande vitesse ou la robotique avancée.

Quand choisir YOLO26 (recommandé) :

  • Tu développes une nouvelle application de vision par ordinateur à partir de zéro et tu as besoin de la solution à l’état de l’art absolu, tant en matière de précision que de vitesse d’inférence sur CPU et en périphérie.
  • Tu as besoin d’un déploiement rapide et fluide, comme l’exportation vers CoreML ou TensorRT, sans avoir à gérer les contraintes des opérateurs NMS.
  • Tu souhaites exploiter toutes les capacités de l’Ultralytics Platform pour l’entraînement dans le cloud, la gestion des jeux de données et le déploiement automatisé.

En tirant parti de l’écosystème robuste des modèles Ultralytics, les développeurs peuvent réduire considérablement le temps d’ingénierie tout en garantissant des performances prédictives de premier ordre pour leurs applications concrètes.

Commentaires