YOLO Vision 2026 :

DAMO-YOLO vs YOLOv7#

L'évolution rapide de la vision par ordinateur a produit des modèles de détection d'objets hautement efficaces conçus pour équilibrer la précision et le coût de calcul. Deux modèles notables introduits en 2022 sont DAMO-YOLO et YOLOv7. Bien que tous deux visent à repousser les limites des tâches de vision en temps réel, ils obtiennent leurs résultats grâce à des paradigmes architecturaux et des méthodologies d'entraînement extrêmement différents.

Cette comparaison technique complète explore les approches distinctes des deux modèles, en examinant leurs architectures, leur potentiel de déploiement et leurs métriques de performance pour aider les ingénieurs en apprentissage automatique à choisir le bon outil pour leurs applications de vision par ordinateur spécifiques.

Origines et métadonnées des modèles#

Avant de plonger dans l'analyse technique approfondie, il est essentiel de remettre dans leur contexte les origines de ces deux modèles de vision par ordinateur.

DAMO-YOLO#

Développé par des chercheurs d'Alibaba Group, DAMO-YOLO a été introduit pour optimiser à la fois la vitesse et la précision grâce à la recherche d'architecture automatisée et à la distillation.

En savoir plus sur DAMO-YOLO

YOLOv7#

Sorti comme la pointe de la technologie au milieu de l'année 2022, YOLOv7 a poussé l'inférence en temps réel plus loin en introduisant un « sac de goodies » entraînable (« bag-of-freebies ») sans augmenter les coûts de déploiement.

En savoir plus sur YOLOv7

Écosystème pris en charge

YOLOv7 est officiellement pris en charge au sein de l'écosystème Ultralytics, permettant un entraînement, une validation et une exportation fluides avec une API unifiée.

Innovations architecturales#

DAMO-YOLO : NAS et distillation#

DAMO-YOLO intègre plusieurs techniques de pointe orientées vers une efficacité maximale :

  • Backbones NAS : Utilise la recherche d'architecture neuronale (NAS) pour concevoir automatiquement des backbones optimaux (MAE-NAS) adaptés aux environnements où la latence est critique.
  • Efficient RepGFPN : Un réseau de pyramide de caractéristiques généralisé modifié qui améliore considérablement l'efficacité de la fusion de caractéristiques à travers plusieurs échelles.
  • ZeroHead & AlignedOTA : Intègre une tête de détection légère et une stratégie d'affectation d'étiquettes optimisée (AlignedOTA) pour réduire la surcharge computationnelle.
  • Amélioration par distillation : Tire largement parti de la distillation de connaissances pendant l'entraînement pour augmenter les performances des variantes de modèles plus petits sans augmenter leur nombre de paramètres.

YOLOv7 : E-ELAN et Bag-of-Freebies#

YOLOv7 a adopté une approche d'ingénierie plus structurelle, se concentrant sur l'optimisation des chemins de gradient et des stratégies d'entraînement robustes.

  • Architecture E-ELAN : L'Extended Efficient Layer Aggregation Network permet au modèle d'apprendre des caractéristiques plus diversifiées en contrôlant les chemins de gradient les plus courts et les plus longs, assurant une convergence d'apprentissage efficace.
  • Mise à l'échelle du modèle : Introduit une méthode de mise à l'échelle composée adaptée aux modèles basés sur la concaténation, ajustant la profondeur et la largeur simultanément pour un alignement structurel.
  • Sac de goodies entraînable : Utilise des techniques telles que les convolutions reparamétrées (RepConv) sans connexions d'identité et des stratégies d'attribution de labels dynamiques, qui renforcent la précision pendant l'entraînement sans affecter la vitesse d'inférence.

Analyse des performances#

Lors de l'évaluation de la précision moyenne (mAP), de la vitesse et de l'efficacité, les deux modèles affichent des métriques impressionnantes, bien qu'ils ciblent des segments légèrement différents. YOLOv7 se concentre fortement sur le déploiement sur GPU à haute précision, tandis que les structures dérivées du NAS de DAMO-YOLO visent un déploiement agressif à faible latence sur CPU et en périphérie (edge).

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Comme le montrent les métriques, bien que DAMO-YOLO fournisse des variantes extrêmement légères (comme le modèle tiny avec seulement 8,5M de paramètres), YOLOv7 atteint un pic de précision globale plus élevé, avec YOLOv7x atteignant un mAP impressionnant de 53,1 sur le jeu de données COCO.

L'avantage de l'écosystème Ultralytics#

Bien que l'architecture théorique soit importante, la praticité d'un modèle est dictée par son écosystème. Les modèles pris en charge par Ultralytics, tels que YOLOv7, bénéficient d'un écosystème bien entretenu et d'une facilité d'utilisation inégalée.

  • Équilibre des performances : Les modèles Ultralytics trouvent systématiquement un compromis optimal entre la vitesse d'inférence et la précision de détection, ce qui les rend idéaux à la fois pour les appareils de périphérie (edge) et le déploiement de modèles basé sur le cloud.
  • Exigences de mémoire : Contrairement aux modèles plus lourds basés sur les Transformer, les modèles Ultralytics YOLO maintiennent de faibles exigences de mémoire CUDA pendant l'entraînement. Cela permet des tailles de batch (batch sizes) plus grandes, rationalisant le processus d'entraînement même sur du matériel grand public.
  • Polyvalence : Le framework Ultralytics va au-delà de la détection d'objets pour des tâches telles que la Segmentation d'instances et l'Estimation de pose, offrant aux développeurs une boîte à outils complète de vision par ordinateur.
Efficacité de l'entraînement

Le package Ultralytics te permet de passer facilement des jeux de données à un modèle entièrement entraîné en quelques minutes, en tirant parti de chargeurs de données hautement optimisés et de poids pré-entraînés.

Exemple de code : Entraînement de YOLOv7 avec Ultralytics#

Intégrer YOLOv7 dans ton pipeline de vision par ordinateur est incroyablement simple en utilisant l'API Python d'Ultralytics.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

La nouvelle norme : Présentation de YOLO26#

Alors que YOLOv7 et DAMO-YOLO ont représenté des percées significatives en 2022, le domaine de l'IA de vision évolue rapidement. Pour les équipes qui lancent de nouveaux projets aujourd'hui, le modèle recommandé est le tout dernier Ultralytics YOLO26, sorti en janvier 2026.

YOLO26 apporte un saut générationnel en termes de performance et d'utilisabilité, intégrant des innovations de pointe :

  • Conception de bout en bout sans NMS : YOLO26 est nativement de bout en bout. En éliminant le post-traitement de suppression non maximale (NMS), il offre une logique de déploiement plus rapide et plus simple — un changement de paradigme initialement introduit par YOLOv10.
  • Optimiseur MuSGD : Inspiré par les innovations des grands modèles de langage comme Kimi K2 de Moonshot AI, YOLO26 utilise un hybride de SGD et Muon. Cet optimiseur assure des dynamiques d'entraînement hautement stables et des taux de convergence considérablement plus rapides.
  • Inférence CPU jusqu'à 43% plus rapide : Avec la suppression ciblée de la Distribution Focal Loss (DFL) et des améliorations structurelles profondes, YOLO26 est fortement optimisé pour l'informatique en périphérie à faible consommation, surpassant les générations précédentes sur le matériel non-GPU.
  • ProgLoss + STAL : Intègre de nouvelles fonctions de perte avancées qui ciblent et améliorent explicitement la reconnaissance des petits objets, une capacité essentielle pour les applications d'imagerie aérienne, de robotique et de surveillance de sécurité.
  • Améliorations spécifiques aux tâches : Au-delà de la détection standard, YOLO26 propose des optimisations sur mesure pour diverses tâches, y compris le prototypage multi-échelle pour la segmentation, le RLE pour l'estimation de pose et des pertes d'angle spécifiques pour les Boîtes englobantes orientées (OBB).

En savoir plus sur YOLO26

Cas d'utilisation idéaux#

Le choix de la bonne architecture dépend entièrement de ton environnement de déploiement cible et des contraintes de ton projet.

Quand choisir DAMO-YOLO :

  • Tu travailles dans des environnements en périphérie fortement contraints et limités en ressources où le nombre brut de paramètres doit être maintenu extrêmement bas (ex : microcontrôleurs).
  • Tu utilises des pipelines d'apprentissage automatique automatisés spécifiquement intégrés aux services cloud propriétaires d'Alibaba.

Quand choisir YOLOv7 :

  • Tu as des pipelines GPU existants déjà optimisés pour l'inférence basée sur des ancres et de haute précision.
  • Tu operes dans des environnements où la précision en temps réel est primordiale, comme les véhicules autonomes à grande vitesse ou la robotique avancée.

Quand choisir YOLO26 (recommandé) :

  • Tu construis une nouvelle application de vision par ordinateur à partir de zéro et as besoin de la pointe absolue de la technologie à la fois en termes de précision et de vitesse d'inférence sur CPU/périphérie (edge).
  • Tu as besoin d'un déploiement rapide et transparent (tel que l'exportation vers CoreML ou TensorRT) sans avoir à gérer les contraintes de l'opérateur NMS.
  • Tu souhaites utiliser toutes les fonctionnalités de la Plateforme Ultralytics pour l'entraînement dans le cloud, la gestion des jeux de données et le déploiement automatisé.

En tirant parti de l'écosystème robuste des modèles Ultralytics, les développeurs peuvent réduire considérablement le temps d'ingénierie tout en garantissant des performances prédictives de premier plan pour leurs applications réelles.

Commentaires