Ultralytics YOLO27 :
Get Started

DAMO-YOLO vs YOLO26#

Le domaine de la vision par ordinateur évolue constamment, porté par le besoin d’architectures qui concilient haute précision et inférence à faible latence. Cette comparaison examine en détail les aspects techniques de DAMO-YOLO et d’Ultralytics YOLO26, en étudiant leurs innovations architecturales, leurs méthodes d’entraînement et leurs cas d’utilisation idéaux.

Que tu déploies des modèles de vision sur des appareils en périphérie ou que tu construises des pipelines cloud à haut débit, comprendre les nuances entre ces modèles est essentiel pour prendre des décisions architecturales éclairées dans le développement moderne de l’IA.

DAMO-YOLO : recherche d’architecture neuronale à grande échelle#

Développé par Alibaba Group, DAMO-YOLO est sorti le 23 novembre 2022. Conçu par Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun, le modèle met l’accent sur la découverte automatisée d’architectures efficaces grâce à la recherche d’architecture neuronale (NAS).

Tu peux consulter la recherche originale dans leur article ArXiv ou explorer le code source dans le dépôt GitHub de DAMO-YOLO.

Principales caractéristiques architecturales#

DAMO-YOLO propose plusieurs innovations techniques conçues pour repousser les limites de la détection d’objets en temps réel :

  • Backbones MAE-NAS : DAMO-YOLO utilise une recherche guidée par l’entropie maximale pour trouver des backbones optimaux. Cette approche NAS découvre des architectures qui équilibrent rigoureusement la précision de détection et la vitesse d’inférence sur un matériel donné.
  • RepGFPN efficace : Une conception de neck imposante qui améliore considérablement la fusion des caractéristiques, particulièrement utile pour analyser des scènes complexes comme celles des images aériennes.
  • Conception ZeroHead : Une tête de détection fortement simplifiée qui réduit la complexité de calcul des couches de prédiction finales.
  • AlignedOTA et distillation : DAMO-YOLO utilise l’assignation optimale par transport alignée (AlignedOTA) pour résoudre les ambiguïtés d’assignation des étiquettes, associée à une stratégie efficace d’amélioration par distillation des connaissances qui accroît la précision des petits modèles étudiants à l’aide de réseaux enseignants plus grands.

En savoir plus sur DAMO-YOLO

L’avantage Ultralytics : YOLO26#

Sorti le 14 janvier 2026 par Glenn Jocher et Jing Qiu chez Ultralytics, YOLO26 représente le summum de l’IA visuelle performante et accessible. Dans la continuité de YOLO11 et de YOLOv10, YOLO26 a été conçu dès le départ pour privilégier le déploiement en périphérie, la polyvalence multitâche et une facilité d’utilisation inégalée.

Innovations de YOLO26#

Ultralytics YOLO26 apporte plusieurs fonctionnalités révolutionnaires qui en font le choix de référence pour les applications modernes de vision par ordinateur :

  • Conception de bout en bout sans NMS : La tête native un-à-un de YOLO26 (nms=False) élimine le post-traitement par suppression des non-maxima (NMS). D’abord introduite dans YOLOv10, cette approche de bout en bout simplifie considérablement les pipelines de déploiement et garantit une inférence déterministe à faible latence.
  • Jusqu’à 43 % d’inférence plus rapide sur CPU : Optimisé sur le plan architectural pour l’informatique en périphérie, YOLO26 offre une vitesse exceptionnelle sur les appareils en périphérie et les CPU standard, ce qui le rend idéal pour les appareils IoT alimentés par batterie.
  • Optimiseur MuSGD : Inspiré par l’entraînement des LLM, comme Kimi K2 de Moonshot AI, YOLO26 intègre une combinaison de SGD et de Muon. Cela apporte à la vision par ordinateur la stabilité de l’entraînement des grands modèles de langage et permet une convergence plus rapide et plus fiable.
  • Suppression de DFL : En supprimant la perte focale de distribution, le graphe du modèle est simplifié, ce qui facilite l’exportation vers des formats comme ONNX et TensorRT.
  • ProgLoss + STAL : Ces fonctions de perte avancées améliorent nettement la reconnaissance des petits objets, essentielle aux opérations de drones et à l’agriculture.
Améliorations spécifiques aux tâches

YOLO26 intègre des améliorations spécialisées pour plusieurs modalités : un module proto multi-échelle pour la segmentation d’instances, l’estimation résiduelle de log-vraisemblance (RLE) pour l’estimation de pose et une fonction de perte angulaire avancée pour atténuer les problèmes de délimitation lors de la détection des boîtes englobantes orientées (OBB).

Comparaison des performances#

Pour évaluer ces modèles, l’équilibre entre précision (mAP) et efficacité de calcul (vitesse/FLOPs) est primordial. Le tableau ci-dessous compare ces modèles à l’aide du jeu de données COCO, une référence du secteur.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Comme on peut le voir ci-dessus, YOLO26 offre systématiquement une meilleure précision avec nettement moins de paramètres et de FLOPs, ce qui donne une architecture bien plus efficace à l’entraînement comme à l’inférence.

Efficacité de l’entraînement et facilité d’utilisation#

La complexité de DAMO-YOLO#

Bien que DAMO-YOLO atteigne une précision compétitive, sa méthode d’entraînement est très complexe. Le recours à la recherche d’architecture neuronale (NAS) et à une distillation des connaissances poussée signifie que l’entraînement d’un modèle personnalisé nécessite souvent d’importantes ressources GPU et des compétences spécialisées. Ce processus en plusieurs étapes — entraîner un modèle enseignant massif pour en distiller un modèle étudiant plus petit — peut ralentir les équipes d’ingénierie agiles qui cherchent à itérer rapidement sur des jeux de données personnalisés.

L’expérience Ultralytics simplifiée#

À l’inverse, Ultralytics YOLO26 est conçu pour être facile à utiliser, du débutant à l’expert. L’ensemble du cycle de vie de l’entraînement, de la validation et du déploiement est accessible depuis une API Python et une CLI unifiées et épurées. De plus, YOLO26 nécessite beaucoup moins de mémoire CUDA à l’entraînement que les modèles basés sur des Transformers comme RT-DETR, ce qui permet aux chercheurs d’entraîner des modèles de pointe sur du matériel grand public.

Voici un exemple qui montre à quel point il est simple d’entraîner, d’évaluer et d’exporter un modèle YOLO26 à l’aide du SDK Ultralytics :

from ultralytics import YOLO

# Charger le dernier modèle nano YOLO26
model = YOLO("yolo26n.pt")

# Entraîner le modèle sur le jeu de données COCO8 pendant 50 époques
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Évaluer les performances du modèle sur le jeu de validation
metrics = model.val()

# Lancer l’inférence sur une image d’exemple
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Exporter le modèle au format ONNX pour le déploiement
model.export(format="onnx")

Pour les équipes qui préfèrent un environnement sans code, la plateforme Ultralytics propose une interface intuitive pour annoter des jeux de données, entraîner des modèles dans le cloud et les déployer facilement.

Applications concrètes#

Le choix de la bonne architecture dépend largement de l’environnement de déploiement cible et des contraintes matérielles.

Contrôle qualité industriel#

Pour l’automatisation de la fabrication à grande vitesse, DAMO-YOLO peut être performant sur du matériel GPU dédié. Cependant, YOLO26 est le choix privilégié pour les chaînes de montage modernes. Sa conception de bout en bout sans NMS garantit une latence déterministe et sans fluctuation, essentielle pour synchroniser les données visuelles et les actionneurs robotiques en temps réel.

IA en périphérie et appareils mobiles#

Le déploiement de la vision par ordinateur sur des appareils alimentés par batterie exige une efficacité extrême. Alors que DAMO-YOLO s’appuie sur des necks RepGFPN spécifiques, YOLO26n (Nano) est spécialement optimisé pour l’informatique en périphérie. La suppression de DFL et son inférence CPU 43 % plus rapide en font la solution idéale pour les caméras intelligentes, les applications mobiles et les systèmes d’alarme de sécurité.

Exigences des projets multitâches#

Si un projet exige plus que la simple détection d’objets — par exemple, analyser les mouvements des joueurs dans le sport grâce à l’estimation de pose, ou extraire des contours précis au pixel près grâce à la segmentation d’instances — YOLO26 prend nativement en charge toutes ces tâches dans une base de code unifiée. DAMO-YOLO se limite strictement à la détection par boîtes englobantes.

Cas d’utilisation et recommandations#

Le choix entre DAMO-YOLO et YOLO26 dépend des besoins spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir DAMO-YOLO#

DAMO-YOLO est un excellent choix pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
  • Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
  • Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.

Quand choisir YOLO26#

YOLO26 est recommandé pour :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

Conclusion#

Les deux architectures représentent des réalisations majeures dans le domaine de l’apprentissage profond. DAMO-YOLO donne un aperçu fascinant du potentiel de la recherche d’architecture neuronale et des techniques de distillation conçues pour des benchmarks matériels spécifiques.

Cependant, pour les développeurs, les chercheurs et les entreprises à la recherche d’une solution prête pour la production, Ultralytics YOLO26 est le choix supérieur. Sa conception de bout en bout sans NMS, ses gains considérables en inférence CPU, sa polyvalence multitâche et son intégration à l’écosystème Ultralytics bien maintenu en font aujourd’hui l’outil le plus robuste et le plus pratique pour relever les défis concrets de la vision par ordinateur.

Les utilisateurs qui souhaitent découvrir d’autres modèles de l’écosystème Ultralytics peuvent consulter la documentation complète de YOLO11, YOLOv8 et RT-DETR, basé sur un Transformer.

Commentaires