Ultralytics YOLO27 :

DAMO-YOLO contre YOLO26#

Le paysage de la vision par ordinateur évolue constamment, porté par le besoin d'architectures combinant une grande précision et une inférence à faible latence. Cette comparaison examine en détail les aspects techniques de DAMO-YOLO et d'Ultralytics YOLO26, en explorant leurs innovations architecturales, leurs méthodes d'entraînement et leurs cas d'utilisation idéaux.

Que tu déploies des modèles de vision sur des appareils edge ou que tu construises des pipelines cloud à haut débit, comprendre les nuances entre ces modèles est essentiel pour prendre des décisions architecturales éclairées dans le développement moderne de l'IA.

DAMO-YOLO : recherche d'architecture neuronale à grande échelle#

DAMO-YOLO, développé par le groupe Alibaba, a été publié le 23 novembre 2022. Conçu par Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun, le modèle met fortement l'accent sur la découverte automatisée d'architectures efficaces à l'aide de la recherche d'architectures neuronales (NAS).

Tu peux consulter la recherche originale dans leur article ArXiv ou explorer le code source dans le dépôt GitHub de DAMO-YOLO.

Principales caractéristiques architecturales#

DAMO-YOLO introduit plusieurs innovations techniques conçues pour repousser les limites de la détection d'objets en temps réel :

  • Dossiers de base MAE-NAS : DAMO-YOLO utilise une recherche guidée par entropie maximale pour trouver des dossiers de base optimaux. Cette approche NAS découvre des architectures qui équilibrent strictement la précision de détection et la vitesse d'inférence sur un matériel spécifique.
  • RepGFPN efficace : une architecture de neck lourde qui améliore considérablement la fusion des caractéristiques, ce qui est particulièrement avantageux pour l'analyse de scènes complexes comme celles présentes dans les images aériennes.
  • Conception ZeroHead : une tête de détection fortement simplifiée qui réduit la complexité de calcul des dernières couches de prédiction.
  • AlignedOTA et distillation : DAMO-YOLO utilise l'affectation par transport optimal aligné (AlignedOTA) pour résoudre les ambiguïtés d'affectation des labels, associée à une stratégie robuste d'amélioration par distillation des connaissances afin d'accroître la précision de modèles étudiants plus petits à l'aide de réseaux enseignants plus grands.

L'avantage d'Ultralytics : YOLO26#

Sorti le 14 janvier 2026 par Glenn Jocher et Jing Qiu chez Ultralytics, YOLO26 représente le summum de l'IA de vision accessible et haute performance. S'appuyant sur l'héritage de YOLO11 et de YOLOv10, YOLO26 est conçu dès le départ pour le déploiement axé sur la périphérie, la polyvalence multi-tâches et une facilité d'utilisation inégalée.

Innovations de YOLO26#

Ultralytics YOLO26 introduit plusieurs fonctionnalités révolutionnaires qui en font le choix de référence pour les applications modernes de vision par ordinateur :

  • Conception de bout en bout sans NMS : YOLO26 élimine nativement le post-traitement de suppression des non-maxima (NMS). Initiée dans YOLOv10, cette approche de bout en bout simplifie considérablement les pipelines de déploiement et garantit une inférence déterministe à faible latence.
  • Jusqu'à 43 % d'inférence plus rapide sur CPU : optimisé architecturalement pour l'informatique edge, YOLO26 offre une vitesse exceptionnelle sur les appareils edge et les CPU standard, ce qui le rend idéal pour les appareils IoT alimentés par batterie.
  • Optimiseur MuSGD : inspiré de l'entraînement des LLM (comme Kimi K2 de Moonshot AI), YOLO26 intègre une combinaison de SGD et de Muon. Cela apporte à la vision par ordinateur la stabilité de l'entraînement des grands modèles de langage, pour une convergence plus rapide et plus fiable.
  • Suppression de DFL : en supprimant Distribution Focal Loss, le graphe du modèle est simplifié, ce qui permet un export fluide vers des formats tels que ONNX et TensorRT.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent sensiblement la reconnaissance des petits objets, une caractéristique essentielle pour les opérations de drones et l'agriculture.
Améliorations spécifiques aux tâches

YOLO26 inclut des améliorations spécialisées pour plusieurs modalités : un proto multi-échelle pour la segmentation d'instances, l'estimation résiduelle de log-vraisemblance (RLE) pour l'estimation de pose, ainsi qu'une fonction de perte angulaire avancée pour atténuer les problèmes de frontières lors de la détection de boîtes englobantes orientées (OBB).

Comparaison des performances#

Lors de l'évaluation de ces modèles, l'équilibre entre la précision (mAP) et l'efficacité computationnelle (vitesse/FLOPs) est primordial. Le tableau ci-dessous montre comment ces modèles se comparent à l'aide du jeu de données COCO, une référence du secteur.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Comme indiqué ci-dessus, YOLO26 offre systématiquement une meilleure précision avec beaucoup moins de paramètres et de FLOPs, ce qui donne une architecture bien plus efficace pour l'entraînement comme pour l'inférence.

Efficacité de l'entraînement et facilité d'utilisation#

Les complexités de DAMO-YOLO#

Bien que DAMO-YOLO atteigne une précision compétitive, sa méthode d'entraînement est très complexe. Le recours à la recherche d'architectures neuronales (NAS) et à une importante distillation des connaissances signifie que l'entraînement d'un modèle personnalisé nécessite souvent des ressources GPU considérables et des connaissances spécialisées. Ce processus en plusieurs étapes — entraîner un modèle enseignant massif pour distiller ses connaissances dans un modèle étudiant plus petit — peut ralentir les équipes d'ingénierie agiles qui cherchent à itérer rapidement sur des jeux de données personnalisés.

L'expérience Ultralytics simplifiée#

À l'inverse, Ultralytics YOLO26 est conçu pour être utilisable « de zéro à expert ». L'ensemble du cycle de vie de l'entraînement, de la validation et du déploiement est encapsulé derrière une API Python et une CLI propres et unifiées. En outre, YOLO26 nécessite beaucoup moins de mémoire CUDA pendant l'entraînement que les modèles basés sur des Transformer comme RT-DETR, ce qui permet aux chercheurs d'entraîner des modèles de pointe sur du matériel grand public.

Voici un exemple de la simplicité avec laquelle tu peux entraîner, évaluer et exporter un modèle YOLO26 à l'aide du SDK Ultralytics :

from ultralytics import YOLO

# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evaluate the model's performance on the validation set
metrics = model.val()

# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export the model to ONNX format for deployment
model.export(format="onnx")

Pour les équipes qui préfèrent un environnement sans code, Ultralytics Platform fournit une interface intuitive pour l'annotation des jeux de données, l'entraînement dans le cloud et le déploiement fluide.

Applications concrètes#

Le choix de l'architecture appropriée dépend largement de l'environnement de déploiement ciblé et des contraintes matérielles.

Contrôle qualité industriel#

Pour l'automatisation industrielle à grande vitesse, DAMO-YOLO peut offrir de bonnes performances sur du matériel GPU dédié. Cependant, YOLO26 est le choix privilégié pour les chaînes d'assemblage modernes. Sa conception de bout en bout sans NMS garantit une latence déterministe et sans à-coups, essentielle pour synchroniser en temps réel les données visuelles avec les actionneurs robotiques.

IA edge et appareils mobiles#

Le déploiement de la vision par ordinateur sur des appareils alimentés par batterie exige une efficacité extrême. Alors que DAMO-YOLO s'appuie sur des necks RepGFPN spécifiques, YOLO26n (Nano) est spécialement optimisé pour l'informatique edge. La suppression de DFL et son inférence CPU 43 % plus rapide en font la solution ultime pour les caméras intelligentes, les applications mobiles et les systèmes d'alarme de sécurité.

Exigences du projet multi-tâches#

Si un projet exige plus que la simple détection d'objets — par exemple analyser la mécanique des joueurs dans le sport à l'aide de l'estimation de pose, ou extraire les contours exacts des pixels grâce à la segmentation d'instances — YOLO26 offre une prise en charge native de toutes ces tâches au sein d'une base de code unique et unifiée. DAMO-YOLO se limite strictement à la détection par boîtes englobantes.

Cas d'utilisation et recommandations#

Le choix entre DAMO-YOLO et YOLO26 dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir DAMO-YOLO#

DAMO-YOLO est un choix solide pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est la métrique principale.
  • Lignes de fabrication industrielles : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
  • Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche automatisée d'architecture (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.

Quand choisir YOLO26#

YOLO26 est recommandé pour :

  • Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.

Conclusion#

Les deux architectures représentent des avancées majeures dans le domaine de l'apprentissage profond. DAMO-YOLO offre un aperçu fascinant de la puissance de la recherche d'architectures neuronales et des techniques de distillation adaptées à des références matérielles spécifiques.

Cependant, pour les développeurs, les chercheurs et les entreprises à la recherche d'une solution prête pour la production, Ultralytics YOLO26 s'impose comme le choix supérieur. Sa combinaison d'une conception de bout en bout sans NMS, de gains massifs d'inférence sur processeur, de sa polyvalence multi-tâches et de son intégration dans l'écosystème bien entretenu d'Ultralytics en fait l'outil le plus robuste et le plus pratique pour résoudre les défis de vision par ordinateur du monde réel aujourd'hui.

Pour les utilisateurs souhaitant explorer d'autres modèles de l'écosystème Ultralytics, une documentation complète est disponible pour YOLO11, YOLOv8 et le modèle basé sur un Transformer RT-DETR.

Commentaires