YOLO Vision 2026 :

YOLOv10 vs DAMO-YOLO#

Quand tu construis des pipelines de computer vision modernes, il est primordial de sélectionner la bonne architecture de détection d'objets en temps réel. Dans cette analyse technique complète, nous explorons les architectures, les métriques de performance et les cas d'usage idéaux pour YOLOv10 et DAMO-YOLO. Les deux modèles représentent des avancées significatives dans les capacités de détection d'objets, mais ils empruntent des voies architecturales différentes pour atteindre leurs objectifs.

Que ton projet nécessite un déploiement sur du matériel edge AI contraint ou exige une précision maximale sur des GPU cloud, comprendre les subtilités de ces architectures t'aidera à prendre une décision éclairée.

Exploration de YOLOv10#

Présenté par des chercheurs de l'Université de Tsinghua, YOLOv10 a révolutionné la famille YOLO en introduisant une approche nativement de bout en bout, éliminant ainsi efficacement le besoin de suppression des non-maxima (NMS) lors du post-traitement.

Détails sur YOLOv10 :

Fonctionnalités architecturales clés#

La principale innovation de YOLOv10 est sa stratégie Consistent Dual Assignments pour l'entraînement sans NMS. Les détecteurs d'objets traditionnels reposent fortement sur la NMS pour filtrer les boîtes englobantes qui se chevauchent, ce qui introduit une latence imprévisible — un goulet d'étranglement important pour les applications en temps réel telles que les autonomous vehicles et la robotique à grande vitesse. En prédisant directement une seule boîte englobante optimale par objet, YOLOv10 atteint une inférence prévisible et à ultra-faible latence.

De plus, le modèle emploie un design Holistic Efficiency-Accuracy Driven Design. L'architecture optimise divers composants, notamment une tête de classification légère et un sous-échantillonnage découplé spatial-canal, ce qui réduit considérablement la redondance de calcul. Il en résulte une architecture qui affiche un nombre de paramètres inférieur et moins de FLOPs tout en maintenant une mean Average Precision (mAP) compétitive.

Exportation rationalisée pour la production

Étant donné que YOLOv10 supprime les opérations NMS du graphe d'inférence, l'exportation du modèle vers des formats tels que ONNX ou TensorRT est grandement simplifiée, ce qui le rend exceptionnellement bien adapté aux déploiements en périphérie.

En savoir plus sur YOLOv10

Exemple d'utilisation#

YOLOv10 est profondément intégré dans l'écosystème Ultralytics, ce qui le rend incroyablement facile à utiliser via le Ultralytics Python package.

from ultralytics import YOLO

# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")

# Export the model to TensorRT format
model.export(format="engine", quantize=16)

Exploration de DAMO-YOLO#

Développé par le groupe Alibaba, DAMO-YOLO se concentre sur la découverte de structures réseau hautement efficaces grâce à la recherche automatisée d'architecture neuronale (NAS), visant à repousser la frontière de Pareto en termes de vitesse et de précision.

Détails de DAMO-YOLO :

Fonctionnalités architecturales clés#

DAMO-YOLO introduit plusieurs nouvelles technologies adaptées aux applications industrielles. La base du modèle est son backbone MAE-NAS, généré via une recherche évolutionnaire multi-objectifs. Ce processus automatisé découvre des structures de backbone qui respectent strictement des budgets computationnels prédéfinis, trouvant un équilibre fin entre précision et latence d'inférence.

De plus, l'architecture utilise un cou Efficient RepGFPN. Ce réseau de pyramide de caractéristiques est conçu pour améliorer la fusion des caractéristiques à différentes échelles, ce qui est critique pour les tâches complexes telles que l'aerial imagery analysis où les objets varient radicalement en taille. Pour compléter cela, DAMO-YOLO implémente un ZeroHead, une tête de détection minimaliste qui réduit drastiquement la complexité des couches de prédiction finales, économisant un temps de calcul précieux lors de l'inférence.

En savoir plus sur DAMO-YOLO

Comparaison des performances#

Lors de l'évaluation des architectures de détection d'objets, il est primordial de trouver le bon compromis entre la vitesse d'inférence, l'efficacité des paramètres et la précision de la détection. Le tableau ci-dessous compare les performances de YOLOv10 et DAMO-YOLO selon leurs tailles de modèles respectives.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Comme observé dans les benchmarks, YOLOv10 offre constamment des profils de latence exceptionnels sur TensorRT, en particulier dans sa variante nano, nécessitant beaucoup moins de paramètres et de FLOPs que les modèles comparables de DAMO-YOLO. Bien que DAMO-YOLO offre un mAP solide dans sa variante tiny, l'efficacité des paramètres et la latence d'inférence de la famille YOLOv10 offrent un avantage distinct pour les environnements de déploiement contraints.

Cas d'utilisation et recommandations#

Le choix entre YOLOv10 et DAMO-YOLO dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOv10#

YOLOv10 est un choix solide pour :

  • Détection temps réel sans NMS : Applications bénéficiant d'une détection de bout en bout sans NMS (Non-Maximum Suppression), ce qui réduit la complexité du déploiement.
  • Compromis vitesse-précision équilibré : Projets nécessitant un bon équilibre entre la vitesse d'inférence et la précision de détection pour différentes tailles de modèles.
  • Applications à latence constante : Les scénarios de déploiement où des temps d'inférence prévisibles sont essentiels, tels que la robotique ou les systèmes autonomes.

Quand choisir DAMO-YOLO#

DAMO-YOLO est recommandé pour :

  • Analytique vidéo à haut débit : Traitement de flux vidéo FPS élevés sur une infrastructure GPU NVIDIA fixe où le débit par lot est la mesure principale.
  • Lignes de fabrication industrielle : Scénarios avec des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
  • Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche d'architecture automatisée (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre la meilleure combinaison de performance et d'expérience développeur :

  • Déploiement en périphérie sans NMS : Applications nécessitant une inférence cohérente et à faible latence sans la complexité du post-traitement par Non-Maximum Suppression.
  • Environnements CPU uniquement : Appareils sans accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 offre un avantage décisif.
  • Détection de petits objets : Les scénarios complexes tels que l'imagerie par drone aérien ou l'analyse par capteurs IoT où ProgLoss et STAL améliorent considérablement la précision sur les minuscules objets.

L'avantage Ultralytics#

Bien que les deux modèles soient techniquement impressionnants, choisir une architecture pour la production implique de regarder au-delà des métriques brutes. Développer avec des modèles nativement pris en charge par l'Ultralytics ecosystem offre des avantages inégalés tant pour les développeurs que pour les chercheurs.

Facilité d'utilisation et écosystème bien maintenu#

Contrairement aux dépôts académiques autonomes qui font souvent l'objet d'un abandon, Ultralytics propose un écosystème robuste et activement maintenu. Configurer des environnements complexes pour des modèles reposant lourdement sur des pipelines NAS peut s'avérer décourageant. En revanche, Ultralytics fournit une API Python standardisée et intuitive ainsi qu'un CLI puissant, soutenus par une documentation étendue. Cela réduit radicalement le délai de commercialisation pour les solutions de vision sur mesure.

Efficacité de l'entraînement et exigences en mémoire#

L'entraînement de grands modèles peut rapidement devenir coûteux en calcul. Les architectures Ultralytics YOLO sont historiquement connues pour leur faible empreinte mémoire CUDA lors de l'entraînement et de l'inférence. Cette efficacité permet aux développeurs d'entraîner des modèles sur du matériel grand public ou des instances cloud économiques sans rencontrer d'erreurs de mémoire (out-of-memory) qui sont courantes lors de l'utilisation de modèles basés sur des transformers comme RT-DETR.

Suivi des expériences

Ultralytics s'intègre de manière native avec les principaux outils MLOps. Tu peux facilement suivre la progression de l'entraînement de ton modèle grâce à des intégrations avec Weights & Biases, Comet ou ClearML sans code boilerplate supplémentaire.

Polyvalence des tâches#

Une limitation importante de nombreux modèles de détection spécialisés est leur champ d'action restreint. Au sein de l'écosystème Ultralytics, tu ne te limites pas seulement à la détection d'objets. Les outils s'étendent de manière transparente à de multiples computer vision tasks, notamment l'instance segmentation, l'image classification, la pose estimation et la oriented bounding box (OBB) detection.

Regard vers l'avenir : L'évolution de YOLO26#

Alors que YOLOv10 a été pionnier de l'inférence sans NMS et que DAMO-YOLO a démontré la puissance du NAS, le domaine de la vision par ordinateur évolue rapidement. Pour les développeurs à la recherche de la solution ultime de pointe, nous te recommandons de découvrir Ultralytics YOLO26.

Lancé comme le successeur définitif de YOLO11, YOLO26 s'appuie sur la fondation sans NMS établie par YOLOv10 mais va beaucoup plus loin.

Les avancées clés de YOLO26 incluent :

  • Inférence CPU jusqu'à 43 % plus rapide : Spécifiquement optimisée pour l'edge computing et les appareils à faible consommation.
  • Suppression du DFL : La Distribution Focal Loss a été supprimée, garantissant des exports plus simples et une compatibilité améliorée avec diverses cibles de déploiement.
  • Optimiseur MuSGD : Un hybride de SGD et Muon, apportant une stabilité d'entraînement LLM avancée et une convergence plus rapide directement dans la vision par ordinateur.
  • ProgLoss + STAL: Des fonctions de perte considérablement améliorées qui offrent des améliorations notables dans la reconnaissance de petits objets, ce qui est essentiel pour des cas d'usage tels que l'agriculture et la télédétection.

En utilisant la nouvelle Ultralytics Platform repensée, les développeurs peuvent annoter, entraîner et déployer de manière transparente des modèles de nouvelle génération comme YOLO26 en quelques clics seulement, garantissant que ton pipeline de vision par ordinateur est à la fois à la pointe de la technologie et pérenne.

Commentaires