Ultralytics YOLO27 :

YOLOv9 vs EfficientDet#

Le domaine de la vision par ordinateur a connu une évolution rapide de la détection d’objets en temps réel, les chercheurs repoussant continuellement les limites de la précision et de l’efficacité. Lors de la conception de systèmes de vision robustes, sélectionner l’architecture optimale est une décision essentielle. Deux modèles très étudiés dans ce domaine sont YOLOv9, une itération avancée de la famille YOLO axée sur les informations de gradient, et EfficientDet, un framework évolutif développé par Google.

Ce guide propose une analyse technique approfondie comparant ces deux architectures, en examinant leurs mécanismes internes, leurs métriques de performance et leurs scénarios de déploiement idéaux, afin de t’aider à prendre une décision éclairée pour ton prochain projet d’IA.

Origines des modèles et spécifications techniques#

Comprendre la lignée et la philosophie de conception d’un modèle fournit un contexte précieux pour ses choix structurels et ses applications pratiques.

YOLOv9 : maximiser le flux d’informations#

Conçu pour s’attaquer au « goulot d’étranglement de l’information » du deep learning, YOLOv9 introduit de nouvelles méthodes pour garantir que les données ne soient pas perdues lors de leur passage dans des réseaux neuronaux profonds.

  • Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
  • Organisation : Institute of Information Science, Academia Sinica, Taïwan
  • Date : 21 février 2024
  • Liens : Publication ArXiv, GitHub officiel

YOLOv9 introduit les informations de gradient programmables (PGI), un framework de supervision auxiliaire qui garantit la préservation fiable des informations de gradient à travers les couches profondes. Ce mécanisme est associé au réseau généralisé d’agrégation efficace des couches (GELAN), qui optimise l’efficacité des paramètres en combinant les atouts de CSPNet et d’ELAN. Cela permet à YOLOv9 d’atteindre une précision élevée tout en conservant une empreinte légère adaptée au traitement périphérique en temps réel.

En apprends plus sur YOLOv9

EfficientDet : mise à l’échelle composée et BiFPN#

Présenté par Google Brain, EfficientDet aborde la détection d’objets en mettant systématiquement à l’échelle les dimensions du réseau afin d’équilibrer vitesse et précision.

EfficientDet s’appuie sur un backbone EfficientNet associé à un réseau pyramidal de caractéristiques bidirectionnel (BiFPN). BiFPN permet une fusion facile et rapide des caractéristiques multi-échelles. L’architecture utilise une méthode de mise à l’échelle composée qui augmente uniformément la résolution, la profondeur et la largeur de tous les réseaux du backbone, des caractéristiques et de prédiction des boîtes/classes simultanément.

Choisir le bon framework

Bien que les architectures théoriques soient importantes, l’écosystème logiciel détermine souvent la réussite d’un projet. Ultralytics fournit une expérience utilisateur simplifiée et des outils de déploiement robustes qui réduisent considérablement le délai de mise sur le marché par rapport aux bases de code complexes orientées recherche.

Comparaison des performances et des métriques#

Lors de l’analyse des performances d’un modèle, il est essentiel d’équilibrer la précision avec la latence d’inférence et le coût de calcul. Le tableau ci-dessous illustre les compromis entre différentes tailles de YOLOv9 et d’EfficientDet.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Analyse critique des métriques#

  1. Seuils de précision : YOLOv9e atteint la meilleure précision globale avec un mAP (précision moyenne) impressionnant de 55,6 %, dépassant le modèle EfficientDet-d7 le plus lourd (53,7 %) tout en conservant des vitesses TensorRT supérieures.
  2. Vitesse en temps réel : YOLOv9t ne nécessite que 2,3 ms sur un GPU T4 avec TensorRT, ce qui souligne l’efficacité de l’architecture GELAN pour les flux vidéo à haute vitesse. EfficientDet-d0 fonctionne rapidement, mais sacrifie une part importante de son mAP pour atteindre ces vitesses.
  3. Complexité computationnelle : EfficientDet augmente fortement le nombre de paramètres et les FLOPs à mesure que le facteur composé croît. La variante d7 atteint une latence de 128 ms, ce qui la rend plus de 10 fois plus lente que les modèles YOLO modernes comparables et limite fortement son utilisation dans les environnements d’inférence en temps réel.

Efficacité de l’entraînement et écosystème#

Choisir un modèle implique d’évaluer l’écosystème destiné aux développeurs. L’écosystème Ultralytics offre un avantage incomparable en matière d’efficacité de l’entraînement, de flexibilité du déploiement et de polyvalence générale.

L'avantage Ultralytics#

Les modèles pris en charge dans le cadre d'Ultralytics, notamment YOLOv9, YOLOv8 et YOLO11, bénéficient d'exigences en mémoire considérablement réduites lors de l'entraînement par rapport aux architectures basées sur des transformers ou aux architectures TensorFlow plus anciennes comme EfficientDet. Le backend robuste de PyTorch garantit une convergence rapide et une stabilité.

Exemple d’implémentation#

L’entraînement d’un modèle avancé de vision par ordinateur ne devrait pas nécessiter des centaines de lignes de code répétitif. Voici comment tu peux facilement lancer un entraînement avec le package Python Ultralytics :

from ultralytics import YOLO

# Load an official Ultralytics model (e.g., YOLO11 or YOLO26)
model = YOLO("yolo11n.pt")

# Train the model natively on a custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Cas d’utilisation idéaux et applications concrètes#

Des paradigmes structurels différents rendent ces modèles adaptés à des scénarios distincts.

Quand utiliser EfficientDet : EfficientDet reste une option viable dans les systèmes existants fortement ancrés dans l’écosystème TensorFlow, lorsque la migration vers PyTorch est irréalisable. Il est également historiquement notable dans la recherche en analyse d’images médicales, où un traitement hors ligne plus lent des numérisations haute résolution est acceptable.

Quand utiliser YOLOv9 : YOLOv9 excelle dans les environnements nécessitant d’extraire une précision maximale des couches profondes sans faire exploser le nombre de paramètres. Des applications telles que la gestion du trafic des villes intelligentes et la surveillance de foules à forte densité bénéficient grandement de la capacité de PGI à préserver l’intégrité des caractéristiques.

Préparer l’avenir : la prochaine génération de l’IA pour la vision#

Bien que YOLOv9 et EfficientDet soient puissants, les développeurs à la recherche de l’équilibre optimal entre la vitesse de l’informatique périphérique, la stabilité de l’entraînement et la simplicité du déploiement devraient se tourner vers les dernières innovations.

Sorti en janvier 2026, Ultralytics YOLO26 représente l’état de l’art actuel. Il améliore les générations précédentes, notamment YOLO11 et YOLOv8, grâce à plusieurs avancées majeures :

  • Conception de bout en bout sans NMS : YOLO26 élimine entièrement la suppression des non-maxima, un concept introduit par YOLOv10, ce qui permet un [déploiement des modèles](https://ultralytics-translation-1.invalid nettement plus rapide et plus simple.
  • Suppression de DFL : la perte focale de distribution est supprimée pour simplifier l’exportation et améliorer la compatibilité avec les appareils périphériques et basse consommation.
  • Inférence CPU jusqu’à 43 % plus rapide : parfaitement optimisée pour les appareils IoT et les environnements dépourvus de GPU dédiés.
  • Optimiseur MuSGD : un hybride révolutionnaire de SGD et de Muon, inspiré des innovations de l’entraînement des LLM, qui garantit une convergence plus rapide et des entraînements extrêmement stables.
  • ProgLoss + STAL : des fonctions de perte avancées qui améliorent considérablement la détection des petits objets, un facteur essentiel pour les images aériennes prises par drone et la robotique robuste.

En s’appuyant sur l’Ultralytics Platform complète, les équipes peuvent gérer facilement les jeux de données, suivre les expériences et déployer des modèles tels que YOLO26 sur divers écosystèmes matériels, afin de garantir que leurs pipelines de vision par ordinateur restent à la pointe et prêts pour la production.

Contributeurs

Commentaires