YOLO26 et YOLOv5#
L'évolution de la vision par ordinateur a été marquée par une quête incessante de vitesse, de précision et d'accessibilité. Le choix de la bonne architecture est essentiel à la réussite de tout projet d'IA. Dans ce guide complet, nous comparons deux versions marquantes d'Ultralytics : le YOLOv5, précurseur, et le YOLO26, révolutionnaire. Bien que les deux modèles aient fortement influencé le domaine de la détection d'objets en temps réel, leurs technologies sous-jacentes reflètent un changement de paradigme majeur dans la façon dont les réseaux neuronaux traitent les données visuelles.
Présentation du modèle#
Avant d’examiner les détails architecturaux, posons les bases en présentant les informations essentielles sur les deux modèles.
Détails de YOLO26 :
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2026-01-14
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : Documentation YOLO26
Détails sur YOLOv5 :
- Auteurs : Glenn Jocher
- Organisation : Ultralytics
- Date : 2020-06-26
- GitHub : https://github.com/ultralytics/yolov5
- Docs : Documentation de YOLOv5
Innovations architecturales#
Les six années qui séparent YOLOv5 de YOLO26 correspondent à un bond immense dans la recherche en apprentissage profond. YOLOv5 a popularisé l’utilisation généralisée de PyTorch pour les modèles de vision, avec un mécanisme de détection par ancres très optimisé, devenu la norme du secteur. Toutefois, il dépendait fortement de la suppression non maximale (NMS) lors du post-traitement, ce qui pouvait entraîner des goulots d’étranglement au niveau de la latence sur les appareils aux ressources limitées.
YOLO26 repense entièrement le pipeline d’inférence avec une conception de bout en bout sans NMS. Sa tête facultative un-à-un (nms=False) supprime la nécessité du post-traitement NMS, pour un déploiement plus rapide et une logique beaucoup plus simple. Ce concept a été introduit dans YOLOv10, puis perfectionné ici. De plus, YOLO26 propose la suppression de DFL (perte focale de distribution), ce qui simplifie considérablement la tête de sortie. L’exportation du modèle vers des formats comme ONNX et TensorRT devient ainsi très simple, avec une excellente compatibilité garantie pour les appareils périphériques et basse consommation.
Lors de l’entraînement, YOLO26 utilise l’optimiseur MuSGD de pointe, un hybride de SGD et de Muon inspiré par Kimi K2 de Moonshot AI. Il transpose les innovations de l’entraînement des LLM dans le domaine de la vision par ordinateur, garantissant un entraînement très stable et une convergence nettement plus rapide qu’avec les optimiseurs SGD ou AdamW traditionnels utilisés dans YOLOv5.
Performances et métriques#
Lors de l’évaluation des modèles, l’équilibre entre la précision moyenne (mAP) et la vitesse d’inférence détermine leur viabilité en conditions réelles. YOLO26 est optimisé nativement pour les GPU haut de gamme comme pour les CPU périphériques.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Les benchmarks révèlent une amélioration spectaculaire. Par exemple, YOLO26n atteint une mAP de 40,9, contre 28,0 pour YOLOv5n, et YOLO26 offre jusqu’à 43 % d’inférence CPU plus rapide que YOLO11n. YOLO26 est donc nettement supérieur pour les déploiements embarqués, comme sur Raspberry Pi ou les appareils mobiles. YOLOv5 garde une légère avance en vitesse GPU TensorRT sur les modèles Nano, mais le compromis en matière de précision favorise largement YOLO26.
Écosystème d’entraînement et facilité d’utilisation#
Les deux modèles tirent pleinement parti de l’écosystème Ultralytics, bien entretenu. Ils offrent une expérience « de zéro à expert » grâce à une API Python simplifiée, une documentation complète et le soutien d’une communauté active. Toutefois, YOLO26 porte l’efficacité de l’entraînement à un niveau supérieur.
Pendant l’entraînement, les modèles Ultralytics nécessitent systématiquement beaucoup moins de mémoire CUDA que les solutions reposant massivement sur les Transformer. YOLO26 renforce cet avantage avec ses fonctions de perte ProgLoss + STAL. Ces avancées améliorent sensiblement la reconnaissance des petits objets sans augmenter l’empreinte mémoire.
from ultralytics import YOLO
# Initialise le modèle YOLO26 Nano de pointe
model = YOLO("yolo26n.pt")
# Entraîne le modèle (optimizer='auto' sélectionne MuSGD pour les entraînements plus longs)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Lance une inférence rapide sans NMS sur une image de test
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
predictions[0].show()Ce script simple permet aux développeurs d’itérer rapidement sur des jeux de données personnalisés, en passant aisément de l’ingestion des données à un modèle prêt pour la production.
Avec la plateforme Ultralytics, tu peux exporter automatiquement tes modèles YOLO26 entraînés vers des formats comme CoreML ou LiteRT, sans écrire une seule ligne de code de conversion.
Polyvalence et cas d’utilisation idéaux#
Quand utiliser YOLOv5#
YOLOv5 reste une valeur sûre pour les systèmes hérités. Si tu disposes d’un pipeline industriel existant étroitement lié à des sorties basées sur des ancres, ou si tu exécutes l’inférence sur d’anciens appareils NVIDIA Jetson dotés de piles TensorRT éprouvées et figées, YOLOv5 constitue une solution stable et très bien documentée.
Quand utiliser YOLO26#
YOLO26 est le choix de référence pour les projets modernes de vision par ordinateur. Sa polyvalence dépasse largement celle de son prédécesseur. Alors que YOLOv5 se concentre principalement sur la détection (avec l’ajout ultérieur de la segmentation), YOLO26 prend nativement en charge la segmentation d’instances, l’estimation de pose, la classification d’images et les boîtes englobantes orientées (OBB).
YOLO26 apporte des améliorations propres à chaque tâche, notamment une fonction de perte spécialisée pour la segmentation sémantique, l’estimation résiduelle de log-vraisemblance (RLE) pour des points clés de pose d’une très grande précision et une fonction de perte angulaire avancée pour les OBB, afin de résoudre les problèmes complexes liés aux frontières.
- IoT périphérique et robotique : l’inférence facultative sans NMS et jusqu’à 43 % de vitesse d’inférence CPU en plus par rapport à YOLO11n font de YOLO26 un modèle idéal pour la navigation robotique en temps réel et les caméras domestiques intelligentes.
- Imagerie aérienne : les améliorations ProgLoss + STAL rendent bien plus fiable la détection de minuscules objets depuis des drones, comme les véhicules dans les parkings ou les cultures dans les champs.
- Analyse vidéo en temps réel : qu’il s’agisse de suivre des athlètes lors de retransmissions sportives ou de surveiller la circulation, l’équilibre des performances de YOLO26 garantit un rappel élevé sans perdre d’images.
En définitive, l’engagement d’Ultralytics en faveur d’un écosystème accessible et performant permet de passer facilement de YOLOv5 à YOLO26 et donne aux chercheurs comme aux développeurs accès à des capacités de pointe.