YOLOv9 vs YOLO26#
Il panorama del rilevamento di oggetti in tempo reale si è evoluto notevolmente negli ultimi anni. Poiché chi lavora nel machine learning cerca di distribuire modelli su hardware diversi, scegliere l'architettura giusta è fondamentale. In questa guida tecnica completa confrontiamo due importanti traguardi nel campo della computer vision: YOLOv9, presentato all'inizio del 2024 con particolare attenzione alle ottimizzazioni dei percorsi del gradiente, e Ultralytics YOLO26, il framework all'avanguardia più recente, rilasciato all'inizio del 2026, che ridefinisce completamente l'inferenza edge e la stabilità dell'addestramento.
Riepilogo esecutivo: lignaggio e autori dei modelli#
Comprendere le origini di questi modelli di deep learning fornisce un contesto prezioso per capire le scelte architetturali e i destinatari a cui si rivolgono.
YOLOv9#
YOLOv9, realizzato da Chien-Yao Wang e Hong-Yuan Mark Liao dell'Institute of Information Science presso Academia Sinica a Taiwan, è stato rilasciato il 21 febbraio 2024. Il modello si concentra in particolare sui concetti teorici del deep learning, affrontando nello specifico il problema del collo di bottiglia informativo nelle reti neurali convoluzionali profonde (CNNs).
Ultralytics YOLO26#
YOLO26, realizzato da Glenn Jocher e Jing Qiu presso Ultralytics, è stato rilasciato il 14 gennaio 2026. Sulla scia del grande successo dei predecessori, come YOLO11 e YOLOv8, YOLO26 è stato progettato da zero per privilegiare la preparazione alla produzione, la distribuzione edge e l'efficienza end-to-end nativa.
Vuoi aggiornare la tua pipeline di computer vision? Puoi addestrare e distribuire facilmente modelli YOLO26 nel cloud senza scrivere codice, utilizzando la Ultralytics Platform.
Innovazioni architetturali#
Entrambi i modelli introducono cambiamenti rivoluzionari nel modo in cui le reti neurali elaborano i dati visivi, ma affrontano il problema da prospettive diverse.
Informazioni programmabili sul gradiente in YOLOv9#
Il principale contributo di YOLOv9 al settore è l'introduzione delle Informazioni programmabili sul gradiente (PGI) e della Rete generalizzata efficiente di aggregazione dei livelli (GELAN). Man mano che le reti neurali diventano più profonde, spesso perdono informazioni durante il processo feed-forward. PGI garantisce che i gradienti utilizzati per aggiornare i pesi durante la retropropagazione rimangano accurati e affidabili, consentendo all'architettura GELAN di raggiungere un'elevata accuratezza con meno parametri.
YOLOv9, tuttavia, si affida molto alla tradizionale soppressione dei non massimi (NMS) per la post-elaborazione, che può diventare un collo di bottiglia in termini di latenza durante l'inferenza nel mondo reale.
L'architettura edge-first di YOLO26#
YOLO26 adotta un approccio radicalmente diverso, ottimizzando l'intera pipeline, dall'addestramento alla distribuzione in tempo reale. Si basa sul design end-to-end senza NMS introdotto per la prima volta in YOLOv10, eliminando del tutto la necessità della post-elaborazione NMS. Il risultato è una latenza estremamente bassa, che lo rende altamente ottimizzato per dispositivi edge come Raspberry Pi o NVIDIA Jetson.
Inoltre, YOLO26 elimina completamente la Distribution Focal Loss (DFL). Questa modifica strutturale semplifica l'esportazione in ONNX e garantisce una compatibilità nettamente migliore con i dispositivi edge a basso consumo.
Per la fase di addestramento, YOLO26 integra il nuovo ottimizzatore MuSGD, una soluzione ibrida che combina la discesa stocastica del gradiente e Muon (ispirata alle metodologie di addestramento degli LLM usate da Kimi K2 di Moonshot AI). In questo modo, le innovazioni dell'addestramento dei Large Language Model (LLM) vengono applicate alla computer vision, garantendo un addestramento molto più stabile e tempi di convergenza più rapidi.
Confronto delle prestazioni e delle metriche#
Nei benchmark sul diffuso dataset COCO, entrambi i modelli dimostrano capacità eccezionali, ma l'ecosistema Ultralytics si distingue per le velocità di inferenza pratiche e l'efficienza dei parametri.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Analisi dei risultati#
- Velocità ed efficienza: grazie all'architettura senza NMS e alle funzioni di perdita semplificate, YOLO26 offre un'inferenza su CPU fino al 43% più veloce rispetto alle architetture precedenti. YOLO26n impiega appena 1,7 ms su una GPU NVIDIA T4 con TensorRT, diventando così la scelta ideale per i flussi video in tempo reale.
- Accuratezza: YOLO26x raggiunge un valore mAP di 57,5 senza precedenti, superando il modello YOLOv9e più grande e mantenendo una latenza inferiore.
- Requisiti di memoria: i modelli Ultralytics sono noti per la loro efficienza. Rispetto ai complessi modelli di visione basati su Transformer, YOLO26 richiede molta meno memoria CUDA durante l'addestramento del modello e l'inferenza, consentendo agli sviluppatori di usare batch più grandi su hardware consumer.
Ecosistema, facilità d'uso e versatilità#
Il vero punto di forza dell'ecosistema Ultralytics è l'esperienza utente. Mentre chi fa ricerca e utilizza la base di codice GitHub di YOLOv9 deve gestire configurazioni complesse degli ambienti e script manuali, YOLO26 è integrato nell'intuitiva API Python di Ultralytics.
Esempio di API semplificata#
Per addestrare un modello YOLO26 all'avanguardia bastano poche righe di codice Python:
from ultralytics import YOLO
# Carica l'ultimo modello YOLO26 end-to-end nativo
model = YOLO("yolo26s.pt")
# Addestra il modello; optimizer="auto" seleziona MuSGD per le esecuzioni più lunghe (>10k iterazioni)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Esporta nativamente in formato ONNX con un solo comando
model.export(format="onnx")Versatilità multitasking senza pari#
A differenza di YOLOv9, progettato principalmente per il rilevamento di oggetti standard, YOLO26 supporta nativamente un'ampia gamma di attività di computer vision, senza necessità di configurazioni aggiuntive. L'architettura include miglioramenti specifici per diverse applicazioni:
- Segmentazione di istanze: include una funzione di perdita specializzata per la segmentazione semantica e prototipi multiscala per creare maschere impeccabili a livello di pixel.
- Stima della posa: integra la stima della log-verosimiglianza residua (RLE) per tracciare i punti chiave dello scheletro con estrema precisione.
- Box di delimitazione orientati (OBB): include una funzione di perdita angolare specializzata, progettata per risolvere i problemi ai bordi nel rilevamento di oggetti ruotati nelle immagini aeree.
- Classificazione delle immagini: categorizzazione affidabile di immagini intere secondo gli standard ImageNet.
Tutti i modelli YOLO26 beneficiano dell'integrazione perfetta con la Ultralytics Platform, che offre etichettatura dei dataset, apprendimento attivo e pipeline di distribuzione immediate.
Applicazioni nel mondo reale#
La scelta tra questi modelli dipende spesso dall'ambiente in cui verranno distribuiti.
IoT e robotica edge#
Per la robotica, i droni autonomi e i dispositivi IoT per la casa intelligente, YOLO26 è il campione indiscusso. L'integrazione di ProgLoss + STAL apporta miglioramenti significativi al riconoscimento degli oggetti di piccole dimensioni, fondamentale per il monitoraggio agricolo effettuato da droni ad alta quota. Con un'inferenza su CPU più veloce del 43% e un design senza NMS, YOLO26 può funzionare in modo fluido su hardware privo di GPU dedicate.
Ricerca accademica e analisi del gradiente#
YOLOv9 rimane un modello molto apprezzato negli ambienti accademici. Chi studia i limiti teorici del flusso del gradiente o vuole creare livelli PyTorch personalizzati basati sul concetto PGI troverà nella base di codice di YOLOv9 un'ottima base per esplorare la teoria del deep learning.
Pipeline di produzione ad alta velocità#
In contesti industriali, ad esempio per il rilevamento dei difetti automatizzato su nastri trasportatori ad alta velocità, le prestazioni di TensorRT dei modelli YOLO26 garantiscono che non venga perso alcun fotogramma, massimizzando la produttività dei sistemi di controllo qualità.
Casi d'uso e consigli#
La scelta tra YOLOv9 e YOLO26 dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle tue preferenze in fatto di ecosistemi.
Quando scegliere YOLOv9#
YOLOv9 è una scelta valida per:
- Ricerca sui colli di bottiglia informativi: progetti accademici che studiano le informazioni di gradiente programmabili (PGI) e le architetture di rete di aggregazione efficiente generalizzata dei livelli (GELAN).
- Studi sull'ottimizzazione del flusso del gradiente: ricerche incentrate sulla comprensione e sulla riduzione della perdita di informazioni nei livelli delle reti profonde durante l'addestramento.
- Benchmark di rilevamento ad alta precisione: scenari in cui le prestazioni di YOLOv9 nei benchmark COCO servono come riferimento per confrontare le architetture.
Quando scegliere YOLO26#
YOLO26 è consigliato per:
- Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
- Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
- Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.
Conclusione#
Entrambi i modelli rappresentano enormi progressi per la comunità open source. YOLOv9 ha introdotto importanti miglioramenti teorici al flusso del gradiente, che ispireranno le architetture per gli anni a venire. Tuttavia, per sviluppatori, startup e team aziendali di oggi che cercano il perfetto equilibrio tra velocità, accuratezza e facilità di distribuzione, Ultralytics YOLO26 è la scelta consigliata.
Grazie all'inferenza senza NMS, al potente ottimizzatore MuSGD e a una suite di strumenti senza pari per attività di rilevamento, segmentazione e stima della posa, YOLO26 garantisce che i tuoi progetti di computer vision si basino sul framework più affidabile e pronto per il futuro oggi disponibile.