YOLOX vs YOLOv9#
Il panorama della computer vision è stato plasmato da continue innovazioni architetturali, che bilanciano l’efficienza computazionale e l’elevata precisione. Nel confronto tra modelli di rilevamento degli oggetti in tempo reale, YOLOX di Megvii e YOLOv9 dell’Academia Sinica rappresentano due filosofie distinte di sviluppo del deep learning. Il primo ha introdotto un paradigma semplificato senza anchor, mentre il secondo ha introdotto tecniche avanzate di instradamento dei gradienti per massimizzare la conservazione delle informazioni.
Questa guida tecnica analizza le differenze architetturali, i benchmark prestazionali e i casi d’uso ideali di entrambi i modelli, mostrando inoltre come soluzioni moderne come la Ultralytics Platform e il modello YOLO26, rilasciato di recente, offrano alternative superiori per distribuzioni pronte per la produzione.
YOLOX: pioniere del paradigma senza anchor#
Rilasciato a metà del 2021, YOLOX ha rappresentato un importante passo avanti nel colmare il divario tra ricerca accademica e applicazioni industriali. Eliminando la necessità di riquadri di anchor predefiniti, ha semplificato drasticamente le regolazioni euristiche richieste dai dataset personalizzati.
- Autori: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun
- Organizzazione: Megvii
- Data di rilascio: 18 luglio 2021
- Riferimento: Articolo su Arxiv
- Codice sorgente: Repository GitHub di YOLOX
- Documentazione: Documentazione ufficiale di YOLOX
Innovazioni architetturali#
YOLOX ha introdotto diverse modifiche importanti alla pipeline standard di rilevamento. Ha implementato una testa disaccoppiata, separando le attività di classificazione e regressione e riducendo sensibilmente il conflitto tra l’identificazione di un oggetto e l’individuazione dei suoi contorni. Inoltre, YOLOX ha adottato SimOTA, una strategia avanzata di assegnazione delle etichette che assegnava dinamicamente i campioni positivi durante l’addestramento, ottenendo una convergenza più rapida e prestazioni complessive migliori sui dataset di benchmark standard.
Punti di forza e limiti#
Il principale punto di forza di YOLOX è il design semplificato. Il meccanismo senza anchor permette agli sviluppatori di dedicare meno tempo agli algoritmi di clustering per trovare le dimensioni ottimali degli anchor per i propri dati. Tuttavia, essendo un’architettura meno recente, progettata senza i progressi più recenti nell’attenzione selettiva o nei percorsi dei gradienti, fatica a eguagliare l’efficienza parametrica delle reti più nuove. Inoltre, non supporta nativamente task avanzati come la segmentazione di istanze e la stima della posa in un’API unificata.
YOLOv9: massimizzare le informazioni sui gradienti#
Nel 2024, YOLOv9 ha introdotto un approccio fortemente teorico per risolvere il problema del collo di bottiglia informativo insito nelle reti neurali convoluzionali profonde.
- Autori: Chien-Yao Wang e Hong-Yuan Mark Liao
- Organizzazione: Institute of Information Science, Academia Sinica
- Data di rilascio: 21 febbraio 2024
- Riferimento: Articolo su Arxiv
- Codice sorgente: Repository GitHub di YOLOv9
- Documentazione: Documentazione Ultralytics di YOLOv9
Innovazioni architetturali#
La caratteristica distintiva di YOLOv9 è l’informazione programmabile dei gradienti (PGI), che garantisce che i dati semantici essenziali non vadano persi attraversando i numerosi layer della rete. In combinazione con la rete di aggregazione dei layer efficiente generalizzata (GELAN), YOLOv9 raggiunge un rapporto tra numero di parametri e accuratezza eccezionale. Il modello riesce così a mantenere gradienti accurati per l’aggiornamento dei pesi, risultando molto efficace anche nelle varianti leggere.
Punti di forza e limiti#
YOLOv9 eccelle nel superare i limiti teorici dell’accuratezza del modello. Ottiene ottimi punteggi mAP su COCO e per questo è molto apprezzato dai ricercatori. Tuttavia, nonostante la sua efficienza, YOLOv9 si basa ancora sulla soppressione dei non massimi (NMS) tradizionale per il post-processing, che causa picchi di latenza durante l’inferenza. Per gli ingegneri che si occupano di distribuire l’AI sui dispositivi edge, gestire la logica NMS aggiunge complessità non necessaria alla pipeline di distribuzione.
I modelli tradizionali come YOLOX e YOLOv9 richiedono la soppressione dei non massimi (NMS) per filtrare i riquadri di delimitazione duplicati. Questo passaggio è intrinsecamente sequenziale e spesso crea un collo di bottiglia sulle CPU, evidenziando la necessità delle architetture end-to-end native dei più recenti modelli Ultralytics.
Confronto delle prestazioni#
Confrontando le metriche computazionali grezze di queste architetture, è chiaro che YOLOv9 offre una baseline più moderna, mentre YOLOX resta un’opzione leggera per i sistemi legacy. Di seguito trovi un’analisi dettagliata dei modelli standard.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
YOLOv9 dimostra un’accuratezza superiore a parità di numero di parametri, ma gli sviluppatori che cercano il miglior equilibrio tra velocità, accuratezza e facilità d’uso dovrebbero valutare le ultime innovazioni di Ultralytics.
I vantaggi di Ultralytics: ecco YOLO26#
Sebbene valutare modelli storici come YOLOX e YOLOv9 offra un contesto utile, lo stato dell’arte attuale è rappresentato da Ultralytics YOLO26. Rilasciato all’inizio del 2026, YOLO26 riprogetta radicalmente la pipeline di rilevamento per i moderni ambienti aziendali.
Innovazioni architetturali senza pari#
YOLO26 risolve i colli di bottiglia del post-processing dei modelli precedenti con un’architettura end-to-end opzionale senza NMS (nms=False), che semplifica la distribuzione su qualsiasi hardware. Inoltre, eliminando la Distribution Focal Loss (DFL) e integrando il nuovo ottimizzatore MuSGD, una combinazione di Stochastic Gradient Descent e Muon, YOLO26 raggiunge una stabilità di addestramento senza precedenti.
Per gli sviluppatori che distribuiscono i modelli in ambienti con risorse limitate come Raspberry Pi, YOLO26 offre un’inferenza su CPU fino al 43% più veloce. Introduce anche ProgLoss + STAL (loss progressiva e assegnazione delle etichette consapevole degli oggetti piccoli), ottenendo miglioramenti significativi nel riconoscimento degli oggetti piccoli, fondamentale per le immagini aeree e l’analisi dei dati acquisiti dai droni.
Ecosistema di sviluppo semplificato#
A differenza dei repository di ricerca autonomi, l’ecosistema Ultralytics offre un’esperienza di sviluppo senza pari. Utilizzando la Ultralytics Python API, gli ingegneri possono ridurre drasticamente il codice ripetitivo. Inoltre, i requisiti di memoria sono altamente ottimizzati: puoi addestrare modelli robusti utilizzando meno memoria VRAM della GPU rispetto alle architetture che fanno ampio uso dell’attenzione.
from ultralytics import YOLO
# Carica il modello YOLO26 small altamente ottimizzato e senza NMS
model = YOLO("yolo26s.pt")
# Addestra un modello su un dataset personalizzato con un ingombro minimo in memoria
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Esporta facilmente in formati ottimizzati per la distribuzione
model.export(format="engine", quantize=16) # Esporta in TensorRTOltre al rilevamento, YOLO26 supporta senza problemi numerosi task all’interno dello stesso framework. Che ti servano riquadri di delimitazione orientati (OBB) precisi per le immagini satellitari o maschere pixel dettagliate per le applicazioni di diagnostica per immagini, il flusso di lavoro resta identico. Per i team che utilizzano flussi di lavoro della generazione precedente, è disponibile e pienamente supportato anche Ultralytics YOLO11.
Casi d'uso ideali e strategie di distribuzione#
La scelta dell’architettura giusta dipende interamente dall’ambiente di distribuzione e dai requisiti del tuo progetto.
Edge computing e robotica#
Sui dispositivi a basso consumo, l’utilizzo di modelli che richiedono un post-processing impegnativo può compromettere le prestazioni. YOLOX-Nano è estremamente piccolo, ma spesso la sua accuratezza è insufficiente per i task critici per la sicurezza. In questo caso, YOLO26 è la scelta ideale: la sua testa senza DFL e l’inferenza opzionale senza NMS gli consentono di funzionare senza problemi usando direttamente i thread della CPU, rendendolo perfetto per la robotica autonoma o la gestione intelligente dei parcheggi.
Benchmark accademici#
Se l’unico obiettivo è analizzare il flusso dei gradienti e studiare i colli di bottiglia delle reti profonde, YOLOv9 resta un eccellente caso di studio. Il suo framework PGI offre spunti interessanti su come le caratteristiche vengono preservate nei layer delle reti neurali profonde, rendendolo uno strumento prezioso per i ricercatori universitari che studiano la teoria delle reti convoluzionali.
Analisi video aziendale#
Per le attività di elaborazione video su larga scala, come i sistemi di allarme di sicurezza o il monitoraggio del traffico, velocità e flessibilità di esportazione sono essenziali. Gli strumenti di esportazione nativi del framework Ultralytics consentono ai team di compilare YOLO26 direttamente in TensorRT o OpenVINO con un solo comando, riducendo drasticamente il time-to-market.
Sfruttando le funzionalità complete dell’ecosistema Ultralytics, i team di machine learning possono evitare le complessità dei codebase di ricerca originali e concentrarsi direttamente sulla creazione di applicazioni AI scalabili e concrete.