YOLO Vision 2026:

YOLOX vs YOLOv5#

La selezione del modello di object detection corretto è una decisione fondamentale che determina il successo di qualsiasi progetto di computer vision. Questa guida fornisce un confronto tecnico completo tra due modelli cardine nel panorama dell'IA: YOLOX di Megvii e Ultralytics YOLOv5. Analizzando le loro architetture, metriche di performance ed ecosistemi di training, miriamo ad aiutare sviluppatori e ricercatori a fare una scelta informata per i loro specifici ambienti di deployment.

Introduzione ai modelli#

Entrambi i modelli sono emersi durante un periodo di rapido avanzamento nel rilevamento di oggetti in tempo reale, tuttavia hanno adottato filosofie architettoniche diverse per raggiungere le loro prestazioni.

YOLOX: Un approccio senza anchor#

Rilasciato dai ricercatori Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun presso Megvii il 18 luglio 2021, YOLOX ha introdotto un cambiamento significativo abbandonando i tradizionali anchor boxes. Documentato nel loro report tecnico Arxiv, YOLOX ha integrato un design anchor-free con una testa disaccoppiata e la strategia di assegnazione delle etichette SimOTA. Questo design mirava a colmare il divario tra ricerca accademica e applicazione industriale, offrendo forti performance su dataset standard.

Scopri di più su YOLOX

YOLOv5: Lo standard per la Vision AI di produzione#

Autore Glenn Jocher e rilasciato da Ultralytics il 26 giugno 2020, YOLOv5 è rapidamente diventato lo standard industriale per la computer vision in produzione. Costruito nativamente sul framework PyTorch, ha democratizzato l'IA all'avanguardia offrendo una facilità d'uso senza pari, un training eccezionalmente veloce e un repository altamente rifinito. L'architettura di YOLOv5 si è concentrata su un perfetto bilanciamento di velocità, accuratezza e facilità di deployment, rendendolo un preferito per qualsiasi cosa, dai dispositivi edge ai massicci deployment cloud.

Scopri di più su YOLOv5

Differenze architettoniche#

Comprendere le differenze meccaniche fondamentali tra queste reti chiarisce perché si comportano in modo diverso in varie attività.

Senza anchor vs. Con anchor#

Il contrasto più definitorio è il meccanismo senza anchor di YOLOX. I modelli tradizionali come YOLOv5 si basano su anchor box predefiniti per prevedere i bounding box, il che richiede un'analisi di clustering sul dataset di addestramento per determinare le dimensioni ottimali degli anchor. YOLOX elimina questo aspetto, prevedendo le coordinate del bounding box direttamente in ogni posizione spaziale. Mentre l'approccio senza anchor riduce il numero di parametri di progettazione e la messa a punto euristica, l'approccio basato su anchor raffinato di YOLOv5, aiutato dalla sua funzionalità auto-anchor, garantisce una convergenza di addestramento incredibilmente stabile e prevedibile fin da subito.

Head disaccoppiata vs. Head accoppiata#

YOLOX impiega una head disaccoppiata, il che significa che le attività di classificazione e regressione sono separate in distinti rami della rete neurale. Gli autori hanno sostenuto che questo risolve i conflitti tra l'apprendimento delle caratteristiche spaziali e semantiche. Al contrario, YOLOv5 ha utilizzato una head accoppiata altamente ottimizzata (nelle sue versioni precedenti) che massimizzava l'efficienza computazionale e riduceva la latenza di inferenza, fondamentale per l'edge computing in tempo reale.

Evoluzione architettonica

Mentre YOLOX ha promosso la testa disaccoppiata nel 2021, Ultralytics ha successivamente adottato e perfezionato architetture disaccoppiate in modelli successivi come YOLOv8 e l'innovativo YOLO26, combinando il meglio di entrambi i mondi.

Strategia di assegnazione delle etichette#

YOLOX utilizza SimOTA per l'assegnazione delle etichette, che formula l'accoppiamento degli oggetti di ground truth alle previsioni come un problema di trasporto ottimale. Questa assegnazione dinamica migliora la gestione di scene affollate. YOLOv5 impiega una solida assegnazione basata su regole di forma, garantendo che campioni positivi di alta qualità vengano costantemente forniti alla funzione di perdita, il che contribuisce alla sua leggendaria stabilità di addestramento.

Prestazioni e benchmark#

Il compromesso tra velocità e precisione è il test finale per queste architetture. La tabella seguente illustra le prestazioni di varie dimensioni di modello su benchmark standard.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Mentre YOLOX raggiunge punteggi mAP competitivi, specialmente nelle sue varianti più grandi, YOLOv5 mantiene un vantaggio notevole nella velocità di inferenza TensorRT in tutti gli ambiti. Il modello YOLOv5s, ad esempio, fornisce rapporti velocità-precisione eccezionali, rendendolo altamente desiderabile per applicazioni in tempo reale dove ogni millisecondo conta.

Il vantaggio di Ultralytics: Addestramento e usabilità#

Quando si passa dalla ricerca alla produzione, l'ecosistema che circonda un modello è spesso importante quanto il modello stesso. Qui, i vantaggi dell'ecosistema Ultralytics diventano chiaramente evidenti.

Esperienza utente ottimizzata#

YOLOv5 è universalmente elogiato per la sua esperienza di sviluppo "zero-to-hero". La Python API di Ultralytics e la CLI consentono di caricare, addestrare ed eseguire il deployment dei modelli con singole righe di codice. Al contrario, eseguire YOLOX dal repository GitHub di Megvii richiede una configurazione più manuale delle variabili d'ambiente, complesse impostazioni dei percorsi Python e una curva di apprendimento più ripida tipica dei codebase di ricerca accademica.

Efficienza di addestramento e requisiti di memoria#

I modelli Ultralytics sono meticolosamente progettati per ridurre al minimo l'utilizzo di memoria durante il training. YOLOv5 richiede significativamente meno memoria CUDA rispetto ai modelli transformer pesantemente parametrizzati come RT-DETR o modelli di ricerca non ottimizzati. Ciò consente agli sviluppatori di addestrare batch size più ampi su hardware di consumo, accelerando il ciclo di sviluppo iterativo.

Versatilità tra i compiti#

Mentre YOLOX è strettamente un framework di object detection, l'ecosistema Ultralytics ha evoluto YOLOv5 per supportare molteplici attività di visione. Subito operativo, puoi eseguire Image Classification, Instance Segmentation e object detection utilizzando esattamente la stessa sintassi delle API.

Innovazione continua

Se richiedi attività ancora più avanzate come Pose Estimation o Oriented Bounding Box (OBB) detection, consigliamo vivamente di passare all'ultima architettura Ultralytics YOLO26, che supporta tutte queste nativamente con un'accuratezza all'avanguardia.

Confronto del codice#

La differenza di usabilità è dimostrata al meglio attraverso il codice.

Addestramento con YOLOv5:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

Addestramento con YOLOX: (Richiede clonazione manuale del repository, installazione setup.py e complessi argomenti CLI)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

L'approccio Ultralytics rimuove gli ostacoli, consentendoti di concentrarti sul tuo dataset e sulla logica dell'applicazione anziché sul debug dei file di configurazione. Inoltre, il tracciamento dei tuoi esperimenti è fluido grazie alle integrazioni integrate per Weights & Biases e Comet ML.

Casi d'uso ideali e applicazioni nel mondo reale#

Scegliere tra questi modelli dipende dall'ambiente operativo del tuo progetto.

Dove eccelle YOLOX#

YOLOX rimane un forte candidato in contesti accademici dove i ricercatori studiano esplicitamente paradigmi senza anchor o strategie di assegnazione delle etichette. È anche utile in scenari in cui il rilevamento di scene affollate è la metrica principale assoluta e le velocità di distribuzione edge sono secondarie.

Dove eccelle YOLOv5#

YOLOv5 è il campione indiscusso della distribuzione pratica.

  • Produzione ad alta velocità: per il rilevamento dei difetti in catena di montaggio, la minima latenza di inferenza di YOLOv5 su GPU edge assicura che i prodotti siano ispezionati senza rallentare il nastro.
  • Drone e immagini aeree: il suo ingombro di memoria efficiente gli consente di essere eseguito su computer di supporto leggeri sui droni per attività come il monitoraggio agricolo e il tracciamento della fauna selvatica.
  • Retail intelligente: dal checkout automatizzato alla gestione dell'inventario, YOLOv5 si esporta facilmente in TensorRT e ONNX per il deployment di massa su migliaia di telecamere in negozio.

Guardando al futuro: Il vantaggio di YOLO26#

Sebbene YOLOv5 sia un modello leggendario, il campo dell'IA avanza rapidamente. Se stai iniziando un nuovo progetto oggi, ti consigliamo vivamente di guardare l'ultima generazione di modelli Ultralytics.

Rilasciato nel 2026, Ultralytics YOLO26 rappresenta un enorme salto in avanti. Presenta un design End-to-End NMS-Free, rimuovendo completamente la necessità di post-elaborazione Non-Maximum Suppression, il che semplifica drasticamente la logica di deployment. Rimuovendo la Distribution Focal Loss (DFL) e utilizzando l'innovativo ottimizzatore MuSGD, YOLO26 raggiunge fino al 43% di inferenza CPU più veloce rispetto alle generazioni precedenti, pur mantenendo un'accuratezza superiore, specialmente sugli oggetti piccoli grazie alle nuove funzioni di perdita ProgLoss + STAL.

Che tu scelga l'affidabilità testata in battaglia di YOLOv5 o le performance all'avanguardia di YOLO26, la piattaforma Ultralytics ti assicura di avere i migliori strumenti disponibili per portare le tue soluzioni di computer vision dal concetto alla produzione in modo fluido. Assicurati di esplorare la completa documentazione di Ultralytics per sbloccare il pieno potenziale della tua pipeline di IA.

Commenti