Ultralytics YOLO27:
Get Started

YOLOX vs YOLO11#

L'evoluzione della visione artificiale è stata trainata soprattutto dalla ricerca di framework per il rilevamento degli oggetti in tempo reale capaci di bilanciare alta accuratezza e velocità di inferenza. Tra le tappe più significative di questo percorso figurano YOLOX e Ultralytics YOLO11. Sebbene entrambi i modelli abbiano contribuito in modo significativo al settore, le rispettive architetture, filosofie progettuali ed ecosistemi per gli sviluppatori sono molto diversi.

Questo confronto tecnico approfondito analizza le architetture, le metriche di prestazione, le metodologie di addestramento e gli scenari di implementazione ideali, per aiutarti a prendere una decisione consapevole per il tuo prossimo progetto di intelligenza artificiale.

Panoramica di YOLOX#

Presentato il 18 luglio 2021 dai ricercatori Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun di Megvii, YOLOX ha segnato un cambiamento importante nella serie YOLO. Ha colmato con successo il divario tra ricerca accademica e applicazioni industriali introducendo un design senza anchor.

Per ulteriori informazioni tecniche, puoi consultare l'articolo originale di YOLOX su arXiv.

Caratteristiche architetturali principali#

YOLOX si è discostato dal rilevamento tradizionale basato su anchor adottando una head disaccoppiata e un meccanismo senza anchor. Questo design ha ridotto il numero di parametri di progettazione e migliorato le prestazioni del modello su diversi benchmark. Ha inoltre introdotto strategie avanzate di assegnazione delle etichette, come SimOTA, per accelerare l'addestramento e migliorare la convergenza.

Per la sua epoca, YOLOX offre un'ottima accuratezza, ma si concentra principalmente sul rilevamento degli oggetti tramite box di delimitazione e non supporta nativamente altre attività complesse di visione artificiale.

Scopri di più su YOLOX

Design senza anchor

Eliminando gli anchor box predefiniti, YOLOX ha ridotto drasticamente la regolazione euristica necessaria per i diversi dataset, diventando un valido riferimento per la ricerca sulle metodologie senza anchor.

Panoramica di Ultralytics YOLO11#

Rilasciato il 27 settembre 2024 da Glenn Jocher e Jing Qiu di Ultralytics, YOLO11 è un modello all'avanguardia che ridefinisce versatilità e semplicità d'uso nella visione artificiale. Basato su anni di ricerca fondamentale, offre una soluzione perfezionata e pronta per la produzione, che eccelle in numerose attività.

I vantaggi di Ultralytics#

YOLO11 non è solo un rilevatore di oggetti: è un framework unificato che supporta la segmentazione di istanze, la classificazione di immagini, la stima della posa e il rilevamento di box di delimitazione orientati (OBB). La sua architettura altamente efficiente punta a un equilibrio ottimale tra velocità, numero di parametri e accuratezza.

Inoltre, YOLO11 è completamente integrato nella piattaforma Ultralytics, che offre un ecosistema semplificato per l'annotazione dei dati, l'addestramento dei modelli e la loro implementazione.

Confronto delle prestazioni e delle metriche#

Confrontando questi modelli, emerge chiaramente l'equilibrio delle prestazioni. YOLO11 raggiunge una precisione media (mAP) superiore con un numero di parametri e FLOP notevolmente inferiore nella maggior parte delle categorie dimensionali rispetto ai corrispondenti modelli YOLOX.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Come dimostrato, i modelli YOLO11 superano costantemente YOLOX in accuratezza pur avendo un numero di parametri inferiore. Per esempio, YOLO11m raggiunge un valore di 51.5 mAP con soli 20.1M parametri, mentre YOLOXx ottiene un valore simile, pari a 51.1 mAP, ma richiede ben 99.1M parametri. Questa efficienza in termini di memoria durante l'addestramento e l'inferenza rende YOLO11 particolarmente adatto all'implementazione su dispositivi edge di IA, evitando gli elevati requisiti di memoria CUDA tipici dei modelli più vecchi o basati su Transformer, come RT-DETR.

Addestramento efficiente

Durante l'addestramento, i modelli Ultralytics richiedono molta meno memoria GPU rispetto a YOLOX e alle architetture basate su Transformer, consentendo ai ricercatori di addestrare modelli potenti su hardware consumer standard.

Ecosistema e facilità d’uso#

Una delle differenze più evidenti tra i due framework riguarda l'esperienza degli sviluppatori.

Spesso YOLOX richiede di clonare repository, configurare ambienti complessi e usare argomenti dettagliati da riga di comando per addestrare ed esportare modelli in formati come ONNX o TensorRT.

Al contrario, Ultralytics YOLO11 offre un'API Python e una CLI estremamente semplici. La libreria Ultralytics gestisce automaticamente l'aumento dei dati, l'ottimizzazione degli iperparametri e l'esportazione.

from ultralytics import YOLO

# Carica un modello YOLO11 preaddestrato
model = YOLO("yolo11n.pt")

# Addestra facilmente il modello sui tuoi dati personalizzati
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta il modello addestrato in TensorRT per un'implementazione ottimizzata
model.export(format="engine")

Questo ecosistema ben mantenuto è supportato da una documentazione completa e dall'integrazione perfetta con strumenti come Weights & Biases per il monitoraggio degli esperimenti.

Casi d'uso ideali#

La scelta tra questi modelli dipende spesso dalle caratteristiche specifiche dell'ambiente di implementazione.

Quando usare YOLOX#

  • Sistemi legacy: se hai una pipeline consolidata, sviluppata esplicitamente sulla codebase originale di YOLOX o sui paradigmi di rilevamento degli oggetti dei primi anni 2021.
  • Riferimenti accademici: quando svolgi ricerche che richiedono un confronto diretto con le architetture senza anchor fondamentali dell'era 2021.

Quando usare YOLO11#

  • Implementazioni in produzione: per applicazioni commerciali nella vendita al dettaglio intelligente o nei sistemi di allarme di sicurezza, dove codice affidabile e mantenuto e alta accuratezza sono requisiti imprescindibili.
  • Pipeline multi-attività: quando un progetto richiede di tracciare gli oggetti, stimare le pose umane e segmentare le istanze con un unico framework unificato.
  • Dispositivi edge con risorse limitate: grazie al numero ridotto di parametri e all'elevato throughput, YOLO11 è ideale per l'implementazione su Raspberry Pi o nodi edge mobili tramite CoreML e NCNN.

Uno sguardo al futuro: i vantaggi di YOLO26#

Sebbene YOLO11 rappresenti un enorme passo avanti rispetto a YOLOX, il settore della computer vision avanza rapidamente. Per gli sviluppatori che iniziano oggi nuovi progetti, Ultralytics YOLO26 è la scelta consigliata per eccellenza.

Rilasciato a gennaio 2026, YOLO26 riprende l’eccellenza architetturale di YOLO11 e introduce diverse funzionalità innovative:

  • Architettura end-to-end senza NMS: la testa opzionale one-to-one di YOLO26 (nms=False) elimina la soppressione dei non massimi (NMS) nel post-processing, per pipeline di distribuzione più rapide e semplici (un concetto esplorato per la prima volta in YOLOv10).
  • Inferenza su CPU fino al 43% più veloce: eliminando la Distribution Focal Loss (DFL), YOLO26 è molto più efficiente sulle CPU e sui dispositivi edge a basso consumo.
  • Ottimizzatore MuSGD: ispirato alle innovazioni nell’addestramento degli LLM di Moonshot AI, l’ottimizzatore MuSGD garantisce sessioni di addestramento molto stabili e una convergenza rapida.
  • Funzioni di loss avanzate: utilizzando ProgLoss + STAL, YOLO26 migliora notevolmente il riconoscimento degli oggetti piccoli, una funzionalità fondamentale per le immagini acquisite da droni e la robotica autonoma.

Per la stragrande maggioranza dei moderni task di computer vision, aggiornare la tua pipeline per sfruttare YOLO26 ti offrirà il miglior equilibrio possibile tra velocità, accuratezza e semplicità di distribuzione.

Commenti