Ultralytics YOLO27:
Get Started

DAMO-YOLO vs YOLOX#

Il panorama della visione artificiale in tempo reale è in costante evoluzione. DAMO-YOLO e YOLOX rappresentano due tappe importanti di questo percorso, ciascuna con innovazioni specifiche per il rilevamento di oggetti ad alta velocità e accuratezza. Entrambi i modelli hanno contribuito in modo significativo alla comunità open source, ma per gli ingegneri del machine learning è fondamentale comprenderne le differenze architetturali, le metodologie di addestramento e gli scenari di deployment ideali.

Questa guida completa esamina gli aspetti tecnici di entrambi i modelli e spiega perché le alternative moderne come la piattaforma Ultralytics YOLO26 offrono prestazioni e facilità d'uso superiori negli ambienti di produzione odierni.

Panoramica dei modelli#

Dettagli su DAMO-YOLO#

Sviluppato da un gruppo di ricercatori di Alibaba Group, DAMO-YOLO è stato presentato come metodo di rilevamento di oggetti altamente efficiente, basato sulla scoperta automatizzata delle architetture.

Scopri di più su DAMO-YOLO

Dettagli su YOLOX#

Creato dai ricercatori di Megvii, YOLOX mirava a colmare il divario tra la comunità di ricerca e quella industriale, convertendo la serie YOLO a un design anchor-free. In questo modo ha semplificato notevolmente l'architettura, migliorando al contempo le prestazioni dell'epoca.

Scopri di più su YOLOX

Analisi architetturale#

Architettura di DAMO-YOLO#

DAMO-YOLO si affida ampiamente alla ricerca dell'architettura neurale (NAS). I componenti principali includono:

  • Backbone MAE-NAS: Utilizzano una ricerca guidata dall'entropia massima per individuare backbone che offrano il miglior equilibrio tra velocità di inferenza e accuratezza.
  • RepGFPN efficiente: Un neck complesso progettato per la fusione delle feature, che aiuta il modello a mantenere un'elevata accuratezza con oggetti di dimensioni diverse.
  • ZeroHead: Una head di rilevamento semplificata e leggera, che riduce il carico computazionale nei livelli finali di predizione.

Architettura di YOLOX#

YOLOX ha adottato un approccio diverso, puntando sulla semplicità strutturale e su un design anchor-free:

  • Meccanismo anchor-free: Predicendo direttamente le coordinate delle bounding box senza anchor predefinite, YOLOX riduce il numero di parametri di progettazione e le regolazioni euristiche necessarie.
  • Head disaccoppiata: Separa le attività di classificazione e regressione in rami di feature distinti, migliorando la velocità di convergenza e l'accuratezza complessiva.
  • Assegnazione delle etichette SimOTA: Una strategia avanzata di assegnazione delle etichette che alloca dinamicamente i campioni positivi alle annotazioni di riferimento, migliorando l'efficienza dell'addestramento.
Filosofie di progettazione

DAMO-YOLO utilizza ricerche NAS automatizzate per individuare architetture ottimali entro vincoli rigorosi, mentre YOLOX sfrutta semplificazioni eleganti progettate da persone, come le head anchor-free, per snellire la pipeline di rilevamento degli oggetti.

Confronto delle prestazioni#

Per valutare questi modelli occorre considerare la precisione media (mAP), la velocità di inferenza e il numero di parametri. Di seguito trovi una tabella comparativa dettagliata delle varianti standard e leggere di entrambe le architetture.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

YOLOXx raggiunge il valore mAP assoluto più alto, pari a 51,1, mentre DAMO-YOLOl offre un competitivo 50,8 mAP con meno della metà dei parametri (42,1M contro 99,1M) e un'esecuzione TensorRT significativamente più veloce.

Metodologie di training#

Addestramento di DAMO-YOLO#

Durante l'addestramento, DAMO-YOLO utilizza un complesso processo di distillazione. Spesso si addestra prima un modello "insegnante" di grandi dimensioni, per poi trasferirne le conoscenze ai modelli "studenti" più piccoli. Utilizza anche AlignedOTA per l'assegnazione dinamica delle etichette. Sebbene sia molto efficace, questo processo di addestramento in più fasi aumenta notevolmente il tempo di calcolo GPU e il sovraccarico di memoria richiesti.

Addestramento di YOLOX#

YOLOX si affida a strategie di aumento dei dati efficaci come MixUp e Mosaic. Gli autori hanno però scoperto che disattivare queste trasformazioni avanzate nelle ultime 15 epoche permette al modello di colmare il divario con la realtà, aumentando sensibilmente le metriche di accuratezza finali.

Casi d'uso ideali#

  • DAMO-YOLO: Ideale per deployment industriali critici, in cui è possibile supportare pipeline di distillazione lato server e in cui l'hardware di destinazione, come specifiche GPU NVIDIA, trae vantaggio diretto dalla sua architettura NAS con neck complesso.
  • YOLOX: Ottimo per gli sviluppatori che cercano un approccio puramente anchor-free. Il modello estremamente leggero YOLOXnano è adatto ai dispositivi Android meno recenti, all'edge computing e ai sensori IoT con risorse molto limitate, in cui il numero di parametri costituisce il principale vincolo.

Il vantaggio Ultralytics: arriva YOLO26#

Sebbene DAMO-YOLO e YOLOX rappresentino tappe eccellenti, oggi gli sviluppatori richiedono soluzioni più complete, versatili e facili da usare. È qui che brillano la piattaforma Ultralytics e il nuovo Ultralytics YOLO26.

Rilasciato a gennaio 2026, YOLO26 è il modello consigliato per tutte le attività di visione artificiale. Introduce una serie di innovazioni che superano le architetture precedenti:

  • Progettazione end-to-end senza NMS: La head opzionale one-to-one di YOLO26 (nms=False) salta il post-processing di soppressione dei massimi non locali (NMS). Questo permette un deployment molto più semplice e veloce, evitando i colli di bottiglia della latenza tipici delle head di rilevamento tradizionali.
  • Inferenza su CPU fino al 43% più veloce: Rimuovendo in modo mirato Distribution Focal Loss (DFL) e ottimizzando i livelli, YOLO26 offre velocità senza pari su CPU e hardware edge.
  • Ottimizzatore MuSGD: Ispirato alle tecniche di addestramento dei modelli linguistici di grandi dimensioni (LLM), YOLO26 introduce l'ottimizzatore MuSGD, un ibrido di SGD e Muon, che garantisce un addestramento molto stabile e una convergenza assai più rapida rispetto alle configurazioni obsolete di YOLOX.
  • ProgLoss + STAL: Queste funzioni di loss avanzate migliorano sensibilmente il riconoscimento degli oggetti di piccole dimensioni, rendendo YOLO26 nettamente superiore per le riprese con droni e la robotica.
  • Versatilità: A differenza di DAMO-YOLO, limitato al rilevamento di oggetti, YOLO26 gestisce senza problemi la segmentazione di istanze, la stima della posa, la classificazione e le bounding box orientate (OBB) in modo nativo, all'interno dello stesso ecosistema ben mantenuto.

Facilità d’uso con Ultralytics#

L'API Python di Ultralytics semplifica l'esperienza di sviluppo. Per addestrare un modello YOLO26 all'avanguardia serve molto meno codice ripetitivo e non occorre ricorrere alle complesse pipeline di distillazione di DAMO-YOLO. Inoltre, durante l'addestramento i modelli Ultralytics richiedono quantità di memoria CUDA eccezionalmente ridotte rispetto ai pesanti modelli basati su Transformer.

from ultralytics import YOLO

# Carica l'ultimo modello nano Ultralytics YOLO26
model = YOLO("yolo26n.pt")

# Addestra il modello sul tuo dataset personalizzato con una sola riga di codice
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esegui un'inferenza rapida e senza NMS su un'immagine
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Esporta senza problemi in ONNX o TensorRT
model.export(format="onnx")
Addestramento e deployment nel cloud

Puoi annotare automaticamente, addestrare e distribuire modelli sui dispositivi edge con la piattaforma Ultralytics, che gestisce per te il versionamento dei dati e la predisposizione delle risorse GPU nel cloud.

Conclusione#

La scelta tra DAMO-YOLO e YOLOX dipende da vincoli specifici: DAMO-YOLO offre rapporti velocità-accuratezza eccezionali su determinate GPU grazie a NAS, mentre YOLOX propone un design chiaro e anchor-free, ideale per scenari edge leggeri.

Tuttavia, per i team che cercano una soluzione moderna e pronta per il futuro, con una community attiva, l'architettura Ultralytics YOLO26 è la scelta definitiva. L'inferenza opzionale senza NMS, la rapidità di inferenza su CPU e l'API unificata per il rilevamento, la segmentazione e la stima della posa lo rendono senza pari per passare agevolmente dalla ricerca a una produzione robusta e reale.

Se vuoi esplorare altre architetture moderne, ti consigliamo anche Ultralytics YOLO11 o modelli basati su Transformer come RT-DETR, disponibili nella documentazione completa di Ultralytics.

Commenti