YOLOX vs DAMO-YOLO#
L'evoluzione del rilevamento degli oggetti in tempo reale ha visto il susseguirsi di numerosi cambi di paradigma: dalle architetture basate su anchor a quelle senza anchor, e dai backbone progettati manualmente alla ricerca automatizzata di architetture neurali (NAS). In questo confronto tecnico completo analizzeremo due tappe fondamentali di questo percorso: YOLOX e DAMO-YOLO. Esamineremo le innovazioni architetturali, le metodologie di addestramento e i compromessi prestazionali, evidenziando anche come il moderno Ultralytics YOLO26 offra un'alternativa senza pari agli sviluppatori di oggi.
YOLOX: pioniere del paradigma senza anchor#
Rilasciato il 18 luglio 2021 da Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun presso Megvii, YOLOX ha segnato una svolta decisiva integrando con successo un design senza anchor nella famiglia YOLO. Come descritto nel loro rapporto tecnico su ArXiv, YOLOX mirava a colmare il divario tra la ricerca accademica e la distribuzione industriale.
Principali innovazioni architetturali#
YOLOX ha introdotto diversi cambiamenti strutturali fondamentali che hanno migliorato notevolmente i modelli precedenti:
- Meccanismo senza anchor: prevedendo direttamente il centro di un oggetto e le dimensioni del relativo riquadro di delimitazione, YOLOX ha ridotto il numero di euristiche di progettazione e semplificato i complessi processi di clustering degli anchor. Questo lo rende altamente adattabile a diversi scenari di computer vision.
- Testa disaccoppiata: i modelli YOLO tradizionali utilizzavano un'unica testa accoppiata per la classificazione e la regressione. YOLOX ha implementato una testa disaccoppiata, elaborando separatamente la classificazione e la localizzazione: in questo modo la convergenza è stata molto più rapida e la precisione è migliorata.
- Assegnazione delle etichette SimOTA: è stata utilizzata una versione semplificata dell'assegnazione ottimale del trasporto (OTA) per assegnare dinamicamente i campioni positivi, riducendo i tempi di addestramento e superando le ambiguità delle assegnazioni basate sui punti centrali.
Il design della testa disaccoppiata di YOLOX ha influenzato profondamente le generazioni successive di rilevatori di oggetti, diventando una caratteristica standard in molti modelli moderni.
DAMO-YOLO: ricerca automatizzata dell'architettura su larga scala#
Sviluppato da Xianzhe Xu e da un team di ricercatori dell'Alibaba Group, DAMO-YOLO è stato presentato il 23 novembre 2022. Come illustrato nella loro pubblicazione su ArXiv, il modello ha fatto ampio ricorso alla ricerca di architetture neurali (NAS) per spingere la frontiera di Pareto tra velocità e precisione.
Principali innovazioni architetturali#
La strategia di DAMO-YOLO si basava sull'automazione della progettazione di strutture efficienti:
- Backbone MAE-NAS: usando una ricerca guidata dalla massima entropia, DAMO-YOLO ha individuato backbone altamente efficienti, personalizzati per specifici budget di latenza, soprattutto quando esportati in framework come TensorRT.
- RepGFPN efficiente: un design del neck pesante che migliora notevolmente la fusione delle caratteristiche tra diverse risoluzioni spaziali, particolarmente utile per l'analisi di immagini aeree e il rilevamento di oggetti a scale diverse.
- ZeroHead: una testa di predizione semplificata che riduce la ridondanza computazionale senza sacrificare la precisione media complessiva del modello (mAP).
- AlignedOTA e distillazione: integra tecniche avanzate di assegnazione delle etichette e distillazione della conoscenza da insegnante a studente per ottenere il massimo dai modelli studente più piccoli.
Confronto delle prestazioni e delle metriche#
Per confrontare questi due modelli, dobbiamo esaminare il numero di parametri, i FLOP richiesti e i profili di latenza. Di seguito sono riportati i dati di benchmark che confrontano YOLOX e DAMO-YOLO a più scale.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Entrambi i modelli ottengono risultati notevoli, ma presentano alcune criticità. YOLOX richiede un'attenta ottimizzazione della testa disaccoppiata, mentre la forte dipendenza di DAMO-YOLO dalla distillazione rende il riaddestramento su dataset personalizzati molto dispendioso in termini di risorse e richiede grandi quantità di memoria GPU.
Casi d'uso e consigli#
La scelta tra YOLOX e DAMO-YOLO dipende dai requisiti specifici del progetto, dai vincoli di distribuzione e dalle preferenze relative all'ecosistema.
Quando scegliere YOLOX#
YOLOX è una scelta valida per:
- Ricerca sul rilevamento senza anchor: Ricerca accademica che usa l'architettura pulita e senza anchor di YOLOX come riferimento per sperimentare nuove head di rilevamento o funzioni di perdita.
- Dispositivi edge ultraleggeri: Implementazione su microcontrollori o hardware mobile legacy, dove le dimensioni estremamente ridotte della variante YOLOX-Nano (0,91 M di parametri) sono fondamentali.
- Studi sull'assegnazione delle etichette SimOTA: Progetti di ricerca che analizzano le strategie di assegnazione delle etichette basate sul trasporto ottimale e il loro impatto sulla convergenza dell'addestramento.
Quando scegliere DAMO-YOLO#
DAMO-YOLO è consigliato per:
- Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
- Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
- Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.
Quando scegliere Ultralytics (YOLO26)#
Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:
- Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
- Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
- Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.
Il vantaggio di Ultralytics: ecco YOLO26#
YOLOX e DAMO-YOLO rappresentano importanti tappe storiche, ma gli sviluppatori di oggi hanno bisogno di una soluzione che abbini una precisione all'avanguardia a una facilità d'uso senza pari. È qui che Ultralytics YOLO26 cambia le carte in tavola. Rilasciato a gennaio 2026, YOLO26 si basa sull'eredità dei modelli senza NMS per offrire il perfetto equilibrio tra velocità, precisione ed esperienza per gli sviluppatori.
Perché scegliere YOLO26?#
L'ecosistema integrato di Ultralytics supera i repository accademici frammentati offrendo:
- Design end-to-end senza NMS: la testa one-to-one opzionale di YOLO26 (
nms=False) elimina la soppressione dei non massimi (NMS) durante l'inferenza. Ne derivano latenze estremamente ridotte e prevedibili, fondamentali per le distribuzioni edge e i veicoli autonomi. - Rimozione di DFL: rimuovendo la Distribution Focal Loss, YOLO26 semplifica i processi di esportazione sui dispositivi edge, riducendo notevolmente i requisiti di memoria per le applicazioni leggere.
- Ottimizzatore MuSGD: YOLO26 riprende le innovazioni dell'addestramento degli LLM con il suo ottimizzatore ibrido SGD e Muon, garantendo una stabilità di addestramento eccellente e una convergenza rapidissima.
- Inferenza CPU fino al 43% più veloce: grazie a profonde ottimizzazioni strutturali, YOLO26 funziona a velocità elevatissime sulle CPU senza richiedere costoso hardware GPU.
- Funzioni di perdita avanzate: l'integrazione di ProgLoss + STAL migliora notevolmente il riconoscimento degli oggetti di piccole dimensioni, rendendo il modello ideale per attività come le ispezioni con droni e il monitoraggio IoT.
- Versatilità: a differenza di DAMO-YOLO, che è esclusivamente un rilevatore, YOLO26 supporta nativamente le attività di segmentazione di istanze, stima della posa, classificazione delle immagini e rilevamento di riquadri di delimitazione orientati (OBB) in un unico framework unificato.
Con l'API Python di Ultralytics, non devi configurare manualmente complesse pipeline di distillazione né scrivere centinaia di righe di codice C++ per distribuire il tuo modello.
from ultralytics import YOLO
# Carica il modello nano YOLO26 all'avanguardia
model = YOLO("yolo26n.pt")
# Addestra facilmente il modello su un dataset personalizzato
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Esegui inferenze rapidissime senza NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Esporta in ONNX o OpenVINO con un solo comando
model.export(format="openvino")Altri modelli da considerare#
L'ecosistema della computer vision è vasto. A seconda dei tuoi vincoli specifici, potresti voler esplorare anche altre architetture pienamente supportate dall'ecosistema Ultralytics:
- YOLO11: il predecessore di YOLO26, altamente capace e noto per la sua robustezza nell'analisi del commercio al dettaglio e nel controllo qualità manifatturiero.
- YOLOv8: un modello senza anchor leggendario e molto stabile, che ha reso popolare la distribuzione edge su larga scala.
- RT-DETR: un Transformer per il rilevamento in tempo reale sviluppato da Baidu, che offre un'ottima alternativa per le attività che traggono grande vantaggio dai meccanismi di attenzione globale, sebbene richieda più memoria durante l'addestramento.
Conclusione#
YOLOX e DAMO-YOLO hanno contribuito con concetti essenziali all'evoluzione del deep learning: YOLOX ha convalidato l'approccio disaccoppiato e senza anchor, mentre DAMO-YOLO ha dimostrato la potenza della ricerca automatizzata di architetture. Tuttavia, negli ambienti di produzione reali, la complessità delle basi di codice della ricerca originale può rallentare i team agili.
Sfruttando la Piattaforma Ultralytics completa, gli sviluppatori possono superare questi ostacoli. Grazie al design end-to-end di YOLO26, alle prestazioni superiori su CPU e alla documentazione esaustiva, ottenere risultati all'avanguardia nell'AI per la visione non è mai stato così accessibile. Che tu stia sviluppando infrastrutture per città intelligenti, sistemi diagnostici per la sanità o robotica avanzata, Ultralytics offre il percorso più efficiente dai dati grezzi alla distribuzione robusta nel mondo reale.