DAMO-YOLO vs YOLO11#
Quando scegli un'architettura di rilevamento di oggetti in tempo reale per il tuo prossimo progetto di computer vision, è fondamentale comprendere le differenze tra i modelli leader. Questa guida completa offre un'analisi tecnica approfondita che mette a confronto DAMO-YOLO e Ultralytics YOLO11, esaminandone architetture, metriche di prestazione, metodologie di addestramento e scenari ideali per la distribuzione nel mondo reale.
Dettagli su DAMO-YOLO:
- Autori: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
- Organizzazione: Alibaba Group
- Data: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Documentazione: Documentazione di DAMO-YOLO
Dettagli di YOLO11:
- Autori: Glenn Jocher e Jing Qiu
- Organizzazione: Ultralytics
- Data: 2024-09-27
- GitHub: ultralytics/ultralytics
- Documentazione: Documentazione di YOLO11
Filosofia di progettazione dell'architettura#
L'architettura alla base di un modello di rilevamento di oggetti determina la velocità di inferenza, l'accuratezza e l'adattabilità ai diversi ambienti hardware.
DAMO-YOLO introduce diverse innovazioni accademiche e si affida in larga misura alla ricerca dell'architettura neurale (NAS) per progettare automaticamente il backbone. Utilizza un RepGFPN efficiente (rete piramidale generalizzata delle caratteristiche riparametrizzata) per migliorare la fusione delle caratteristiche e un design ZeroHead che riduce notevolmente le dimensioni della pesante testa di predizione spesso presente nelle architetture precedenti. Sebbene questo approccio basato su NAS consenta a DAMO-YOLO di ottenere efficienze specifiche su determinate GPU, le architetture risultanti possono talvolta non avere la flessibilità necessaria per generalizzare senza problemi su diversi dispositivi edge.
Al contrario, YOLO11 si basa su anni di ricerca fondamentale per offrire un'architettura progettata manualmente e altamente ottimizzata. Si concentra su un backbone snello e un neck molto efficiente che riduce i calcoli ridondanti. Uno dei principali vantaggi di YOLO11 è la sua efficienza raffinata nell'uso dei parametri: ottiene un'elevata rappresentazione delle caratteristiche senza richiedere la grande quantità di VRAM tipica dei modelli basati su Transformer come RT-DETR. Questo rende YOLO11 eccezionalmente versatile, capace di funzionare senza problemi su GPU consumer, dispositivi mobili e acceleratori edge specializzati.
Prestazioni e metriche#
Per valutare le prestazioni occorre andare oltre l'accuratezza complessiva e considerare l'equilibrio tra velocità, dimensioni del modello e carico computazionale (FLOPs).
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Come mostra la tabella, YOLO11 raggiunge un equilibrio prestazionale molto favorevole. La variante YOLO11s, ad esempio, supera DAMO-YOLOs in termini di accuratezza, pur mantenendo un numero di parametri notevolmente inferiore. Questa riduzione dei requisiti di memoria si traduce direttamente in costi di distribuzione inferiori e prestazioni più agili sui dispositivi edge.
Metodologie di addestramento e facilità d’uso#
La maggior parte del tempo degli sviluppatori viene impiegata nella pipeline di addestramento, perciò l'efficienza dell'addestramento è una priorità assoluta.
DAMO-YOLO utilizza un processo di addestramento in più fasi, che dipende fortemente dalla distillazione della conoscenza. Impiega AlignedOTA (assegnazione ottimale tramite trasporto) per l'assegnazione delle etichette e spesso richiede di addestrare un modello "teacher" più grande per trasferire le conoscenze ai modelli "student" più piccoli. Questa metodologia aumenta notevolmente l'uso di memoria CUDA e il tempo di calcolo complessivo necessari per raggiungere una convergenza ottimale.
Al contrario, l'ecosistema Ultralytics astrae la complessità dell'addestramento dei modelli. YOLO11 è progettato per essere eccezionalmente facile da usare e offre un'API Python snella e interfacce CLI complete, che consentono agli ingegneri di avviare l'addestramento su dataset personalizzati con un solo comando. La pipeline di addestramento è efficiente nell'uso delle risorse per sua natura e riduce al minimo i picchi di memoria, così anche i modelli più grandi possono essere addestrati su hardware standard.
Per addestrare un modello Ultralytics non serve alcun codice boilerplate. Le pipeline integrate per il caricamento dei dati, l'aumento dei dati e il calcolo della loss sono completamente ottimizzate fin da subito.
Ecco un rapido esempio di quanto sia semplice addestrare e distribuire un modello Ultralytics:
from ultralytics import YOLO
# Carica un modello YOLO11 small preaddestrato
model = YOLO("yolo11s.pt")
# Addestra facilmente il modello su un dataset personalizzato
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Esporta il modello addestrato in ONNX per una distribuzione senza problemi
model.export(format="onnx")Applicazioni nel mondo reale e versatilità#
La scelta tra queste architetture dipende spesso dall'ampiezza delle attività richieste dall'ambiente di distribuzione.
Dove si colloca DAMO-YOLO#
DAMO-YOLO è un framework esclusivamente per il rilevamento di oggetti. Eccelle negli ambienti di ricerca accademica, dove i team esplorano la riparametrizzazione o riproducono specifici esperimenti di ricerca dell'architettura neurale. Può inoltre essere distribuito in ambienti industriali con vincoli rigorosi, dove uno specifico acceleratore GPU si abbina perfettamente al backbone generato con NAS.
I vantaggi di Ultralytics#
I modelli Ultralytics, incluso YOLO11, si distinguono nelle applicazioni commerciali reali grazie alla loro versatilità senza pari e a un ecosistema ben gestito. A differenza di DAMO-YOLO, il framework Ultralytics supporta nativamente più attività. Dalla segmentazione di istanze nell'imaging medico alla stima della posa per l'analisi biomeccanica nello sport, un'unica base di codice unificata gestisce tutto.
Tra i settori che utilizzano YOLO11 troviamo:
- Agricoltura intelligente: utilizzo del rilevamento di oggetti per monitorare la salute delle colture e automatizzare i macchinari per la raccolta.
- Analisi del settore retail: implementazione della videosorveglianza intelligente per analizzare il flusso dei clienti e automatizzare la gestione delle scorte.
- Logistica e catena di approvvigionamento: rilevamento ad alta velocità di codici a barre e pacchi sui nastri trasportatori veloci mediante riquadri di delimitazione orientati (OBB).
Casi d'uso e consigli#
La scelta tra DAMO-YOLO e YOLO11 dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze relative all'ecosistema.
Quando scegliere DAMO-YOLO#
DAMO-YOLO è un'ottima scelta per:
- Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
- Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
- Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.
Quando scegliere YOLO11#
YOLO11 è consigliato per:
- Deployment edge in produzione: applicazioni commerciali su dispositivi come Raspberry Pi o NVIDIA Jetson, per cui affidabilità e manutenzione attiva sono fondamentali.
- Applicazioni di visione multi-task: progetti che richiedono rilevamento, segmentazione, stima della posa e OBB all'interno di un unico framework unificato.
- Prototipazione e deployment rapidi: team che devono passare rapidamente dalla raccolta dei dati alla produzione usando la API Python di Ultralytics, semplice e intuitiva.
Quando scegliere Ultralytics (YOLO26)#
Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:
- Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
- Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
- Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.
La nuova generazione: ecco YOLO26#
Sebbene YOLO11 resti una scelta potente e affidabile, il panorama della computer vision evolve rapidamente. Per gli sviluppatori che avviano nuovi progetti, il più recente modello YOLO26 rappresenta il nuovo stato dell'arte.
Rilasciato a gennaio 2026, YOLO26 introduce diversi progressi rivoluzionari:
- Design end-to-end senza NMS: grazie alla testa opzionale uno-a-uno (
nms=False), YOLO26 salta la post-elaborazione con soppressione dei massimi locali, garantisce tempi di inferenza più rapidi e deterministici e semplifica notevolmente le pipeline di distribuzione. - Inferenza su CPU fino al 43% più veloce: eliminando la Distribution Focal Loss (DFL), il modello è particolarmente adatto ai dispositivi edge e a basso consumo privi di GPU dedicate.
- Ottimizzatore MuSGD: integrando innovazioni nell'addestramento degli LLM (ispirate a Moonshot AI), questo ottimizzatore ibrido garantisce una convergenza stabile e rapida durante l'addestramento.
- Funzioni di loss avanzate: utilizzando ProgLoss + STAL, YOLO26 mostra notevoli miglioramenti nel riconoscimento di oggetti piccoli, fondamentale per le immagini aeree e la robotica.
Conclusione#
Sia DAMO-YOLO sia YOLO11 hanno contribuito in modo significativo al progresso della computer vision veloce e accurata. DAMO-YOLO offre interessanti spunti accademici sulla ricerca di architetture e sulla distillazione, mentre Ultralytics YOLO11 (e il rivoluzionario YOLO26) offre un'esperienza di sviluppo superiore.
Grazie ai minori requisiti di memoria, alla documentazione completa, alle capacità multi-task e all'integrazione con la potente Ultralytics Platform, i modelli Ultralytics restano la scelta consigliata a ricercatori e ingegneri aziendali che vogliono creare soluzioni di AI robuste e scalabili. Se vuoi esplorare altre architetture avanzate, il confronto tra YOLO26 e RT-DETR offre ulteriori spunti sulle alternative basate su Transformer.