Ultralytics YOLO27:
Get Started

YOLOv5 vs DAMO-YOLO#

Il panorama della computer vision in tempo reale è in continua evoluzione: ricercatori e ingegneri puntano a trovare il giusto equilibrio tra precisione, velocità e facilità d’uso. Due modelli di spicco che hanno segnato questo percorso sono Ultralytics YOLOv5 e DAMO-YOLO di Alibaba.

Questa guida offre un’analisi tecnica approfondita delle loro architetture, metriche di prestazione e metodologie di addestramento per aiutarti a scegliere il modello giusto per la tua prossima distribuzione.

Contesto dei modelli#

Prima di esaminare i dettagli tecnici, è importante comprendere le origini e le principali filosofie di progettazione alla base di questi influenti modelli di computer vision.

Ultralytics YOLOv5#

Sviluppato da Glenn Jocher e dal team di Ultralytics, YOLOv5 è diventato uno standard di settore sin dal suo rilascio. Basato nativamente sul framework PyTorch, ha privilegiato un’esperienza di sviluppo snella e solide funzionalità di distribuzione fin da subito.

DAMO-YOLO#

Creato dai ricercatori di Alibaba Group, DAMO-YOLO si concentra fortemente sulla ricerca dell’architettura neurale (NAS) e su tecniche avanzate di distillazione. Spinge al limite le prestazioni teoriche specifiche per l’hardware, rivolgendosi soprattutto agli ambienti di ricerca ed edge che richiedono un’ottimizzazione estrema.

Scopri di più su DAMO-YOLO

Innovazioni architetturali#

Entrambi i modelli sfruttano concetti strutturali unici per ottenere prestazioni in tempo reale, sebbene adottino approcci significativamente diversi.

YOLOv5: stabilità e versatilità#

YOLOv5 utilizza un backbone CSP (Cross Stage Partial) modificato abbinato a un neck PANet (Path Aggregation Network). Questa struttura è estremamente efficiente e riduce al minimo l’utilizzo della memoria CUDA sia durante l’addestramento che durante l’inferenza.

Uno dei maggiori punti di forza di YOLOv5 è la sua versatilità tra diverse attività. Oltre alle previsioni dei riquadri di delimitazione, offre architetture specifiche per la segmentazione delle immagini e la classificazione delle immagini, consentendo agli sviluppatori di basare le proprie pipeline di computer vision su un unico framework coerente.

L’innovazione principale di DAMO-YOLO è il suo backbone MAE-NAS. Grazie a una ricerca guidata dalla massima entropia, il team di Alibaba ha individuato backbone che bilanciano dinamicamente la precisione di rilevamento e la velocità di inferenza.

Inoltre, integra il neck Efficient RepGFPN per migliorare la fusione delle caratteristiche, particolarmente utile per le complesse variazioni di scala che si riscontrano spesso nell’analisi delle immagini satellitari. Il design ZeroHead semplifica i livelli finali di previsione per ridurre la latenza, ma questa complessa generazione strutturale può rendere l’architettura rigida e più difficile da modificare per applicazioni personalizzate.

Requisiti di memoria

Le architetture basate su Transformer spesso hanno difficoltà a causa dell’elevato consumo di VRAM. Sia YOLOv5 che DAMO-YOLO utilizzano design convoluzionali efficienti per contenere l’uso della memoria, ma i modelli Ultralytics sono ottimizzati in particolare per le GPU di fascia consumer, rendendoli molto più accessibili a ricercatori indipendenti e startup.

Prestazioni e metriche#

Per valutare i rilevatori di oggetti in tempo reale bisogna considerare le metriche mAP (precisione media), velocità di inferenza e dimensione del modello.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Sebbene DAMO-YOLO raggiunga punteggi mAP molto competitivi in corrispondenza di determinati numeri di parametri, YOLOv5 dimostra costantemente velocità eccezionali con TensorRT e un numero incredibilmente basso di parametri nelle configurazioni nano e small. Questo equilibrio prestazionale garantisce che YOLOv5 operi in modo efficiente in diversi scenari di distribuzione su dispositivi edge.

Efficienza dell'addestramento ed ecosistema#

La precisione teorica di un modello è valida solo quanto la sua effettiva realizzabilità pratica. È qui che i modelli si differenziano notevolmente.

La complessità della distillazione#

DAMO-YOLO dipende fortemente da una metodologia di addestramento articolata in più fasi. Combina l’assegnazione delle etichette AlignedOTA con una tecnica di distillazione della conoscenza teacher-student. Sebbene consenta di ottenere le massime prestazioni dal modello studente, richiede prima l’addestramento di un enorme modello teacher. Questo aumenta notevolmente il tempo di calcolo, i costi energetici e le risorse hardware necessarie, creando un collo di bottiglia per i team ML agili.

I vantaggi di Ultralytics: facilità d’uso#

Al contrario, l'ecosistema Ultralytics è rinomato in tutto il mondo per le API intuitive e l'efficienza di addestramento. Grazie allo sviluppo attivo e a un'enorme comunità open source, gli sviluppatori possono addestrare, convalidare e distribuire modelli senza difficoltà.

from ultralytics import YOLO

# Carica un modello YOLOv5 preaddestrato
model = YOLO("yolov5su.pt")  # YOLOv5u: pesi YOLOv5 anchor-free per il pacchetto ultralytics

# Addestra facilmente il modello su un dataset personalizzato
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta in formato ONNX per la distribuzione
model.export(format="onnx")

Ultralytics offre anche il supporto integrato per il tracciamento degli esperimenti tramite strumenti come Weights & Biases e Comet ML, garantendo un flusso di lavoro senza intoppi.

Casi d’uso nel mondo reale#

  • YOLOv5 è ideale per gli ambienti di produzione dai ritmi serrati. La sua semplice esportabilità lo rende la scelta migliore per l’analisi intelligente del commercio al dettaglio, il rilevamento ad alta velocità dei difetti di produzione e l’integrazione nelle applicazioni mobili tramite CoreML.
  • DAMO-YOLO è particolarmente adatto ai rigorosi benchmark accademici e agli scenari in cui sono disponibili ampie risorse di calcolo per eseguire lunghi cicli di addestramento con distillazione, mirati a ottenere miglioramenti minimi della mAP su specifici hardware prestabiliti.

Casi d'uso e consigli#

La scelta tra YOLOv5 e DAMO-YOLO dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze relative all’ecosistema.

Quando scegliere YOLOv5#

YOLOv5 è un'ottima scelta per:

  • Sistemi di produzione collaudati: distribuzioni esistenti in cui sono apprezzati lo storico di stabilità di YOLOv5, la documentazione esaustiva e il vasto supporto della community.
  • Addestramento con risorse limitate: ambienti con risorse GPU limitate, in cui la pipeline di addestramento efficiente e i requisiti di memoria ridotti di YOLOv5 sono vantaggiosi.
  • Ampio supporto dei formati di esportazione: progetti che richiedono la distribuzione in numerosi formati, tra cui ONNX, TensorRT, CoreML e LiteRT.

Quando scegliere DAMO-YOLO#

DAMO-YOLO è consigliato per:

  • Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
  • Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
  • Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

La prossima evoluzione: YOLO26#

Se stai avviando un nuovo progetto, ti consigliamo vivamente di guardare al futuro. Ultralytics YOLO26 si basa sulle solide fondamenta di YOLOv5 e integra progressi rivoluzionari che ridefiniscono lo stato dell’arte dell’IA per la computer vision.

Perché passare a YOLO26?

Accolto con grande entusiasmo, YOLO26 è nativamente end-to-end. Include un design end-to-end senza NMS (nms=False) che salta il post-processing della soppressione non massima, rendendo la distribuzione notevolmente più rapida e semplice.

Tra le innovazioni principali di YOLO26 figurano:

  • Ottimizzatore MuSGD: Ispirato alle innovazioni nell’addestramento degli LLM, questo ibrido di SGD e Muon garantisce un addestramento molto stabile e una convergenza rapida.
  • Inferenza su CPU fino al 43% più veloce: Altamente ottimizzato per l’edge computing, è perfetto per i dispositivi IoT che funzionano senza GPU dedicate.
  • ProgLoss + STAL: Funzioni di perdita avanzate che migliorano notevolmente il riconoscimento degli oggetti di piccole dimensioni, fondamentale per le immagini aeree riprese con droni e la robotica.
  • Miglioramenti specifici per attività: Dalla funzione di perdita angolare specializzata per i riquadri di delimitazione orientati (OBB) alla stima della verosimiglianza logaritmica residua (RLE) per una stima della posa accurata, YOLO26 gestisce con facilità domini complessi.

Conclusione#

Sia YOLOv5 che DAMO-YOLO si sono assicurati un posto nella storia del rilevamento degli oggetti. DAMO-YOLO rimane un interessante caso di studio sulla ricerca dell’architettura neurale e sulla distillazione. Tuttavia, per le organizzazioni che danno priorità a un ecosistema ben mantenuto, alla facilità d’uso e a un percorso rapido verso la produzione, i modelli Ultralytics restano ineguagliabili.

Ti consigliamo vivamente di utilizzare la piattaforma Ultralytics per annotare, addestrare e distribuire la nuova generazione di modelli, come YOLO26, assicurandoti che la tua pipeline di computer vision sia pronta per il futuro, veloce e straordinariamente precisa.

Approfondimenti#

  • Scopri il modello Transformer RT-DETR per le applicazioni che richiedono un’elevata precisione.
  • Scopri il modello della generazione precedente YOLO11.
  • Scopri come ottimizzare le distribuzioni con OpenVINO.

Commenti