Ultralytics YOLO27:
Get Started

DAMO-YOLO vs YOLOv9#

Il panorama del rilevamento di oggetti in tempo reale continua a evolversi a ritmi vertiginosi. Mentre team di ingegneria e ricercatori cercano l'equilibrio ideale tra accuratezza, velocità di inferenza ed efficienza computazionale, dalla comunità di ricerca sono emerse due architetture degne di nota: DAMO-YOLO e YOLOv9. Entrambi i modelli introducono importanti innovazioni architetturali che mirano a superare i limiti della computer vision.

Questa guida tecnica dettagliata offre un'analisi approfondita dei due modelli e confronta i rispettivi approcci architetturali, le metodologie di addestramento e le capacità di distribuzione nel mondo reale. Esamineremo anche il ruolo cruciale dell'ecosistema software più ampio nello sviluppo moderno dell'AI, mettendo in evidenza i vantaggi delle piattaforme integrate come la Ultralytics Platform e dei modelli di nuova generazione come YOLO26.

Riepilogo esecutivo: scegliere l'architettura giusta#

Sebbene entrambi i modelli rappresentino tappe importanti nella ricerca sul deep learning, rispondono a filosofie di distribuzione leggermente diverse.

DAMO-YOLO eccelle negli ambienti in cui è possibile ricorrere a un'intensa ricerca dell'architettura neurale (NAS) per ottenere profili prestazionali specifici, risultando interessante per lo studio di distribuzioni edge personalizzate. YOLOv9, invece, si concentra sulla risoluzione dei colli di bottiglia informativi del deep learning e offre un'efficienza dei parametri eccezionalmente elevata.

Per le distribuzioni pronte per la produzione, tuttavia, i team di ingegneria consigliano costantemente di affidarsi all'ecosistema Ultralytics unificato. Per i nuovi progetti, il più recente modello YOLO26 offre il meglio di entrambi: accuratezza allo stato dell'arte abbinata a un design end-to-end opzionale che elimina la necessità di una post-elaborazione complessa.

Rendi la tua pipeline di computer vision pronta per il futuro

DAMO-YOLO e YOLOv9 sono potenti modelli accademici, ma la loro distribuzione in produzione richiede spesso un notevole lavoro di ingegneria personalizzato. Con Ultralytics YOLO26 puoi accedere a prestazioni all'avanguardia tramite un'API snella e facile da gestire.

Specifiche tecniche e autori#

Comprendere le origini e gli obiettivi di sviluppo di questi modelli fornisce un contesto essenziale per valutarne i rispettivi punti di forza.

DAMO-YOLO#

Sviluppato dai ricercatori di Alibaba Group, DAMO-YOLO si concentra soprattutto sulla generazione automatizzata di architetture e sulla fusione efficiente delle caratteristiche.

Scopri di più su DAMO-YOLO

YOLOv9#

Presentato come soluzione alla perdita di informazioni nelle reti convoluzionali profonde, YOLOv9 spinge al limite le possibilità teoriche di conservazione dei gradienti durante l'addestramento.

Scopri di più su YOLOv9

Innovazioni architetturali#

DAMO-YOLO si distingue per i componenti altamente personalizzati e generati automaticamente. Il suo backbone viene generato usando la ricerca dell'architettura neurale (NAS), con particolare attenzione all'inferenza a bassa latenza su hardware diversi.

L'architettura include un RepGFPN efficiente (rete piramidale generalizzata delle caratteristiche riparametrizzata) per la fusione delle caratteristiche, che migliora il rilevamento di oggetti su più scale senza aumentare eccessivamente il carico computazionale. Inoltre, impiega un design ZeroHead per semplificare la testa di rilevamento e utilizza AlignedOTA per l'assegnazione delle etichette, abbinandolo a un sofisticato processo di potenziamento tramite distillazione durante l'addestramento. Queste tecniche offrono un'inferenza rapida, ma il processo di distillazione in più fasi richiede spesso molta VRAM e tempi di addestramento prolungati.

YOLOv9: risolvere il collo di bottiglia informativo#

YOLOv9 affronta un problema fondamentale delle reti profonde: la graduale perdita delle informazioni contenute nei dati di input man mano che attraversano i layer successivi.

Per contrastare questo problema, gli autori hanno introdotto Informazioni di gradiente programmabili (PGI), un framework di supervisione ausiliaria progettato per conservare dettagli cruciali negli strati profondi e generare gradienti altamente affidabili per l'aggiornamento dei pesi. Insieme alla PGI viene presentata l'architettura GELAN (Rete generalizzata ed efficiente di aggregazione degli strati). GELAN ottimizza l'efficienza dei parametri combinando i punti di forza di CSPNet ed ELAN, massimizzando il flusso di informazioni e riducendo al minimo le operazioni in virgola mobile (FLOPs).

Analisi delle prestazioni e metriche#

Nella valutazione delle prestazioni, entrambi i modelli dimostrano una solida precisione media (mAP) su benchmark standard come COCO. YOLOv9 raggiunge una precisione superiore a parità di numero di parametri e la precisione assoluta più elevata nel complesso, sfruttando la sua architettura PGI per mantenere un'elevata fedeltà su dataset difficili.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Come mostrato sopra, YOLOv9-E raggiunge la precisione più elevata, mentre DAMO-YOLO e le varianti più piccole di YOLOv9 mantengono velocità di inferenza molto competitive grazie alle ottimizzazioni di TensorRT.

Metodologie di training ed ecosistema#

Sebbene l'architettura in sé sia importante, l'usabilità e l'efficienza di addestramento determinate dall'ecosistema di un modello sono fondamentali per l'applicazione nel mondo reale.

La dipendenza di DAMO-YOLO dalla distillazione della conoscenza richiede spesso di addestrare un ingombrante modello "insegnante" prima di trasferire le conoscenze al modello "studente" di destinazione. Questo approccio di ricerca tradizionale aumenta notevolmente i requisiti di memoria e la durata dei cicli di addestramento. Allo stesso modo, il repository originale di YOLOv9 richiede di destreggiarsi tra file di configurazione complessi, che possono rallentare lo sviluppo agile.

Integrare i modelli nella piattaforma Ultralytics trasforma completamente l'esperienza di sviluppo. Il pacchetto Python di Ultralytics astrae il codice ripetitivo, consentendo ai team di gestire senza sforzo l'aumento dei dati, la regolazione degli iperparametri e l'esportazione dei modelli.

Applicazioni e casi d'uso nel mondo reale#

Architetture diverse eccellono naturalmente in settori specifici, in base ai requisiti delle risorse e ai profili di precisione.

  • DAMO-YOLO nell'IA edge: grazie ai suoi backbone ottimizzati tramite NAS, DAMO-YOLO viene spesso preso in considerazione per i sistemi embedded in cui la riparametrizzazione specifica per l'hardware è indispensabile, ad esempio per l'implementazione di ASIC personalizzati nel controllo qualità della produzione di base.
  • YOLOv9 nell'analisi di precisione: grazie all'elevata efficienza dei parametri e alla conservazione dei gradienti ottenuta con PGI, YOLOv9 è ideale per gli scenari di rilevamento densi, come l'analisi di immagini aeree o il tracciamento di oggetti minuscoli in ambienti commerciali affollati.

Casi d'uso e consigli#

La scelta tra DAMO-YOLO e YOLOv9 dipende dai requisiti specifici del tuo progetto, dai vincoli di implementazione e dalle preferenze relative all'ecosistema.

Quando scegliere DAMO-YOLO#

DAMO-YOLO è un'ottima scelta per:

  • Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
  • Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
  • Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.

Quando scegliere YOLOv9#

YOLOv9 è consigliato per:

  • Ricerca sui colli di bottiglia informativi: progetti accademici che studiano le informazioni di gradiente programmabili (PGI) e le architetture di rete di aggregazione efficiente generalizzata dei livelli (GELAN).
  • Studi sull'ottimizzazione del flusso del gradiente: ricerche incentrate sulla comprensione e sulla riduzione della perdita di informazioni nei livelli delle reti profonde durante l'addestramento.
  • Benchmark di rilevamento ad alta precisione: scenari in cui le prestazioni di YOLOv9 nei benchmark COCO servono come riferimento per confrontare le architetture.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Il vantaggio di Ultralytics: il passaggio a YOLO26#

Per chi confronta architetture legacy, passare al moderno ecosistema Ultralytics, in particolare agli ultimi modelli YOLO26, offre un vantaggio senza pari.

YOLO26 trasforma radicalmente lo scenario dell'implementazione grazie al suo design end-to-end senza NMS. La testa opzionale one-to-one (nms=False) elimina la fase di post-elaborazione della soppressione dei massimi non locali (NMS), offrendo architetture di implementazione più rapide e notevolmente più semplici. Insieme alla rimozione della Distribution Focal Loss (DFL), YOLO26 offre una compatibilità superiore con dispositivi edge e a basso consumo.

Inoltre, YOLO26 integra il rivoluzionario ottimizzatore MuSGD, un ibrido tra la discesa del gradiente stocastica e le ottimizzazioni Muon, ispirato alle innovazioni nell'addestramento degli LLM. Questo garantisce una convergenza dell'addestramento molto stabile e un utilizzo della memoria notevolmente ridotto rispetto alle alternative basate pesantemente su Transformer.

Addestramento semplificato con YOLO26

Grazie all'API intuitiva di Ultralytics, puoi addestrare un modello YOLO26 all'avanguardia con il tracciamento degli esperimenti integrato usando solo poche righe di Python.

from ultralytics import YOLO

# Carica il modello YOLO26 più recente
model = YOLO("yolo26n.pt")

# Addestra in modo efficiente sul tuo dataset personalizzato
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta il modello addestrato in formato ONNX
model.export(format="onnx")

Che tu abbia bisogno di segmentazione di istanze avanzata, di una stima della posa altamente accurata o del normale rilevamento di riquadri delimitatori, la versatilità del framework Ultralytics fa sì che il tuo team dedichi meno tempo alla configurazione degli ambienti di deep learning e più tempo all'implementazione di soluzioni IA affidabili. Grazie a miglioramenti specifici per attività, come ProgLoss + STAL, che potenziano il riconoscimento degli oggetti piccoli, YOLO26 è la scelta migliore per la prossima generazione di applicazioni di visione artificiale.

Commenti