Ultralytics YOLO27:
Get Started

RTDETRv2 vs DAMO-YOLO#

Il panorama della computer vision è in continua evoluzione e ricercatori e ingegneri si impegnano a realizzare modelli che bilancino perfettamente velocità, precisione ed efficienza. Due architetture di spicco che hanno lasciato il segno in questo ambito sono RTDETRv2, sviluppata da Baidu, e DAMO-YOLO, creata da Alibaba Group. Entrambi i modelli ampliano i confini del rilevamento degli oggetti in tempo reale, ma adottano filosofie architetturali fondamentalmente diverse per ottenere risultati notevoli.

In questo confronto tecnico analizzeremo nel dettaglio le architetture, le metodologie di addestramento e le capacità di distribuzione nel mondo reale. Esamineremo anche come questi modelli si confrontano con l'ecosistema più ampio, in particolare con la Ultralytics Platform, altamente ottimizzata, e con l'architettura YOLO26 all'avanguardia.

Innovazioni architetturali#

Comprendere i meccanismi fondamentali di questi modelli è essenziale per gli ingegneri di machine learning che devono scegliere lo strumento giusto per gli ambienti di produzione.

RTDETRv2: l'approccio Transformer#

Sulla scia del successo dell'RT-DETR originale, RTDETRv2 utilizza un encoder ibrido e un decoder Transformer. Questo design consente al modello di elaborare il contesto globale con grande efficacia, rendendolo particolarmente adatto a distinguere gli oggetti sovrapposti nelle scene dense. Il vantaggio più significativo di questa architettura è il design nativamente privo di NMS (soppressione dei non massimi). Eliminando la fase di post-elaborazione NMS, RTDETRv2 semplifica la pipeline di inferenza e garantisce una latenza più stabile su configurazioni hardware diverse.

Scopri di più su RTDETRv2

DAMO-YOLO: verso una maggiore efficienza delle CNN#

DAMO-YOLO, invece, resta fedele alla fortunata linea di modelli YOLO basati su CNN, ma introduce diversi miglioramenti innovativi. Sfrutta la ricerca di architetture neurali (NAS) per ottimizzare il backbone e garantire la massima efficienza nell'estrazione delle feature. Integra inoltre un efficiente RepGFPN (rete piramidale generalizzata delle feature riparametrizzata) e un design ZeroHead, insieme ad AlignedOTA e a tecniche di miglioramento tramite distillazione. Queste innovazioni consentono a DAMO-YOLO di raggiungere velocità di inferenza elevate mantenendo un punteggio mAPval altamente competitivo.

Scopri di più su DAMO-YOLO

Divergenza architetturale

Mentre RTDETRv2 si concentra sull'uso dei meccanismi di attenzione per comprendere le feature globali senza NMS, DAMO-YOLO massimizza l'efficienza delle CNN tradizionali tramite NAS e distillazione avanzata. Richiede la post-elaborazione standard, ma offre vantaggi distinti in termini di velocità su determinati hardware.

Confronto delle prestazioni e delle metriche#

Per valutare i modelli destinati alla distribuzione, sono fondamentali metriche di prestazione come la precisione media media (mAP), la velocità di inferenza e il numero di parametri. Di seguito trovi un confronto dettagliato tra le due famiglie di modelli.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analisi dei risultati#

Come mostra la tabella, RTDETRv2-x raggiunge la precisione più elevata, con un mAPval pari a 54,3, dimostrando la potenza dell'architettura Transformer su set di validazione complessi come il dataset COCO. Questo risultato comporta tuttavia un numero di parametri (76M) e di FLOP notevolmente superiore.

Al contrario, DAMO-YOLOt (Tiny) è estremamente leggero: richiede solo 8,5M di parametri ed è quindi un'opzione molto veloce per gli ambienti in cui la memoria CUDA è fortemente limitata. In genere, DAMO-YOLO offre un buon compromesso tra velocità e precisione per i dispositivi edge meno recenti.

Ecosistema, usabilità e vantaggi di Ultralytics#

Sebbene repository indipendenti come quelli ufficiali di RT-DETR su GitHub e DAMO-YOLO su GitHub forniscano il codice grezzo per addestrare questi modelli, integrarli nelle pipeline di produzione richiede spesso molto codice ripetitivo e ottimizzazione manuale.

È qui che l'ecosistema Ultralytics semplifica notevolmente l'esperienza di sviluppo. Ultralytics integra i rilevatori Transformer, come l'originale RT-DETR, direttamente nella propria API unificata, permettendoti di addestrare, convalidare ed esportare modelli con una sola riga di codice. Inoltre, rispetto ai repository indipendenti basati su Transformer più pesanti, i modelli Ultralytics sono noti per i requisiti di memoria ridotti durante l'addestramento.

Esempio di codice: integrazione fluida#

Ecco quanto è semplice sfruttare la libreria Python di Ultralytics per eseguire inferenze. L'API rimane coerente sia che tu utilizzi un modello Transformer sia una CNN all'avanguardia.

from ultralytics import RTDETR, YOLO

# Carica un modello RT-DETR per comprendere scene complesse
model_rtdetr = RTDETR("rtdetr-l.pt")

# Carica il modello Ultralytics YOLO26 più recente per prestazioni edge ottimali
model_yolo26 = YOLO("yolo26n.pt")

# Esegui facilmente l'inferenza su un'immagine di esempio
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Visualizza i risultati
results_yolo[0].show()
Esportazione dei modelli per la produzione

Con l'API Ultralytics puoi esportare senza difficoltà i modelli addestrati in formati come TensorRT, ONNX o CoreML con un semplice comando model.export(format="engine"), riducendo drasticamente gli ostacoli alla distribuzione.

Casi d'uso ideali#

La scelta tra queste architetture dipende interamente dai requisiti specifici del progetto:

  • RTDETRv2 eccelle nell'elaborazione lato server, dove la VRAM è abbondante. La sua capacità di cogliere il contesto globale è ideale per l'imaging medico e l'analisi di folle in scene dense, dove le occlusioni sono frequenti.
  • DAMO-YOLO è particolarmente adatto alle applicazioni IoT embedded e alle linee di ispezione industriale ad alta velocità, dove sono indispensabili un numero ridotto di parametri e un FPS elevato.

Il futuro: Ultralytics YOLO26#

Sia RTDETRv2 sia DAMO-YOLO offrono vantaggi, ma il settore della computer vision avanza rapidamente. Per i nuovi progetti, l'ultimo modello Ultralytics YOLO26 rappresenta la sintesi ideale di velocità, precisione ed esperienza di sviluppo.

YOLO26 adotta un design end-to-end privo di NMS, ottenendo il principale vantaggio dei Transformer senza il notevole carico computazionale. Integra l'innovativo ottimizzatore MuSGD—ispirato all'addestramento dei modelli linguistici di grandi dimensioni—per una convergenza stabile e rapida. Inoltre, grazie alla rimozione della DFL (Distribution Focal Loss), che semplifica l'esportazione e migliora la compatibilità con i dispositivi edge e a basso consumo, YOLO26 raggiunge un'inferenza CPU fino al 43% più veloce, affermandosi come la soluzione migliore per l'edge computing. Infine, ProgLoss + STAL offre funzioni di perdita migliorate e notevoli progressi nel riconoscimento degli oggetti piccoli, essenziale per IoT, robotica e immagini aeree.

A differenza dei modelli limitati esclusivamente alle bounding box, la famiglia YOLO26 offre una versatilità senza pari e supporta attività che vanno dalla segmentazione di istanze alla stima della posa, fino alle bounding box orientate (OBB), tutte gestite senza difficoltà tramite l'intuitiva Ultralytics Platform.

Dettagli del modello e riferimenti#

RTDETRv2#

DAMO-YOLO#

Se vuoi esplorare altri confronti, consulta le nostre guide su RTDETRv2 vs. YOLO11 o DAMO-YOLO vs. YOLOv8 per vedere come si comportano questi modelli rispetto alle generazioni precedenti della famiglia Ultralytics.

Commenti