RTDETRv2 vs DAMO-YOLO#
Il panorama della computer vision è in continua evoluzione, mentre ricercatori e ingegneri si impegnano a creare modelli che bilancino perfettamente velocità, accuratezza ed efficienza. Due architetture di rilievo che hanno avuto un impatto significativo in questo settore sono RTDETRv2, sviluppata da Baidu, e DAMO-YOLO, realizzata da Alibaba Group. Entrambi i modelli ampliano i confini della rilevazione degli oggetti in tempo reale, ma adottano filosofie architetturali fondamentalmente diverse per ottenere risultati così avanzati.
In questo confronto tecnico analizzeremo in dettaglio le loro architetture, le metodologie di addestramento e le capacità di distribuzione nel mondo reale. Esamineremo inoltre il loro posizionamento rispetto all'ecosistema più ampio, in particolare rispetto alla Ultralytics Platform, altamente ottimizzata, e all'architettura YOLO26 all'avanguardia.
Innovazioni architetturali#
Comprendere i meccanismi fondamentali di questi modelli è fondamentale per gli ingegneri di machine learning incaricati di selezionare lo strumento giusto per gli ambienti di produzione.
RTDETRv2: l'approccio Transformer#
Basandosi sul successo dell'originale RT-DETR, RTDETRv2 utilizza un encoder ibrido e un decoder Transformer. Questo design consente al modello di elaborare il contesto globale in modo estremamente efficace, rendendolo particolarmente adatto a distinguere tra oggetti sovrapposti in scene dense. Il vantaggio più significativo di questa architettura è il suo design nativo senza NMS (soppressione dei massimi non pertinenti). Eliminando la fase di post-elaborazione NMS, RTDETRv2 semplifica la pipeline di inferenza e garantisce una latenza più stabile tra diverse configurazioni hardware.
DAMO-YOLO: migliorare l'efficienza delle CNN#
DAMO-YOLO, d'altra parte, rimane ancorato alla linea di modelli YOLO basati su CNN, di grande successo, ma introduce diversi miglioramenti innovativi. Utilizza la Ricerca dell'architettura neurale (NAS) per ottimizzare il backbone, garantendo la massima efficienza nell'estrazione delle caratteristiche. Integra inoltre un RepGFPN efficiente (rete piramidale generalizzata delle caratteristiche riparametrizzata) e un design ZeroHead, insieme alle tecniche di miglioramento AlignedOTA e di distillazione. Queste innovazioni consentono a DAMO-YOLO di raggiungere velocità di inferenza elevate mantenendo un punteggio mAPval altamente competitivo.
Mentre RTDETRv2 si concentra sull'utilizzo dei meccanismi di attenzione per comprendere le caratteristiche globali senza NMS, DAMO-YOLO massimizza l'efficienza delle CNN tradizionali attraverso NAS e una distillazione avanzata, richiedendo una post-elaborazione standard ma offrendo distinti vantaggi in termini di velocità su determinati hardware.
Confronto di prestazioni e metriche#
Quando valuti i modelli per la distribuzione, le metriche di prestazione, come la precisione media (mAP), la velocità di inferenza e il numero di parametri, sono fondamentali. Di seguito trovi un confronto dettagliato delle due famiglie di modelli.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Analisi dei risultati#
Come mostra la tabella, RTDETRv2-x raggiunge l'accuratezza più elevata, con un mAPval pari a 54,3, dimostrando la potenza dell'architettura Transformer su validazioni complesse come il dataset COCO. Tuttavia, questo risultato comporta un numero di parametri significativamente maggiore (76M) e più FLOPs.
Al contrario, DAMO-YOLOt (Tiny) è eccezionalmente leggero e richiede solo 8,5M di parametri, risultando un'opzione incredibilmente veloce per gli ambienti in cui la memoria CUDA è fortemente limitata. DAMO-YOLO offre generalmente un compromesso favorevole tra velocità e accuratezza per i dispositivi edge meno recenti.
Ecosistema, usabilità e il vantaggio di Ultralytics#
Sebbene repository indipendenti come il GitHub ufficiale di RT-DETR e il GitHub di DAMO-YOLO offrano il codice grezzo per addestrare questi modelli, integrarli nelle pipeline di produzione richiede spesso una notevole quantità di codice ripetitivo e ottimizzazione manuale.
È qui che l'ecosistema Ultralytics semplifica drasticamente l'esperienza dello sviluppatore. Ultralytics integra modelli come RTDETRv2 direttamente nella sua API unificata, consentendoti di addestrare, validare ed esportare i modelli con una sola riga di codice. Inoltre, i modelli Ultralytics sono noti per i requisiti minimi di memoria durante l'addestramento rispetto ai repository indipendenti basati su Transformer più pesanti.
Esempio di codice: integrazione immediata#
Ecco quanto è facile utilizzare la libreria Python di Ultralytics per eseguire l'inferenza. L'API rimane coerente sia che tu utilizzi un modello Transformer sia una CNN all'avanguardia.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")
# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Display the results
results_yolo[0].show()Utilizzando l'API Ultralytics, puoi esportare senza problemi i tuoi modelli addestrati in formati come TensorRT, ONNX o CoreML con un semplice comando model.export(format="engine"), riducendo drasticamente le difficoltà di distribuzione.
Casi d'uso ideali#
La scelta tra queste architetture dipende interamente dai requisiti specifici del tuo progetto:
- RTDETRv2 eccelle nell'elaborazione lato server, dove la VRAM è abbondante. La sua capacità di comprendere il contesto globale è perfetta per l'imaging medico e l'analisi di folle dense, dove le occlusioni sono frequenti.
- DAMO-YOLO è particolarmente adatto alle applicazioni IoT integrate e alle linee di ispezione industriale ad alta velocità, dove un numero ridotto di parametri e un FPS elevato sono requisiti imprescindibili.
Il futuro: Ultralytics YOLO26#
Sebbene RTDETRv2 e DAMO-YOLO abbiano entrambi i loro punti di forza, il settore della computer vision progredisce rapidamente. Per i nuovi progetti, l'ultima Ultralytics YOLO26 rappresenta la sintesi definitiva di velocità, accuratezza ed esperienza dello sviluppatore.
YOLO26 adotta un design end-to-end senza NMS, offrendo il principale vantaggio dei Transformer senza il massiccio sovraccarico computazionale. Integra l'innovativo ottimizzatore MuSGD, ispirato all'addestramento dei modelli linguistici di grandi dimensioni, per una convergenza stabile e rapida. Inoltre, grazie alla rimozione di DFL (Distribution Focal Loss rimossa per semplificare l'esportazione e migliorare la compatibilità con dispositivi edge e a basso consumo), YOLO26 raggiunge un'inferenza su CPU fino al 43% più veloce, diventando il campione indiscusso per l'edge computing. Inoltre, ProgLoss + STAL offre funzioni di perdita migliorate, con miglioramenti significativi nel riconoscimento degli oggetti di piccole dimensioni, fondamentale per IoT, robotica e immagini aeree.
A differenza dei modelli limitati esclusivamente ai riquadri di delimitazione, la famiglia YOLO26 offre una versatilità senza pari e supporta attività che vanno dalla segmentazione delle istanze e dalla stima della posa ai riquadri di delimitazione orientati (OBB), il tutto gestito senza problemi tramite l'intuitiva Ultralytics Platform.
Dettagli del modello e riferimenti#
RTDETRv2#
- Autori: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organizzazione: Baidu
- Data: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Repository di RT-DETR
DAMO-YOLO#
- Autori: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
- Organizzazione: Alibaba Group
- Data: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: Repository DAMO-YOLO
Se ti interessa esplorare altri confronti, consulta le nostre guide su RTDETRv2 vs. YOLO11 o DAMO-YOLO vs. YOLOv8 per vedere come si comportano questi modelli rispetto alle generazioni precedenti della famiglia Ultralytics.