RTDETRv2 vs EfficientDet#
La selezione dell'architettura ottimale di una rete neurale è una scelta determinante per qualsiasi progetto di visione artificiale. Questo confronto tecnico completo analizza due influenti modelli di rilevamento degli oggetti: RTDETRv2, un rilevatore basato su Transformer all'avanguardia, ed EfficientDet, una rete neurale convoluzionale altamente scalabile. Valuteremo le rispettive architetture, le metriche di prestazione, le metodologie di addestramento e gli scenari di distribuzione ideali per aiutarti a prendere decisioni basate sui dati per le tue pipeline di AI.
RTDETRv2: il Transformer per il rilevamento in tempo reale#
Basandosi sul successo dell'originale RT-DETR, RTDETRv2 perfeziona il paradigma del rilevamento degli oggetti basato su Transformer. Ottimizzando le strutture dell'encoder e del decoder, offre un'elevata accuratezza mantenendo velocità di inferenza in tempo reale, colmando efficacemente il divario tra le CNN tradizionali e i Transformer per la visione artificiale.
Dettagli del modello
- Autori: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organizzazione: Baidu
- Data: 2024-07-24
- Link: Arxiv, GitHub, Docs
Architettura e principali punti di forza#
RTDETRv2 utilizza un'architettura ibrida che combina un potente backbone CNN (spesso ResNet o HGNet) con un decoder Transformer efficiente. La caratteristica più distintiva di RTDETRv2 è la capacità nativa di bypassare la soppressione dei non-massimi (NMS). I rilevatori tradizionali richiedono la NMS per filtrare i riquadri di delimitazione duplicati, aggiungendo una latenza di inferenza variabile durante la post-elaborazione. RTDETRv2 formula il rilevamento come un problema di predizione diretta di un insieme, utilizzando l'abbinamento bipartito per produrre predizioni univoche.
Questo modello eccelle nelle distribuzioni lato server, dove la memoria GPU è abbondante. Il suo meccanismo di attenzione globale offre una consapevolezza eccezionale del contesto, rendendolo particolarmente efficace nel separare oggetti sovrapposti in ambienti densi e disordinati, come i sistemi automatizzati di allarme di sicurezza o il monitoraggio di folle numerose.
Limitazioni#
Sebbene siano potenti, le architetture Transformer richiedono intrinsecamente più memoria CUDA durante l'addestramento rispetto alle CNN standard. Inoltre, il fine-tuning di RTDETRv2 può richiedere tempi più lunghi per la convergenza dei dati di addestramento, rendendo la prototipazione rapida leggermente più onerosa in termini di risorse.
EfficientDet: CNN scalabili ed efficienti#
EfficientDet ha introdotto una famiglia di modelli per il rilevamento degli oggetti ottimizzati sia per l'accuratezza sia per l'efficienza, in un'ampia gamma di vincoli di risorse. Rimane un esempio classico di progettazione della visione artificiale scalabile.
Dettagli del modello
- Autori: Mingxing Tan, Ruoming Pang e Quoc V. Le
- Organizzazione: Google
- Data: 2019-11-20
- Link: Arxiv, GitHub, Docs
Architettura e principali punti di forza#
L'innovazione alla base di EfficientDet risiede in due aree chiave: la rete piramidale delle caratteristiche bidirezionale (BiFPN) e un metodo di scalatura composta. BiFPN consente un'estrazione delle caratteristiche multiscala semplice e veloce introducendo pesi apprendibili per imparare l'importanza delle diverse caratteristiche di input, applicando ripetutamente la fusione delle caratteristiche multiscala dall'alto verso il basso e dal basso verso l'alto. Il metodo di scalatura composta ridimensiona uniformemente e simultaneamente la risoluzione, la profondità e la larghezza della rete.
I modelli EfficientDet vanno dall'ultraleggero D0 al massiccio D7. Questo li rende estremamente versatili per le distribuzioni di AI edge, dove gli sviluppatori devono bilanciare budget computazionali limitati e requisiti di accuratezza, come nelle prime applicazioni mobili di realtà aumentata.
Limitazioni#
EfficientDet è un'architettura meno recente che fa ampio affidamento sugli anchor box e sulla pipeline tradizionale di post-elaborazione NMS. Il processo di generazione degli anchor richiede un'attenta ottimizzazione degli iperparametri, mentre la fase NMS può creare un collo di bottiglia nella distribuzione su hardware embedded come un Raspberry Pi. Inoltre, non offre supporto nativo per attività moderne come la stima della posa o i riquadri di delimitazione orientati (OBB).
Confronto di prestazioni e metriche#
Per comprendere gli esatti compromessi tra questi modelli è necessario analizzarne il throughput e l'efficienza in termini di parametri. La tabella seguente illustra il confronto tra la moderna serie RTDETRv2 e la famiglia scalabile EfficientDet.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Come mostrato sopra, RTDETRv2 raggiunge una precisione media media (mAP) significativamente superiore con un numero di parametri paragonabile a quello dei modelli EfficientDet di fascia media, sfruttando ampiamente la propria architettura Transformer per aumentare l'accuratezza.
Casi d'uso e raccomandazioni#
La scelta tra RT-DETR ed EfficientDet dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle tue preferenze in termini di ecosistema.
Quando scegliere RT-DETR#
RT-DETR è una scelta valida per:
- Ricerca sul rilevamento basato su Transformer: progetti che esplorano i meccanismi di attenzione e le architetture Transformer per il rilevamento degli oggetti end-to-end senza NMS.
- Scenari ad alta accuratezza con latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e una latenza di inferenza leggermente superiore è accettabile.
- Rilevamento di oggetti di grandi dimensioni: scene contenenti principalmente oggetti di medie e grandi dimensioni, in cui il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.
Quando scegliere EfficientDet#
EfficientDet è consigliato per:
- Pipeline Google Cloud e TPU: sistemi profondamente integrati con le API Google Cloud Vision o con infrastrutture TPU, dove EfficientDet dispone di ottimizzazioni native.
- Ricerca sullo scaling composto: benchmark accademici incentrati sullo studio degli effetti dello scaling bilanciato di profondità, larghezza e risoluzione della rete.
- Deployment mobile tramite TFLite: progetti che richiedono specificamente l'esportazione in TensorFlow Lite per Android o dispositivi Linux embedded.
Quando scegliere Ultralytics (YOLO26)#
Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la migliore combinazione di prestazioni ed esperienza per gli sviluppatori:
- Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
- Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
- Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.
L'alternativa Ultralytics: portare avanti lo stato dell'arte#
Sebbene RTDETRv2 ed EfficientDet presentino entrambi vantaggi significativi, lo sviluppo moderno dell'AI richiede framework che offrano un'esperienza per gli sviluppatori fluida insieme a prestazioni all'avanguardia. L'ecosistema Ultralytics fornisce un approccio significativamente più snello alle attività di visione artificiale.
Se stai esplorando il rilevamento all'avanguardia, il nuovo Ultralytics YOLO26 sintetizza i migliori aspetti delle CNN e dei Transformer.
YOLO26 implementa un design end-to-end senza NMS, portando la semplicità di distribuzione di RTDETRv2 nell'architettura YOLO ultraefficiente. Inoltre, introduce l'ottimizzatore MuSGD, ispirato alle innovazioni nell'addestramento degli LLM, per una stabilità di addestramento superiore. Grazie alla rimozione di DFL (Distribution Focal Loss rimossa per semplificare l'esportazione e migliorare la compatibilità con dispositivi edge e a basso consumo), YOLO26 offre un'inferenza su CPU fino al 43% più veloce rispetto alle generazioni precedenti, diventando una scelta eccezionale per l'edge computing rispetto ai modelli più pesanti. Inoltre, ProgLoss + STAL offre funzioni di perdita migliorate, con progressi significativi nel riconoscimento degli oggetti piccoli, fondamentale per IoT, robotica e immagini aeree.
La facilità d'uso offerta dal pacchetto Python di Ultralytics è senza pari. Gli sviluppatori possono addestrare, convalidare ed esportare modelli utilizzando un'API intuitiva che astrae il codice ripetitivo normalmente richiesto dai repository di ricerca.
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")I modelli Ultralytics supportano nativamente diverse attività, tra cui la segmentazione delle istanze e la classificazione delle immagini, offrendo un toolkit versatile per esigenze industriali eterogenee. Inoltre, la rimozione della Distribution Focal Loss (DFL) nei moderni modelli Ultralytics semplifica il grafo computazionale, garantendo un'esportazione più fluida verso NPU e TPU embedded.
Per una annotazione dei dati e una gestione dei modelli fluide, la piattaforma Ultralytics offre un ambiente cloud completo per supervisionare l'intero ciclo di vita del machine learning, affermandosi come la scelta principale per distribuire in produzione solide soluzioni di visione artificiale.