Ultralytics YOLO27:
Get Started

YOLOv9 vs RTDETRv2#

Il panorama del rilevamento di oggetti in tempo reale è cambiato radicalmente negli ultimi anni. Nel settore si sono affermate due filosofie architetturali distinte: le reti neurali convoluzionali (CNNs) altamente ottimizzate e i Transformer per il rilevamento in tempo reale (DETR). YOLOv9 e RTDETRv2 rappresentano l'apice di questi due approcci.

Questa guida completa confronta questi due potenti modelli e ne analizza le innovazioni architetturali, le metriche di prestazione e gli scenari di distribuzione ideali per aiutarti a scegliere il modello giusto per la tua pipeline di visione artificiale.

Riepilogo esecutivo#

Entrambi i modelli raggiungono risultati all'avanguardia, ma rispondono a vincoli di distribuzione e a ecosistemi di sviluppo leggermente diversi.

  • Scegli YOLOv9 se: hai bisogno di un utilizzo dei parametri altamente efficiente e di un'inferenza rapida sui dispositivi edge. YOLOv9 spinge al limite teorico l'efficienza delle CNN ed è quindi ideale negli ambienti con risorse computazionali strettamente limitate.
  • Scegli RTDETRv2 se: hai bisogno della comprensione contestuale sfumata offerta dai Transformer, in particolare nelle scene con occlusioni estese o relazioni complesse tra gli oggetti, e disponi dell'hardware necessario per supportare un'architettura leggermente più pesante.
  • Scegli YOLO26 (consigliato) se: vuoi il meglio di entrambi gli approcci. Essendo la generazione più recente disponibile sulla piattaforma Ultralytics, YOLO26 include una progettazione end-to-end senza NMS opzionale (nms=False, simile ai modelli DETR ma molto più veloce), che elimina i colli di bottiglia della post-elaborazione e offre un'inferenza CPU fino al 43% più veloce rispetto alle generazioni precedenti.

Specifiche tecniche e autori#

Comprendere le origini e gli obiettivi di progettazione di questi modelli fornisce un contesto essenziale per interpretarne le scelte architetturali.

YOLOv9#

Scopri di più su YOLOv9

RTDETRv2#

Scopri di più su RTDETRv2

Innovazioni architetturali#

YOLOv9: risolvere il collo di bottiglia informativo#

YOLOv9 introduce due importanti innovazioni progettate per affrontare la perdita di informazioni durante il passaggio dei dati attraverso reti neurali profonde:

  1. Informazioni programmabili sul gradiente (PGI): questo framework di supervisione ausiliaria garantisce la generazione di gradienti affidabili per aggiornare i pesi della rete, preservando informazioni cruciali sulle caratteristiche anche nei livelli più profondi della rete.
  2. Rete di aggregazione dei livelli efficiente generalizzata (GELAN): una nuova architettura che combina i punti di forza di CSPNet ed ELAN. GELAN ottimizza l'efficienza dei parametri, consentendo a YOLOv9 di raggiungere una maggiore accuratezza con meno FLOPs rispetto alle CNN tradizionali.

RTDETRv2: Transformers in tempo reale più efficaci#

Basandosi sul successo dell'RT-DETR originale, RTDETRv2 utilizza un'architettura basata su Transformer che evita intrinsecamente la necessità della soppressione non massima (NMS). I miglioramenti includono:

  1. Strategia Bag-of-Freebies: l'iterazione v2 integra tecniche di addestramento avanzate e aumenti dei dati che migliorano notevolmente l'accuratezza senza aggiungere alcun overhead alla latenza dell'inferenza.
  2. Encoder ibrido efficiente: elaborando le caratteristiche multiscala tramite un meccanismo di attenzione disaccoppiato, intra-scala e inter-scala, RTDETRv2 gestisce efficacemente l'elevato costo computazionale tradizionalmente associato ai Vision Transformer.
Rilevamento nativo end-to-end

Mentre RTDETRv2 sfrutta i Transformer per il rilevamento senza NMS, la nuova architettura YOLO26 ottiene lo stesso risultato con una testa opzionale one-to-one (nms=False) all'interno di una struttura CNN altamente ottimizzata, offrendo una distribuzione altrettanto snella ma velocità di inferenza edge nettamente superiori.

Confronto delle prestazioni#

Quando valuti i modelli per la produzione, è fondamentale considerare il compromesso tra accuratezza e requisiti computazionali. La tabella seguente illustra le prestazioni di modelli di diverse dimensioni su benchmark standard.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Analisi#

Come mostrano i dati, YOLOv9 mantiene un netto vantaggio nell'efficienza dei parametri. Il modello YOLOv9c raggiunge l'eccellente risultato di 53.0 mAP con soli 25.5M di parametri, risultando estremamente leggero.

Al contrario, RTDETRv2 è molto competitivo nelle categorie dei modelli medi e grandi. Questo, però, comporta un numero maggiore di parametri e un numero di FLOPs significativamente più elevato, caratteristiche tipiche dei modelli Transformer. Questa differenza architetturale si riflette anche nell'uso della memoria: durante l'addestramento e l'inferenza, i modelli YOLO richiedono in genere molta meno memoria CUDA rispetto ai corrispondenti modelli Transformer.

I vantaggi di Ultralytics: ecosistema e versatilità#

Anche se le metriche architetturali pure sono importanti, spesso è l'ecosistema software a determinare il successo di un progetto di IA. Accedere a questi modelli avanzati tramite la API Python di Ultralytics offre vantaggi senza pari.

Addestramento e distribuzione semplificati#

L'addestramento di un Transformer per il rilevamento richiede in genere file di configurazione complessi e GPU di fascia alta. Utilizzando il framework Ultralytics, gli sviluppatori possono addestrare sia YOLOv9 sia i modelli RT-DETR con la stessa sintassi semplice, beneficiando di pipeline di addestramento altamente efficienti e pesi preaddestrati subito disponibili.

from ultralytics import RTDETR, YOLO

# Addestra un modello YOLOv9
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Addestra un modello RTDETR usando esattamente la stessa API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta i modelli in OpenVINO o TensorRT senza complicazioni
model_yolo.export(format="openvino")

Versatilità multitasking senza pari#

Un limite importante dei modelli specializzati come RTDETRv2 è il loro ambito ristretto, incentrato sul rilevamento delle bounding box. Al contrario, il più ampio ecosistema Ultralytics, che comprende modelli come YOLO11 e YOLOv8, supporta un'ampia gamma di attività di visione artificiale. Tra queste figurano la segmentazione di istanze precisa a livello di pixel, la stima della posa scheletrica, la classificazione dell'intera immagine e il rilevamento di bounding box orientate (OBB) nelle immagini aeree.

Applicazioni nel mondo reale#

Analisi edge ad alta velocità#

Per ambienti commerciali o linee di produzione che richiedono il riconoscimento dei prodotti in tempo reale su dispositivi edge, YOLOv9 è la scelta migliore. La sua architettura GELAN garantisce un throughput elevato su hardware con risorse limitate, come la serie NVIDIA Jetson, consentendo il controllo qualità automatizzato senza ritardi significativi.

Analisi di scene complesse#

In scenari come il monitoraggio di folle dense o di incroci stradali complessi, dove gli oggetti si occludono spesso a vicenda, i meccanismi di attenzione globale di RTDETRv2 danno il meglio. La capacità del modello di ragionare nativamente sul contesto dell'intera immagine gli consente di mantenere un rilevamento e un tracciamento affidabili anche quando gli oggetti sono parzialmente nascosti.

Casi d'uso e consigli#

La scelta tra YOLOv9 e RT-DETR dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze in fatto di ecosistema.

Quando scegliere YOLOv9#

YOLOv9 è una scelta valida per:

  • Ricerca sui colli di bottiglia informativi: progetti accademici che studiano le informazioni di gradiente programmabili (PGI) e le architetture di rete di aggregazione efficiente generalizzata dei livelli (GELAN).
  • Studi sull'ottimizzazione del flusso del gradiente: ricerche incentrate sulla comprensione e sulla riduzione della perdita di informazioni nei livelli delle reti profonde durante l'addestramento.
  • Benchmark di rilevamento ad alta precisione: scenari in cui le prestazioni di YOLOv9 nei benchmark COCO servono come riferimento per confrontare le architetture.

Quando scegliere RT-DETR#

RT-DETR è consigliato per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Il futuro: arriva YOLO26#

Sebbene YOLOv9 e RTDETRv2 rappresentino risultati eccezionali, il settore della visione artificiale evolve rapidamente. Per gli sviluppatori che vogliono avviare nuovi progetti, YOLO26 è la soluzione all'avanguardia consigliata.

Rilasciato nel 2026, YOLO26 integra le migliori caratteristiche di CNN e DETR. Include una progettazione end-to-end senza NMS opzionale (nms=False) che elimina la post-elaborazione NMS, una tecnica introdotta per la prima volta in YOLOv10. Inoltre, YOLO26 rimuove la Distribution Focal Loss (DFL) per una migliore compatibilità edge e introduce il rivoluzionario ottimizzatore MuSGD. Ispirato all'addestramento dei Large Language Model, in particolare a Kimi K2 di Moonshot AI, questo ottimizzatore ibrido garantisce una stabilità di addestramento senza precedenti e una convergenza più rapida.

Grazie anche a ProgLoss e STAL (Progressive Loss and Small-Target-Aware Label Assignment), che assicurano un riconoscimento eccezionale degli oggetti piccoli, YOLO26 offre un'inferenza su CPU fino al 43% più veloce, consolidando il proprio ruolo di modello ideale per le moderne distribuzioni di IA.

Commenti