Ultralytics YOLO27:
Get Started

RTDETRv2 vs YOLO11#

Il panorama della visione artificiale è in continua evoluzione, con nuove architetture che ampliano i limiti di ciò che è possibile realizzare su dispositivi edge e server cloud. Due dei principali concorrenti nell'attuale ambito del rilevamento di oggetti in tempo reale sono RTDETRv2 e YOLO11. Entrambi i modelli offrono prestazioni eccezionali, ma incarnano filosofie architetturali fondamentalmente diverse: l'approccio basato su Transformer rispetto alla rete neurale convoluzionale (CNN) altamente ottimizzata.

In questo confronto tecnico approfondito esamineremo architetture, metriche di prestazione, metodologie di addestramento e casi d'uso ideali di entrambi i modelli, aiutandoti a prendere una decisione informata per la tua prossima applicazione di intelligenza artificiale.

RTDETRv2: il concorrente basato su Transformer#

Presentato come evoluzione dell'originale Real-Time Detection Transformer, RTDETRv2 sfrutta i meccanismi di attenzione per elaborare i dati visivi. Trattando le porzioni dell'immagine come sequenze, ottiene una comprensione globale del contesto dell'immagine, particolarmente utile per rilevare oggetti molto sovrapposti in scene complesse.

Dettagli del modello:

Punti di forza e debolezza dell'architettura#

La principale innovazione di RTDETRv2 è la sua architettura end-to-end senza NMS. Eliminando la soppressione dei non massimi (NMS), semplifica la pipeline di post-elaborazione. Inoltre, le sue capacità di estrazione delle caratteristiche multiscala sono state migliorate rispetto al modello RT-DETR originale, consentendogli di identificare meglio oggetti di dimensioni diverse.

Tuttavia, poiché si basa sui Transformer, RTDETRv2 richiede generalmente molta più memoria durante l'addestramento. I Transformer convergono in genere più lentamente e necessitano di molta più memoria CUDA rispetto alle CNN tradizionali, risultando meno accessibili ai ricercatori che utilizzano hardware consumer o eseguono il deployment in ambienti di IA edge con risorse limitate.

Scopri di più su RTDETRv2

Ultralytics YOLO11: il massimo dell'efficienza delle CNN#

Sulla base di anni di ricerca fondamentale, Ultralytics ha presentato YOLO11 come un enorme passo avanti nella linea evolutiva di YOLO. Perfeziona l'architettura CNN per ottenere velocità e precisione senza precedenti, mantenendo la flessibilità e l'ecosistema intuitivo per gli sviluppatori che la community si aspetta.

Dettagli del modello:

I vantaggi di Ultralytics#

YOLO11 si distingue per il suo equilibrio delle prestazioni. Offre un compromesso straordinario tra velocità e precisione, rendendolo eccezionalmente versatile in diversi scenari di deployment nel mondo reale, dai cluster di cloud computing ai dispositivi mobili leggeri.

Inoltre, i modelli YOLO di Ultralytics sono noti per il minor consumo di memoria durante l'addestramento e l'inferenza. A differenza dei modelli Transformer, che possono esaurire facilmente la VRAM, YOLO11 consente di usare batch di dimensioni maggiori sulle GPU standard. Inoltre, YOLO11 non si limita al semplice rilevamento degli oggetti: offre una straordinaria versatilità, con supporto nativo per la segmentazione di istanze, la classificazione delle immagini, la stima della posa e le bounding box orientate (OBB).

Confronto delle prestazioni e delle metriche#

Confrontando i valori grezzi, è evidente che, mentre RTDETRv2 raggiunge una precisione notevole, YOLO11 offre una selezione di dimensioni dei modelli molto più articolata e velocità di inferenza superiori, soprattutto su TensorRT.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Come mostra la tabella, il modello YOLO11x raggiunge un mAPval superiore, pari al 54,7%, utilizzando meno FLOP (195,3B contro 259B) e offrendo un'inferenza più rapida su TensorRT (11,3 ms contro 15,03 ms) rispetto alla variante RTDETRv2-x. Le varianti nano e small di YOLO11 offrono opzioni leggere senza pari per dispositivi con risorse limitate, come Raspberry Pi.

Ecosistema, facilità d'uso e addestramento#

La caratteristica distintiva dei modelli Ultralytics è l'esperienza utente semplificata. Il pacchetto Python ultralytics offre un'API unificata e intuitiva che si occupa delle operazioni più complesse, dall'aumento dei dati all'addestramento distribuito e all'esportazione dei modelli. Mentre il repository di ricerca di RTDETRv2 richiede molto codice ripetitivo e configurazione, Ultralytics offre una pipeline che ti porta da zero a esperto.

L'ecosistema Ultralytics è così solido da supportare nativamente l'esecuzione dei modelli RT-DETR insieme ai modelli YOLO. Puoi così sfruttare l'ecosistema ben mantenuto di Ultralytics, comprese le integrazioni con Weights & Biases e Comet ML, per monitorare gli esperimenti senza complicazioni.

from ultralytics import RTDETR, YOLO

# Carica senza complicazioni un modello RTDETR tramite l'API Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Carica un modello YOLO11 altamente ottimizzato
model_yolo = YOLO("yolo11n.pt")

# Addestra YOLO11 con un uso della memoria altamente efficiente
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta il modello YOLO addestrato in formato ONNX
model_yolo.export(format="onnx")
Semplifica il tuo flusso di lavoro

L'efficienza dell'addestramento è fondamentale nel machine learning. I modelli Ultralytics utilizzano pesi preaddestrati che convergono rapidamente. Per gestire dataset, esecuzioni di addestramento ed endpoint di deployment senza scrivere codice, esplora la piattaforma Ultralytics per un'esperienza MLOps integrata.

Applicazioni nel mondo reale#

La scelta tra queste architetture dipende spesso dai vincoli specifici di deployment del tuo progetto.

Dove RTDETRv2 eccelle: Il backbone Transformer di RTDETRv2 è molto efficace negli scenari con oggetti numerosi e fortemente occlusi, in cui è necessario il contesto globale. Viene spesso valutato nella ricerca accademica e nelle applicazioni in cui il budget computazionale conta meno della mappatura delle relazioni basata sull'attenzione.

Dove YOLO11 eccelle: YOLO11 è il campione indiscusso del deployment pratico nel mondo reale. L'ingombro di memoria ridotto e le velocità di inferenza elevatissime lo rendono ideale per:

  • Produzione intelligente: esecuzione del rilevamento dei difetti in tempo reale sulle linee di produzione tramite PC industriali.
  • Agricoltura: deployment su droni per monitorare in tempo reale la salute delle colture e automatizzare i robot per la raccolta.
  • Analisi per il commercio al dettaglio: elaborazione simultanea dei flussi di più telecamere per gestire le code e monitorare l'inventario, senza dover ricorrere a enormi server farm.

Casi d'uso e consigli#

La scelta tra RT-DETR e YOLO11 dipende dai requisiti specifici del tuo progetto, dai vincoli di deployment e dalle preferenze relative all'ecosistema.

Quando scegliere RT-DETR#

RT-DETR è un'ottima scelta per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere YOLO11#

YOLO11 è consigliato per:

  • Deployment edge in produzione: applicazioni commerciali su dispositivi come Raspberry Pi o NVIDIA Jetson, per cui affidabilità e manutenzione attiva sono fondamentali.
  • Applicazioni di visione multi-task: progetti che richiedono rilevamento, segmentazione, stima della posa e OBB all'interno di un unico framework unificato.
  • Prototipazione e deployment rapidi: team che devono passare rapidamente dalla raccolta dei dati alla produzione usando la API Python di Ultralytics, semplice e intuitiva.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Uno sguardo al futuro: l'arrivo di YOLO26#

Se stai avviando un nuovo progetto, dovresti considerare anche la nuova generazione di IA visiva: Ultralytics YOLO26. Rilasciato a gennaio 2026, YOLO26 combina il meglio di entrambi gli approcci. Introduce una head end-to-end senza NMS opzionale (nms=False, sperimentata per la prima volta in YOLOv10), che elimina la post-elaborazione NMS proprio come RTDETRv2, ma con la velocità ineguagliabile di una CNN.

YOLO26 integra l'ottimizzatore MuSGD, ispirato alle innovazioni nell'addestramento degli LLM, per una convergenza incredibilmente stabile e rapida; offre inoltre un'inferenza sulla CPU fino al 43% più veloce, grazie alla rimozione della Distribution Focal Loss (DFL). Le funzioni di perdita ProgLoss + STAL, appositamente progettate, migliorano notevolmente il riconoscimento degli oggetti di piccole dimensioni, rendendo YOLO26 la scelta ideale per qualsiasi pipeline di visione artificiale moderna.

Che tu scelga YOLO11 per la sua versatilità comprovata, RTDETRv2 per i suoi meccanismi di attenzione o YOLO26, all'avanguardia, per ottenere prestazioni ottimali sui dispositivi edge, la documentazione Ultralytics offre tutte le risorse necessarie per il tuo percorso nella visione artificiale.

Commenti