Ultralytics YOLO27:
Get Started

RTDETRv2 vs PP-YOLOE+#

Il settore della visione artificiale, in rapida evoluzione, ha prodotto approcci architetturali diversi per affrontare le sfide complesse del rilevamento di oggetti in tempo reale. Tra i progressi recenti più rilevanti spiccano RTDETRv2 e PP-YOLOE+, due modelli potenti che affrontano il riconoscimento visivo da prospettive progettuali fondamentalmente diverse. Entrambi mirano a offrire prestazioni elevate nel rilevamento, ma differiscono notevolmente per meccanismi interni, paradigmi di addestramento e scenari di distribuzione ideali.

Questa guida completa approfondisce gli aspetti tecnici di entrambi i modelli, confrontandone le architetture, le metriche di prestazione e il supporto dell'ecosistema, per aiutare sviluppatori e ricercatori a scegliere la soluzione ottimale per le proprie esigenze di distribuzione.

Panoramica dei modelli#

Prima di analizzare i dati sulle prestazioni, è importante comprendere le origini e gli obiettivi architetturali di ciascun modello. Entrambi provengono da gruppi di ricerca di Baidu, ma rappresentano rami diversi dell'evoluzione dei modelli di rilevamento di oggetti.

RTDETRv2#

RTDETRv2 rappresenta un notevole passo avanti nelle architetture Transformer per la visione. Basandosi sul Real-Time Detection Transformer originale, combina un backbone CNN con un encoder ibrido efficiente e un decoder Transformer. La sua caratteristica più distintiva è la capacità di produrre previsioni end-to-end nativamente, eliminando completamente la necessità della soppressione non massima (NMS) durante la post-elaborazione.

Scopri di più su RTDETRv2

PP-YOLOE+#

PP-YOLOE+ è una versione avanzata della serie YOLO, fortemente ottimizzata per le applicazioni industriali ad alte prestazioni. Utilizza un'architettura CNN scalabile con una head di rilevamento senza anchor. Progettato per offrire un eccellente compromesso tra velocità e accuratezza, introduce tecniche potenti come ET-head e una funzione di loss focale generalizzata per migliorare il rilevamento di oggetti piccoli.

Scopri di più su PP-YOLOE+

Integrazione nell'ecosistema

Entrambi i modelli dispongono di repository di ricerca indipendenti, ma puoi sperimentare facilmente l'RT-DETR originale direttamente all'interno del pacchetto Python di Ultralytics, approfittando di un'API unificata e di opzioni di esportazione semplificate.

Differenze architetturali#

La differenza fondamentale tra questi due modelli riguarda il modo in cui elaborano il contesto visivo e generano le previsioni.

PP-YOLOE+ utilizza un backbone di rete neurale convoluzionale (CNN) tradizionale ma altamente ottimizzato. Sfrutta campi recettivi locali per estrarre le caratteristiche, risultando estremamente rapido ed efficiente nelle distribuzioni standard. Richiede tuttavia la normale post-elaborazione NMS per filtrare i riquadri di delimitazione sovrapposti, il che può introdurre colli di bottiglia nella latenza nelle scene dense.

RTDETRv2 utilizza invece un encoder ibrido e un decoder Transformer. Ciò consente al modello di acquisire simultaneamente il contesto globale dell'intera immagine. I meccanismi di attenzione comprendono intrinsecamente le relazioni tra gli oggetti, permettendo al modello di produrre direttamente i riquadri di delimitazione finali senza NMS. Questo approccio end-to-end garantisce una latenza di inferenza stabile indipendentemente dal numero di oggetti rilevati.

Metriche di prestazione e confronto#

Quando valuti le metriche di prestazione di YOLO, è fondamentale bilanciare l'accuratezza (mAP) con il costo computazionale (FLOPs) e la velocità di inferenza. La tabella seguente mette a confronto le prestazioni dei due modelli in diverse dimensioni.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

PP-YOLOE+x raggiunge una mAPval leggermente superiore, pari al 54,7%, sul dataset COCO; i modelli RTDETRv2 offrono in genere un'accuratezza competitiva e il vantaggio di una latenza costante grazie al design senza NMS. PP-YOLOE+ mantiene tuttavia un netto vantaggio nel numero di parametri e nei FLOPs per i modelli più piccoli, risultando molto efficiente per le distribuzioni edge.

Il vantaggio Ultralytics: arriva YOLO26#

RTDETRv2 e PP-YOLOE+ sono entrambi modelli potenti, ma lo stato dell'arte ha continuato a evolversi. Per gli sviluppatori che cercano il miglior equilibrio tra velocità, accuratezza e supporto dell'ecosistema, Ultralytics YOLO26 rappresenta il nuovo standard del settore.

YOLO26 combina gli aspetti migliori delle CNN e dei Transformer. Adotta una modalità di inferenza opzionale end-to-end senza NMS (nms=False), introdotta dalle architetture moderne, che elimina i colli di bottiglia della post-elaborazione quando è attivata. Inoltre, introduce il rivoluzionario ottimizzatore MuSGD, un approccio ibrido ispirato alle innovazioni nell'addestramento degli LLM, che garantisce un addestramento molto stabile e una convergenza rapida.

Ottimizzato per l'edge

A differenza dei pesanti modelli Transformer, che richiedono molta memoria CUDA, YOLO26 elimina la DFL (Distribution Focal Loss) ed è ottimizzato specificamente per l'edge computing, offrendo un'inferenza su CPU fino al 43% più veloce rispetto alle generazioni precedenti.

Inoltre, YOLO26 non si limita al semplice rilevamento di oggetti. È versatile per natura e supporta nativamente segmentazione di istanze, stima della posa e riquadri di delimitazione orientati (OBB), mentre PP-YOLOE+ si concentra principalmente sul rilevamento dei riquadri di delimitazione.

Metodologie di training ed ecosistema#

È nell'efficienza di addestramento e nella facilità d'uso che l'ecosistema Ultralytics si distingue davvero dai repository di ricerca indipendenti. PP-YOLOE+ si basa sul framework PaddlePaddle e RTDETRv2 richiede spesso configurazioni di ambiente complesse; integrando i modelli tramite Ultralytics, invece, l'esperienza è fluida.

Con l'API Ultralytics, puoi contare su requisiti di memoria inferiori durante l'addestramento, gestione automatizzata dei dataset e ottimizzazione semplificata degli iperparametri. Inoltre, distribuire i modelli in formati di produzione come ONNX o TensorRT è possibile con un solo comando.

Esempio di codice: inferenza semplificata#

Di seguito trovi una dimostrazione di quanto sia semplice utilizzare RT-DETR insieme al modello YOLO26 consigliato, tramite il pacchetto Python di Ultralytics:

from ultralytics import RTDETR, YOLO

# Inizializza un modello RT-DETR (Ultralytics supporta gli RT-DETR-L e RT-DETR-X originali)
model_rtdetr = RTDETR("rtdetr-l.pt")

# Esegui un'inferenza senza NMS su un'immagine di test
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# Per ottenere velocità e versatilità superiori, inizializza il modello YOLO26 più recente
model_yolo26 = YOLO("yolo26n.pt")

# Addestra il modello YOLO26 senza sforzo e con un utilizzo ottimizzato della memoria
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# Esporta in TensorRT per la distribuzione edge
model_yolo26.export(format="engine")

Applicazioni e casi d'uso reali#

La scelta tra queste architetture dipende spesso dai requisiti specifici dell'hardware e dell'applicazione.

  • RTDETRv2 eccelle negli ambienti server e nella comprensione di scene complesse. Il suo meccanismo di attenzione globale lo rende estremamente efficace nella gestione della folla e nell'analisi di immagini mediche con scene dense, in cui gli oggetti sovrapposti fanno solitamente fallire gli algoritmi NMS standard.
  • PP-YOLOE+ è particolarmente indicato per l'ispezione industriale ad alta velocità e per gli ambienti che investono molto nell'ecosistema PaddlePaddle. Il numero ridotto di parametri nelle versioni più piccole lo rende una soluzione praticabile per alcune applicazioni robotiche.
  • Ultralytics YOLO26 è la soluzione consigliata in assoluto per le distribuzioni commerciali complete. Grazie alle funzioni ProgLoss + STAL potenziate, migliora notevolmente il riconoscimento degli oggetti di piccole dimensioni, fondamentale per le operazioni con droni aerei e il monitoraggio del traffico nelle smart city.

Casi d'uso e consigli#

La scelta tra RT-DETR e PP-YOLOE+ dipende dai requisiti specifici del progetto, dai vincoli di distribuzione e dalle preferenze relative all'ecosistema.

Quando scegliere RT-DETR#

RT-DETR è un'ottima scelta per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere PP-YOLOE+#

PP-YOLOE+ è consigliato per:

  • Integrazione con l'ecosistema PaddlePaddle: Organizzazioni che dispongono già di un'infrastruttura basata sul framework e sugli strumenti PaddlePaddle di Baidu.
  • Distribuzione edge con Paddle Lite: Distribuzione su hardware con kernel di inferenza altamente ottimizzati specificamente per Paddle Lite o per il motore di inferenza Paddle.
  • Rilevamento lato server ad alta accuratezza: Scenari che privilegiano la massima accuratezza di rilevamento su potenti server GPU, dove la dipendenza dal framework non è un problema.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Conclusione#

Sia RTDETRv2 sia PP-YOLOE+ hanno ampliato i confini di ciò che è possibile fare nella computer vision, dimostrando la validità sia delle architetture Transformer sia delle CNN altamente ottimizzate. Tuttavia, la complessità della distribuzione di codebase di ricerca frammentati può rallentare i tempi di messa in produzione.

Per chi si occupa oggi di ingegneria AI, sfruttare la Ultralytics Platform offre un vantaggio senza pari. Passando a modelli integrati in modo fluido come YOLO11 o l'avanzatissimo YOLO26, i team possono raggiungere i massimi rapporti possibili tra precisione e velocità, riducendo drasticamente i requisiti di memoria e il carico di sviluppo.

Commenti