Ultralytics YOLO27:
Get Started

PP-YOLOE+ vs RTDETRv2#

Il campo della visione artificiale ha assistito a una profonda evoluzione negli ultimi anni, in particolare nell'ambito del rilevamento di oggetti in tempo reale. Scegliere l'architettura giusta per la tua distribuzione può fare la differenza tra un'applicazione lenta e avida di memoria e un sistema altamente ottimizzato e reattivo. In questo confronto tecnico, analizziamo due modelli di spicco di Baidu: PP-YOLOE+, basato su CNN, e RTDETRv2, basato su Transformer. Esamineremo le loro architetture, le metriche di prestazione e i casi d'uso ideali, analizzando anche il confronto con la piattaforma all'avanguardia Ultralytics YOLO26.

PP-YOLOE+: evoluzione del paradigma CNN#

Sviluppato come iterazione dei modelli precedenti, PP-YOLOE+ spinge oltre i limiti di ciò che le tradizionali reti neurali convoluzionali (CNN) possono ottenere nel rilevamento di oggetti. È un rilevatore anchor-free molto potente, che si basa sui meccanismi fondamentali della serie YOLO introducendo ottimizzazioni specifiche per l'ecosistema PaddlePaddle.

Dettagli del modello:

Architettura e metodologie#

PP-YOLOE+ si basa su un backbone fortemente ottimizzato e su una rete piramidale di caratteristiche personalizzata per aggregare efficacemente caratteristiche a più scale. Utilizza un design anchor-free, che semplifica il processo di regolazione euristica normalmente richiesto per generare le anchor box. Inoltre, la metodologia di addestramento include strategie avanzate di assegnazione delle etichette per associare meglio le predizioni alle bounding box di riferimento durante l'apprendimento.

Punti di forza e casi d'uso#

Il principale punto di forza di PP-YOLOE+ è la sua solida prestazione su hardware server standard e la profonda integrazione con gli strumenti di Baidu. È adatto ai flussi di lavoro industriali tradizionali, come il rilevamento statico dei difetti negli ambienti di produzione, dove i vincoli hardware non sono particolarmente stringenti.

Scopri di più su PP-YOLOE+

Considerazioni sull'ecosistema

Sebbene PP-YOLOE+ offra una precisione elevata, distribuirlo al di fuori del suo ecosistema nativo può talvolta richiedere passaggi di conversione aggiuntivi, a differenza dei formati di esportazione nativi subito disponibili nelle moderne pipeline Ultralytics.

RTDETRv2: Transformer per il rilevamento in tempo reale#

Abbandonando le CNN pure, RTDETRv2 (Transformer per il rilevamento in tempo reale, versione 2) introduce un salto verso i meccanismi basati sull'attenzione per le attività di visione artificiale. Cerca di combinare la comprensione del contesto globale dei Transformer con la bassa latenza richiesta dalle applicazioni reali.

Dettagli del modello:

Architettura e metodologie#

RTDETRv2 sfrutta un'architettura ibrida, che combina un backbone CNN per l'estrazione delle caratteristiche con un encoder-decoder Transformer snello. Una caratteristica distintiva di RTDETRv2 è il design nativamente end-to-end, che evita la post-elaborazione tradizionale con soppressione non massima (NMS). Introduce anche funzionalità come il rilevamento a più scale e la gestione di scene complesse, utilizzando la self-attention per comprendere le relazioni spaziali tra oggetti distanti.

Punti di forza e casi d'uso#

L'architettura Transformer rende RTDETRv2 molto efficace negli scenari in cui è fondamentale comprendere il contesto globale. Tuttavia, rispetto alle CNN leggere, i modelli Transformer richiedono in genere molta più memoria CUDA sia durante l'addestramento che durante l'inferenza. Sono più adatti ad ambienti senza vincoli hardware, come l'analisi video basata sul cloud e in esecuzione su potenti server GPU.

Scopri di più su RTDETRv2

Confronto delle prestazioni e delle metriche#

Nel valutare questi modelli, il compromesso tra precisione media media (mAP) e costo computazionale (misurato in FLOPs e latenza di inferenza) è fondamentale. La tabella seguente riassume le metriche principali per diverse dimensioni di PP-YOLOE+ e RTDETRv2.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

RTDETRv2 offre una mAP elevata, ma richiede più parametri e FLOPs; gli sviluppatori che intendono distribuirlo su dispositivi edge con risorse limitate spesso incontrano colli di bottiglia dovuti all'elevato consumo di memoria tipico dei livelli Transformer.

Casi d'uso e consigli#

La scelta tra PP-YOLOE+ e RT-DETR dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze relative all'ecosistema.

Quando scegliere PP-YOLOE+#

PP-YOLOE+ è una scelta valida per:

  • Integrazione con l'ecosistema PaddlePaddle: Organizzazioni che dispongono già di un'infrastruttura basata sul framework e sugli strumenti PaddlePaddle di Baidu.
  • Distribuzione edge con Paddle Lite: Distribuzione su hardware con kernel di inferenza altamente ottimizzati specificamente per Paddle Lite o per il motore di inferenza Paddle.
  • Rilevamento lato server ad alta accuratezza: Scenari che privilegiano la massima accuratezza di rilevamento su potenti server GPU, dove la dipendenza dal framework non è un problema.

Quando scegliere RT-DETR#

RT-DETR è consigliato per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Il vantaggio di Ultralytics: ecco YOLO26#

Sebbene PP-YOLOE+ e RTDETRv2 rappresentino entrambi traguardi importanti, gli sviluppatori di oggi hanno bisogno di un ecosistema che bilanci perfettamente prestazioni estreme e facilità d'uso. La Ultralytics Platform e il rivoluzionario modello YOLO26 offrono proprio questo.

Rilasciato a gennaio 2026, YOLO26 definisce il nuovo standard per l'IA visiva progettata innanzitutto per l'edge. Risolve con eleganza gli ostacoli alla distribuzione associati alle architetture precedenti, superandole sia in velocità che in precisione.

Innovazioni architetturali#

YOLO26 introduce diversi miglioramenti pionieristici che superano le CNN tradizionali e i Transformer più pesanti:

  • Design end-to-end senza NMS: come RTDETRv2, YOLO26 supporta l'inferenza nativamente end-to-end. Evitando la post-elaborazione con soppressione non massima (NMS) grazie alla sua testa opzionale one-to-one (nms=False), offre una distribuzione più rapida e semplice, con una minore variabilità della latenza, ideale per la robotica in tempo reale e i sistemi autonomi.
  • Inferenza CPU fino al 43% più veloce: grazie a profonde ottimizzazioni architetturali, YOLO26 supera nettamente i modelli concorrenti sui dispositivi edge privi di GPU discrete, diventando la scelta ideale per le applicazioni IoT e smart city.
  • Ottimizzatore MuSGD: ispirato alle innovazioni nell'addestramento degli LLM, YOLO26 utilizza un approccio ibrido tra SGD e Muon. Questo assicura traiettorie di addestramento più stabili e una convergenza notevolmente più rapida, riducendo drasticamente le ore di addestramento su GPU.
  • ProgLoss + STAL: queste funzioni di perdita avanzate migliorano notevolmente il riconoscimento degli oggetti piccoli, un ambito in cui modelli come PP-YOLOE+ storicamente incontrano difficoltà, e sono fondamentali per le immagini aeree e le applicazioni con droni.
  • Rimozione di DFL: la rimozione della Distribution Focal Loss semplifica il processo di esportazione, garantendo una compatibilità fluida con diversi dispositivi edge e a basso consumo.
Versatilità specifica per attività

A differenza dei rilevatori di oggetti specializzati, YOLO26 è molto versatile e supporta la segmentazione di istanze, la stima della posa, la classificazione e le bounding box orientate (OBB). Include miglioramenti specifici, come RLE per la posa e una funzione di perdita angolare dedicata per OBB.

Facilità d’uso senza pari#

Uno dei principali svantaggi dell'adozione di architetture complesse come RTDETRv2 è la ripida curva di apprendimento e la frammentazione dei processi di integrazione. L'ecosistema Ultralytics astrae completamente queste complessità grazie a un'API Python intuitiva e a una piattaforma web completa.

Che tu stia addestrando dataset personalizzati o eseguendo una rapida inferenza, il processo è semplice:

from ultralytics import RTDETR, YOLO

# Inizializza il modello YOLO26 all'avanguardia
model_yolo = YOLO("yolo26n.pt")

# In alternativa, inizializza un modello RT-DETR con la stessa semplice API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Esegui facilmente l'inferenza in tempo reale
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# Esporta per la distribuzione edge con una sola riga
model_yolo.export(format="engine", quantize=16)

I requisiti di memoria inferiori tipici dei modelli Ultralytics YOLO ti consentono di addestrare più velocemente e distribuire su hardware meno costoso rispetto alle controparti basate su Transformer. Inoltre, lo sviluppo attivo e la documentazione di livello mondiale garantiscono la stabilità delle tue pipeline di produzione.

Per i team che valutano alternative, YOLO11 rimane un predecessore molto supportato e particolarmente potente nell'ecosistema, offrendo un'eccellente base per le integrazioni con hardware meno recente. Potrebbe esserti utile anche il nostro confronto tra YOLO11 e RT-DETR.

Riepilogo#

PP-YOLOE+ e RTDETRv2 hanno contribuito in modo significativo all'evoluzione della visione artificiale, dimostrando rispettivamente la validità delle pipeline CNN avanzate e dei Transformer in tempo reale. Tuttavia, per le organizzazioni che nel 2026 desiderano distribuire applicazioni di visione artificiale robuste, versatili e altamente ottimizzate, Ultralytics YOLO26 offre una soluzione senza pari. L'inferenza opzionale senza NMS, l'inferenza CPU notevolmente più veloce e l'ecosistema snello consentono agli sviluppatori di passare dall'ideazione alla produzione su larga scala più rapidamente che mai.

Commenti