Ultralytics YOLO27:
Get Started

RTDETRv2 vs YOLOv7#

Il panorama della computer vision si è ampliato notevolmente negli ultimi anni, grazie alle continue innovazioni nelle reti neurali convoluzionali (CNNs) e nei Transformer per la visione (ViTs). Per scegliere l'architettura giusta per la tua implementazione, devi comprendere i sottili compromessi tra velocità, precisione e potenza di calcolo. Questa guida analizza le differenze tecniche tra due architetture molto apprezzate, RTDETRv2 e YOLOv7, e mette in evidenza anche le innovazioni moderne disponibili nel più recente Ultralytics YOLO26.

RTDETRv2: l'approccio Transformer al rilevamento in tempo reale#

RTDETRv2 (Transformer per il rilevamento in tempo reale versione 2) si basa sul lavoro del suo predecessore e dimostra che le architetture basate su Transformer possono competere efficacemente in scenari in tempo reale senza affidarsi alle fasi tradizionali di post-elaborazione.

Punti salienti dell'architettura#

RTDETRv2 utilizza un encoder ibrido e un'architettura con decoder Transformer. Sfruttando i meccanismi di autoattenzione, il modello elabora l'intera immagine nel suo insieme, comprendendo le relazioni spaziali complesse meglio dei kernel convoluzionali strettamente localizzati. Una delle sue caratteristiche più distintive è il design nativamente senza NMS. Eliminando la soppressione dei massimi non locali (NMS), RTDETRv2 rimuove un collo di bottiglia comune che causa variazioni nella latenza di inferenza durante l'implementazione.

Punti di forza e limiti#

Il principale punto di forza di RTDETRv2 è la capacità di gestire oggetti densi e sovrapposti in scene complesse. Il contesto globale fornito dai livelli di attenzione del Transformer garantisce un'elevata precisione, soprattutto negli scenari con occlusioni frequenti.

Tuttavia, questo comporta un costo computazionale. Tradizionalmente, i modelli Transformer richiedono più memoria durante l'addestramento e l'inferenza rispetto alle CNN. Inoltre, RTDETRv2 richiede generalmente più epoche per convergere durante l'addestramento distribuito, allungando i cicli di iterazione per gli sviluppatori che mettono a punto dataset personalizzati.

Scopri di più su RTDETRv2

YOLOv7: una baseline CNN per la velocità#

Rilasciato due anni prima di RTDETRv2, YOLOv7 ha introdotto diverse ottimizzazioni strutturali al framework YOLO classico, stabilendo al momento della pubblicazione un benchmark di riferimento per i rilevatori in tempo reale basati su CNN.

Punti salienti dell'architettura#

L'architettura di YOLOv7 si basa sul concetto di Extended Efficient Layer Aggregation Network (E-ELAN). Questo approccio ottimizza il percorso del gradiente e consente al modello di apprendere in modo più efficace senza aumentare significativamente la complessità computazionale. Gli autori hanno inoltre introdotto un "bag of freebies addestrabile": un insieme di metodi che migliora la precisione del modello durante l'addestramento senza influire sulla velocità di inferenza sui dispositivi edge.

Punti di forza e limiti#

YOLOv7 rimane un modello molto efficace per le attività standard di rilevamento degli oggetti e offre velocità di elaborazione eccellenti sulle GPU consumer. La sua natura CNN fa sì che durante l'addestramento richieda generalmente meno memoria CUDA rispetto ai modelli basati su Transformer come RTDETRv2.

Nonostante questi vantaggi, YOLOv7 si affida ancora alla NMS per la post-elaborazione. Negli ambienti con un'elevata densità di previsioni, la fase NMS può causare variazioni nei tempi di elaborazione, rendendo difficile garantire prestazioni rigorosamente in tempo reale. Inoltre, rispetto ai framework moderni, la gestione di attività diverse come la segmentazione delle istanze e la stima della posa può risultare frammentata.

Scopri di più su YOLOv7

Confronto delle prestazioni#

Per valutare questi modelli, occorre considerare il delicato equilibrio tra precisione media (mAP), numero di parametri e velocità di inferenza.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Contesto delle prestazioni

RTDETRv2-x raggiunge la mAP più elevata, ma ha anche il maggior numero di parametri e FLOPs. Le varianti più piccole, come RTDETRv2-s, offrono una velocità competitiva su TensorRT, ma chi punta ad ambienti a basso consumo senza GPU dedicate deve valutare attentamente le capacità di inferenza su CPU.

La soluzione moderna: arriva YOLO26#

RTDETRv2 e YOLOv7 sono stati fondamentali per ampliare i confini delle applicazioni di computer vision, ma il panorama dell'AI si evolve rapidamente. Rilasciato a gennaio 2026, YOLO26 combina gli aspetti migliori dell'efficienza delle CNN e delle architetture senza NMS simili ai Transformer.

Per gli sviluppatori e i ricercatori che realizzano nuovi sistemi, la Ultralytics Platform integrata e l'ecosistema Python offrono un'esperienza unificata che riduce notevolmente il debito tecnico.

Innovazioni chiave di YOLO26#

  • Design end-to-end senza NMS: YOLO26 è nativamente end-to-end e salta la post-elaborazione NMS grazie alla sua head opzionale one-to-one (nms=False), per un'implementazione più rapida e semplice. Questo approccio rivoluzionario è stato introdotto per la prima volta con YOLOv10, garantendo una latenza stabile indipendentemente dalla densità degli oggetti.
  • Inferenza su CPU fino al 43% più veloce: ottimizzato appositamente per il calcolo edge e per i dispositivi senza GPU, è molto più versatile dei pesanti modelli Transformer per le implementazioni sul campo.
  • Ottimizzatore MuSGD: un ibrido di SGD e Muon, ispirato a Kimi K2 di Moonshot AI, che porta le innovazioni di addestramento degli LLM nella computer vision per un addestramento più stabile e una convergenza più rapida.
  • Rimozione di DFL: Distribution Focal Loss è stata rimossa, semplificando il grafo computazionale e agevolando l'esportazione su NPU integrate e ambienti TensorRT.
  • ProgLoss + STAL: le funzioni di loss migliorate offrono notevoli progressi nel riconoscimento degli oggetti di piccole dimensioni, fondamentale per la robotica, l'IoT e l'analisi delle immagini aeree.
  • Miglioramenti specifici per attività: YOLO26 non è pensato solo per il rilevamento. Include prototipi multiscala per la segmentazione, la stima della log-verosimiglianza residua (RLE) per la stima della posa e una loss angolare specializzata che risolve i problemi dei bordi dei bounding box orientati (OBB).

Un'esperienza di sviluppo più semplice#

Il vero vantaggio di scegliere un modello Ultralytics come YOLO26 (o il popolarissimo YOLO11) è l'ecosistema ben mantenuto. Addestrare un dataset personalizzato richiede pochissimo codice boilerplate:

from ultralytics import YOLO

# Inizializza il modello YOLO26 all'avanguardia
model = YOLO("yolo26s.pt")

# Addestra il modello sul dataset COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta senza problemi per la distribuzione su dispositivi edge
model.export(format="onnx", dynamic=True)

Casi d'uso e applicazioni ideali#

La scelta tra queste architetture dipende soprattutto dall'hardware di destinazione e dai requisiti operativi specifici.

Quando prendere in considerazione RTDETRv2#

RTDETRv2 è molto efficace negli ambienti di elaborazione lato server dotati di GPU potenti. Il suo meccanismo di attenzione globale lo rende adatto alla comprensione di scene complesse, ad esempio per monitorare eventi molto affollati o per applicazioni di imaging medico specializzate, in cui le caratteristiche sovrapposte richiedono un'analisi contestuale approfondita.

Quando prendere in considerazione YOLOv7#

YOLOv7 viene spesso mantenuto nella ricerca accademica legacy come modello di riferimento per i confronti. Si trova anche in implementazioni industriali meno recenti, in cui le pipeline esistenti sono codificate per versioni specifiche di PyTorch e non richiedono la flessibilità multi-task dei framework più recenti.

Per le moderne infrastrutture di smart city, la navigazione dei droni e la produzione ad alta velocità, YOLO26 offre un equilibrio senza pari. Il minor fabbisogno di memoria rende accessibili la messa a punto degli iperparametri e l'addestramento su hardware consumer, mentre l'inferenza senza NMS garantisce un'esecuzione rapida su dispositivi edge con risorse limitate, come Raspberry Pi o NVIDIA Jetson.

Scopri altri confronti

Vuoi sapere come si confrontano questi modelli con altre architetture? Consulta le nostre guide dettagliate su YOLO11 vs. RT-DETR e YOLOv8 vs. YOLOv7 per trovare la soluzione perfetta per il tuo progetto di AI per la visione.

Commenti