Ultralytics YOLO27:
Get Started

RTDETRv2 vs YOLOv10#

L'evoluzione della visione artificiale è stata guidata in larga misura dalla costante ricerca di un equilibrio tra velocità e precisione. Tradizionalmente, le pipeline di rilevamento degli oggetti in tempo reale si sono affidate alla soppressione dei non massimi (NMS) come fase di post-elaborazione per filtrare le bounding box sovrapposte. Tuttavia, NMS introduce colli di bottiglia nella latenza e rende complessa la regolazione degli iperparametri. Di recente sono emersi due approcci architetturali distinti per risolvere il problema in modo nativo: i modelli basati su Transformer come RTDETRv2 e quelli basati su CNN come YOLOv10.

Questa guida offre un confronto tecnico approfondito dei due modelli, analizzandone architetture, metriche di prestazione e casi d'uso ideali, e mettendo in evidenza come le ultime innovazioni dell'ecosistema Ultralytics forniscano la soluzione ideale per il deployment moderno.

RTDETRv2: Transformer per il rilevamento in tempo reale#

RTDETRv2 si basa sull'architettura originale RT-DETR e mira a combinare la comprensione del contesto globale dei Vision Transformer con i requisiti di velocità in tempo reale tradizionalmente soddisfatti dai modelli YOLO.

Caratteristiche principali:

Architettura e metodologie di training#

RTDETRv2 utilizza un'architettura Transformer end-to-end che evita intrinsecamente NMS. Migliora il modello precedente introducendo un approccio "Bag-of-Freebies", che ottimizza la strategia di addestramento e integra funzionalità di rilevamento multiscala. Il modello usa un backbone CNN per estrarre mappe delle caratteristiche (dettagli visivi come bordi e texture), che vengono poi elaborate da una struttura encoder-decoder Transformer. In questo modo il modello analizza simultaneamente il contesto dell'intera immagine ed è molto efficace nel comprendere scene complesse con oggetti numerosi o sovrapposti.

Punti di forza e debolezze#

Punti di forza:

  • Contesto globale: il meccanismo di attenzione consente al modello di eccellere in ambienti complessi e affollati.
  • Senza NMS: predice direttamente le coordinate degli oggetti, semplificando la pipeline di deployment.
  • Elevata precisione: ottiene un'eccellente precisione media (mAP) sul dataset COCO.

Punti deboli:

  • Elevato consumo di risorse: le architetture Transformer richiedono in genere molta più memoria CUDA durante l'addestramento rispetto alle CNN, rendendo costoso il fine-tuning su hardware standard.
  • Variabilità della velocità di inferenza: pur essendo veloce, il pesante carico di calcolo dell'attenzione può ridurre gli FPS nella visione artificiale sui dispositivi edge privi di acceleratori IA dedicati.

Scopri di più su RTDETRv2

YOLOv10: rilevamento di oggetti end-to-end in tempo reale#

YOLOv10 segna una svolta importante nella linea evolutiva del rilevamento degli oggetti con YOLO, affrontando direttamente il problema di lunga data del collo di bottiglia NMS nell'ambito di una struttura CNN.

Caratteristiche principali:

Architettura e metodologie di training#

L'innovazione fondamentale di YOLOv10 consiste nell'uso coerente di assegnazioni doppie per l'addestramento senza NMS. Durante l'addestramento utilizza due head di rilevamento: una con assegnazione uno-a-molti (come nei modelli YOLO tradizionali) per fornire segnali di supervisione dettagliati, e un'altra con assegnazione uno-a-uno per eliminare la necessità di NMS. Durante l'inferenza viene usata solo la head uno-a-uno, ottenendo così un processo end-to-end. Inoltre, gli autori hanno applicato una strategia di progettazione olistica dei modelli, guidata da efficienza e precisione, ottimizzando in modo completo diversi componenti per ridurre la ridondanza computazionale.

Punti di forza e debolezze#

Punti di forza:

  • Velocità eccezionale: rimuovendo NMS e ottimizzando l'architettura, YOLOv10 raggiunge una latenza di inferenza estremamente bassa.
  • Efficienza: richiede meno parametri e FLOP per raggiungere una precisione paragonabile a quella di altri modelli, risultando molto adatto agli ambienti con risorse limitate.
  • Deployment senza NMS: semplifica l'integrazione in applicazioni edge come la videosorveglianza intelligente.

Punti deboli:

  • Concetto di prima generazione: essendo il primo modello YOLO a implementare questa specifica architettura senza NMS, ha gettato le basi, lasciando però spazio alla versatilità multitasking e alle ottimizzazioni introdotte nei modelli successivi, come YOLO11 e YOLO26.

Scopri di più su YOLOv10

Confronto delle prestazioni#

Nella valutazione dei modelli per la produzione, è fondamentale bilanciare la precisione e il costo computazionale. La tabella seguente evidenzia i compromessi prestazionali tra le varie dimensioni di RTDETRv2 e YOLOv10.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

RTDETRv2 offre una precisione affidabile, ma YOLOv10 presenta un notevole vantaggio in termini di latenza ed efficienza dei parametri, soprattutto nelle varianti più piccole (Nano e Small), risultando molto interessante per le applicazioni di edge computing e AIoT.

Scegliere la dimensione giusta

Se esegui il deployment su GPU di classe server, dove la dimensione del batch e la VRAM non sono particolarmente limitate, i modelli più grandi (come -x o -l) massimizzano la precisione. Per dispositivi edge come Raspberry Pi o telefoni cellulari, scegli le varianti nano (-n) o small (-s) per mantenere frequenze dei fotogrammi in tempo reale.

Casi d'uso e consigli#

La scelta tra RT-DETR e YOLOv10 dipende dai requisiti specifici del tuo progetto, dai vincoli di deployment e dalle preferenze relative all'ecosistema.

Quando scegliere RT-DETR#

RT-DETR è un'ottima scelta per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere YOLOv10#

YOLOv10 è consigliato per:

  • Rilevamento in tempo reale senza NMS: applicazioni che traggono vantaggio dal rilevamento end-to-end senza soppressione non massima, riducendo la complessità della distribuzione.
  • Compromesso equilibrato tra velocità e precisione: progetti che richiedono un buon equilibrio tra velocità di inferenza e precisione di rilevamento con modelli di diverse dimensioni.
  • Applicazioni con latenza costante: scenari di distribuzione in cui i tempi di inferenza prevedibili sono fondamentali, ad esempio nella robotica o nei sistemi autonomi.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Il vantaggio di Ultralytics: ecco YOLO26#

Sebbene RTDETRv2 e YOLOv10 offrano entrambi progressi accademici interessanti, il loro deployment in scenari reali richiede un ecosistema software solido e ben mantenuto. La piattaforma Ultralytics offre un'esperienza per sviluppatori senza pari, combinando facilità d'uso, documentazione completa e strumenti potenti per l'annotazione dei dati e il deployment.

Per gli sviluppatori che nel 2026 cercano il massimo all'avanguardia, Ultralytics YOLO26 è la scelta ideale. Riunisce le idee migliori di entrambe le architetture e introduce innovazioni rivoluzionarie:

  • Progettazione end-to-end senza NMS: basandosi sul concetto introdotto da YOLOv10, YOLO26 offre una head uno-a-uno opzionale (nms=False) che salta la post-elaborazione NMS, semplificando e velocizzando la logica di deployment e rendendo la latenza più costante.
  • Rimozione di DFL: eliminando la Distribution Focal Loss, YOLO26 semplifica l'esportazione del modello e migliora notevolmente la compatibilità con i dispositivi edge e a basso consumo.
  • Ottimizzatore MuSGD: ibrido di SGD e Muon, ispirato alle innovazioni nell'addestramento degli LLM, questo nuovo ottimizzatore rende l'addestramento più stabile e accelera notevolmente la convergenza rispetto ai metodi tradizionali.
  • Inferenza sulla CPU fino al 43% più veloce: ottimizzata con cura per gli ambienti privi di GPU dedicate, rende accessibile a tutti l'IA visiva ad alte prestazioni.
  • ProgLoss + STAL: queste funzioni di perdita avanzate migliorano notevolmente il riconoscimento degli oggetti di piccole dimensioni, fondamentale per le applicazioni con droni e i sensori IoT.
  • Versatilità senza pari: a differenza dei modelli limitati alle bounding box, YOLO26 supporta un'intera gamma di attività, tra cui la segmentazione di istanze, la stima della posa, la classificazione delle immagini e il rilevamento OBB, con miglioramenti specifici per ogni attività, come Residual Log-Likelihood Estimation (RLE) per la posa.

Implementazione semplice con Python#

L'addestramento e il deployment di questi modelli tramite l'API Python di Ultralytics sono progettati per essere semplici. I requisiti di memoria durante l'addestramento sono notevolmente inferiori rispetto alle architetture che fanno ampio uso dei Transformer, consentendoti di addestrare modelli potenti su hardware standard.

from ultralytics import YOLO

# Carica il modello YOLO26 all'avanguardia (consigliato)
# In alternativa, carica un modello YOLOv10 usando YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")

# Addestra il modello sul tuo dataset personalizzato
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta facilmente in vari formati per il deployment su dispositivi edge
model.export(format="onnx", simplify=True)

Che tu stia implementando sistemi di allarme di sicurezza o svolgendo analisi di immagini mediche, scegliere un modello supportato dalla community Ultralytics, sempre attiva, ti garantisce gli strumenti, le guide alla regolazione degli iperparametri e gli aggiornamenti continui necessari per ottenere risultati. YOLOv10 e RTDETRv2 hanno aperto la strada alle architetture senza NMS, mentre YOLO26 perfeziona l'approccio, offrendo il miglior equilibrio tra prestazioni, versatilità e prontezza per la produzione.

Commenti