YOLOv10 vs RTDETRv2#
Il panorama della visione artificiale evolve a ritmo vertiginoso, con nuove architetture che ridefiniscono costantemente lo stato dell'arte nel rilevamento degli oggetti in tempo reale. Due tappe fondamentali di questa evoluzione sono YOLOv10 e RTDETRv2. Entrambi i modelli mirano a risolvere un collo di bottiglia fondamentale delle pipeline di rilevamento tradizionali eliminando la necessità della post-elaborazione con soppressione non massima (NMS), ma affrontano questa sfida con paradigmi architetturali completamente diversi.
Questo confronto tecnico fornisce un'analisi approfondita delle loro architetture, metodologie di addestramento e scenari di distribuzione ideali, per aiutare sviluppatori e ricercatori a scegliere lo strumento giusto per il loro prossimo progetto di IA per la visione.
YOLOv10: il pioniere senza NMS#
Sviluppato da ricercatori della Tsinghua University, YOLOv10 si concentra fortemente sull'efficienza dell'architettura e sulla rimozione dei colli di bottiglia della post-elaborazione. Introducendo assegnazioni duali coerenti per l'addestramento senza NMS, raggiunge prestazioni competitive riducendo significativamente la latenza di inferenza.
Specifiche tecniche#
- Autori: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organizzazione: Tsinghua University
- Data: 2024-05-23
- ArXiv: Paper di YOLOv10
- GitHub: THU-MIG/yolov10
- Documentazione: Documentazione di YOLOv10
Architettura e metodologie#
La svolta principale di YOLOv10 consiste nella progettazione del modello, guidata da un approccio olistico all'efficienza e alla precisione. Ottimizza vari componenti da entrambe le prospettive, riducendo notevolmente il sovraccarico computazionale. La strategia delle assegnazioni duali coerenti consente al modello di addestrarsi senza fare affidamento su NMS, traducendosi in una pipeline di distribuzione semplificata ed end-to-end. Questo è particolarmente vantaggioso quando si esportano modelli in formati edge come ONNX o TensorRT, dove le operazioni di post-elaborazione possono introdurre una latenza imprevista.
Punti di forza e debolezze#
Il modello offre un rapporto velocità-precisione eccezionale, soprattutto nelle varianti più piccole (N e S). La latenza minima lo rende ideale per gli ambienti edge ad alta velocità. Tuttavia, sebbene YOLOv10 eccella nella velocità di rilevamento pura, rimane un modello specializzato esclusivamente nel rilevamento. I team che richiedono la segmentazione delle istanze o la stima della posa dovranno orientarsi verso framework più versatili.
RTDETRv2: perfezionare il Transformer per il rilevamento#
Basandosi sul Transformer per il rilevamento in tempo reale originale, RTDETRv2 incorpora una "raccolta di accorgimenti gratuiti" per migliorare la sua baseline, dimostrando che i Transformer possono competere con le CNN negli scenari in tempo reale.
Specifiche tecniche#
- Autori: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organizzazione: Baidu
- Data: 2024-07-24
- ArXiv: Paper di RTDETRv2
- GitHub: lyuwenyu/RT-DETR
- Documentazione: Documentazione di RTDETRv2
Architettura e metodologie#
RTDETRv2 utilizza un'architettura ibrida, combinando una rete neurale convoluzionale (CNN) come backbone per l'estrazione delle caratteristiche visive con un encoder-decoder Transformer per una comprensione completa della scena. Il meccanismo di autoattenzione del Transformer consente al modello di osservare globalmente l'immagine, rendendolo altamente efficace nella gestione di scene complesse, oggetti sovrapposti e folle numerose.
Punti di forza e debolezze#
L'architettura Transformer offre un'eccellente precisione, in particolare con un numero elevato di parametri, e produce nativamente i rilevamenti finali senza NMS. Tuttavia, questo comporta un costo. I modelli Transformer richiedono tradizionalmente molta più memoria CUDA durante l'addestramento e possono convergere più lentamente rispetto alle architetture CNN pure. Sebbene RTDETRv2 abbia migliorato le velocità di inferenza, in genere consuma più memoria delle varianti YOLO leggere.
Confronto delle prestazioni#
La valutazione delle metriche di prestazione offre un quadro più chiaro dei punti di forza di ciascun modello. La tabella seguente evidenzia le loro capacità sul dataset COCO:
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Analizzando i dati, YOLOv10 mantiene un netto vantaggio in termini di efficienza dei parametri e velocità di inferenza TensorRT a parità di dimensioni. RTDETRv2-x raggiunge la massiccia YOLOv10x in termini di precisione, ma richiede quasi 20 milioni di parametri in più e un numero significativamente maggiore di FLOP.
Casi d'uso e raccomandazioni#
La scelta tra YOLOv10 e RT-DETR dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle tue preferenze in termini di ecosistema.
Quando scegliere YOLOv10#
YOLOv10 è una scelta ottimale per:
- Rilevamento in tempo reale senza NMS: applicazioni che traggono vantaggio dal rilevamento end-to-end senza soppressione non massima, riducendo la complessità della distribuzione.
- Compromesso equilibrato tra velocità e accuratezza: progetti che richiedono un equilibrio efficace tra velocità di inferenza e accuratezza del rilevamento su diverse dimensioni del modello.
- Applicazioni a latenza coerente: scenari di distribuzione in cui sono fondamentali tempi di inferenza prevedibili, come la robotica o i sistemi autonomi.
Quando scegliere RT-DETR#
RT-DETR è consigliato per:
- Ricerca sul rilevamento basato su Transformer: progetti che esplorano i meccanismi di attenzione e le architetture Transformer per il rilevamento degli oggetti end-to-end senza NMS.
- Scenari ad alta accuratezza con latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e una latenza di inferenza leggermente superiore è accettabile.
- Rilevamento di oggetti di grandi dimensioni: scene contenenti principalmente oggetti di medie e grandi dimensioni, in cui il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.
Quando scegliere Ultralytics (YOLO26)#
Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la migliore combinazione di prestazioni ed esperienza per gli sviluppatori:
- Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
- Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
- Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.
Il vantaggio di Ultralytics: ecosistema e innovazione#
Sebbene YOLOv10 e RTDETRv2 offrano solide funzionalità di rilevamento, la scelta di un modello riguarda spesso l'ecosistema software che lo circonda. La piattaforma Ultralytics offre un'interfaccia unificata e fluida che astrae le complessità del deep learning.
Il nuovo standard: Ultralytics YOLO26#
Per gli sviluppatori che cercano le prestazioni migliori in assoluto, Ultralytics YOLO26 rappresenta il culmine dei recenti progressi architetturali. Rilasciato all'inizio del 2026, YOLO26 eredita il design end-to-end senza NMS introdotto da YOLOv10, eliminando completamente la post-elaborazione NMS per una distribuzione più rapida e semplice.
YOLO26 porta le innovazioni dell'addestramento degli LLM nella visione artificiale tramite l'ottimizzatore MuSGD (un ibrido di SGD e Muon), con un addestramento più stabile e una convergenza più rapida. Offre inoltre fino al 43% di inferenza più veloce su CPU, diventando la scelta principale per l'edge computing.
Inoltre, YOLO26 introduce ProgLoss + STAL per miglioramenti significativi nel riconoscimento degli oggetti piccoli e, a differenza dello YOLOv10 specializzato, offre una versatilità estrema. Supporta nativamente il rilevamento degli oggetti, la segmentazione, la posa e i riquadri di delimitazione orientati (OBB), con miglioramenti specifici per attività come la perdita di segmentazione semantica e la stima residua della log-verosimiglianza (RLE) per la posa. Inoltre, la rimozione della perdita focale della distribuzione (DFL) garantisce un'esportazione semplificata e una migliore compatibilità con i dispositivi a basso consumo.
Facilità d'uso ed efficienza dell'addestramento#
Che tu stia sperimentando con modelli di generazioni precedenti come Ultralytics YOLO11 o con YOLO26 all'avanguardia, l'API Python ottimizzata garantisce un minor utilizzo della memoria durante l'addestramento e workflow estremamente rapidi.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")L'ecosistema ben mantenuto offre strumenti per un facile tuning degli iperparametri e si integra perfettamente con soluzioni complete di monitoraggio e opzioni di distribuzione dei modelli.
Conclusioni#
YOLOv10 e RTDETRv2 rappresentano entrambi tappe fondamentali nella ricerca del rilevamento degli oggetti senza NMS. RTDETRv2 dimostra che i Transformer possono raggiungere una latenza in tempo reale con un'eccellente comprensione del contesto globale, sebbene con requisiti di memoria più elevati. YOLOv10 offre un'alternativa CNN altamente efficiente e veloce, pensata per attività di rilevamento soggette a limitazioni di risorse.
Tuttavia, per ottenere prestazioni equilibrate, versatilità multi-task e l'ecosistema più maturo, gli sviluppatori sono fortemente incoraggiati a sfruttare Ultralytics YOLO26. Unisce efficacemente le innovazioni architetturali dei suoi predecessori agli strumenti solidi e intuitivi che rendono la distribuzione della visione artificiale un processo fluido.