Ultralytics YOLO27:
Get Started

RTDETRv2 vs YOLOv6-3.0#

Il panorama della computer vision è in continua evoluzione e offre agli sviluppatori un'ampia scelta di architetture per il rilevamento degli oggetti. Due modelli importanti che rappresentano approcci diversi sono RTDETRv2, un Transformer per la visione all'avanguardia, e YOLOv6-3.0, una rete neurale convoluzionale (CNN) altamente ottimizzata per le applicazioni industriali.

Questo confronto tecnico approfondito esamina le rispettive architetture, le metriche di prestazione e gli scenari di implementazione ideali. Vedremo anche come il più ampio ecosistema Ultralytics offra un'esperienza di sviluppo superiore, per poi analizzare le capacità di nuova generazione di Ultralytics YOLO26.

RTDETRv2: l'approccio dei Transformer per la visione#

Sviluppato dai ricercatori di Baidu, RTDETRv2 si basa sulle fondamenta dell'RT-DETR originale e rappresenta un notevole passo avanti nel rilevamento di oggetti basato su Transformer.

Punti salienti dell'architettura#

RTDETRv2 utilizza un'architettura ibrida che combina un estrattore di caratteristiche CNN con un potente decoder Transformer. La caratteristica più distintiva di questo modello è il design nativamente privo di NMS. Eliminando la soppressione non massima (NMS) durante la post-elaborazione, il modello prevede direttamente i riquadri di delimitazione, semplificando la distribuzione e stabilizzando la latenza di inferenza.

Il «Bag-of-Freebies» integrato in RTDETRv2 ne migliora la capacità di gestire scene complesse e oggetti sovrapposti, poiché i meccanismi di attenzione globale comprendono intrinsecamente le relazioni spaziali meglio delle convoluzioni localizzate.

Utilizzo della memoria dei Transformer

Sebbene i Transformer eccellano nella comprensione di scene complesse, in genere richiedono molta più memoria CUDA durante l'addestramento rispetto alle CNN. Questo può limitare le dimensioni dei batch sulle GPU consumer standard e aumentare il tempo complessivo di addestramento.

Scopri di più su RTDETRv2

YOLOv6-3.0: massimizzare la produttività industriale#

Nato nel dipartimento Vision AI di Meituan, YOLOv6-3.0 è stato progettato esplicitamente come rilevatore di nuova generazione per pipeline industriali in cui la produttività della GPU è fondamentale.

  • Autori: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu e Xiangxiang Chu
  • Organizzazione: Meituan
  • Data: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Focus architetturale#

YOLOv6-3.0 si basa su un backbone EfficientRep, progettato meticolosamente per ridurre al minimo i costi di accesso alla memoria sugli acceleratori hardware come le GPU NVIDIA. L'architettura del neck include un modulo di concatenazione bidirezionale (BiC) per migliorare la fusione delle caratteristiche tra scale diverse.

Durante l'addestramento, utilizza una strategia Anchor-Aided Training (AAT) per sfruttare i paradigmi basati su anchor, mantenendo al contempo una modalità di inferenza senza anchor per un'esecuzione più rapida. Offre una produttività eccezionale sulle GPU di livello server (ad es. T4, A100), ma la sua architettura specializzata può causare una latenza non ottimale sui dispositivi edge con la sola CPU.

Scopri di più su YOLOv6

Confronto delle prestazioni#

Quando valuti i modelli per la produzione, è fondamentale bilanciare l'accuratezza (mAP) con la velocità di inferenza e il costo computazionale (FLOPs). La tabella seguente mostra come si confrontano questi modelli.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0 primeggia per velocità di elaborazione pura su TensorRT, mentre RTDETRv2 ottiene punteggi mAP superiori, soprattutto grazie a prestazioni migliori con le varianti di modello più grandi. Tuttavia, a entrambi i modelli manca l'ampia versatilità dei moderni framework unificati. YOLOv6-3.0 è principalmente specializzato nel rilevamento e non supporta nativamente attività come la segmentazione di istanze e la stima della posa.

Casi d'uso e consigli#

La scelta tra RT-DETR e YOLOv6 dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze in termini di ecosistema.

Quando scegliere RT-DETR#

RT-DETR è un'ottima scelta per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere YOLOv6#

YOLOv6 è consigliato per:

  • Distribuzione ottimizzata per l’hardware industriale: scenari in cui la progettazione consapevole dell’hardware e la riparametrizzazione efficiente del modello offrono prestazioni ottimizzate sull’hardware di destinazione specifico.
  • Rilevamento rapido a singolo stadio: applicazioni che privilegiano la velocità pura di inferenza su GPU per l’elaborazione video in tempo reale in ambienti controllati.
  • Integrazione nell’ecosistema Meituan: team che lavorano già nello stack tecnologico e nell’infrastruttura di distribuzione di Meituan.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la combinazione migliore di prestazioni ed esperienza per gli sviluppatori:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

I vantaggi di Ultralytics#

Scegliere il modello giusto richiede più che valutare i risultati dei benchmark: l'esperienza di sviluppo, la flessibilità di distribuzione e il supporto dell'ecosistema sono altrettanto cruciali. Utilizzando i modelli integrati nella piattaforma Ultralytics, gli utenti ottengono vantaggi significativi rispetto ai repository di ricerca statici.

  • Facilità d'uso: il pacchetto Python ultralytics offre un'API intuitiva. Bastano poche righe di codice per addestrare, convalidare ed esportare i modelli.
  • Ecosistema aggiornato e gestito con cura: a differenza dei repository accademici isolati, la piattaforma Ultralytics viene aggiornata attivamente. Offre solide integrazioni per strumenti come ONNX, OpenVINO e CoreML.
  • Efficienza di addestramento: durante l'addestramento, i modelli Ultralytics in genere consumano molta meno VRAM rispetto alle architetture Transformer come RTDETRv2, consentendo batch di dimensioni maggiori sull'hardware consumer.
  • Versatilità: a differenza dell'ambito ristretto di YOLOv6-3.0, i modelli Ultralytics sono multi-task e supportano nativamente segmentazione, classificazione di immagini e riquadri di delimitazione orientati (OBB) all'interno di un unico framework unificato.
Distribuzione semplificata

Con la CLI di Ultralytics, esportare un modello addestrato per la distribuzione edge è semplice come eseguire: yolo export model=yolo11n.pt format=tensorrt.

Ecco YOLO26: la soluzione definitiva#

RTDETRv2 e YOLOv6-3.0 offrono vantaggi specifici, ma il settore evolve rapidamente. Ai team che avviano nuovi progetti di visione artificiale consigliamo vivamente YOLO26, rilasciato da Ultralytics a gennaio 2026.

YOLO26 combina i punti di forza delle CNN industriali e dei Transformer moderni, eliminandone al contempo i rispettivi punti deboli:

  • Design end-to-end senza NMS: adottando l'innovazione introdotta per la prima volta in YOLOv10, YOLO26 offre una head opzionale senza NMS (nms=False) che elimina la post-elaborazione NMS, garantendo una distribuzione stabile e prevedibile, simile a RTDETRv2 ma con un overhead molto inferiore.
  • Ottimizzatore MuSGD: ispirato alle tecniche avanzate di addestramento degli LLM (come Kimi K2 di Moonshot AI), questo ottimizzatore ibrido assicura un addestramento stabile e una convergenza più rapida, superando la nota instabilità dei Transformer tradizionali per la visione.
  • Ottimizzato per l'edge: fino al 43% più veloce nell'inferenza su CPU rispetto alle generazioni precedenti e con la rimozione strategica della Distribution Focal Loss (DFL), YOLO26 è perfetto per i dispositivi mobili e IoT in cui non è disponibile l'accelerazione GPU.
  • ProgLoss + STAL: queste funzioni di loss avanzate migliorano notevolmente il riconoscimento degli oggetti piccoli, una sfida storica per le CNN, rendendo YOLO26 ideale per le immagini aeree e la robotica.

Esempio di training#

L'API intuitiva di Ultralytics ti permette di addestrare senza difficoltà modelli all'avanguardia. Di seguito trovi un esempio eseguibile che mostra come addestrare il modello YOLO26 Nano sul dataset COCO8:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

Riepilogo#

Nel confronto tra RTDETRv2 e YOLOv6-3.0, la scelta dipende in larga misura dal tuo hardware specifico e dai vincoli di latenza. RTDETRv2 eccelle negli ambienti di ricerca e nell'elaborazione lato server, dove è fondamentale gestire oggetti complessi e sovrapposti. YOLOv6-3.0 resta una scelta valida per le linee di produzione ad alta produttività dotate di potenti GPU NVIDIA.

Per gli sviluppatori che cercano il meglio di entrambi i mondi — l'eleganza senza NMS dei Transformer, unita alla velocità straordinaria e all'ingombro ridotto in memoria delle CNN — YOLO26 non ha rivali. Grazie alla documentazione completa e alla community attiva dell'ecosistema Ultralytics, YOLO26 rende i tuoi progetti di IA per la visione robusti, scalabili e pronti per il futuro.

Commenti