Ultralytics YOLO27:

YOLOv8 vs RTDETRv2#

Il panorama della computer vision è in continua evoluzione, con nuove architetture che ampliano costantemente i limiti di ciò che è possibile fare nel rilevamento degli oggetti in tempo reale. Due modelli di rilievo che hanno attirato notevole attenzione sono Ultralytics YOLOv8 e RTDETRv2 di Baidu. Questa guida offre un confronto tecnico completo tra questi due potenti modelli, analizzandone le architetture, le metriche di prestazione e gli scenari di implementazione ideali.

Panoramica di YOLOv8#

Ultralytics YOLOv8 rappresenta una tappa fondamentale nella famiglia di modelli YOLO (You Only Look Once). Si basa su anni di ricerca di base per offrire velocità, accuratezza e facilità d'uso eccezionali per un'ampia varietà di attività.

Caratteristiche principali:

Architettura e punti di forza#

YOLOv8 introduce un'architettura semplificata che ottimizza sia l'estrazione delle caratteristiche sia la regressione dei riquadri di delimitazione. È un rilevatore senza ancoraggi, il che semplifica la testa di predizione e riduce il numero di regolazioni degli iperparametri necessarie durante l'addestramento. Questa architettura garantisce un ottimo equilibrio delle prestazioni tra velocità di inferenza e precisione media (mAP), rendendola particolarmente adatta all'implementazione in scenari reali, sia su dispositivi edge sia su server cloud.

Inoltre, rispetto alle architetture basate su Transformer, YOLOv8 richiede una quantità di memoria significativamente inferiore durante l'addestramento. Questo consente agli sviluppatori di addestrare modelli su GPU consumer standard senza incorrere in errori di memoria esaurita.

Versatilità#

Uno dei principali punti di forza di YOLOv8 è la sua versatilità nativa. Mentre molti modelli si concentrano esclusivamente sui riquadri di delimitazione, YOLOv8 offre il supporto immediato per il rilevamento degli oggetti, la segmentazione delle istanze, la classificazione delle immagini, la stima della posa e il rilevamento dei riquadri di delimitazione orientati (OBB).

Panoramica di RTDETRv2#

RTDETRv2 (Transformer per il rilevamento in tempo reale, versione 2) si basa sull'RT-DETR originale e mira a portare i potenti meccanismi di attenzione dei Vision Transformer nelle applicazioni di rilevamento degli oggetti in tempo reale.

Caratteristiche principali:

Architettura e punti di forza#

RTDETRv2 sfrutta un'architettura ibrida che combina un backbone di rete neurale convoluzionale (CNN) con una struttura encoder-decoder basata su Transformer. Questo consente al modello di catturare relazioni spaziali complesse e il contesto globale attraverso meccanismi di autoattenzione. Utilizzando una serie di strategie di addestramento "bag-of-freebies", RTDETRv2 raggiunge punteggi mAP competitivi su dataset benchmark standard come il dataset COCO.

Punti deboli#

Nonostante l'elevata accuratezza, la natura basata su Transformer di RTDETRv2 comporta un consumo di memoria maggiore e tempi di addestramento più lunghi rispetto alle architetture esclusivamente CNN. I Transformer richiedono intrinsecamente più VRAM, rendendo difficile l'addestramento su hardware con risorse limitate. Inoltre, sebbene RTDETRv2 sia efficace nel rilevamento, non offre la versatilità multitask, ad esempio per posa e segmentazione, propria dell'ecosistema Ultralytics.

Scopri di più su RTDETRv2

Confronto delle prestazioni#

Quando valuti i modelli per la produzione, il compromesso tra dimensioni del modello, velocità di inferenza e accuratezza è fondamentale. La tabella seguente offre un confronto diretto tra le varianti di YOLOv8 e RTDETRv2.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Hardware e metriche

Le velocità sono state misurate utilizzando un'istanza Amazon EC2 P4d. L'inferenza su CPU ha utilizzato ONNX, mentre le velocità su GPU sono state testate con TensorRT.

Casi d'uso e raccomandazioni#

La scelta tra YOLOv8 e RT-DETR dipende dai requisiti specifici del tuo progetto, dai vincoli di implementazione e dalle preferenze relative all'ecosistema.

Quando scegliere YOLOv8#

YOLOv8 è una scelta ottimale per:

  • Implementazione versatile multi-attività: Progetti che richiedono un modello collaudato per rilevamento, segmentazione, classificazione e stima della posa all'interno dell'ecosistema Ultralytics.
  • Sistemi di produzione consolidati: Ambienti di produzione esistenti già basati sull'architettura YOLOv8, con pipeline di implementazione stabili e ampiamente testate.
  • Ampio supporto della community e dell'ecosistema: Applicazioni che traggono vantaggio dagli estesi tutorial di YOLOv8, dalle integrazioni di terze parti e dalle risorse attive della community.

Quando scegliere RT-DETR#

RT-DETR è consigliato per:

  • Ricerca sul rilevamento basato su Transformer: progetti che esplorano i meccanismi di attenzione e le architetture Transformer per il rilevamento degli oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza con latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e una latenza di inferenza leggermente superiore è accettabile.
  • Rilevamento di oggetti di grandi dimensioni: scene contenenti principalmente oggetti di medie e grandi dimensioni, in cui il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

Quando scegliere Ultralytics (YOLO26)#

Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la migliore combinazione di prestazioni ed esperienza per gli sviluppatori:

  • Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
  • Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
  • Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.

Il vantaggio di Ultralytics#

La scelta di un modello va oltre le metriche pure: l'ecosistema software circostante è fondamentale per la produttività degli sviluppatori. L'ecosistema Ultralytics è rinomato per la sua facilità d'uso e offre un'API Python unificata che semplifica l'intero ciclo di vita del machine learning.

Dalla gestione dei dataset all'addestramento distribuito, Ultralytics astrae il complesso codice ripetitivo. Gli sviluppatori possono contare su pesi preaddestrati prontamente disponibili e su un'integrazione fluida con piattaforme come Hugging Face e strumenti di monitoraggio. Questo ecosistema ben gestito garantisce sviluppo attivo, aggiornamenti frequenti e un solido supporto della community.

Inoltre, l'efficienza dell'addestramento è una caratteristica distintiva dei modelli YOLO di Ultralytics. Sono altamente ottimizzati per una convergenza rapida e un utilizzo ridotto della memoria durante il processo di addestramento, accelerando notevolmente i cicli di sperimentazione rispetto ai rilevatori basati su Transformer come RTDETRv2.

Uno sguardo al futuro: la potenza di YOLO26#

Sebbene YOLOv8 rimanga un modello estremamente potente, gli sviluppatori che cercano il massimo livello di innovazione dovrebbero valutare l'aggiornamento al tanto atteso YOLO26, rilasciato a gennaio 2026. YOLO26 ridefinisce lo stato dell'arte con diverse innovazioni rivoluzionarie:

  • Design end-to-end senza NMS: YOLO26 elimina la soppressione non massima (NMS) nella fase di post-elaborazione, consentendo workflow di implementazione più veloci e deterministici.
  • Rimozione di DFL: La rimozione di Distribution Focal Loss semplifica il modello, migliorandone la compatibilità con dispositivi edge e a basso consumo.
  • Ottimizzatore MuSGD: Integrando innovazioni dell'addestramento degli LLM, l'ottimizzatore MuSGD garantisce sessioni di addestramento più stabili e una convergenza più rapida.
  • Inferenza su CPU fino al 43% più veloce: Ottimizzato in modo intensivo per gli ambienti privi di GPU dedicate.
  • ProgLoss + STAL: Queste funzioni di perdita avanzate migliorano significativamente il riconoscimento degli oggetti piccoli, un aspetto fondamentale per le immagini aeree e la robotica.

Tra le altre alternative moderne da esplorare nella suite Ultralytics c'è YOLO11, che offre prestazioni solide per i progetti legacy, anche se YOLO26 è consigliato per tutte le nuove implementazioni.

Esempio di codice: addestramento e inferenza#

La semplicità dell'API Ultralytics ti permette di caricare, addestrare e implementare modelli con poche righe di codice Python. Assicurati di aver installato PyTorch prima di eseguire l'esempio seguente.

from ultralytics import YOLO

# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")

# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

# Export seamlessly for edge deployment
export_path = model.export(format="onnx")
Pronto per l'implementazione

Ultralytics supporta l'esportazione con un clic in numerosi formati, tra cui ONNX, TensorRT e CoreML, semplificando le opzioni di implementazione del modello su architetture hardware diverse.

Conclusioni#

Sia YOLOv8 sia RTDETRv2 offrono funzionalità interessanti per il rilevamento degli oggetti in tempo reale. RTDETRv2 dimostra la potenza dei Transformer nel catturare il contesto globale, risultando adatto a complesse attività di ragionamento spaziale in cui la velocità di inferenza e il sovraccarico di memoria non sono i vincoli principali.

Tuttavia, per gli sviluppatori che danno priorità a un equilibrio eccezionale tra velocità, accuratezza ed efficienza delle risorse, i modelli YOLO di Ultralytics rimangono la scelta migliore. La natura leggera di YOLOv8, combinata con la sua facilità d'uso senza pari, la versatilità tra molteplici attività di computer vision e un florido ecosistema open source, lo rende la soluzione di riferimento per gli ambienti di produzione scalabili. Per chi cerca il massimo delle prestazioni edge, il nuovo YOLO26 offre un'efficienza senza pari senza NMS e continua a essere all'avanguardia nel settore.

Commenti