Ultralytics YOLO27:
Get Started

YOLO26 vs RTDETRv2#

Il panorama della visione artificiale è in continua evoluzione e pone i professionisti di fronte a una scelta cruciale: sfruttare reti neurali convoluzionali (CNN) altamente ottimizzate o adottare le più recenti architetture basate sui Transformer? Tra i principali contendenti in questo ambito troviamo l'avanzato Ultralytics YOLO26 e RTDETRv2 di Baidu. Entrambi i modelli ampliano i confini del rilevamento di oggetti in tempo reale, ma si basano su filosofie architetturali fondamentalmente diverse.

Questa guida offre un approfondimento tecnico su entrambi i modelli e ne confronta strutture, metriche di prestazione e casi d'uso ideali per aiutarti a scegliere la base migliore per il tuo prossimo progetto di visione artificiale.

Ultralytics YOLO26: il vertice dell'IA visiva progettata per l'edge#

Sviluppato da Ultralytics, YOLO26 rappresenta un enorme salto generazionale per la famiglia YOLO. Rilasciato a gennaio 2026, è progettato appositamente per offrire velocità, accuratezza e una distribuzione senza interruzioni negli ambienti cloud ed edge.

Innovazioni e punti di forza architetturali#

YOLO26 introduce diverse funzionalità rivoluzionarie che lo distinguono non solo dai modelli Transformer, ma anche dalle versioni precedenti come YOLO11:

  • Design end-to-end senza NMS: la testa opzionale one-to-one di YOLO26 (nms=False) elimina la tradizionale soppressione non massima (NMS) durante la post-elaborazione. Introdotto per la prima volta in modelli come YOLOv10, questo approccio end-to-end riduce le variazioni della latenza di inferenza e semplifica la logica di distribuzione, soprattutto sull'hardware edge.
  • Inferenza CPU fino al 43% più veloce: consapevole della crescente necessità di un'IA decentralizzata, YOLO26 è altamente ottimizzato per i dispositivi privi di GPU dedicate, come Raspberry Pi.
  • Rimozione di DFL: eliminando la Distribution Focal Loss (DFL), YOLO26 semplifica il processo di esportazione e migliora notevolmente la compatibilità con dispositivi edge a basso consumo e microcontrollori.
  • Ottimizzatore MuSGD: colmando il divario tra l'addestramento dei modelli linguistici di grandi dimensioni (LLM) e la visione artificiale, YOLO26 utilizza l'ottimizzatore MuSGD. Questo ibrido di SGD e Muon, ispirato a Kimi K2 di Moonshot AI, assicura un addestramento stabile e una convergenza più rapida.
  • ProgLoss + STAL: le funzioni di perdita avanzate migliorano sensibilmente il riconoscimento degli oggetti piccoli. È un aspetto cruciale per i settori che si affidano all'analisi delle immagini aeree e ai sensori dell'Internet delle cose (IoT).

Versatilità nelle attività di visione#

A differenza dei modelli limitati ai soli riquadri di delimitazione, YOLO26 è uno strumento versatile e potente. Integra miglioramenti specifici per attività, come la funzione di perdita per la segmentazione semantica e un proto multi-scala per la segmentazione di istanze, la stima dei logaritmi di verosimiglianza residui (RLE) per la stima della posa e una funzione di perdita angolare specializzata per risolvere i problemi ai bordi nelle attività con riquadri di delimitazione orientati (OBB).

Strategia di distribuzione edge

Per la distribuzione sui dispositivi edge, usa le varianti YOLO26n (Nano) o YOLO26s (Small). Grazie alla rimozione di DFL e alla testa opzionale senza NMS, esportare questi modelli in CoreML o LiteRT è semplice e garantisce prestazioni fluide in tempo reale su iOS e Android.

RTDETRv2: miglioramento dei Transformer per il rilevamento in tempo reale#

Sviluppato da ricercatori di Baidu, RTDETRv2 si basa sul framework originale RT-DETR. Il suo obiettivo è dimostrare che i Transformer per il rilevamento (DETR) possono competere con le CNN altamente ottimizzate, e talvolta superarle, in termini di velocità e accuratezza negli scenari in tempo reale.

Architettura e funzionalità#

RTDETRv2 utilizza un'architettura basata sui Transformer, che elabora le immagini in modo intrinsecamente diverso dalle CNN, sfruttando meccanismi di self-attention per comprendere il contesto globale.

  • Bag-of-Freebies: la versione v2 introduce una serie di tecniche di addestramento ottimizzate (bag-of-freebies) che migliorano le prestazioni di base senza aumentare i costi di inferenza.
  • Comprensione del contesto globale: grazie ai livelli di attenzione dei Transformer, RTDETRv2 è particolarmente adatto a comprendere scene complesse in cui il contesto globale è necessario per distinguere gli oggetti sovrapposti o occlusi.

Scopri di più su RTDETRv2

Limiti dei modelli Transformer#

Pur essendo potenti, i modelli di rilevamento basati sui Transformer come RTDETRv2 incontrano spesso difficoltà nella distribuzione pratica. In genere richiedono più memoria CUDA durante l'addestramento rispetto alle efficienti CNN. Inoltre, integrarli in ambienti edge diversi può essere complicato a causa delle operazioni complesse richieste dai livelli di attenzione, rendendo modelli come YOLO26 molto più interessanti per le distribuzioni con risorse limitate.

Confronto delle prestazioni#

Il confronto diretto di questi modelli mette in luce i vantaggi concreti delle più recenti ottimizzazioni delle CNN. La tabella seguente ne illustra le prestazioni sui benchmark standard.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Come mostrano i risultati, YOLO26 supera costantemente RTDETRv2 in tutte le varianti di dimensioni. YOLO26x raggiunge un notevole mAP di 57.5 con una latenza inferiore (11.8 ms su TensorRT) e un numero di parametri nettamente minore (55.7M) rispetto a RTDETRv2-x (mAP di 54.3, 15.03 ms, 76M parametri).

Casi d'uso e consigli#

La scelta tra YOLO26 e RT-DETR dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze relative all'ecosistema.

Quando scegliere YOLO26#

YOLO26 è un'ottima scelta per:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Quando scegliere RT-DETR#

RT-DETR è consigliato per:

  • Ricerca sul rilevamento basato sui Transformer: progetti che esplorano meccanismi di attenzione e architetture Transformer per il rilevamento di oggetti end-to-end senza NMS.
  • Scenari ad alta accuratezza e latenza flessibile: applicazioni in cui l'accuratezza del rilevamento è la priorità assoluta e si può accettare una latenza di inferenza leggermente più alta.
  • Rilevamento di oggetti grandi: scene in cui sono presenti principalmente oggetti medio-grandi e il meccanismo di attenzione globale dei Transformer offre un vantaggio naturale.

I vantaggi di Ultralytics#

Scegliere la giusta architettura di machine learning è solo una parte del lavoro: l'ecosistema circostante determina quanto rapidamente un team può passare dalla prototipazione alla produzione.

Facilità d'uso ed efficienza dell'addestramento#

L'API Python di Ultralytics offre un'esperienza straordinariamente intuitiva. Addestrare modelli complessi non richiede più codice boilerplate prolisso. Inoltre, l'efficienza di addestramento di YOLO26 è decisamente superiore: usa molta meno memoria VRAM della GPU rispetto ai meccanismi di attenzione, particolarmente esigenti in termini di memoria, di RTDETRv2. Questo permette di usare batch di dimensioni maggiori anche su hardware consumer.

from ultralytics import YOLO

# Inizializza il modello YOLO26 Nano all'avanguardia
model = YOLO("yolo26n.pt")

# Addestra sul dataset COCO8 per 100 epoche
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esegui inferenze ad alta velocità senza NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Esporta in ONNX per una distribuzione senza interruzioni
model.export(format="onnx")

Un ecosistema sottoposto a manutenzione costante#

Usando i modelli Ultralytics, gli sviluppatori accedono a un framework sottoposto a manutenzione attiva e integrato nativamente con strumenti di tracciamento moderni come Weights & Biases e Comet ML. Se preferisci un approccio senza codice, la piattaforma Ultralytics semplifica l'addestramento nel cloud, la gestione dei dataset e la distribuzione con un solo clic.

Equilibrio delle prestazioni#

YOLO26 offre un equilibrio senza eguali tra velocità di inferenza e accuratezza. La rimozione opzionale di NMS, insieme all'ottimizzatore MuSGD, garantisce un modello altamente accurato sugli oggetti piccoli (grazie a ProgLoss + STAL) e rapidissimo in produzione, rendendolo la scelta migliore per quasi tutte le moderne applicazioni di visione artificiale.

Altri modelli dell'ecosistema#

Sebbene YOLO26 e RTDETRv2 rappresentino l'avanguardia del rilevamento in tempo reale, gli sviluppatori che gestiscono pipeline legacy o esplorano diversi livelli di efficienza potrebbero prendere in considerazione anche YOLOv8 per ambienti aziendali consolidati, oppure valutare altre architetture come EfficientDet. Tuttavia, per ogni nuova iniziativa, YOLO26 è la scelta consigliata.

Commenti