Ultralytics YOLO27:

YOLOv10 vs YOLO26#

Il panorama della visione artificiale ha registrato notevoli progressi negli ultimi anni, passando da architetture complesse e fortemente dipendenti dal post-processing a modelli semplificati end-to-end. Questo confronto tecnico esamina due importanti traguardi di questo percorso: la svolta accademica di YOLOv10 e YOLO26, all'avanguardia e pronto per l'uso in ambito enterprise. Analizzandone le architetture, le metodologie di addestramento e le capacità di deployment nel mondo reale, puoi prendere decisioni consapevoli quando sviluppi la tua prossima applicazione di IA per la visione.

YOLOv10: rilevamento degli oggetti end-to-end all'avanguardia#

Rilasciato a metà del 2024, YOLOv10 ha rappresentato un notevole passo avanti nella ricerca accademica sulla visione artificiale, affrontando uno dei colli di bottiglia più persistenti nel rilevamento degli oggetti in tempo reale: la soppressione non massima (NMS). I rilevatori di oggetti tradizionali si affidavano fortemente alla NMS per filtrare le BBox ridondanti, aggiungendo una latenza variabile durante l'inferenza e complicando il deployment sui dispositivi edge.

Il team dell'Università Tsinghua ha introdotto una strategia coerente di assegnazione duale per l'addestramento senza NMS. Questo ha permesso al modello di prevedere con precisione le BBox senza richiedere un passaggio di filtraggio post-processing, migliorando direttamente la latenza di inferenza e abbassando la soglia per il deployment su acceleratori hardware. Sebbene sia altamente efficiente per le attività di rilevamento standard, il modello si concentrava principalmente sulla previsione delle BBox e non offriva supporto nativo per attività più complesse come la segmentazione delle istanze o la stima della posa.

Scopri di più su YOLOv10

YOLO26: il nuovo standard per l'IA della visione edge e cloud#

Basandosi sui concetti senza NMS introdotti in precedenza, il nuovo YOLO26 rappresenta l'apice delle prestazioni e della versatilità. Progettato sia per la ricerca accademica sia per il deployment di livello enterprise, integra nativamente un design end-to-end senza NMS, eliminando completamente il post-processing NMS per un deployment più rapido e semplice su tutti gli hardware supportati.

YOLO26 introduce diversi miglioramenti architetturali rivoluzionari. La rimozione della perdita focale della distribuzione (DFL) semplifica notevolmente il processo di esportazione del modello e migliora la compatibilità con i dispositivi edge a basso consumo. Insieme a questi cambiamenti strutturali, YOLO26 raggiunge un'inferenza su CPU fino al 43% più veloce, diventando una scelta eccezionale per le applicazioni IoT e di robotica in cui l'accelerazione GPU potrebbe non essere disponibile.

Inoltre, la stabilità dell'addestramento e la velocità di convergenza sono state rivoluzionate grazie all'uso dell'ottimizzatore MuSGD, un ibrido di SGD e Muon ispirato alle tecniche di addestramento degli LLM. In combinazione con funzioni di perdita avanzate come ProgLoss + STAL, YOLO26 offre miglioramenti significativi nel riconoscimento degli oggetti di piccole dimensioni. Introduce inoltre miglioramenti specifici per attività, tra cui la prototipazione multi-scala per la segmentazione, la stima residuale della log-verosimiglianza (RLE) per la stima della posa e una loss angolare specializzata per risolvere i problemi ai bordi nel rilevamento delle BBox orientate (OBB).

Deployment enterprise

Per i team che desiderano scalare i propri workflow di visione artificiale, la Piattaforma Ultralytics offre un'integrazione perfetta con YOLO26, fornendo annotazione intuitiva dei dati, addestramento cloud automatizzato e opzioni di deployment con un solo clic, senza richiedere un'infrastruttura MLOps estesa.

Confronto delle prestazioni tecniche#

Quando valuti questi modelli, l'equilibrio tra accuratezza, dimensioni del modello e velocità di inferenza è fondamentale. La tabella seguente evidenzia le prestazioni di entrambe le famiglie di modelli su diverse scale, valutate sullo standard dataset COCO.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

I dati dimostrano chiaramente il vantaggio evolutivo della nuova architettura. YOLO26 raggiunge una mAP (precisione media) più elevata a tutti i livelli di dimensione, mantenendo al contempo velocità di inferenza altamente competitive. La rimozione della DFL in YOLO26 contribuisce in particolare alle sue eccezionali prestazioni ONNX su CPU, una metrica con cui le generazioni precedenti spesso avevano difficoltà.

Metodologie di addestramento ed ecosistema#

L'utilità di un modello dipende dall'ecosistema che lo supporta. Sebbene YOLOv10 fornisse un'implementazione accademica eccellente basata su PyTorch, spesso richiede una configurazione manuale per le attività che vanno oltre il rilevamento di base.

Al contrario, YOLO26 è completamente integrato nell'ecosistema Ultralytics, sottoposto a manutenzione costante. Questo garantisce requisiti di memoria durante l'addestramento significativamente inferiori rispetto ai modelli basati su Transformer come RT-DETR, consentendo ai ricercatori di addestrare reti all'avanguardia su hardware di livello consumer. La facilità d'uso è senza pari, grazie a un'API unificata che gestisce automaticamente l'aumento dei dati, l'ottimizzazione degli iperparametri e la registrazione dei log.

Esempio di codice: addestramento di YOLO26#

Per addestrare un modello versatile e altamente accurato bastano poche righe di codice Python:

from ultralytics import YOLO

# Load the highly optimized YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model efficiently with automatic memory management
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
)

# Export natively to TensorRT without NMS complexities
model.export(format="engine")

Applicazioni e casi d'uso nel mondo reale#

La scelta dell'architettura giusta dipende interamente dai vincoli di deployment.

Elaborazione edge ad alta velocità#

Per le applicazioni che richiedono un deployment rapido su microcontrollori, robot o dispositivi mobili obsoleti, l'inferenza su CPU più veloce del 43% di YOLO26 lo rende la scelta definitiva. La sua architettura senza NMS e senza DFL si converte perfettamente in formati come OpenVINO e TensorRT, ideali per l'analisi video in tempo reale nelle infrastrutture delle smart city.

Visione multi-task avanzata#

Sebbene YOLOv10 eccella nel puro rilevamento delle BBox, i progetti che richiedono una comprensione visiva approfondita devono affidarsi a YOLO26. Dalla segmentazione delle istanze nelle immagini mediche alla stima precisa della posa per l'analisi sportiva, YOLO26 offre funzioni di perdita specifiche per attività che garantiscono un'accuratezza superiore in diversi ambiti.

Opzioni alternative

Se il tuo progetto richiede un rilevamento robusto a vocabolario aperto, valuta YOLO-World. Per gli utenti che gestiscono pipeline legacy, YOLO11 resta un'alternativa potente e completamente supportata all'interno del framework Ultralytics.

Casi d'uso e raccomandazioni#

La scelta tra YOLOv10 e YOLO26 dipende dai requisiti specifici del tuo progetto, dai vincoli di deployment e dalle preferenze relative all'ecosistema.

Quando scegliere YOLOv10#

YOLOv10 è una scelta ottimale per:

  • Rilevamento in tempo reale senza NMS: applicazioni che traggono vantaggio dal rilevamento end-to-end senza soppressione non massima, riducendo la complessità della distribuzione.
  • Compromesso equilibrato tra velocità e accuratezza: progetti che richiedono un equilibrio efficace tra velocità di inferenza e accuratezza del rilevamento su diverse dimensioni del modello.
  • Applicazioni a latenza coerente: scenari di distribuzione in cui sono fondamentali tempi di inferenza prevedibili, come la robotica o i sistemi autonomi.

Quando scegliere YOLO26#

YOLO26 è consigliato per:

  • Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
  • Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
  • Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.

Conclusioni#

La transizione da YOLOv10 a YOLO26 evidenzia un cambiamento cruciale: dalla prova di concetto accademica alle soluzioni enterprise pronte per la produzione. Adottando il pionieristico design senza NMS e migliorandolo con l'ottimizzatore MuSGD, ProgLoss e una compatibilità edge ottimizzata, YOLO26 stabilisce un nuovo punto di riferimento per ciò che è possibile fare nella visione artificiale in tempo reale. Per gli sviluppatori che mirano a ottenere il miglior equilibrio tra velocità, accuratezza e usabilità, YOLO26 si distingue come la scelta definitiva.

Contributori

Commenti