Ultralytics YOLO27:

YOLO26 vs YOLOv7#

L'evoluzione del rilevamento degli oggetti in tempo reale ha attraversato numerose tappe fondamentali, con Ultralytics YOLO26 e YOLOv7 che rappresentano due importanti progressi nelle capacità di visione artificiale. Mentre YOLOv7 ha introdotto nel 2022 la potente metodologia "bag-of-freebies", ridefinendo i benchmark di accuratezza, la nuova architettura YOLO26 inaugura ottimizzazioni progettate prima di tutto per l'edge, un'elaborazione nativamente end-to-end e dinamiche di addestramento stabili ispirate alle innovazioni dei Modelli linguistici di grandi dimensioni (LLM).

Questo approfondimento mette a confronto queste due architetture, analizzandone le metriche di prestazioni, le differenze strutturali e gli scenari di deployment ideali, per aiutare gli ingegneri del machine learning a prendere decisioni consapevoli per il loro prossimo progetto di IA per la visione.

Contesto e dettagli dei modelli#

Prima di esaminare i dati sulle prestazioni, è importante comprendere le origini e gli obiettivi principali di ciascun modello.

Ultralytics YOLO26#

YOLOv7#

Scopri di più su YOLOv7

Modelli alternativi da prendere in considerazione

Se stai esplorando l'ecosistema più ampio, potresti essere interessato anche a YOLO11 per deployment multitask altamente equilibrati, oppure al modello RT-DETR basato su Transformer per il rilevamento basato su sequenze. Tieni presente che i modelli meno recenti come YOLOv8 e YOLOv5 sono ancora pienamente supportati sulla Ultralytics Platform per le integrazioni legacy.

Approfondimento sull'architettura#

Le filosofie architetturali alla base di YOLO26 e YOLOv7 divergono significativamente, riflettendo il passaggio dalla massimizzazione delle prestazioni su GPU di fascia alta all'ottimizzazione per un deployment edge fluido ed end-to-end.

YOLO26: il paradigma edge-first#

Rilasciato nel 2026, YOLO26 ripensa radicalmente la pipeline di deployment. La sua innovazione più significativa è il design end-to-end senza NMS. Eliminando il post-processing della soppressione dei massimi non pertinenti (NMS), YOLO26 riduce drasticamente la variabilità della latenza, un concetto sperimentato con successo per la prima volta in YOLOv10. Questo garantisce frequenze dei fotogrammi costanti anche in scene densamente popolate, un aspetto fondamentale per la robotica autonoma e il monitoraggio del traffico.

Inoltre, YOLO26 rimuove completamente la Distribution Focal Loss (DFL). Questa rimozione della DFL semplifica l'esportazione in formati come ONNX e Apple CoreML, raggiungendo un'inferenza su CPU fino al 43% più veloce.

La stabilità dell'addestramento è un altro obiettivo principale. L'introduzione dell'ottimizzatore MuSGD—un ibrido tra la discesa del gradiente stocastico standard e Muon, ispirato alle dinamiche di addestramento di Kimi K2—porta nella visione artificiale la stabilità avanzata dell'addestramento degli LLM. In combinazione con le funzioni di perdita ProgLoss + STAL, YOLO26 eccelle nel riconoscimento degli oggetti piccoli, una difficoltà storica per i rilevatori in tempo reale.

YOLOv7: maestria del bag-of-freebies#

YOLOv7 è stato sviluppato sulla base di uno studio esaustivo dell'ottimizzazione dei percorsi del gradiente. La sua innovazione principale è la Rete di aggregazione dei livelli efficienti estesa (E-ELAN), che consente al modello di apprendere caratteristiche più diversificate senza alterare i percorsi originali del gradiente.

L'architettura YOLOv7 si basa inoltre ampiamente su tecniche di riparametrizzazione durante l'inferenza, fondendo essenzialmente i livelli per aumentare la velocità senza sacrificare le ricche rappresentazioni delle caratteristiche apprese durante l'addestramento. Sebbene sia potente sulle GPU server NVIDIA TensorRT standard, questo approccio si basa ancora su teste di rilevamento basate su anchor e sull'NMS tradizionale, che possono complicare il deployment su dispositivi a bassa potenza.

Confronto delle prestazioni#

La tabella seguente offre un confronto diretto tra i modelli addestrati sul dataset COCO standard. YOLO26 dimostra miglioramenti significativi in termini di accuratezza (mAP), mantenendo al contempo un equilibrio eccezionale tra numero di parametri e FLOPs.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Nota: YOLO26x supera YOLOv7x in termini di mAP con un margine notevole (57.5 contro 53.1), richiedendo al contempo circa il 22% di parametri in meno.

Il vantaggio dell'ecosistema Ultralytics#

Uno dei motivi principali per cui gli sviluppatori scelgono costantemente YOLO26 è la sua profonda integrazione nella Ultralytics Platform. A differenza degli script indipendenti richiesti dalle architetture meno recenti, Ultralytics offre un workflow unificato e fluido.

  1. Semplicità d'uso: l'API Python consente di caricare, addestrare e distribuire i modelli con appena poche righe di codice. L'esportazione in formati per dispositivi mobili come TensorFlow Lite richiede semplicemente la modifica di un singolo argomento.
  2. Requisiti di memoria: i modelli Ultralytics sono progettati meticolosamente per un addestramento efficiente. Richiedono molta meno memoria CUDA rispetto ai pesanti modelli Transformer per la visione, consentendo ai ricercatori di eseguire batch size più grandi su hardware consumer.
  3. Versatilità: mentre YOLOv7 richiede repository completamente diversi per attività diverse, YOLO26 supporta nativamente il rilevamento di classificazione delle immagini, segmentazione delle istanze, stima della posa e rilevamento di riquadri delimitatori orientati (OBB) da un'unica libreria coerente. Include persino funzioni di perdita specifiche per attività, come la stima della log-verosimiglianza residua (RLE) per le pipeline della posa umana.
  4. Sviluppo attivo: la community open source di Ultralytics fornisce aggiornamenti frequenti, garantendo la rapida risoluzione dei casi limite e la compatibilità continua con le versioni più recenti di PyTorch.
Esportazione semplificata

Poiché YOLO26 è nativamente privo di NMS, il deployment su target embedded tramite Intel OpenVINO o ONNX Runtime elimina completamente gli script complessi di post-processing.

Casi d'uso nel mondo reale#

Le differenze architetturali tra questi modelli determinano gli scenari di deployment ideali per ciascuno.

Quando scegliere YOLO26#

YOLO26 è la scelta indiscussa per i moderni sistemi di visione artificiale orientati al futuro.

  • IA edge e IoT: grazie alla sua inferenza su CPU più veloce del 43% e al numero contenuto di parametri, YOLO26n è perfetto per dispositivi con risorse limitate come Raspberry Pi o le telecamere per smart city.
  • Droni e immagini aeree: l'integrazione di ProgLoss + STAL migliora drasticamente il rilevamento degli oggetti piccoli, rendendolo la scelta principale per le ispezioni delle condutture e l'agricoltura di precisione.
  • Robotica multitask: poiché gestisce facilmente e simultaneamente riquadri delimitatori, maschere di segmentazione e punti chiave della posa con un overhead di memoria minimo, è particolarmente adatto alla navigazione e all'interazione robotica dinamica.

Quando prendere in considerazione YOLOv7#

Sebbene sia stato per lo più superato dalle architetture più recenti, YOLOv7 conserva alcune utilità di nicchia.

  • Benchmark accademici: i ricercatori che sviluppano nuove teste di rilevamento basate su anchor o studiano le strategie dei percorsi del gradiente utilizzano spesso YOLOv7 come baseline standard di confronto su piattaforme come Papers With Code.
  • Pipeline GPU legacy: i sistemi enterprise sviluppati appositamente intorno agli output tensoriali specifici di YOLOv7 e alle configurazioni NMS personalizzate su potenti istanze AWS EC2 P4d potrebbero rimandare la migrazione ai modelli più recenti finché non sarà necessaria una completa rifattorizzazione del sistema.

Esempio di codice: primi passi#

L'esperienza dello sviluppatore evidenzia il netto contrasto tra i repository di ricerca standard e l'ecosistema Ultralytics. Addestrare un modello YOLO26 personalizzato è straordinariamente semplice:

from ultralytics import YOLO

# Load the latest state-of-the-art YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on your custom dataset with automated caching and logging
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Perform an end-to-end NMS-free prediction on an external image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export the optimized model for edge deployment
model.export(format="onnx")

Considerazioni finali#

Sebbene YOLOv7 rimanga una tappa rispettata nella storia del rilevamento degli oggetti in tempo reale, il settore si è spostato rapidamente verso modelli che privilegiano la semplicità di deployment, la versatilità multitask e l'efficienza edge.

Eliminando l'NMS, introducendo l'ottimizzatore MuSGD e migliorando drasticamente la velocità di inferenza su CPU, Ultralytics YOLO26 si afferma oggi come la scelta definitiva per sviluppatori e ingegneri enterprise. Insieme al solido ecosistema Ultralytics, intuitivo da usare, offre un equilibrio senza pari tra velocità, accuratezza e piacere di progettazione.

Contributori

Commenti