YOLO26 vs YOLOv9#
Il panorama della computer vision evolve rapidamente, con nuove architetture che ampliano continuamente i limiti di velocità e accuratezza. In questo confronto tecnico, analizziamo le differenze tra YOLO26 e YOLOv9, due modelli di grande rilievo nel campo del rilevamento degli oggetti in tempo reale. Sebbene entrambi i modelli offrano innovazioni architetturali distintive, comprenderne i compromessi in termini di prestazioni, le capacità di deployment e i requisiti hardware è fondamentale per scegliere lo strumento giusto per il tuo prossimo progetto di visione artificiale.
YOLO26: il motore ottimizzato per l'edge#
Rilasciato all'inizio del 2026, Ultralytics YOLO26 rappresenta un salto generazionale nell'efficienza del deployment e nella stabilità dell'addestramento del modello. Progettato come framework nativamente end-to-end, affronta direttamente i colli di bottiglia del deployment che storicamente hanno ostacolato le applicazioni di IA edge.
Dettagli del modello:
- Autori: Glenn Jocher e Jing Qiu
- Organizzazione: Ultralytics
- Data: 2026-01-14
- GitHub: Repository di Ultralytics
- Documentazione: Documentazione di YOLO26
Architettura e innovazioni#
YOLO26 riprogetta radicalmente la pipeline di post-elaborazione introducendo un design end-to-end senza NMS. Eliminando la necessità della Soppressione non massima (NMS), il modello raggiunge una variabilità della latenza notevolmente inferiore. Questo semplifica significativamente il deployment su piattaforme mobili ed edge, soprattutto durante l'esportazione verso framework come ONNX e Apple CoreML.
Inoltre, la rimozione della Perdita Focale della Distribuzione (DFL) semplifica il processo di esportazione e aumenta la compatibilità con i microcontrollori a basso consumo. Per migliorare la stabilità dell'addestramento, YOLO26 integra il nuovo ottimizzatore MuSGD, una combinazione di Discesa del Gradiente Stocastico (SGD) e Muon (ispirata alle innovazioni nell'addestramento dei Modelli Linguistici di Grandi Dimensioni). Il risultato è una convergenza più rapida e un'estrazione delle caratteristiche più robusta su dataset complessi.
Grazie alle semplificazioni architetturali e alla rimozione di DFL, YOLO26 raggiunge un'inferenza su CPU fino al 43% più veloce, risultando la scelta ideale per dispositivi edge con risorse limitate, come Raspberry Pi o NVIDIA Jetson Nano.
Per rilevare oggetti particolarmente difficili in scenari come le immagini aeree riprese da droni, YOLO26 utilizza le funzioni di perdita aggiornate ProgLoss + STAL. Queste offrono miglioramenti significativi nel recall del riconoscimento degli oggetti piccoli. Inoltre, il modello include miglioramenti specifici per attività, tra cui proto multi-scala per la segmentazione delle istanze, la Stima Residua della Log-Verosimiglianza (RLE) per la stima della posa e una funzione di perdita angolare specializzata per il rilevamento dei Riquadri di delimitazione orientati (OBB).
YOLOv9: informazioni programmabili sul gradiente#
Introdotto all'inizio del 2024, YOLOv9 ha apportato innovazioni teoriche al modo in cui le reti neurali gestiscono il flusso del gradiente durante la fase di addestramento, concentrandosi sull'efficienza dei parametri e sulla conservazione delle caratteristiche profonde.
Dettagli del modello:
- Autori: Chien-Yao Wang e Hong-Yuan Mark Liao
- Organizzazione: Institute of Information Science, Academia Sinica, Taiwan
- Data: 2024-02-21
- Arxiv: Articolo su YOLOv9
- GitHub: Repository di YOLOv9
- Documentazione: Documentazione di YOLOv9
Architettura e punti di forza#
YOLOv9 si basa sul concetto di Informazioni programmabili sul gradiente (PGI) e sulla Rete generalizzata per l'aggregazione efficiente dei livelli (GELAN). Questi concetti affrontano il problema del collo di bottiglia informativo spesso osservato nelle reti neurali profonde. Preservando le informazioni essenziali durante il processo feed-forward, GELAN garantisce che i gradienti utilizzati per aggiornare i pesi rimangano affidabili. Questa architettura offre un'elevata accuratezza e rende YOLOv9 un valido candidato per la ricerca accademica sulla teoria delle reti neurali e sull'ottimizzazione dei percorsi del gradiente utilizzando il framework PyTorch.
Limitazioni#
Nonostante l'eccellente efficienza dei parametri, YOLOv9 dipende fortemente dalla NMS tradizionale per la post-elaborazione dei riquadri di delimitazione, il che può creare colli di bottiglia computazionali durante l'inferenza sui dispositivi edge. Inoltre, il repository ufficiale è in gran parte incentrato sul rilevamento degli oggetti, richiedendo un notevole lavoro di sviluppo personalizzato per adattarlo ad attività specializzate come il tracking o la stima della posa.
Confronto delle prestazioni#
Quando valuti questi modelli per il deployment nel mondo reale, è fondamentale bilanciare accuratezza (mAP), velocità di inferenza e utilizzo della memoria. I modelli Ultralytics sono rinomati per i bassi requisiti di memoria sia durante l'addestramento sia durante l'inferenza e richiedono molta meno memoria CUDA rispetto ad alternative basate su Transformer come RT-DETR.
Di seguito trovi un confronto diretto delle prestazioni di YOLO26 e YOLOv9 sul dataset COCO. I valori migliori in ogni colonna sono evidenziati in grassetto.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Nota: le velocità su CPU di YOLOv9 sono omesse perché variano notevolmente in base alla configurazione della NMS e sono generalmente inferiori rispetto all'implementazione nativa senza NMS di YOLO26.
Casi d'uso e raccomandazioni#
La scelta tra YOLO26 e YOLOv9 dipende dai requisiti specifici del tuo progetto, dai vincoli di deployment e dalle tue preferenze per l'ecosistema.
Quando scegliere YOLO26#
YOLO26 è una scelta valida per:
- Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
- Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
- Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.
Quando scegliere YOLOv9#
YOLOv9 è consigliato per:
- Ricerca sui colli di bottiglia informativi: progetti accademici che studiano le architetture basate sulle Informazioni programmabili sul gradiente (PGI) e sulla Rete generalizzata per l'aggregazione efficiente dei livelli (GELAN).
- Studi sull'ottimizzazione del flusso del gradiente: ricerche incentrate sulla comprensione e sulla mitigazione della perdita di informazioni nei livelli delle reti profonde durante l'addestramento.
- Benchmarking del rilevamento ad alta accuratezza: scenari in cui le solide prestazioni di YOLOv9 sul benchmark COCO sono necessarie come punto di riferimento per confronti architetturali.
Il vantaggio di Ultralytics#
Scegliere un modello richiede più della semplice lettura di un benchmark di accuratezza: l'ecosistema software circostante determina la rapidità con cui puoi passare dalla raccolta dei dati alla produzione.
Facilità d'uso ed ecosistema#
L'API Python di Ultralytics offre un'esperienza fluida da "zero a esperto". Invece di clonare repository complessi o configurare manualmente gli script per l'addestramento distribuito, puoi installare il pacchetto tramite pip e iniziare subito l'addestramento. L'ecosistema Ultralytics, mantenuto attivamente, garantisce aggiornamenti frequenti, integrazioni automatizzate con piattaforme ML come Weights & Biases e una documentazione completa.
Versatilità tra le attività di visione artificiale#
Mentre YOLOv9 è principalmente un motore di rilevamento, YOLO26 è uno strumento di visione artificiale per uso generale. Utilizzando un'unica sintassi unificata, puoi passare facilmente dal rilevamento degli oggetti alla segmentazione delle immagini con precisione a livello di pixel o alla classificazione dell'immagine completa. Questa versatilità riduce il debito tecnico legato alla manutenzione di più codebase separate per funzionalità diverse di computer vision.
Addestramento e deployment efficienti#
L'efficienza dell'addestramento è un pilastro della filosofia di Ultralytics. YOLO26 utilizza pesi pre-addestrati pronti all'uso e vanta un utilizzo della memoria significativamente inferiore rispetto ai pesanti Transformer per la visione artificiale. Una volta addestrato il modello, le pipeline di esportazione integrate consentono conversioni con un solo clic verso formati ottimizzati come TensorRT o TensorFlow Lite, semplificando il percorso verso la produzione.
Esempio di codice: iniziare con YOLO26#
Implementare YOLO26 è sorprendentemente semplice. Il seguente frammento di codice Python mostra come caricare un modello pre-addestrato, addestrarlo su dati personalizzati ed eseguire l'inferenza utilizzando l'API Ultralytics.
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()Sfruttando la velocità, l'architettura semplificata e il solido ecosistema di YOLO26, i team possono portare sul mercato applicazioni avanzate di IA per la visione artificiale più rapidamente e con meno ostacoli tecnici che mai.