YOLO11 rispetto a YOLOv6-3.0#
Il campo della visione artificiale si evolve rapidamente e selezionare l'architettura del modello giusta è una decisione cruciale per chi lavora nel machine learning. Due tappe significative nell'evoluzione della rilevazione degli oggetti in tempo reale sono YOLO11 e YOLOv6-3.0. Sebbene entrambi i modelli offrano capacità notevoli per estrarre informazioni dai dati visivi, sono stati sviluppati con obiettivi primari e filosofie progettuali differenti.
Questa guida fornisce un'analisi tecnica approfondita che mette a confronto le loro architetture, le metriche di prestazione e gli scenari di distribuzione ideali, per aiutarti a prendere una decisione informata per il tuo prossimo progetto di AI.
Panoramica dei modelli#
Prima di esaminare i benchmark tecnici, è utile comprendere l'origine e l'obiettivo principale di ciascun modello.
Ultralytics YOLO11#
Sviluppato nativamente nell'ecosistema Ultralytics, YOLO11 è stato progettato per offrire un'esperienza di sviluppo fluida e completa, dall'inizio alla fine. Non si concentra solo sulla velocità pura, ma anche sulla versatilità multi-task, sulla facilità d'uso e sull'integrazione con le moderne pipeline di distribuzione.
- Autori: Glenn Jocher e Jing Qiu
- Organizzazione: Ultralytics
- Data: 2024-09-27
- GitHub: Repository di Ultralytics
- Documentazione: Documentazione di YOLO11
Meituan YOLOv6-3.0#
YOLOv6-3.0 è stato progettato esplicitamente per applicazioni industriali in cui sono disponibili unità di elaborazione grafica (GPUs) dedicate. Ottimizza fortemente la distribuzione tramite TensorRT, concentrandosi sulla massimizzazione del throughput in ambienti controllati.
- Autori: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu e Xiangxiang Chu
- Organizzazione: Meituan
- Data: 2023-01-13
- Arxiv: 2301.05586
- GitHub: Repository Meituan YOLOv6
- Documentazione: Documentazione di YOLOv6
Differenze architetturali#
L'architettura sottostante determina il modo in cui un modello apprende e si adatta alla scala. Entrambi i framework introducono miglioramenti distintivi alla formula classica di YOLO.
YOLO11 si basa su anni di ricerca per offrire un'architettura estremamente efficiente in termini di parametri. Include un backbone avanzato e una head generalizzata in grado di gestire diverse attività di visione artificiale, come la segmentazione delle istanze e la stima della posa, senza richiedere profonde revisioni strutturali. Inoltre, YOLO11 vanta requisiti di memoria CUDA eccezionalmente ridotti durante l'addestramento, distinguendosi da modelli Transformer più pesanti come RT-DETR.
Al contrario, YOLOv6-3.0 utilizza un modulo Bi-directional Concatenation (BiC) e una strategia Anchor-Aided Training (AAT). Questi meccanismi sono progettati per migliorare la precisione della localizzazione. L'architettura è principalmente disaccoppiata e fortemente quantizzata per favorire l'inferenza del modello INT8, risultando una soluzione competitiva per linee di produzione ad alta velocità che utilizzano stack GPU legacy.
Se il tuo progetto richiede prototipazione rapida, supporto per attività diverse, come segmentazione o classificazione, e distribuzione su hardware differenti, tra cui CPU, Edge TPU e dispositivi Mobile, il framework Ultralytics offre un'esperienza di sviluppo decisamente più fluida.
Prestazioni e metriche#
Quando valuti i modelli, la precisione media (mAP) e la velocità di inferenza sono fondamentali. La tabella seguente confronta le prestazioni di YOLO11 e YOLOv6-3.0 su diverse scale dei modelli. Le metriche con le prestazioni migliori sono evidenziate in grassetto.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Come mostrato, YOLO11 raggiunge costantemente una precisione (mAP) superiore con un numero significativamente inferiore di parametri e FLOPs nei livelli equivalenti. Questa efficienza in termini di parametri si traduce direttamente in requisiti di memoria inferiori sia durante l'addestramento del modello sia durante l'inferenza.
Il vantaggio di Ultralytics#
Scegliere un modello non significa considerare solo le metriche pure, ma l'intero ciclo di vita del machine learning. I modelli Ultralytics offrono un vantaggio distintivo sia agli sviluppatori sia ai ricercatori.
- Facilità d'uso: l'API Python di Ultralytics ti consente di addestrare, validare ed esportare modelli con poche righe di codice. Non è necessario configurare manualmente alberi complessi di dipendenze.
- Ecosistema gestito attivamente: Ultralytics offre un ecosistema unificato che riceve aggiornamenti frequenti. Utilizzando la Ultralytics Platform, gli sviluppatori hanno accesso all'annotazione collaborativa dei dataset, all'addestramento nel cloud e al monitoraggio fluido dei modelli.
- Versatilità: a differenza di YOLOv6-3.0, che è principalmente un rilevatore di riquadri delimitatori, YOLO11 supporta nativamente la classificazione delle immagini e i riquadri delimitatori orientati (OBB), consentendoti di consolidare il tuo stack tecnologico.
- Efficienza dell'addestramento: sfruttando le moderne ottimizzazioni e l'auto-batching, YOLO11 si addestra in modo efficiente su hardware di livello consumer, rendendo l'AI per la visione all'avanguardia accessibile a tutti.
Esempio di codice: addestramento e inferenza#
Lavorare con i modelli Ultralytics è estremamente intuitivo. Di seguito trovi un esempio eseguibile al 100% che mostra come addestrare un modello ed eseguire l'inferenza utilizzando il pacchetto Ultralytics.
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model efficiently on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on an image from the web
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format for easy deployment
model.export(format="onnx")Casi d'uso ideali#
Comprendere i punti di forza di ciascun modello ti permette di selezionare lo strumento giusto per il lavoro.
Quando scegliere YOLOv6-3.0: Se gestisci un sistema industriale legacy costruito esplicitamente attorno a specifiche pipeline TensorRT 7.x/8.x e il tuo hardware è costituito interamente da GPU NVIDIA T4 o A100 dedicate per l'automazione della produzione ad alta velocità, YOLOv6 rimane un motore valido e capace.
Quando scegliere YOLO11: Per quasi tutte le applicazioni moderne, YOLO11 è la scelta superiore. Che tu stia sviluppando soluzioni di produzione intelligente, distribuendo AI edge su dispositivi Raspberry Pi o eseguendo operazioni multi-task come il rilevamento e la segmentazione di immagini mediche, YOLO11 offre il miglior equilibrio tra velocità, precisione e flessibilità di distribuzione.
Uno sguardo al futuro: YOLO26 all'avanguardia#
Sebbene YOLO11 rappresenti un enorme passo avanti, Ultralytics continua a spingersi oltre i limiti della visione artificiale. Rilasciata a gennaio 2026, la nuova serie di modelli YOLO26 rappresenta lo stato dell'arte assoluto ed è il modello consigliato per tutti i nuovi progetti.
YOLO26 introduce diverse funzionalità rivoluzionarie progettate appositamente per le moderne sfide della distribuzione:
- Design end-to-end senza NMS: basandosi sui concetti introdotti da YOLOv10, YOLO26 è nativamente end-to-end. Elimina completamente il post-processing della soppressione dei non massimi (NMS), dando vita a pipeline di distribuzione più veloci e drasticamente più semplici.
- Rimozione della DFL: eliminando la Distribution Focal Loss, YOLO26 semplifica la head della rete, migliorando notevolmente la compatibilità con i dispositivi Internet delle cose (IoT) a basso consumo e con i dispositivi edge.
- Ottimizzatore MuSGD: ispirato alle innovazioni nell'addestramento dei modelli linguistici di grandi dimensioni (LLM), come Kimi K2 di Moonshot AI, YOLO26 utilizza un ottimizzatore ibrido Muon-SGD, garantendo una stabilità di addestramento senza precedenti e una convergenza più rapida.
- Inferenza CPU fino al 43% più veloce: per le applicazioni eseguite senza acceleratori GPU dedicati, YOLO26 è stato fortemente ottimizzato per il throughput puro della CPU.
- ProgLoss + STAL: queste funzioni di loss avanzate producono miglioramenti significativi nel riconoscimento degli oggetti piccoli, un aspetto fondamentale per le immagini acquisite da droni e la sorveglianza aerea.
- Miglioramenti specifici per attività: YOLO26 include ottimizzazioni personalizzate per tutte le attività, come la prototipazione multi-scala per la segmentazione e la Stima della log-verosimiglianza residua (RLE) per la stima della posa.
Se oggi stai avviando una nuova iniziativa di visione artificiale, utilizzare la Ultralytics Platform per addestrare un modello YOLO26 garantirà che la tua applicazione sia basata sull'architettura più efficiente, accurata e a prova di futuro disponibile.
Per gli sviluppatori interessati a esplorare il rilevamento a vocabolario aperto, puoi consultare anche la nostra documentazione su YOLO-World.