YOLO11 vs EfficientDet#
Selezionare la rete neurale ottimale per i progetti di computer vision richiede una conoscenza approfondita delle architetture disponibili. Questa guida offre un confronto tecnico dettagliato tra Ultralytics YOLO11 ed EfficientDet di Google. Esamineremo le differenze architetturali, le metriche delle prestazioni, l'efficienza dell'addestramento e gli scenari di deployment ideali per aiutarti a prendere una decisione consapevole per i tuoi carichi di lavoro di machine learning.
Contesto e specifiche dei modelli#
Entrambi i modelli hanno avuto un impatto significativo nel panorama del deep learning, sebbene derivino da filosofie progettuali ed epoche diverse dello sviluppo dell'AI.
Dettagli su YOLO11#
- Autori: Glenn Jocher e Jing Qiu
- Organizzazione: Ultralytics
- Data: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentazione: https://docs.ultralytics.com/models/yolo11
Dettagli su EfficientDet#
- Autori: Mingxing Tan, Ruoming Pang e Quoc V. Le
- Organizzazione: Google
- Data: 2019-11-20
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
- Documentazione: https://github.com/google/automl/tree/master/efficientdet#readme
Quando lavori con modelli di computer vision, l'ecosistema circostante è importante tanto quanto il modello stesso. L'ecosistema Ultralytics offre un'esperienza di sviluppo senza pari, con documentazione completa, supporto attivo della community e funzionalità di esportazione fluide verso formati come ONNX e TensorRT.
Innovazioni architetturali#
EfficientDet: BiFPN e scaling composto#
Introdotto alla fine del 2019, EfficientDet mirava a massimizzare la precisione riducendo al minimo il costo computazionale. Ci riesce principalmente attraverso due meccanismi. Innanzitutto, utilizza un backbone EfficientNet che scala in modo coerente profondità, larghezza e risoluzione. In secondo luogo, ha introdotto la rete piramidale delle feature bidirezionale (BiFPN), che consente una fusione delle feature multiscala semplice e veloce.
Sebbene fosse altamente efficiente per l'epoca, la dipendenza di EfficientDet dalla libreria AutoML di TensorFlow può renderlo rigido. Rispetto ai moderni framework modulari basati su PyTorch, i ricercatori spesso considerano difficili il pruning del modello e le modifiche personalizzate.
YOLO11: estrazione avanzata delle feature e versatilità#
YOLO11 rappresenta un notevole passo avanti nelle architetture per il rilevamento degli oggetti. Si basa sui risultati ottenuti dai suoi predecessori e introduce blocchi C3k2 perfezionati e un modulo di Spatial Pyramid Pooling migliorato. Questi perfezionamenti portano a un'estrazione delle feature superiore, consentendo a YOLO11 di catturare pattern visivi complessi con eccezionale nitidezza.
Un vantaggio fondamentale di YOLO11 è la sua versatilità. Mentre EfficientDet è esclusivamente un modello di rilevamento degli oggetti, YOLO11 supporta nativamente la segmentazione delle istanze, la classificazione delle immagini, la stima della posa e i bounding box orientati (OBB). Inoltre, YOLO11 vanta requisiti di memoria estremamente ridotti sia durante l'addestramento sia durante l'inferenza, risultando nettamente superiore ai modelli meno recenti e ai voluminosi vision transformer quando viene distribuito in ambienti di edge AI con risorse limitate.
Prestazioni e benchmark#
L'equilibrio tra precisione, misurata tramite la precisione media media (mAP), e velocità di inferenza è il fattore decisivo per i deployment nel mondo reale. La tabella seguente illustra le prestazioni grezze di entrambe le famiglie di modelli sul dataset COCO standard.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Come mostrato, YOLO11 raggiunge un equilibrio tra prestazioni particolarmente favorevole. YOLO11x raggiunge la massima precisione complessiva (54.7 mAP), mentre le varianti più compatte di YOLO11 dominano nettamente in termini di velocità di inferenza su GPU (fino a soli 1.5 ms su una T4 utilizzando TensorRT).
Efficienza dell'addestramento ed ecosistema#
Una delle caratteristiche distintive dei modelli Ultralytics è la loro facilità d'uso. L'addestramento di un modello EfficientDet richiede spesso di gestire configurazioni complesse dei grafi TensorFlow e catene di dipendenze articolate. Al contrario, YOLO11 è basato su una fondazione PyTorch moderna e pulita.
Questo ecosistema ben mantenuto consente agli sviluppatori di installare il pacchetto, caricare un modello preaddestrato e iniziare ad addestrarlo su un dataset personalizzato con poche righe di codice.
Esempio di codice Python#
Ecco un esempio completamente eseguibile che dimostra la semplicità dell'API Ultralytics. Questo script scarica un modello YOLO11 preaddestrato, lo addestra ed esegue una previsione rapida.
from ultralytics import YOLO
# Initialize a pretrained YOLO11 nano model
model = YOLO("yolo11n.pt")
# Train the model efficiently using the integrated PyTorch engine
# Training efficiency is high, requiring less VRAM than legacy models
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")
# Run real-time inference on a sample image
prediction = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the output bounding boxes
prediction[0].show()Uno sguardo al futuro: il vantaggio di YOLO26#
Sebbene YOLO11 sia eccezionalmente potente, i team che avviano nuovi progetti da zero dovrebbero prendere seriamente in considerazione Ultralytics YOLO26, rilasciato a gennaio 2026. YOLO26 rappresenta un cambio di paradigma in termini di semplicità di deployment e prestazioni edge.
Le principali innovazioni di YOLO26 includono:
- Design end-to-end senza NMS: eliminando la soppressione non massima (NMS) durante il post-processing, YOLO26 garantisce una latenza costantemente bassissima, fondamentale per la robotica ad alta velocità e la guida autonoma.
- Inferenza su CPU fino al 43% più veloce: per i deployment privi di GPU dedicate, YOLO26 è ottimizzato specificamente per massimizzare il throughput sui processori standard.
- Ottimizzatore MuSGD: ispirato a Kimi K2 di Moonshot AI, questo ottimizzatore ibrido porta la stabilità dell'addestramento degli LLM nella computer vision, consentendo una convergenza più rapida.
- ProgLoss + STAL: queste funzioni di loss migliorate potenziano notevolmente il riconoscimento degli oggetti di piccole dimensioni, spesso un punto critico nell'analisi delle immagini satellitari e nelle riprese effettuate con droni.
- Rimozione della DFL: la rimozione della Distribution Focal Loss semplifica il processo di esportazione del modello verso i dispositivi edge.
Casi d'uso e raccomandazioni#
La scelta tra YOLO11 ed EfficientDet dipende dai requisiti specifici del tuo progetto, dai vincoli di deployment e dalle preferenze relative all'ecosistema.
Quando scegliere YOLO11#
YOLO11 è una scelta efficace per:
- Distribuzione edge in produzione: applicazioni commerciali su dispositivi come Raspberry Pi o NVIDIA Jetson, dove affidabilità e manutenzione attiva sono fondamentali.
- Applicazioni di visione multi-task: progetti che richiedono rilevamento, segmentazione, stima della posa e OBB all'interno di un unico framework unificato.
- Prototipazione e distribuzione rapide: team che devono passare rapidamente dalla raccolta dei dati alla produzione utilizzando la semplificata API Python di Ultralytics.
Quando scegliere EfficientDet#
EfficientDet è consigliato per:
- Pipeline Google Cloud e TPU: sistemi profondamente integrati con le API Google Cloud Vision o con infrastrutture TPU, dove EfficientDet dispone di ottimizzazioni native.
- Ricerca sullo scaling composto: benchmark accademici incentrati sullo studio degli effetti dello scaling bilanciato di profondità, larghezza e risoluzione della rete.
- Deployment mobile tramite TFLite: progetti che richiedono specificamente l'esportazione in TensorFlow Lite per Android o dispositivi Linux embedded.
Quando scegliere Ultralytics (YOLO26)#
Per la maggior parte dei nuovi progetti, Ultralytics YOLO26 offre la migliore combinazione di prestazioni ed esperienza per gli sviluppatori:
- Deployment edge senza NMS: applicazioni che richiedono un'inferenza coerente e a bassa latenza senza la complessità della post-elaborazione con Soppressione non massima.
- Ambienti esclusivamente CPU: dispositivi privi di accelerazione GPU dedicata, dove l'inferenza su CPU fino al 43% più veloce di YOLO26 offre un vantaggio decisivo.
- Rilevamento di oggetti piccoli: scenari complessi come le immagini aeree riprese da droni o l'analisi di sensori IoT, in cui ProgLoss e STAL migliorano significativamente l'accuratezza sugli oggetti di piccole dimensioni.
Conclusioni#
EfficientDet è stata un'architettura pionieristica che ha dimostrato la validità dello scaling composto nel rilevamento degli oggetti. Tuttavia, il rapido ritmo della ricerca sull'AI ha portato alla luce modelli semplicemente più capaci, più facili da integrare e più veloci da eseguire.
Grazie alle sue solide capacità multitask, alle eccezionali velocità di inferenza su GPU e a un'API probabilmente tra le più intuitive per gli sviluppatori del settore, YOLO11 è il vincitore indiscusso per le pipeline di vision moderne. Per chi punta al limite estremo dell'innovazione tecnologica, soprattutto nei deployment edge-first, passare a YOLO26 offre la combinazione definitiva di velocità senza NMS e precisione senza pari.