YOLO11 vs PP-YOLOE+#
Scegliere l’architettura di rete neurale ottimale è fondamentale quando si distribuiscono applicazioni di visione artificiale in produzione. In questo confronto tecnico esaminiamo due modelli di spicco nel settore del rilevamento degli oggetti in tempo reale: Ultralytics YOLO11 e PP-YOLOE+ di Baidu. Entrambe le architetture offrono prestazioni affidabili, ma affrontano in modo molto diverso le sfide legate ad accuratezza, velocità di inferenza ed ecosistema per sviluppatori.
Di seguito trovi un grafico interattivo che illustra i limiti prestazionali di questi modelli e ti aiuta a individuare quello più adatto ai tuoi vincoli hardware.
Origini dei modelli e genealogia tecnica#
Comprendere le origini e le filosofie di progettazione di questi modelli offre un contesto prezioso sui rispettivi punti di forza e sui casi d'uso ideali.
Dettagli su YOLO11#
Sviluppato da Ultralytics, YOLO11 rappresenta un'iterazione particolarmente perfezionata della serie YOLO, che punta a bilanciare inferenza ad alta velocità, efficienza estrema dei parametri e facilità d'uso senza pari. È ampiamente riconosciuto per le sue capacità unificate multi-task e per la sua API Python intuitiva per gli sviluppatori.
- Autori: Glenn Jocher e Jing Qiu
- Organizzazione: Ultralytics
- Data: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentazione: Documentazione di YOLO11
Dettagli su PP-YOLOE+#
PP-YOLOE+ è una versione evoluta di PP-YOLOv2, basata sul framework PaddlePaddle. Introduce modifiche architetturali come il backbone CSPRepResNet e il Task Alignment Learning (TAL) per spingere oltre i limiti della precisione, in particolare sulle GPU di fascia alta.
- Autori: Autori di PaddlePaddle
- Organizzazione: Baidu
- Data: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Documentazione: Documentazione di configurazione di PP-YOLOE+
Differenze architetturali#
Le architetture fondamentali di YOLO11 e PP-YOLOE+ riflettono le loro diverse priorità nel panorama della visione artificiale.
YOLO11 si basa su un backbone altamente ottimizzato e una testa di rilevamento senza anchor. Utilizza blocchi C3k2 e Spatial Pyramid Pooling - Fast (SPPF) per acquisire caratteristiche multi-scala con un overhead computazionale minimo. Questo design è particolarmente vantaggioso per ridurre la latenza di inferenza sui dispositivi con risorse limitate, come le NPU edge e le CPU mobili. Inoltre, YOLO11 è progettato nativamente per l'apprendimento multi-task e supporta segmentazione delle istanze, stima della posa e rilevamento di riquadri delimitatori orientati (OBB) fin da subito.
PP-YOLOE+ introduce il backbone CSPRepResNet e una testa Efficient Task-aligned (ET-head). Sfrutta ampiamente tecniche di riparametrizzazione per aumentare la capacità rappresentativa durante l'addestramento, ripiegando poi quei parametri in convoluzioni standard per l'inferenza. Sebbene ciò produca una precisione media (mAP) impressionante, i modelli risultanti tendono ad avere più parametri e un maggiore ingombro di memoria, rendendoli più adatti alla distribuzione su GPU server robuste che su dispositivi edge leggeri.
Se il tuo progetto deve andare oltre i riquadri delimitatori standard, Ultralytics YOLO11 offre supporto nativo per segmentazione, stima della posa e classificazione tramite la stessa identica API, riducendo notevolmente il carico di sviluppo rispetto all'integrazione di diversi repository distinti.
Prestazioni e benchmark#
Per valutare le prestazioni, consideriamo la precisione (mAP), la velocità di inferenza su hardware diversi e l'efficienza del modello (parametri e FLOPs). La tabella seguente evidenzia le metriche comparative, con i valori più efficienti o dalle prestazioni migliori in grassetto.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Analisi#
YOLO11 mostra un chiaro vantaggio in termini di equilibrio delle prestazioni ed efficienza dei parametri. Per esempio, YOLO11m raggiunge un mAP superiore (51.5) rispetto a PP-YOLOE+m (49.8), utilizzando meno parametri (20.1M contro 23.43M) e offrendo velocità di inferenza significativamente maggiori con TensorRT (4.7ms contro 5.56ms). La leggerezza dei modelli YOLO11 si traduce intrinsecamente in minori requisiti di memoria durante l'addestramento del modello e la distribuzione.
Ecosistema di addestramento e facilità d'uso#
Il vero valore di un modello spesso dipende dalla facilità con cui gli sviluppatori possono addestrarlo su dataset di visione artificiale personalizzati e distribuirlo in produzione.
I vantaggi di Ultralytics#
Ultralytics dà priorità a un'esperienza di sviluppo semplificata. L'addestramento di YOLO11 avviene tramite una semplice API Python o CLI, che astrae il codice boilerplate complesso. La piattaforma Ultralytics migliora ulteriormente l'esperienza offrendo addestramento senza codice, gestione automatizzata dei dataset ed esportazioni con un clic in formati come ONNX, CoreML e TensorRT.
Inoltre, durante l'addestramento i modelli YOLO sono molto efficienti nell'uso della memoria, evitando l'enorme consumo di VRAM tipico delle architetture basate su Transformer o dei modelli pesantemente riparametrizzati e consentendo così l'addestramento su hardware di fascia consumer.
from ultralytics import YOLO
# Carica un modello YOLO11 preaddestrato
model = YOLO("yolo11n.pt")
# Addestra il modello sul dataset COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Esegui l'inferenza su un'immagine
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Ecosistema PP-YOLOE+#
PP-YOLOE+ opera all'interno dell'ecosistema PaddleDetection. Questo framework è potente e profondamente integrato con le soluzioni industriali di Baidu, ma richiede agli sviluppatori di adottare il framework di deep learning specifico PaddlePaddle. Per i team che hanno già standardizzato PyTorch, questo può comportare una curva di apprendimento più ripida. Inoltre, rispetto alle pipeline di esportazione native disponibili nei flussi di lavoro Ultralytics, l'esportazione dei modelli PP-YOLOE+ in formati universali standard per dispositivi edge può richiedere ulteriori passaggi di conversione.
Casi d'uso ideali#
La scelta tra questi modelli dipende dal tuo specifico ambiente di distribuzione.
- Scegli YOLO11 per uno sviluppo agile, l'edge computing e le applicazioni mobili. L'elevata velocità di inferenza, l'ingombro ridotto in memoria e le ampie capacità di esportazione lo rendono ideale per attività come la gestione delle scorte nella vendita al dettaglio in tempo reale su CPU standard, l'analisi di immagini aeree acquisite da droni e le pipeline multi-task complesse.
- Scegli PP-YOLOE+ se la tua intera pipeline di produzione si basa già ampiamente sull'ecosistema PaddlePaddle o se distribuisci su server di inferenza dedicati di fascia alta, dove i vincoli di memoria e la compatibilità hardware (al di fuori dell'hardware ottimizzato per Paddle) non sono tra le preoccupazioni principali.
La nuova generazione: ecco YOLO26#
YOLO11 è ancora incredibilmente potente, ma il settore dell'AI evolve rapidamente. Per il massimo all'avanguardia nel rilevamento di oggetti, Ultralytics ha introdotto il nuovo YOLO26. Rilasciato a gennaio 2026, YOLO26 sviluppa i successi dei predecessori per offrire efficienza e precisione senza precedenti.
Innovazioni principali di YOLO26:
- Design end-to-end senza NMS: la testa opzionale one-to-one di YOLO26 (
nms=False) evita la post-elaborazione con soppressione non massima (NMS). Questo accelera notevolmente l'inferenza e semplifica la logica di distribuzione: un salto architetturale introdotto per la prima volta da YOLOv10. - Inferenza su CPU fino al 43% più veloce: ottimizzata specificamente per i dispositivi edge senza GPU, assicura prestazioni in tempo reale su hardware a basso consumo.
- Ottimizzatore MuSGD: ispirato alla stabilità dell'addestramento degli LLM, questo ibrido tra SGD e Muon assicura una convergenza più rapida e un addestramento più stabile.
- ProgLoss + STAL: le funzioni di loss migliorate potenziano notevolmente il riconoscimento degli oggetti di piccole dimensioni, fondamentale per le applicazioni con droni e la videosorveglianza.
- Rimozione di DFL: l'eliminazione di Distribution Focal Loss semplifica l'esportazione del modello e migliora drasticamente la compatibilità con un'ampia gamma di dispositivi edge.
Per i nuovi progetti che danno priorità a velocità, esportazione senza problemi e massima precisione, ti consigliamo vivamente di sfruttare le potenzialità di YOLO26 tramite la piattaforma Ultralytics.
Se stai valutando altre architetture, potrebbe interessarti anche il confronto tra YOLO11 e RT-DETR oppure scoprire come il precedente YOLOv8 si comporta nei benchmark moderni.