Ultralytics YOLO27:

YOLOv9 vs PP-YOLOE+#

Il panorama del rilevamento degli oggetti in tempo reale continua a evolversi rapidamente, offrendo agli ingegneri della computer vision un'ampia gamma di opzioni per distribuire modelli altamente accurati su infrastrutture edge e cloud. Due modelli importanti in questo ambito sono YOLOv9 e PP-YOLOE+. Sebbene entrambi amplino i limiti di accuratezza e velocità, provengono da filoni di ricerca ed ecosistemi software diversi.

Questo confronto tecnico completo analizza le rispettive architetture, metodologie di addestramento, metriche di prestazioni e applicazioni ideali nel mondo reale. Esamineremo inoltre come il più ampio ecosistema Ultralytics offra vantaggi significativi agli sviluppatori che danno priorità alla facilità d'uso, all'efficienza della memoria e alla versatilità di distribuzione.

Origini dei modelli e specifiche tecniche#

Comprendere il contesto di questi modelli aiuta a contestualizzare le loro scelte architetturali e le dipendenze dai framework.

YOLOv9: risolvere il collo di bottiglia informativo#

Introdotto all'inizio del 2024, YOLOv9 affronta la perdita di dati che si verifica quando le informazioni attraversano reti neurali profonde. È una rete neurale convoluzionale altamente ottimizzata, progettata per massimizzare l'efficienza dei parametri.

Scopri di più su YOLOv9

PP-YOLOE+: l'evoluzione dell'ecosistema Paddle#

Rilasciato da Baidu nel 2022, PP-YOLOE+ è un miglioramento iterativo di PP-YOLOv2. Utilizza un paradigma senza ancoraggi e introduce una strategia dinamica di assegnazione delle etichette per migliorare la convergenza e l'accuratezza all'interno del framework PaddlePaddle.

Scopri di più su PP-YOLOE+

Confronto delle architetture#

Informazioni sui gradienti programmabili vs. CSPRepResStage#

L'innovazione principale di YOLOv9 è rappresentata dalle informazioni sui gradienti programmabili (PGI). PGI funge da framework di supervisione ausiliario, garantendo che le informazioni essenziali sui gradienti vengano preservate e propagate accuratamente agli strati superficiali durante l'addestramento. Questo è abbinato alla rete generalizzata di aggregazione efficiente dei livelli (GELAN), che combina i punti di forza di CSPNet ed ELAN per offrire un'elevata accuratezza riducendo drasticamente il costo computazionale (FLOPs).

PP-YOLOE+ si basa su un backbone specializzato chiamato CSPRepResStage. Sfrutta tecniche di riparametrizzazione (simili a quelle utilizzate in RepVGG) per accelerare l'inferenza unendo i livelli convoluzionali durante la distribuzione. Inoltre, utilizza la head Efficient Task-aligned (ET-head) per bilanciare le attività di classificazione e regressione.

Sebbene PP-YOLOE+ sia robusto, l'architettura GELAN di YOLOv9 richiede in genere un ingombro di memoria inferiore sia durante l'addestramento sia durante l'inferenza, risultando particolarmente adatta ai dispositivi edge per l'AI.

Confronto delle prestazioni#

Quando si valutano modelli per la produzione, è fondamentale considerare il compromesso tra mAP (precisione media media), velocità di inferenza e dimensioni del modello.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Analisi#

  • Efficienza dei parametri: YOLOv9 raggiunge un'efficienza notevolmente superiore. Ad esempio, YOLOv9c raggiunge una mAP del 53,0% utilizzando appena 25,3 milioni di parametri, mentre PP-YOLOE+l richiede più del doppio dei parametri (52,2 milioni) per ottenere una mAP leggermente inferiore, pari al 52,9%. Questo riduce drasticamente i requisiti di memoria di YOLOv9.
  • Velocità di inferenza: i modelli YOLOv9 dimostrano un'eccellente ottimizzazione per acceleratori hardware come TensorRT, offrendo velocità di inferenza competitive sulle GPU NVIDIA T4, fondamentali per l'inferenza in tempo reale.

Metodologie di addestramento ed ecosistema#

La scelta tra questi modelli spesso dipende dall'ecosistema software.

PP-YOLOE+ e PaddlePaddle#

PP-YOLOE+ è strettamente integrato con la suite PaddleDetection. Sebbene sia potente, richiede agli utenti di orientarsi in un ambiente ricco di configurazioni e basato sulla riga di comando. Per i team profondamente integrati negli ecosistemi PyTorch o TensorFlow, il passaggio a PaddlePaddle introduce notevoli difficoltà e una curva di apprendimento più ripida.

Il vantaggio di Ultralytics: workflow semplificati#

Al contrario, YOLOv9 opera all'interno dell'ecosistema Ultralytics, altamente rifinito. Progettato per sviluppatori e ricercatori, Ultralytics dà priorità a un'eccezionale facilità d'uso. La API Python astrae completamente il complesso codice boilerplate.

from ultralytics import YOLO

# Load a pre-trained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Run inference and visualize results
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for production deployment
model.export(format="onnx")

Questo workflow evidenzia la superiore efficienza di addestramento dei modelli Ultralytics. Il supporto nativo per l'aumento dei dati, l'addestramento distribuito e la registrazione automatica su piattaforme come Weights & Biases o MLflow è incluso di serie.

Scopri le ultime novità della Vision AI

Sebbene YOLOv9 offra prestazioni eccezionali, per i nuovi progetti consigliamo vivamente di prendere in considerazione il nuovo Ultralytics YOLO26. YOLO26 presenta un design nativo end-to-end senza NMS, che semplifica notevolmente la distribuzione. Grazie alla rimozione di DFL (Distribution Focal Loss rimossa per semplificare l'esportazione e migliorare la compatibilità con dispositivi edge e a basso consumo), offre un'inferenza su CPU fino al 43% più veloce per l'edge computing. Basato sull'ottimizzatore MuSGD, garantisce un addestramento stabile e una convergenza rapida. Inoltre, ProgLoss + STAL fornisce funzioni di perdita migliorate, con progressi significativi nel riconoscimento degli oggetti piccoli, un aspetto fondamentale per IoT, robotica e immagini aeree.

Versatilità e supporto delle attività#

I moderni progetti di computer vision raramente si limitano ai semplici riquadri delimitatori.

PP-YOLOE+ è progettato principalmente per il rilevamento standard degli oggetti. Adattare la sua architettura ad altre attività richiede un'intensa attività di sviluppo personalizzato.

Al contrario, il framework Ultralytics è una potente soluzione multi-task. Grazie a una API unificata, gli sviluppatori possono passare senza difficoltà dal rilevamento standard degli oggetti alla complessa segmentazione delle istanze, alla stima della posa altamente accurata, al rilevamento di riquadri delimitatori orientati (OBB) per immagini aeree e alla classificazione delle immagini. Questa versatilità senza pari spiega perché i team aziendali scelgano costantemente modelli Ultralytics come YOLOv9, YOLO11 e YOLO26.

Casi d'uso e applicazioni ideali#

  • Analisi delle smart city e gestione del traffico: l'elevata efficienza dei parametri e la bassa latenza di YOLOv9 (e del successivo YOLO26) li rendono ideali per la distribuzione su hardware edge con risorse limitate (come i dispositivi NVIDIA Jetson) per monitorare il flusso del traffico e la sicurezza urbana.
  • Sistemi di inventario per la vendita al dettaglio: per rilevare configurazioni dense di piccoli articoli sugli scaffali, il PGI di YOLOv9 preserva efficacemente i dettagli spaziali fini, superando PP-YOLOE+ nelle attività di rilevamento degli oggetti piccoli.
  • Distribuzioni legacy: PP-YOLOE+ rimane un'opzione valida esclusivamente per i team obbligati esplicitamente a utilizzare lo stack software Baidu/PaddlePaddle nelle infrastrutture legacy esistenti.

Per i ricercatori che esplorano architetture basate su Transformer, Ultralytics supporta nativamente anche RT-DETR all'interno della stessa API intuitiva, garantendo un accesso costante al modello ottimale per i tuoi specifici requisiti di distribuzione.

Commenti