Ultralytics YOLO27:
Get Started

YOLOv7 e PP-YOLOE+#

Quando valutano i modelli di visione artificiale all’avanguardia per le pipeline di produzione, gli sviluppatori considerano spesso i vantaggi delle diverse architetture. Due modelli di rilievo nel panorama del rilevamento degli oggetti sono YOLOv7 e PP-YOLOE+. Questa guida offre un confronto tecnico dettagliato delle loro architetture, delle metriche di prestazione e degli scenari di distribuzione ideali, per aiutarti a prendere una decisione consapevole per il tuo prossimo progetto di visione artificiale.

Innovazioni architetturali#

Comprendere le differenze strutturali fondamentali tra questi modelli è essenziale per prevederne il comportamento durante l’addestramento e l’inferenza.

Caratteristiche principali dell’architettura YOLOv7#

YOLOv7 ha introdotto diversi progressi importanti, progettati per migliorare l’accuratezza senza aumentare drasticamente i costi di inferenza.

  • Reti di aggregazione dei livelli estese ed efficienti (E-ELAN): Questa architettura controlla i percorsi del gradiente più brevi e quelli più lunghi. In questo modo, consente alla rete di apprendere caratteristiche più diversificate e migliora la capacità di apprendimento complessiva senza distruggere il percorso originale del gradiente.
  • Strategie di scaling del modello: YOLOv7 utilizza lo scaling composto del modello, regolando simultaneamente profondità e larghezza e concatenando i livelli per mantenere una struttura architetturale ottimale nelle diverse dimensioni.
  • Bag-of-freebies addestrabile: Gli autori hanno integrato un metodo di convoluzione riparametrizzata (RepConv) senza connessioni identità, che migliora notevolmente la velocità di inferenza senza compromettere la capacità predittiva del modello.

Dettagli di YOLOv7:

  • Autori: Chien-Yao Wang, Alexey Bochkovskiy e Hong-Yuan Mark Liao
  • Organizzazione: Institute of Information Science, Academia Sinica, Taiwan
  • Data: 2022-07-06
  • Arxiv: https://arxiv.org/abs/2207.02696

Scopri di più su YOLOv7

Caratteristiche principali dell’architettura PP-YOLOE+#

Sviluppato da Baidu nell’ecosistema PaddlePaddle, PP-YOLOE+ si basa sul predecessore PP-YOLOv2 e si concentra soprattutto sulle metodologie anchor-free e su rappresentazioni delle caratteristiche migliorate.

  • Architettura anchor-free: A differenza degli approcci basati su anchor, questa architettura semplifica la head di predizione e riduce il numero di iperparametri, rendendo il modello più facile da ottimizzare per dataset personalizzati.
  • Backbone CSPRepResNet: questo backbone integra connessioni residue e reti Cross Stage Partial per migliorare le capacità di estrazione delle caratteristiche mantenendo al contempo l'efficienza computazionale.
  • Apprendimento dell'allineamento dei task (TAL): PP-YOLOE+ utilizza ET-head (testa efficiente allineata ai task) per allineare meglio i task di classificazione e localizzazione, affrontando un collo di bottiglia comune nei rilevatori one-stage.

Dettagli su PP-YOLOE+:

Scopri di più su PP-YOLOE+

Metriche di prestazione e benchmark#

La scelta del modello giusto dipende spesso dai vincoli specifici dell'hardware e dai requisiti di latenza. La tabella seguente illustra i compromessi tra accuratezza (mAP), velocità e complessità del modello.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Analisi dei risultati#

  • Scenari ad alta accuratezza: YOLOv7x offre prestazioni solide, raggiungendo un mAP elevato e competitivo per le attività di rilevamento complesse. PP-YOLOE+x raggiunge un mAP leggermente superiore, ma comporta un notevole aumento dei parametri e dei FLOPs.
  • Efficienza e velocità: le varianti più piccole di PP-YOLOE+ (t e s) offrono una latenza TensorRT estremamente bassa, rendendole particolarmente adatte alle implementazioni edge con vincoli hardware rigorosi.
  • Il giusto equilibrio: YOLOv7l offre un compromesso convincente: supera il 51% di mAP mantenendo un tempo di inferenza inferiore a 7 ms sulle GPU T4, risultando una scelta solida per le applicazioni server standard in tempo reale.
Ottimizzazione per la produzione

Quando distribuisci questi modelli, utilizzare formati di esportazione come TensorRT o ONNX può ridurre notevolmente la latenza rispetto all'inferenza nativa PyTorch.

I vantaggi di Ultralytics#

Sebbene YOLOv7 e PP-YOLOE+ offrano entrambi ottime prestazioni nei benchmark, l'esperienza di sviluppo e il supporto dell'ecosistema sono altrettanto fondamentali per il successo di un progetto.

Esperienza utente semplificata#

I modelli Ultralytics puntano sulla facilità d'uso grazie a un'API Python unificata. A differenza di PP-YOLOE+, che richiede di orientarsi nell'ecosistema PaddlePaddle e nei relativi file di configurazione specifici, Ultralytics ti permette di passare senza problemi dall'addestramento alla distribuzione.

from ultralytics import YOLO

# Carica un modello YOLO26 pretrained (il pacchetto Ultralytics non supporta l'addestramento di YOLOv7)
model = YOLO("yolo26n.pt")

# Addestra il modello senza difficoltà
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Esporta per una distribuzione ottimizzata
model.export(format="engine")  # Esportazione TensorRT

Efficienza nell'uso delle risorse#

Un importante punto di forza dei modelli Ultralytics YOLO è il minore consumo di memoria sia durante l'addestramento sia durante l'inferenza. Questa efficienza consente a ricercatori e sviluppatori di usare batch size più grandi su hardware consumer, accelerando l'addestramento rispetto ai modelli più pesanti o alle architetture Transformer complesse come RT-DETR.

Ecosistema e versatilità#

L'ecosistema Ultralytics è gestito in modo eccellente e offre aggiornamenti frequenti, documentazione completa e supporto nativo per diverse attività oltre al rilevamento standard. Con Ultralytics, un unico framework supporta la segmentazione di istanze, la stima della posa, la classificazione e le bounding box orientate (OBB), offrendo una versatilità senza pari, spesso assente nei modelli concorrenti.

Il futuro della vision AI: YOLO26#

Con la rapida evoluzione della computer vision, sono emerse nuove architetture che ridefiniscono gli standard di velocità ed efficienza. Rilasciato a gennaio 2026, Ultralytics YOLO26 rappresenta il culmine di questa evoluzione ed è la scelta fortemente consigliata per tutti i nuovi progetti.

Innovazioni principali di YOLO26:

  • Design end-to-end senza NMS: la testa one-to-one opzionale di YOLO26 (nms=False) salta la post-elaborazione con soppressione dei massimi locali (NMS). Questo approccio nativamente end-to-end semplifica notevolmente la logica di distribuzione e riduce la latenza variabile: una svolta introdotta per la prima volta in YOLOv10.
  • Prestazioni edge senza precedenti: eliminando Distribution Focal Loss (DFL), YOLO26 raggiunge un'inferenza CPU fino al 43% più veloce, risultando superiore per i dispositivi IoT ed edge rispetto alle generazioni precedenti.
  • Dinamiche di addestramento avanzate: l'integrazione dell'ottimizzatore MuSGD, ispirato alle innovazioni degli LLM come Kimi K2 di Moonshot AI, garantisce un addestramento più stabile e una convergenza più rapida.
  • Rilevamento superiore degli oggetti piccoli: funzioni di perdita migliorate, in particolare ProgLoss + STAL, affrontano le difficoltà storiche nel riconoscimento degli oggetti piccoli, essenziale per applicazioni come le immagini aeree.

Applicazioni nel mondo reale#

La scelta tra queste architetture dipende spesso dall'ambiente di distribuzione specifico.

Quando scegliere PP-YOLOE+#

  • Integrazione con PaddlePaddle: se la tua infrastruttura è già profondamente integrata nell'ecosistema PaddlePaddle di Baidu, PP-YOLOE+ è una scelta naturale.
  • Ispezione industriale in Asia: è spesso utilizzato nei poli manifatturieri asiatici, dove gli stack hardware e software sono preconfigurati per gli strumenti di Baidu.

Quando scegliere YOLOv7#

  • Sistemi accelerati da GPU: offre prestazioni eccezionali sulle GPU di classe server per le attività che richiedono un throughput elevato, come l'analisi video.
  • Integrazione nella robotica: ideale per integrare la computer vision nella robotica, consentendo decisioni rapide in ambienti dinamici.
  • Ricerca accademica: è ampiamente supportato e spesso utilizzato come baseline affidabile nella ricerca basata su PyTorch.

Sebbene i modelli meno recenti abbiano una rilevanza storica, passare ad architetture moderne come YOLO26 o YOLO11 tramite la Ultralytics Platform garantisce l'accesso alle ottimizzazioni più recenti, ai workflow di addestramento più semplici e al supporto multi-task più ampio oggi disponibile.

Collaboratori

Commenti