YOLO Vision 2026:

DAMO-YOLO vs YOLOv7#

La rapida evoluzione della visione artificiale ha prodotto modelli di object detection altamente efficienti, progettati per bilanciare precisione e costo computazionale. Due modelli notevoli introdotti nel 2022 sono DAMO-YOLO e YOLOv7. Sebbene entrambi mirino a spingere i confini delle attività di visione in tempo reale, raggiungono i loro risultati attraverso paradigmi architetturali e metodologie di addestramento notevolmente diversi.

Questo confronto tecnico completo esplora i diversi approcci di entrambi i modelli, esaminandone le architetture, il potenziale di distribuzione e le metriche di performance per aiutare gli ingegneri di machine learning a scegliere lo strumento giusto per le loro specifiche computer vision applications.

Origini e metadati dei modelli#

Prima di immergersi nell'analisi tecnica approfondita, è essenziale contestualizzare le origini di questi due modelli di computer vision.

DAMO-YOLO#

Sviluppato dai ricercatori di Alibaba Group, DAMO-YOLO è stato introdotto per ottimizzare sia la velocità che l'accuratezza attraverso la ricerca automatizzata dell'architettura e la distillazione.

Scopri di più su DAMO-YOLO

YOLOv7#

Rilasciato come lo stato dell'arte a metà del 2022, YOLOv7 ha spinto ulteriormente l'real-time inference introducendo "bag-of-freebies" addestrabili senza aumentare i costi di distribuzione.

Scopri di più su YOLOv7

Ecosistema supportato

YOLOv7 è supportato ufficialmente all'interno dell'ecosistema Ultralytics, consentendo addestramento, validazione ed esportazione senza problemi con una API unificata.

Innovazioni architettoniche#

DAMO-YOLO: NAS e distillazione#

DAMO-YOLO incorpora diverse tecniche all'avanguardia orientate alla massima efficienza:

  • Backbone NAS: Utilizza la Neural Architecture Search (NAS) per progettare automaticamente backbone ottimali (MAE-NAS) su misura per ambienti in cui la latenza è critica.
  • Efficient RepGFPN: Una Generalized Feature Pyramid Network modificata che migliora significativamente l'efficienza della fusione delle feature su scale multiple.
  • ZeroHead & AlignedOTA: Incorpora una head di rilevamento leggera e una strategia di assegnazione delle etichette ottimizzata (AlignedOTA) per ridurre l'overhead computazionale.
  • Potenziamento tramite distillazione: Sfrutta pesantemente la knowledge distillation durante l'addestramento per aumentare le prestazioni di varianti di modello più piccole senza aumentarne il conteggio dei parametri.

YOLOv7: E-ELAN e Bag-of-Freebies#

YOLOv7 ha adottato un approccio di ingegneria strutturale più marcato, concentrandosi sull'ottimizzazione del percorso del gradiente e su strategie di addestramento robuste.

  • Architettura E-ELAN: L'Extended Efficient Layer Aggregation Network consente al modello di apprendere feature più diversificate controllando i percorsi del gradiente più brevi e più lunghi, garantendo una convergenza dell'apprendimento efficace.
  • Scalabilità del modello: Introduce un metodo di scaling composto su misura per modelli basati sulla concatenazione, scalando profondità e larghezza simultaneamente per un allineamento strutturale.
  • Trainable Bag-of-Freebies: Utilizza tecniche come le convoluzioni riparametrizzate (RepConv) senza connessioni di identità e strategie di assegnazione dinamica delle etichette, che aumentano l'accuracy durante l'addestramento senza influire sulla velocità di inferenza.

Analisi delle prestazioni#

Nel valutare mean Average Precision (mAP), velocità ed efficienza, entrambi i modelli mostrano metriche impressionanti, sebbene si rivolgano a segmenti leggermente diversi. YOLOv7 si concentra pesantemente sulla distribuzione GPU ad alta precisione, mentre le strutture derivate da NAS di DAMO-YOLO mirano a una distribuzione aggressiva a bassa latenza su CPU e edge.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Come si vede dalle metriche, mentre DAMO-YOLO fornisce varianti estremamente leggere (come il modello tiny con soli 8.5M di parametri), YOLOv7 raggiunge un picco di precisione complessiva più elevato, con YOLOv7x che raggiunge un impressionante 53.1 mAP sul dataset COCO.

Il vantaggio dell'ecosistema Ultralytics#

Sebbene l'architettura teorica sia importante, la praticità di un modello è dettata dal suo ecosistema. I modelli supportati da Ultralytics, come YOLOv7, beneficiano di un ecosistema ben mantenuto e di una facilità d'uso senza pari.

  • Bilanciamento delle Performance: I modelli Ultralytics trovano costantemente un compromesso ottimale tra velocità di inferenza e precisione di rilevamento, rendendoli ideali sia per dispositivi edge che per il model deployment basato su cloud.
  • Requisiti di Memoria: A differenza dei modelli basati su Transformer più pesanti, i modelli Ultralytics YOLO mantengono bassi requisiti di memoria CUDA durante l'addestramento. Ciò consente batch sizes maggiori, ottimizzando il processo di addestramento anche su hardware di fascia consumer.
  • Versatilità: Il framework Ultralytics si estende oltre il rilevamento di oggetti ad attività come Instance Segmentation e Pose Estimation, offrendo agli sviluppatori un toolkit completo per la visione artificiale.
Efficienza dell'addestramento

Il pacchetto Ultralytics ti consente di passare senza problemi dai dataset a un modello completamente addestrato in pochi minuti, sfruttando data loader altamente ottimizzati e pesi pre-addestrati.

Esempio di codice: Addestramento di YOLOv7 con Ultralytics#

Integrare YOLOv7 nella tua pipeline di computer vision è incredibilmente semplice utilizzando la Python API di Ultralytics.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

Il nuovo standard: introduzione di YOLO26#

Mentre YOLOv7 e DAMO-YOLO hanno rappresentato significative innovazioni nel 2022, il campo dell'IA visiva si muove rapidamente. Per i team che avviano nuovi progetti oggi, il modello consigliato è il rivoluzionario Ultralytics YOLO26, rilasciato a gennaio 2026.

YOLO26 porta un salto generazionale nelle prestazioni e nell'usabilità, incorporando innovazioni all'avanguardia:

  • Design End-to-End NMS-Free: YOLO26 è nativamente end-to-end. Eliminando la post-elaborazione Non-Maximum Suppression (NMS), offre una logica di distribuzione più rapida e semplice, un cambiamento di paradigma inizialmente introdotto da YOLOv10.
  • Ottimizzatore MuSGD: Ispirato dalle innovazioni nei grandi modelli linguistici come il Kimi K2 di Moonshot AI, YOLO26 utilizza un ibrido di SGD e Muon. Questo ottimizzatore garantisce dinamiche di addestramento altamente stabili e tassi di convergenza drasticamente più rapidi.
  • Fino al 43% di inferenza CPU più veloce: Con la rimozione mirata della Distribution Focal Loss (DFL) e profondi miglioramenti strutturali, YOLO26 è pesantemente ottimizzato per l'edge computing a basso consumo, superando le generazioni precedenti su hardware non GPU.
  • ProgLoss + STAL: Incorpora nuove funzioni di perdita avanzate che mirano esplicitamente e migliorano il riconoscimento di piccoli oggetti, una capacità essenziale per applicazioni in immagini aeree, robotica e security monitoring.
  • Miglioramenti Specifici per Attività: Oltre al rilevamento standard, YOLO26 presenta miglioramenti mirati per diverse attività, tra cui la prototipazione multiscala per la segmentazione, RLE per la stima della posa e specifiche perdite di angolo per Oriented Bounding Boxes (OBB).

Scopri di più su YOLO26

Casi d'uso ideali#

Scegliere l'architettura giusta dipende interamente dal tuo ambiente di implementazione target e dai vincoli del progetto.

Quando scegliere DAMO-YOLO:

  • Stai lavorando in ambienti edge fortemente vincolati e limitati nelle risorse, dove il conteggio grezzo dei parametri deve essere mantenuto estremamente basso (es. microcontrollori).
  • Stai utilizzando pipeline di machine learning automatizzate integrate specificamente con i servizi cloud proprietari di Alibaba.

Quando scegliere YOLOv7:

  • Hai pipeline GPU legacy già ottimizzate per l'inferenza basata su anchor ad alta precisione.
  • Operi in ambienti in cui la precisione in tempo reale è fondamentale, come autonomous vehicles ad alta velocità o robotics avanzata.

Quando scegliere YOLO26 (Consigliato):

  • Stai costruendo una nuova applicazione di computer vision da zero e hai bisogno dello stato dell'arte assoluto sia in termini di precisione che di velocità di inferenza su CPU/edge.
  • Richiedi una distribuzione rapida e senza interruzioni (come l'esportazione verso CoreML o TensorRT) senza dover gestire i vincoli degli operatori NMS.
  • Vuoi sfruttare tutte le funzionalità della Ultralytics Platform per l'addestramento su cloud, la gestione dei dataset e la distribuzione automatizzata.

Sfruttando il robusto ecosistema dei modelli Ultralytics, gli sviluppatori possono ridurre drasticamente i tempi di ingegneria garantendo al contempo prestazioni predittive di alto livello per le loro applicazioni nel mondo reale.

Commenti