Ultralytics YOLO27:
Get Started

DAMO-YOLO vs YOLO26#

Il panorama della visione artificiale è in continua evoluzione, spinto dalla necessità di architetture che bilancino elevata accuratezza e inferenza a bassa latenza. Questo confronto approfondisce gli aspetti tecnici di DAMO-YOLO e Ultralytics YOLO26, esaminandone le innovazioni architetturali, le metodologie di addestramento e i casi d'uso ideali.

Che tu stia distribuendo modelli di visione su dispositivi edge o creando pipeline cloud ad alto throughput, comprendere le differenze tra questi modelli è fondamentale per prendere decisioni architetturali consapevoli nello sviluppo moderno dell'IA.

DAMO-YOLO: ricerca di architetture neurali su larga scala#

DAMO-YOLO, sviluppato dal gruppo Alibaba, è stato rilasciato il 23 novembre 2022. Progettato da Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun, il modello si concentra soprattutto sulla ricerca automatizzata di architetture efficienti tramite la ricerca di architetture neurali (NAS).

Puoi consultare la ricerca originale nel loro articolo su ArXiv o esplorare il codice sorgente nel repository DAMO-YOLO su GitHub.

Caratteristiche architetturali principali#

DAMO-YOLO introduce diverse innovazioni tecniche progettate per ampliare i limiti del rilevamento degli oggetti in tempo reale:

  • Backbone MAE-NAS: DAMO-YOLO utilizza una ricerca guidata dall'entropia massima per individuare i backbone ottimali. Questo approccio NAS individua architetture che bilanciano rigorosamente l'accuratezza del rilevamento e la velocità di inferenza su hardware specifico.
  • Efficient RepGFPN: Un design con neck pesante che migliora notevolmente la fusione delle caratteristiche, particolarmente utile per analizzare scene complesse come quelle presenti nelle immagini aeree.
  • Design ZeroHead: Una head di rilevamento fortemente semplificata che riduce al minimo la complessità computazionale dei livelli finali di predizione.
  • AlignedOTA e distillazione: DAMO-YOLO utilizza l'assegnazione ottimale tramite trasporto allineato (AlignedOTA) per risolvere le ambiguità nell'assegnazione delle etichette, insieme a una solida strategia di miglioramento basata sulla distillazione della conoscenza, che aumenta l'accuratezza dei modelli studente più piccoli sfruttando reti insegnanti più grandi.

Scopri di più su DAMO-YOLO

Il vantaggio di Ultralytics: YOLO26#

Rilasciato il 14 gennaio 2026 da Glenn Jocher e Jing Qiu presso Ultralytics, YOLO26 rappresenta il massimo dell'IA visiva accessibile e ad alte prestazioni. Basato sull'eredità di YOLO11 e YOLOv10, YOLO26 è progettato da zero per la distribuzione edge-first, la versatilità multi-task e una facilità d'uso senza pari.

Innovazioni di YOLO26#

Ultralytics YOLO26 introduce diverse funzionalità rivoluzionarie che lo rendono la scelta definitiva per le applicazioni moderne di visione artificiale:

  • Design end-to-end senza NMS: La head nativa one-to-one di YOLO26 (nms=False) elimina la post-elaborazione con soppressione dei massimi non locali (NMS). Introdotto inizialmente in YOLOv10, questo approccio end-to-end semplifica notevolmente le pipeline di distribuzione e garantisce inferenza deterministica a bassa latenza.
  • Inferenza su CPU fino al 43% più veloce: Ottimizzato a livello architetturale per l'edge computing, YOLO26 offre velocità eccezionali sui dispositivi edge e sulle CPU standard, risultando perfetto per i dispositivi IoT alimentati a batteria.
  • Ottimizzatore MuSGD: Ispirato all'addestramento degli LLM, come Kimi K2 di Moonshot AI, YOLO26 integra una combinazione di SGD e Muon. Questo trasferisce la stabilità dell'addestramento dei modelli linguistici di grandi dimensioni alla visione artificiale, con una convergenza più rapida e affidabile.
  • Rimozione della DFL: Eliminando la Distribution Focal Loss, il grafo del modello viene semplificato e l'esportazione in formati come ONNX e TensorRT diventa immediata.
  • ProgLoss + STAL: Queste funzioni di perdita avanzate migliorano notevolmente il riconoscimento degli oggetti piccoli, una caratteristica fondamentale per le operazioni con droni e l'agricoltura.
Miglioramenti specifici per attività

YOLO26 include miglioramenti specializzati per diverse modalità: un proto multi-scala per la segmentazione di istanze, la stima residua della log-verosimiglianza (RLE) per la stima della posa e una funzione di perdita angolare avanzata per mitigare i problemi ai bordi nel rilevamento dei riquadri di delimitazione orientati (OBB).

Confronto delle prestazioni#

Per valutare questi modelli, è fondamentale bilanciare l'accuratezza (mAP) e l'efficienza computazionale (velocità/FLOPs). La tabella seguente mostra un confronto tra i modelli usando il dataset COCO, lo standard del settore.

Modellodimensione
(pixel)
mAPval
50-95
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Come si vede sopra, YOLO26 offre costantemente un'accuratezza maggiore con molti meno parametri e FLOPs, ottenendo un'architettura molto più efficiente sia in fase di addestramento sia di inferenza.

Efficienza e usabilità dell'addestramento#

Le complessità di DAMO-YOLO#

Sebbene DAMO-YOLO raggiunga un'accuratezza competitiva, la sua metodologia di addestramento è molto complessa. La dipendenza dalla ricerca di architetture neurali (NAS) e da un'intensa distillazione della conoscenza fa sì che l'addestramento di un modello personalizzato richieda spesso notevoli risorse GPU e competenze specialistiche. Questo processo in più fasi, che prevede l'addestramento di un enorme modello insegnante da cui distillare un modello studente più piccolo, può rallentare i team di ingegneria agili che cercano di iterare rapidamente su dataset personalizzati.

L'esperienza Ultralytics semplificata#

Al contrario, Ultralytics YOLO26 è progettato per essere semplice da usare, dal livello base a quello avanzato. L'intero ciclo di vita di addestramento, convalida e distribuzione è accessibile tramite un'API Python e una CLI pulite e unificate. Inoltre, durante l'addestramento YOLO26 richiede molta meno memoria CUDA rispetto ai modelli basati su Transformer come RT-DETR, consentendo ai ricercatori di addestrare modelli all'avanguardia su hardware di fascia consumer.

Ecco un esempio di quanto sia semplice addestrare, valutare ed esportare un modello YOLO26 usando l'SDK Ultralytics:

from ultralytics import YOLO

# Carica il modello nano YOLO26 più recente
model = YOLO("yolo26n.pt")

# Addestra il modello sul dataset COCO8 per 50 epoche
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Valuta le prestazioni del modello sul set di convalida
metrics = model.val()

# Esegui l'inferenza su un'immagine di esempio
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Esporta il modello in formato ONNX per la distribuzione
model.export(format="onnx")

Per i team che preferiscono un ambiente senza codice, la Ultralytics Platform offre un'interfaccia intuitiva per annotare i dataset, addestrare nel cloud e distribuire senza problemi.

Applicazioni nel mondo reale#

La scelta dell'architettura giusta dipende in larga misura dall'ambiente di distribuzione di destinazione e dai vincoli hardware.

Controllo qualità industriale#

Per l'automazione della produzione ad alta velocità, DAMO-YOLO può funzionare bene su hardware GPU dedicato. Tuttavia, YOLO26 è la scelta preferita per le moderne linee di assemblaggio. Il suo design end-to-end senza NMS assicura una latenza deterministica e priva di oscillazioni, fondamentale per sincronizzare in tempo reale i dati visivi con gli attuatori robotici.

IA edge e dispositivi mobili#

Distribuire la visione artificiale su dispositivi alimentati a batteria richiede un'efficienza estrema. Mentre DAMO-YOLO si basa su neck RepGFPN specifici, YOLO26n (Nano) è ottimizzato appositamente per l'edge computing. La rimozione della DFL e un'inferenza su CPU più veloce del 43% lo rendono la soluzione ideale per le telecamere intelligenti, le applicazioni mobili e i sistemi di allarme di sicurezza.

Requisiti dei progetti multi-task#

Se un progetto richiede più del semplice rilevamento degli oggetti, ad esempio l'analisi della meccanica dei giocatori nello sport tramite la stima della posa o l'estrazione di contorni esatti a livello di pixel tramite la segmentazione di istanze, YOLO26 offre il supporto nativo per tutte queste attività in un'unica codebase unificata. DAMO-YOLO è limitato al solo rilevamento dei riquadri di delimitazione.

Casi d'uso e consigli#

La scelta tra DAMO-YOLO e YOLO26 dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze in termini di ecosistema.

Quando scegliere DAMO-YOLO#

DAMO-YOLO è un'ottima scelta per:

  • Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
  • Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
  • Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.

Quando scegliere YOLO26#

YOLO26 è consigliato per:

  • Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
  • Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
  • Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.

Conclusione#

Entrambe le architetture rappresentano risultati significativi nel campo del deep learning. DAMO-YOLO offre uno sguardo interessante sulle potenzialità della ricerca di architetture neurali e delle tecniche di distillazione ottimizzate per benchmark hardware specifici.

Tuttavia, per gli sviluppatori, i ricercatori e le aziende che cercano una soluzione pronta per la produzione, Ultralytics YOLO26 si distingue come la scelta migliore. La combinazione di un design end-to-end senza NMS, enormi miglioramenti dell'inferenza su CPU, versatilità multi-task e integrazione nell'ecosistema Ultralytics ben mantenuto ne fa lo strumento più solido e pratico per affrontare oggi le sfide reali della visione artificiale.

Gli utenti interessati a esplorare altri modelli dell'ecosistema Ultralytics possono consultare la documentazione completa per YOLO11, YOLOv8 e RT-DETR, basato su Transformer.

Commenti