DAMO-YOLO vs YOLO26#
Il panorama della visione artificiale è in continua evoluzione, spinto dalla necessità di architetture che bilancino elevata accuratezza e inferenza a bassa latenza. Questo confronto approfondisce gli aspetti tecnici di DAMO-YOLO e Ultralytics YOLO26, esaminandone le innovazioni architetturali, le metodologie di addestramento e i casi d'uso ideali.
Che tu stia distribuendo modelli di visione su dispositivi edge o creando pipeline cloud ad alto throughput, comprendere le differenze tra questi modelli è fondamentale per prendere decisioni architetturali consapevoli nello sviluppo moderno dell'IA.
DAMO-YOLO: ricerca di architetture neurali su larga scala#
DAMO-YOLO, sviluppato dal gruppo Alibaba, è stato rilasciato il 23 novembre 2022. Progettato da Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun, il modello si concentra soprattutto sulla ricerca automatizzata di architetture efficienti tramite la ricerca di architetture neurali (NAS).
Puoi consultare la ricerca originale nel loro articolo su ArXiv o esplorare il codice sorgente nel repository DAMO-YOLO su GitHub.
Caratteristiche architetturali principali#
DAMO-YOLO introduce diverse innovazioni tecniche progettate per ampliare i limiti del rilevamento degli oggetti in tempo reale:
- Backbone MAE-NAS: DAMO-YOLO utilizza una ricerca guidata dall'entropia massima per individuare i backbone ottimali. Questo approccio NAS individua architetture che bilanciano rigorosamente l'accuratezza del rilevamento e la velocità di inferenza su hardware specifico.
- Efficient RepGFPN: Un design con neck pesante che migliora notevolmente la fusione delle caratteristiche, particolarmente utile per analizzare scene complesse come quelle presenti nelle immagini aeree.
- Design ZeroHead: Una head di rilevamento fortemente semplificata che riduce al minimo la complessità computazionale dei livelli finali di predizione.
- AlignedOTA e distillazione: DAMO-YOLO utilizza l'assegnazione ottimale tramite trasporto allineato (AlignedOTA) per risolvere le ambiguità nell'assegnazione delle etichette, insieme a una solida strategia di miglioramento basata sulla distillazione della conoscenza, che aumenta l'accuratezza dei modelli studente più piccoli sfruttando reti insegnanti più grandi.
Il vantaggio di Ultralytics: YOLO26#
Rilasciato il 14 gennaio 2026 da Glenn Jocher e Jing Qiu presso Ultralytics, YOLO26 rappresenta il massimo dell'IA visiva accessibile e ad alte prestazioni. Basato sull'eredità di YOLO11 e YOLOv10, YOLO26 è progettato da zero per la distribuzione edge-first, la versatilità multi-task e una facilità d'uso senza pari.
Innovazioni di YOLO26#
Ultralytics YOLO26 introduce diverse funzionalità rivoluzionarie che lo rendono la scelta definitiva per le applicazioni moderne di visione artificiale:
- Design end-to-end senza NMS: La head nativa one-to-one di YOLO26 (
nms=False) elimina la post-elaborazione con soppressione dei massimi non locali (NMS). Introdotto inizialmente in YOLOv10, questo approccio end-to-end semplifica notevolmente le pipeline di distribuzione e garantisce inferenza deterministica a bassa latenza. - Inferenza su CPU fino al 43% più veloce: Ottimizzato a livello architetturale per l'edge computing, YOLO26 offre velocità eccezionali sui dispositivi edge e sulle CPU standard, risultando perfetto per i dispositivi IoT alimentati a batteria.
- Ottimizzatore MuSGD: Ispirato all'addestramento degli LLM, come Kimi K2 di Moonshot AI, YOLO26 integra una combinazione di SGD e Muon. Questo trasferisce la stabilità dell'addestramento dei modelli linguistici di grandi dimensioni alla visione artificiale, con una convergenza più rapida e affidabile.
- Rimozione della DFL: Eliminando la Distribution Focal Loss, il grafo del modello viene semplificato e l'esportazione in formati come ONNX e TensorRT diventa immediata.
- ProgLoss + STAL: Queste funzioni di perdita avanzate migliorano notevolmente il riconoscimento degli oggetti piccoli, una caratteristica fondamentale per le operazioni con droni e l'agricoltura.
YOLO26 include miglioramenti specializzati per diverse modalità: un proto multi-scala per la segmentazione di istanze, la stima residua della log-verosimiglianza (RLE) per la stima della posa e una funzione di perdita angolare avanzata per mitigare i problemi ai bordi nel rilevamento dei riquadri di delimitazione orientati (OBB).
Confronto delle prestazioni#
Per valutare questi modelli, è fondamentale bilanciare l'accuratezza (mAP) e l'efficienza computazionale (velocità/FLOPs). La tabella seguente mostra un confronto tra i modelli usando il dataset COCO, lo standard del settore.
| Modello | dimensione (pixel) | mAPval 50-95 | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Come si vede sopra, YOLO26 offre costantemente un'accuratezza maggiore con molti meno parametri e FLOPs, ottenendo un'architettura molto più efficiente sia in fase di addestramento sia di inferenza.
Efficienza e usabilità dell'addestramento#
Le complessità di DAMO-YOLO#
Sebbene DAMO-YOLO raggiunga un'accuratezza competitiva, la sua metodologia di addestramento è molto complessa. La dipendenza dalla ricerca di architetture neurali (NAS) e da un'intensa distillazione della conoscenza fa sì che l'addestramento di un modello personalizzato richieda spesso notevoli risorse GPU e competenze specialistiche. Questo processo in più fasi, che prevede l'addestramento di un enorme modello insegnante da cui distillare un modello studente più piccolo, può rallentare i team di ingegneria agili che cercano di iterare rapidamente su dataset personalizzati.
L'esperienza Ultralytics semplificata#
Al contrario, Ultralytics YOLO26 è progettato per essere semplice da usare, dal livello base a quello avanzato. L'intero ciclo di vita di addestramento, convalida e distribuzione è accessibile tramite un'API Python e una CLI pulite e unificate. Inoltre, durante l'addestramento YOLO26 richiede molta meno memoria CUDA rispetto ai modelli basati su Transformer come RT-DETR, consentendo ai ricercatori di addestrare modelli all'avanguardia su hardware di fascia consumer.
Ecco un esempio di quanto sia semplice addestrare, valutare ed esportare un modello YOLO26 usando l'SDK Ultralytics:
from ultralytics import YOLO
# Carica il modello nano YOLO26 più recente
model = YOLO("yolo26n.pt")
# Addestra il modello sul dataset COCO8 per 50 epoche
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Valuta le prestazioni del modello sul set di convalida
metrics = model.val()
# Esegui l'inferenza su un'immagine di esempio
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Esporta il modello in formato ONNX per la distribuzione
model.export(format="onnx")Per i team che preferiscono un ambiente senza codice, la Ultralytics Platform offre un'interfaccia intuitiva per annotare i dataset, addestrare nel cloud e distribuire senza problemi.
Applicazioni nel mondo reale#
La scelta dell'architettura giusta dipende in larga misura dall'ambiente di distribuzione di destinazione e dai vincoli hardware.
Controllo qualità industriale#
Per l'automazione della produzione ad alta velocità, DAMO-YOLO può funzionare bene su hardware GPU dedicato. Tuttavia, YOLO26 è la scelta preferita per le moderne linee di assemblaggio. Il suo design end-to-end senza NMS assicura una latenza deterministica e priva di oscillazioni, fondamentale per sincronizzare in tempo reale i dati visivi con gli attuatori robotici.
IA edge e dispositivi mobili#
Distribuire la visione artificiale su dispositivi alimentati a batteria richiede un'efficienza estrema. Mentre DAMO-YOLO si basa su neck RepGFPN specifici, YOLO26n (Nano) è ottimizzato appositamente per l'edge computing. La rimozione della DFL e un'inferenza su CPU più veloce del 43% lo rendono la soluzione ideale per le telecamere intelligenti, le applicazioni mobili e i sistemi di allarme di sicurezza.
Requisiti dei progetti multi-task#
Se un progetto richiede più del semplice rilevamento degli oggetti, ad esempio l'analisi della meccanica dei giocatori nello sport tramite la stima della posa o l'estrazione di contorni esatti a livello di pixel tramite la segmentazione di istanze, YOLO26 offre il supporto nativo per tutte queste attività in un'unica codebase unificata. DAMO-YOLO è limitato al solo rilevamento dei riquadri di delimitazione.
Casi d'uso e consigli#
La scelta tra DAMO-YOLO e YOLO26 dipende dai requisiti specifici del tuo progetto, dai vincoli di distribuzione e dalle preferenze in termini di ecosistema.
Quando scegliere DAMO-YOLO#
DAMO-YOLO è un'ottima scelta per:
- Analisi video ad alto throughput: elaborazione di flussi video ad alto FPS su infrastrutture GPU NVIDIA fisse, dove il throughput con batch di dimensione 1 è la metrica principale.
- Linee di produzione industriale: scenari con rigidi vincoli di latenza GPU su hardware dedicato, come l'ispezione della qualità in tempo reale sulle linee di assemblaggio.
- Ricerca sulla ricerca di architetture neurali: studio degli effetti della ricerca automatizzata delle architetture (MAE-NAS) e dei backbone efficienti riparametrizzati sulle prestazioni di rilevamento.
Quando scegliere YOLO26#
YOLO26 è consigliato per:
- Distribuzione edge senza NMS: applicazioni che richiedono inferenza costante a bassa latenza senza la complessità della post-elaborazione con soppressione non massima.
- Ambienti con sola CPU: dispositivi senza accelerazione GPU dedicata, sui quali l'inferenza su CPU di YOLO26, fino al 43% più veloce, offre un vantaggio decisivo.
- Rilevamento di oggetti di piccole dimensioni: scenari complessi come le immagini aeree acquisite da droni o l'analisi dei sensori IoT, in cui ProgLoss e STAL migliorano notevolmente la precisione sugli oggetti molto piccoli.
Conclusione#
Entrambe le architetture rappresentano risultati significativi nel campo del deep learning. DAMO-YOLO offre uno sguardo interessante sulle potenzialità della ricerca di architetture neurali e delle tecniche di distillazione ottimizzate per benchmark hardware specifici.
Tuttavia, per gli sviluppatori, i ricercatori e le aziende che cercano una soluzione pronta per la produzione, Ultralytics YOLO26 si distingue come la scelta migliore. La combinazione di un design end-to-end senza NMS, enormi miglioramenti dell'inferenza su CPU, versatilità multi-task e integrazione nell'ecosistema Ultralytics ben mantenuto ne fa lo strumento più solido e pratico per affrontare oggi le sfide reali della visione artificiale.
Gli utenti interessati a esplorare altri modelli dell'ecosistema Ultralytics possono consultare la documentazione completa per YOLO11, YOLOv8 e RT-DETR, basato su Transformer.