Ultralytics YOLO26#
Panoramica#
Ultralytics YOLO26 è una famiglia unificata di modelli di visione in tempo reale descritta nell'articolo su Ultralytics YOLO26. Introduce l'inferenza end-to-end nativa, una head di rilevamento più leggera, una ricetta di training aggiornata e head specifiche per attività di rilevamento, segmentazione, stima della posa, classificazione e rilevamento orientato.
Sulle sue cinque scale di rilevamento, YOLO26 raggiunge 40.9-57.5 mAP su COCO con una latenza T4 TensorRT di 1.7-11.8 ms. L'articolo riporta anche un'inferenza CPU ONNX fino al 43% più veloce per YOLO26n rispetto a YOLO11n su una CPU Intel Xeon a 2.00 GHz.
Consulta l'anteprima di YOLO27 non ancora rilasciato per informazioni sull'architettura prevista, le attività e i benchmark preliminari.

from ultralytics import YOLO
model = YOLO("yolo26n.pt") # carica un modello YOLO26n preaddestrato
results = model("path/to/bus.jpg") # esegui l'inferenzaEsplora ed esegui direttamente i modelli YOLO26 sulla Ultralytics Platform.
La famiglia di modelli YOLO26 si basa su quattro aree di progettazione:
- Inferenza end-to-end nativa: la head di rilevamento one-to-one opzionale genera predizioni senza soppressione non massima (NMS), semplificando il deployment e riducendo il post-processing.
- Regressione dei box più leggera: YOLO26 rimuove Distribution Focal Loss (DFL), riducendo la complessità della head di rilevamento e mantenendo un intervallo di regressione non vincolato.
- Aggiornamenti alla ricetta di training: la pipeline di training combina MuSGD (un ottimizzatore ibrido Muon + SGD), Progressive Loss e STAL (Small-Target-Aware Label Assignment) per migliorare l'ottimizzazione, spostare la supervisione verso la head usata in inferenza e mantenere una copertura positiva delle etichette per gli oggetti piccoli. Gli iperparametri completi dei checkpoint rilasciati sono documentati nella Guida alla ricetta di training di YOLO26.
- Head e loss specifiche per attività: YOLO26 introduce soluzioni mirate per la segmentazione di istanze, le varianti di segmentazione semantica, la stima della posa e il rilevamento orientato, mantenendo un'unica pipeline di modello per tutte le attività.
Nel complesso, questi aggiornamenti migliorano il compromesso tra accuratezza e latenza per le diverse scale dei modelli e i vari target di deployment.
Funzionalità principali#
-
Regressione senza DFL YOLO26 rimuove Distribution Focal Loss (DFL), riducendo la complessità della head di rilevamento e semplificando l'esportazione.
-
Inferenza end-to-end senza NMS YOLO26 supporta l'inferenza end-to-end nativa con
nms=False, generando predizioni senza un passaggio NMS separato. Il percorso predefinito one-to-many usa NMS per garantire l'accuratezza. -
Progressive Loss + STAL Progressive Loss sposta l'enfasi del training verso la head usata in inferenza, mentre STAL migliora la copertura positiva delle etichette per gli oggetti piccoli.
-
Ottimizzatore MuSGD Un ottimizzatore ibrido che combina SGD con Muon, adattando alla visione artificiale idee di ottimizzazione provenienti dal training di modelli linguistici di grandi dimensioni.
-
Deployment efficiente La head semplificata e il percorso opzionale senza NMS riducono il sovraccarico dell'inferenza per i target di esportazione e i profili hardware, incluso il miglioramento di velocità CPU ONNX riportato nell'articolo per YOLO26n rispetto a YOLO11n.
-
Miglioramenti alla segmentazione di istanze Introduce una loss di segmentazione semantica per migliorare la convergenza del modello e un modulo proto aggiornato che sfrutta le informazioni multi-scala per ottenere maschere di qualità superiore. L'articolo riporta, rispetto a YOLO11, miglioramenti fino a +2.5 AP dei box e +3.7 AP delle maschere nella segmentazione di istanze su COCO.
-
Stima precisa della posa Integra Residual Log-Likelihood Estimation (RLE) per localizzare i keypoint con maggiore precisione e ottimizza il processo di decodifica per aumentare la velocità di inferenza. L'articolo riporta un miglioramento fino a +7.2 AP rispetto a YOLO11 nella stima della posa su COCO.
-
Decodifica OBB perfezionata Introduce una loss angolare specializzata per migliorare l'accuratezza del rilevamento di oggetti di forma quadrata e ottimizza la decodifica OBB per risolvere i problemi di discontinuità ai bordi. L'articolo riporta un miglioramento fino a +3.4 mAP rispetto a YOLO11 nel rilevamento orientato su DOTA-v1.0.

Attività e modalità supportate#
YOLO26 supporta il set standard di attività Ultralytics su cinque scale del modello:
| Modello | Nomi dei file | Attività | Addestramento | Validazione | Inferenza | Esporta |
|---|---|---|---|---|---|---|
| YOLO26 | yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.pt | Rilevamento | ✅ | ✅ | ✅ | ✅ |
| YOLO26-seg | yolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.pt | Segmentazione di istanze | ✅ | ✅ | ✅ | ✅ |
| YOLO26-sem | yolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.pt | Segmentazione semantica | ✅ | ✅ | ✅ | ✅ |
| YOLO26-depth | yolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.pt | Stima della profondità | ✅ | ✅ | ✅ | ✅ |
| YOLO26-cls | yolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.pt | Classificazione | ✅ | ✅ | ✅ | ✅ |
| YOLO26-pose | yolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.pt | Pose/Keypoint | ✅ | ✅ | ✅ | ✅ |
| YOLO26-obb | yolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.pt | Rilevamento orientato | ✅ | ✅ | ✅ | ✅ |
Questo framework unificato supporta il rilevamento in tempo reale, la segmentazione di istanze, la segmentazione semantica, la stima monoculare della profondità, la classificazione, la stima della posa e il rilevamento di oggetti orientati, con supporto per training, validazione, inferenza ed esportazione.
yolo26-p2.yaml e yolo26-p6.yaml aggiungono una head di rilevamento P2 (oggetti piccoli) o P6 (input di grandi dimensioni) e vengono distribuiti solo come architetture YAML. Non vengono rilasciati pesi yolo26*-p2.pt o yolo26*-p6.pt specifici per scala. Crea un'istanza di una configurazione scalata da YAML (ad esempio, YOLO("yolo26n-p6.yaml")) e addestrala o ottimizzala, secondo necessità.
Metriche di prestazione#
Consulta la documentazione sul rilevamento per esempi d'uso di questi modelli addestrati su COCO, che includono 80 classi preaddestrate.
| Modello | dimensione (pixel) | mAPval 50-95 | mAPval 50-95(e2e) | Velocità CPU ONNX (ms) | Velocità T4 TensorRT10 (ms) | parametri (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 40.1 | 38.9 ± 0.7 | 1.7 ± 0.0 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 47.8 | 87.2 ± 0.9 | 2.5 ± 0.0 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 52.5 | 220.0 ± 1.4 | 4.7 ± 0.1 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 54.4 | 286.2 ± 2.0 | 6.2 ± 0.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 56.9 | 525.8 ± 4.0 | 11.8 ± 0.2 | 55.7 | 194.4 |
I valori di Params e FLOPs si riferiscono al modello fuso dopo l'accorpamento di Conv/BatchNorm e la rimozione del ramo di rilevamento inutilizzato. Le misurazioni della velocità selezionano la head senza NMS con nms=False. I checkpoint preaddestrati mantengono l'architettura di training completa e possono mostrare valori più alti.
Esempi d'uso#
Questa sezione fornisce semplici esempi di training e inferenza con YOLO26. Per la documentazione completa su queste e altre modalità, consulta le pagine della documentazione Predict, Train, Val ed Export.
Nota: l'esempio seguente riguarda i modelli YOLO26 Detect per il rilevamento di oggetti. Per altre attività supportate, consulta la documentazione di Segment, Semantic Segmentation, Depth, Classify, Pose e OBB.
I modelli *.pt preaddestrati con PyTorch e i file di configurazione *.yaml possono essere passati alla classe YOLO() per creare un'istanza del modello in Python:
from ultralytics import YOLO
# Carica un modello YOLO26n preaddestrato su COCO
model = YOLO("yolo26n.pt")
# Esegui l'inferenza con il modello YOLO26n sull'immagine 'bus.jpg'
results = model("path/to/bus.jpg")
# Addestra il modello sul dataset di esempio COCO8 per 100 epoche
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)I modelli di rilevamento YOLO26 utilizzano un'architettura a doppia head che offre flessibilità per diversi scenari di deployment:
- Head One-to-Many (predefinita): genera output YOLO tradizionali che richiedono il post-processing NMS e produce
(N, nc + 4, 8400), dovencè il numero di classi. Questa head raggiunge in genere un'accuratezza leggermente superiore, a costo di un'elaborazione aggiuntiva. - Head One-to-One (
nms=False): produce predizioni end-to-end senza NMS e restituisce(N, 300, 6), con un massimo di 300 rilevamenti per immagine. Questa head è ottimizzata per un'inferenza rapida e un deployment semplificato.
Puoi passare da una head all'altra durante l'esportazione, la predizione o la validazione:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Usa la head one-to-many (predefinita, Ultralytics applica NMS)
results = model.predict("image.jpg") # inference
metrics = model.val(data="coco.yaml") # validation
model.export(format="onnx") # export
# Attiva la head one-to-one senza NMS
results = model.predict("image.jpg", nms=False) # inference
metrics = model.val(data="coco.yaml", nms=False) # validation
model.export(format="onnx", nms=False) # exportPer impostazione predefinita, la predizione e la validazione utilizzano la head one-to-many per garantire l'accuratezza. Usa nms=False per l'inferenza senza NMS oppure nms=True per incorporare NMS in un'esportazione supportata. Entrambe le head vengono addestrate, indipendentemente da questa scelta. Consulta la guida al rilevamento end-to-end per i formati di output e la compatibilità delle esportazioni.
YOLOE-26: rilevamento e segmentazione a vocabolario aperto#
YOLO26 è anche alla base di YOLOE-26, una variante a vocabolario aperto che rileva e segmenta categorie di oggetti usando prompt testuali, prompt visivi o una modalità senza prompt, anziché un elenco fisso di classi appreso durante il training. YOLOE-26 mantiene la head end-to-end (e2e) opzionale senza NMS di YOLO26, così l'inferenza a vocabolario aperto rimane abbastanza rapida per gli ambienti dinamici in cui le categorie di oggetti cambiano nel tempo. YOLOE-26x raggiunge 40.6 AP su LVIS minival con prompt testuali, 38.5 AP con prompt visivi e 31.1 AP senza prompt: sono i valori Non-E2E riportati nel paper, superati dalla head end-to-end rispettivamente di 1.1, 2.3 e 1.2 AP.
Consulta la documentazione di YOLOE per le tabelle delle prestazioni per scala, le varianti senza prompt e gli esempi d'uso completi.
Citazioni e ringraziamenti#
Per una descrizione tecnica completa dell'architettura YOLO26, della procedura di training, delle head specifiche per attività e dell'estensione a vocabolario aperto YOLOE-26, leggi Ultralytics YOLO26: modelli di visione end-to-end unificati in tempo reale. Se usi YOLO26 nella tua ricerca, cita:
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
year = {2026},
eprint = {2606.03748},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
doi = {10.48550/arXiv.2606.03748},
url = {https://arxiv.org/abs/2606.03748},
}Il codice, i modelli e la documentazione di YOLO26 sono disponibili nel repository GitHub di Ultralytics e nella documentazione di Ultralytics, con licenze AGPL-3.0 ed Enterprise.
Domande frequenti#
- Regressione senza DFL: semplifica la head di rilevamento e il processo di esportazione
- Inferenza end-to-end senza NMS: supporta l'inferenza senza NMS con
nms=False - Progressive Loss + STAL: migliora l'allineamento del training e la copertura delle etichette per gli oggetti piccoli
- Ottimizzatore MuSGD: combina SGD con un'ottimizzazione ispirata a Muon per un training stabile
- Head e funzioni di loss specifiche per attività: migliora il supporto per la segmentazione, la stima della posa e il rilevamento orientato
YOLO26 è una famiglia di modelli unificata che offre supporto end-to-end per diverse attività di computer vision:
- Rilevamento di oggetti
- Segmentazione di istanze
- Segmentazione semantica
- Stima della profondità monoculare
- Classificazione delle immagini
- Stima della posa
- Rilevamento di oggetti orientati (OBB)
Ogni variante dimensionale (n, s, m, l, x) supporta tutte le attività, oltre alle versioni a vocabolario aperto tramite YOLOE-26.
YOLO26 migliora l'efficienza del deployment grazie a:
- Inferenza end-to-end nativa opzionale senza NMS (
nms=False) - Regressione senza DFL e una head di rilevamento più leggera
- Esportazione del modello fuso, che rimuove i componenti ausiliari usati solo durante il training
- Inferenza ONNX su CPU fino al 43% più veloce con YOLO26n rispetto a YOLO11n su una CPU Intel Xeon @ 2.00 GHz
- Formati di esportazione flessibili, tra cui TensorRT, ONNX, CoreML, LiteRT e OpenVINO
- Inferenza end-to-end nativa opzionale senza NMS (
I modelli YOLO26 sono disponibili per il download tramite il pacchetto
ultralytics. Installa o aggiorna il pacchetto e carica un modello:from ultralytics import YOLO # Carica un modello YOLO26 nano preaddestrato model = YOLO("yolo26n.pt") # Esegui l'inferenza su un'immagine results = model("image.jpg")Consulta la sezione Esempi d'uso per le istruzioni di training, validazione ed esportazione.