Ultralytics YOLO27:

Ultralytics YOLO26#

Panoramica#

Ultralytics YOLO26 è una famiglia unificata di modelli di visione in tempo reale descritta nell'articolo su Ultralytics YOLO26. Introduce l'inferenza nativamente end-to-end, una testa di rilevamento più leggera, una procedura di addestramento aggiornata e teste specifiche per attività di rilevamento, segmentazione, stima della posa, classificazione e rilevamento orientato.

Considerando le sue cinque scale di rilevamento, YOLO26 raggiunge 40.9-57.5 mAP su COCO con una latenza TensorRT su T4 di 1.7-11.8 ms. L'articolo riporta inoltre un'inferenza CPU ONNX fino al 43% più veloce per YOLO26n rispetto a YOLO11n su una CPU Intel Xeon @ 2.00 GHz.

Consulta l' anteprima di YOLO27 non rilasciata per l'architettura pianificata, le attività e i benchmark preliminari.

Grafici di confronto di Ultralytics YOLO26



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Guida rapida
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Prova Ultralytics Platform

Esplora ed esegui i modelli YOLO26 direttamente su Ultralytics Platform.

La famiglia di modelli YOLO26 si basa su quattro aree progettuali:

  • Inferenza end-to-end nativa: la testa di rilevamento uno-a-uno opzionale produce predizioni senza NMS, semplificando il deployment e riducendo il post-processing.
  • Regressione delle bounding box più leggera: YOLO26 rimuove la perdita focale della distribuzione (DFL), riducendo la complessità della testa di rilevamento e mantenendo al contempo un intervallo di regressione non vincolato.
  • Aggiornamenti della procedura di addestramento: la pipeline di addestramento combina MuSGD (un ottimizzatore ibrido Muon + SGD), Progressive Loss e STAL (assegnazione delle etichette consapevole dei piccoli oggetti) per migliorare l'ottimizzazione, spostare la supervisione verso la testa usata in inferenza e mantenere una copertura positiva delle etichette per i piccoli oggetti. Gli iperparametri completi alla base dei checkpoint rilasciati sono documentati nella guida alla procedura di addestramento di YOLO26.
  • Teste e perdite specifiche per attività: YOLO26 aggiunge design mirati per la segmentazione delle istanze, le varianti di segmentazione semantica, la stima della posa e il rilevamento orientato, mantenendo al contempo un'unica pipeline di modello per tutte le attività.

Nel complesso, questi aggiornamenti migliorano il compromesso tra accuratezza e latenza tra le diverse scale dei modelli e i vari target di deployment.

Funzionalità principali#

  • Regressione senza DFL YOLO26 rimuove la perdita focale della distribuzione (DFL), riducendo la complessità della testa di rilevamento e semplificando l'esportazione.

  • Inferenza End-to-End Senza NMS YOLO26 supporta l'inferenza native end-to-end con nms=False, producendo predizioni senza un passaggio NMS separato. Il percorso predefinito uno-a-molti utilizza NMS per la precisione.

  • Progressive Loss + STAL Progressive Loss sposta l'attenzione dell'addestramento verso la testa usata in inferenza, mentre STAL migliora la copertura positiva delle etichette per i piccoli oggetti.

  • Ottimizzatore MuSGD Un ottimizzatore ibrido che combina SGD con Muon, adattando alla visione artificiale idee di ottimizzazione provenienti dall'addestramento dei modelli linguistici di grandi dimensioni.

  • Deployment Efficiente La testa semplificata e il percorso opzionale senza NMS riducono il sovraccarico di inferenza tra gli target di esportazione e i profili hardware, incluso il speedup su CPU ONNX riportato nel paper per YOLO26n rispetto a YOLO11n.

  • Miglioramenti alla segmentazione delle istanze Introduce una perdita di segmentazione semantica per migliorare la convergenza del modello e un modulo proto aggiornato che sfrutta informazioni multi-scala per una qualità superiore delle maschere. L'articolo riporta miglioramenti rispetto a YOLO11 fino a +2.5 box AP e +3.7 mask AP sulla segmentazione delle istanze COCO.

  • Stima precisa della posa Integra la stima della log-verosimiglianza residua (RLE) per una localizzazione più accurata dei keypoint e ottimizza il processo di decoding per aumentare la velocità di inferenza. L'articolo riporta fino a +7.2 AP rispetto a YOLO11 sulla stima della posa COCO.

  • Decoding OBB perfezionato Introduce una perdita angolare specializzata per migliorare l'accuratezza del rilevamento degli oggetti di forma quadrata e ottimizza il decoding OBB per risolvere i problemi di discontinuità ai bordi. L'articolo riporta fino a +3.4 mAP rispetto a YOLO11 sul rilevamento orientato DOTA-v1.0.

Grafici di confronto end-to-end di Ultralytics YOLO26

Attività e modalità supportate#

YOLO26 supporta il set standard di attività Ultralytics attraverso cinque scale di modello:

ModelloNomi dei fileAttivitàAddestramentoConvalidaInferenzaEsportazione
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptRilevamento
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptSegmentazione delle istanze
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSegmentazione semantica
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptStima della profondità
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptClassificazione
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPosa/Keypoint
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptRilevamento orientato

Questo framework unificato comprende rilevamento in tempo reale, segmentazione delle istanze, segmentazione semantica, stima della profondità monoculare, classificazione, stima della posa e rilevamento di oggetti orientati, con supporto per addestramento, validazione, inferenza ed esportazione.

Varianti con la sola architettura

yolo26-p2.yaml e yolo26-p6.yaml aggiungono una testa di rilevamento P2 (per piccoli oggetti) o P6 (per input di grandi dimensioni) e vengono distribuiti esclusivamente come architetture YAML. Non vengono rilasciati pesi yolo26*-p2.pt o yolo26*-p6.pt specifici per scala. Istanzia una configurazione scalata da YAML (ad esempio, YOLO("yolo26n-p6.yaml")) e addestrala o sottoponila a fine-tuning secondo necessità.

Metriche delle prestazioni#

Prestazioni

Consulta la documentazione sul rilevamento per esempi di utilizzo con questi modelli addestrati su COCO, che includono 80 classi pretrained.

Modellodimensione
(pixel)
mAPval
50-95
mAPval
50-95(e2e)
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.5
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.9
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.4
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.8
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7194.4

I valori di parametri e FLOPs si riferiscono al modello fuso dopo il folding di Conv/BatchNorm e la rimozione del ramo di rilevamento non utilizzato. Le misurazioni della velocità selezionano la testa senza NMS con nms=False. I checkpoint pre-addestrati conservano l'intera architettura di addestramento e potrebbero mostrare conteggi superiori.

Esempi di utilizzo#

Questa sezione fornisce semplici esempi di addestramento e inferenza con YOLO26. Per la documentazione completa su queste e altre modalità, consulta le pagine della documentazione Predict, Train, Val ed Export.

Tieni presente che l'esempio seguente riguarda i modelli YOLO26 Detect per il rilevamento degli oggetti. Per le altre attività supportate, consulta la documentazione Segment, Semantic Segmentation, Depth, Classify, Pose e OBB.

Esempio

I modelli *.pt preaddestrati con PyTorch, così come i file di configurazione *.yaml, possono essere passati alla classe YOLO() per creare un'istanza del modello in Python:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Architettura a doppia testa

I modelli di rilevamento YOLO26 utilizzano un'architettura a doppia testa che offre flessibilità per diversi scenari di deployment:

  • Testa Uno-a-Molti (Predefinita): Genera output YOLO tradizionali che richiedono il post-processing NMS, emettendo (N, nc + 4, 8400) dove nc è il numero di classi. Questa testa tipicamente raggiunge una precisione leggermente superiore a costo di un'elaborazione aggiuntiva.
  • Testa Uno-a-Uno (nms=False): Produce predizioni end-to-end senza NMS, emettendo (N, 300, 6) con un massimo di 300 rilevamenti per immagine. Questa testa è ottimizzata per l'inferenza rapida e un deployment semplificato.

Puoi passare da una testa all'altra durante l'esportazione, la predizione o la validazione:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-many head (default, Ultralytics applies NMS)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Opt into the NMS-free one-to-one head
results = model.predict("image.jpg", nms=False)  # inference
metrics = model.val(data="coco.yaml", nms=False)  # validation
model.export(format="onnx", nms=False)  # export

La predizione e la validazione utilizzano per impostazione predefinita la testa uno-a-molti per la precisione. Usa nms=False per l'inferenza senza NMS, o nms=True per incorporare NMS in un'esportazione supportata. Entrambe le teste vengono addestrate indipendentemente da questa scelta. Consulta la guida al rilevamento End-to-End per i formati di output e la compatibilità di esportazione.

YOLOE-26: rilevamento e segmentazione a vocabolario aperto#

YOLO26 alimenta anche YOLOE-26, una variante open-vocabulary che rileva e segmenta categorie di oggetti da prompt di testo, prompt visivi o una modalità senza prompt invece di un elenco di classi fisso appreso durante l'addestramento. YOLOE-26 mantiene la testa end-to-end (e2e) opzionale senza NMS di YOLO26, in modo che l'inferenza open-vocabulary rimanga abbastanza veloce per ambienti dinamici in cui le categorie target cambiano nel tempo. YOLOE-26x raggiunge 40.6 AP su LVIS minival con prompt testuale, 38.5 AP con prompt visivo e 31.1 AP senza prompt - i dati Non-E2E del paper, che la testa end-to-end precede con un distacco di 1.1, 2.3 e 1.2 AP.

Consulta la documentazione di YOLOE per le tabelle delle prestazioni per scala, le varianti senza prompt e gli esempi d'uso completi.

Citazioni e ringraziamenti#

Per una descrizione tecnica completa dell'architettura YOLO26, della procedura di addestramento, delle teste per attività e dell'estensione YOLOE-26 a vocabolario aperto, leggi Ultralytics YOLO26: modelli di visione unificati end-to-end in tempo reale. Se utilizzi YOLO26 nella tua ricerca, cita:

Citazione
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

Il codice, i modelli e la documentazione di YOLO26 sono disponibili nel repository Ultralytics su GitHub e nella documentazione Ultralytics con licenze AGPL-3.0 ed Enterprise.

FAQ#

    • Regressione senza DFL: semplifica la testa di rilevamento e il percorso di esportazione
    • Inferenza end-to-end senza NMS: supporta l'inferenza senza NMS con nms=False
    • Progressive Loss + STAL: migliora l'allineamento dell'addestramento e la copertura delle etichette per i piccoli oggetti
    • Ottimizzatore MuSGD: combina SGD con un'ottimizzazione ispirata a Muon per un addestramento stabile
    • Teste e perdite specifiche per attività: migliora il supporto per segmentazione, posa e rilevamento orientato
  • YOLO26 è una famiglia di modelli unificata che offre supporto end-to-end per molteplici attività di visione artificiale:

    Ogni variante dimensionale (n, s, m, l, x) supporta tutte le attività, oltre alle versioni a vocabolario aperto tramite YOLOE-26.

  • YOLO26 migliora l'efficienza del deployment grazie a:

    • Inferenza end-to-end nativa opzionale senza NMS (nms=False)
    • Regressione senza DFL e una testa di rilevamento più leggera
    • Esportazione del modello fuso, che rimuove i componenti ausiliari utilizzati solo durante l'addestramento
    • Inferenza CPU ONNX fino al 43% più veloce per YOLO26n rispetto a YOLO11n su una CPU Intel Xeon @ 2.00 GHz
    • Formati di esportazione flessibili, tra cui TensorRT, ONNX, CoreML, LiteRT e OpenVINO
  • I modelli YOLO26 sono disponibili per il download tramite il pacchetto ultralytics. Installa o aggiorna il pacchetto e carica un modello:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO26 nano model
    model = YOLO("yolo26n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Consulta la sezione Esempi d'uso per le istruzioni su addestramento, validazione ed esportazione.

Commenti