Ultralytics YOLO27:
Get Started

YOLOE: Gerçek Zamanlı Açık Kelime Dağarcıklı Algılama ve Segmentasyon#

Ultralytics YOLOE (Gerçek Zamanlı Her Şeyi Görme), açık kelime dağarcıklı bir algılama ve örnek segmentasyonu modelidir: eğitim sırasında sabitlenen bir sınıf listesi yerine, çıkarım sırasında istediğin kategorileri metin istemi, görsel örnek veya yerleşik 4.585 adlık bir söz varlığı olarak modele verirsin. Ultralytics YOLO mimarileri — YOLOv8, YOLO11 ve YOLO26 — üzerine kurulan ve YOLO-World'den ilham alan YOLOE, kapalı küme YOLO hızına yakın bir hızda sıfır örnekli en gelişmiş doğruluğa ulaşır.



İzle: Ultralytics YOLOE-26 (Yeni) Nasıl Kullanılır | Açık Kelime Dağarcığı ve Gerçek Zamanlı Her Şeyi Görme 🚀

Hızlı Başlangıç#

İstediğin sınıfları belirt ve çalıştır. YOLOE-26, hiç eğitilmediği kategoriler için sınırlayıcı kutular ve örnek segmentasyonu maskeleri döndürür.

Adını verebildiğin her şeyi algıla
from ultralytics import YOLOE

model = YOLOE("yoloe-26s-seg.pt")

# "double-decker bus" bir COCO sınıfı değildir; YOLOE bunu yalnızca sözcüklerden belirler
model.set_classes(["double-decker bus", "person"])

results = model.predict("https://ultralytics.com/images/bus.jpg")
results[0].show()

İlk set_classes() çağrısı bir metin kodlayıcı indirir; ağ erişimi olmayan bir makineye dağıtım yapmadan önce Kurulum ve Gereksinimler bölümüne bak.

İstem Modunu Seçme#

YOLOE üç istem modunu destekler; seçimin hangi kontrol noktasını yükleyeceğini ve sınıf etiketlerinin nasıl görüneceğini belirler. Çıkarım sırasında sağlayabileceklerine uyan satırı seç.

YOLOE'nin metin istemlerinden, görsel istemlerden ve istem gerektirmeyen söz varlığından yararlanarak nesneleri algılaması ve segmentlere ayırması

ModKontrol noktasıSağladığın girdiSonuçlardaki sınıf adlarıŞu durumda kullan
Metin istemi*-seg.ptDizeler olarak sınıf adlarıGirdiğin adların aynısıHedefi sözcüklerle tarif edebiliyorsan — genellikle tercih edilen seçenek
Görsel istem*-seg.ptReferans görüntü üzerindeki örnek kutularGenel object0, object1, …Hedefi sözcüklerle ifade edemiyorsan: belirli bir parça, logo veya kusur
İstemsiz*-seg-pf.ptHiçbir şeyYerleşik 4.585 adlık söz varlığındaki adlarKatalog oluşturuyor veya keşif yapıyorsan ve önceden ne arayacağını bilmiyorsan
Sık Karşılaşılan İki Sürpriz
  • Görsel istemler etiketlerini taşımaz. visual_prompts içindeki sınıf kimlikleri örnekleri gruplandırır; model bunları object0, object1 vb. olarak raporlar. Bunları kendi adlarınla kendin eşleştir.
  • İstemsiz kontrol noktaları set_classes() girdisini kabul etmez. Bunu bir *-seg-pf.pt modeli üzerinde çağırmak AssertionError: Prompt-free model does not support setting classes. Please try with Text/Visual prompt models. hatasına yol açar. Kendi sınıflarına ihtiyaç duyduğunda bunun yerine bir *-seg.pt kontrol noktası yükle.

Kurulum ve Gereksinimler#

YOLOE, ana Ultralytics paketinde sunulur:

pip install -U ultralytics

Metinle istem vermek için buna ek olarak bir metin kodlayıcı gerekir; bu kodlayıcı kurulum sırasında değil, ilk kullanımda indirilir:

  • İlk set_classes() çağrısı, pip ile (belirteçleyiciyi sağlar) GitHub'dan ultralytics/CLIP yükler ve bir TorchScript metin kodlayıcısını geçerli çalışma dizinine indirir. YOLOE-26, yaklaşık 254 MB olan mobileclip2_b.ts dosyasını; YOLOE-11 ve YOLOE-v8 ise mobileclip_blt.ts dosyasını indirir. İndirme işlemini çalıştıracağın dizinden bir kez yap veya dosyayı bu dizine kopyala; aksi takdirde dosya yeniden indirilir.
  • Her iki adım da ağ erişimi gerektirir; bu nedenle çevrimdışı veya ağ bağlantısı kesilmiş bir makineye dağıtım yapmadan önce istemli bir tahmin çalıştır.
  • Görsel istemler ve istemsiz kontrol noktaları hiç metin kodlayıcı gerektirmez.

YOLOE-26 kontrol noktaları için ultralytics 8.4.0 veya daha yeni bir sürüm gerekir; YOLOE-11 ve YOLOE-v8 aileleri daha eski sürümlerde kullanılabilir. Metin istemli tek bir tahmin tüm akışı — kontrol noktasının indirilmesi, CLIP kurulumu, metin kodlayıcı ve çıkarım — çalıştırır:

yolo predict model=yoloe-26s-seg.pt source="https://ultralytics.com/images/bus.jpg" classes="person"

Çıkarım sırasında metin kodlayıcıyı indirme adımını tamamen atlamak için istemleri bir kez ağırlıklara göm ve yeniden kullan — İstem gömmelerini yeniden kullanma bölümüne bak.

Mimariye Genel Bakış#

YOLOE Architecture

YOLOE, standart YOLO yapısını korur — özellik çıkarımı için evrişimli bir omurga, çok ölçekli birleştirme için bir boyun ve sınıfları ve kutuları tahmin eden çapasız, ayrık bir başlık — ve her istem modu için bir tane olmak üzere üç modül ekler:

  • Yeniden Parametrelendirilebilir Bölge-Metin Hizalaması (RepRTA), CLIP'ten alınan metin gömmelerini küçük bir yardımcı ağ üzerinden iyileştirir. Bu ağ her set_classes() çağrısında bir kez çalışır ve dışa aktarma sırasında katlanarak kaldırılır; dolayısıyla kare başına maliyeti yoktur. Her ileri geçişte çalışan işlem, depolanan istem gömmelerini bölge özellikleriyle karşılaştırmaktır; geniş bir istem kümesinin maliyetini öğrenmek için Sınırlamalar bölümüne bak.
  • Anlamsal Etkinleştirmeli Görsel İstem Kodlayıcı (SAVPE), örnek bir kutudan anlamsal ve etkinleştirme özellikleri kodlayarak modeli bu kutudakilere benzeyen neslelere göre koşullandırır. Logo veya belirli bir parça gibi adlandırılması zor hedefler için tek örnekli yol budur.
  • Tembel Bölge-İstem Karşıtlığı (LRPC), bölge gömmelerini yerleşik 4.585 adlık söz varlığıyla eşleştirir; böylece istemsiz kontrol noktaları herhangi bir harici istem veya metin kodlayıcı olmadan nesneleri tanır.

Örnek segmentasyonu, YOLOv8-Seg'deki gibi algılama başlığındaki bir maske dalından gelir ve her tahmin results[0].masks üzerinde bir maske içerir. Model dışa aktarıldıktan sonra açık dünya modülleri standart bir YOLO başlığına yeniden parametrelendirilir; böylece dışa aktarılan dosya normal algılama/segmentasyon yolunu çalıştırır.

Kullanılabilir Modeller#

Aşağıdaki her kontrol noktası bir örnek segmentasyonu modelidir ve val, predict, export ve track işlemlerini destekler. Metin veya görsel istem kullanmak için *-seg.pt dosyasını, istemsiz çıkarım için *-seg-pf.pt dosyasını yükle; bunlar birbirinin yerine kullanılamaz. İstem Modunu Seçme bölümüne bak. Yalnızca *-seg.pt dosyaları train işlemini destekler; istemsiz bir kontrol noktası, metin istemli bir model eğitildikten sonra üretilir. Resmi Modelleri Sıfırdan Eğitme bölümüne bak.

YOLOE'nin LVIS üzerindeki performansı#

640 pikselde LVIS minival üzerindeki sıfır örnekli sonuçlar, Ultralytics YOLO26 makalesinden alınmıştır.

Metin ve görsel istemler#

Her doğruluk ve parametre hücresi metin istemi / görsel istem biçimindedir; FLOP değeri bir kez verilir. Parametre ve FLOP değerleri, makalenin değerlendirdiği algılama yapılandırmasına aittir. Doğruluk, karşılaştırmadaki her model için raporlanan tek protokol olan makalenin Non-E2E değeridir; YOLOE-26 uçtan uca başlığının doğruluğu, metin istemlerinde en fazla 1.1 AP, görsel istemlerde ise 2.6 AP daha düşüktür.

ModelmAP50-95mAPrmAPcmAPfparametre
(M)
FLOPs
(B)
YOLOE-26n24.7 / 21.920.5 / 17.624.1 / 22.326.1 / 22.43.9 / 3.16.1
YOLOE-26s30.8 / 28.623.9 / 25.129.6 / 27.833.0 / 29.910.7 / 11.021.9
YOLOE-26m35.4 / 33.931.1 / 33.434.7 / 34.036.9 / 33.821.3 / 25.170.6
YOLOE-26l37.8 / 36.335.1 / 37.637.6 / 36.238.5 / 36.125.5 / 29.389.0
YOLOE-26x40.6 / 38.537.4 / 35.340.9 / 38.841.0 / 38.855.2 / 65.2197.7
YOLOE-11s27.5 / 26.321.4 / 22.526.8 / 27.129.3 / 26.410.7 / 10.922.7
YOLOE-11m33.0 / 31.426.9 / 27.132.5 / 31.934.5 / 31.721.0 / 24.870.4
YOLOE-11l35.2 / 33.729.1 / 28.135.0 / 34.636.5 / 33.826.0 / 29.889.5
YOLOE-v8s27.9 / 26.222.3 / 21.327.8 / 27.729.0 / 25.712.3 / 12.629.8
YOLOE-v8m32.6 / 31.026.9 / 27.031.9 / 31.734.4 / 31.126.4 / 28.480.7
YOLOE-v8l35.9 / 34.233.2 / 33.234.8 / 34.637.3 / 34.143.5 / 47.3167.6

İstemsiz#

İstemsiz kontrol noktaları, herhangi bir istem sağlanmadan yerleşik söz varlıklarından yanıt verir. Her doğruluk hücresi uçtan uca / Non-E2E biçimindedir; makale YOLOE-26'yı bu iki protokole göre puanlar. YOLO26 sayfasında Non-E2E sütunu alıntılanır.

ModelmAP50-95mAPrmAPcmAPfparametre
(M)
FLOPs
(B)
YOLOE-26n-pf16.6 / 17.715.7 / 15.815.3 / 16.417.9 / 19.22.35.3
YOLOE-26s-pf21.4 / 22.616.2 / 20.220.1 / 20.923.5 / 24.59.020.8
YOLOE-26m-pf25.7 / 26.426.7 / 24.524.0 / 25.026.9 / 27.919.468.4
YOLOE-26l-pf27.2 / 28.026.3 / 25.725.7 / 26.828.7 / 29.523.686.8
YOLOE-26x-pf29.9 / 31.127.5 / 28.929.1 / 30.731.1 / 31.753.1194.4

Metin ve görsel istemlerde YOLOE-26 modelleri, mAP50-95 metriğinde eşleşen her ölçekte YOLOE-11 ve YOLOE-v8 karşılıklarından daha iyi sonuç verirken parametre ve FLOP sayıları v8 serisinin altında kalır. Makale aynı veri bölünmesinde YOLO-Worldv2 için S ölçeğinde 24.4, M ölçeğinde 32.4 ve L ölçeğinde 35.5; Transformer tabanlı algılayıcılar GLIP-T için 26.0, GDINO-T için 27.4 ve DetCLIP-T için 34.4 sonuçlarını bildiriyor; bu modellerin her biri 155 ila 232 M parametre içeriyor. Orijinal YOLOE makalesi, tanıttığı v8 ölçeğindeki modeller için iki sonuç daha sunuyor. LVIS'te YOLOE-v8s, YOLO-Worldv2-S'yi eğitim maliyetinin üçte biriyle ve 1.4× çıkarım hızıyla 3.5 AP farkla geçiyor. COCO'ya aktarıldığında YOLOE-v8l, kapalı küme YOLOv8-L modeline kıyasla 0.6 box AP ve 0.4 mask AP artışı sağlıyor ve eğitim süresi neredeyse 4× daha kısa oluyor.

Makaledeki Sayılar ve Yayımlanan Ağırlıklar

YOLO26 makalesi bir algılama yapılandırmasını değerlendiriyor. Yayımlanan ağırlıklar segmentasyon kontrol noktalarıdır ve üstüne bir maske dalı, SAVPE ve metin projeksiyonu eklenmiştir; bu nedenle yüklenen bir yoloe-26l-seg.pt 25.5 M ve 89.0 B yerine 35.4 M ve 142.0 B bildirir. Her iki durumda da FLOP değeri bölge-metin benzerliğini dışarıda bırakır; bu yüzden sütundaki değer değişmese de gerçek maliyet istem kümesinin boyutuna göre artar. Sınırlamalar bölümüne bak.

Kullanım Örnekleri#

Aşağıdaki her YOLOE örneği Python API üzerinden çalışır. Metin istemiyle tahmin, doğrulama, dışa aktarma, izleme ve standart eğitim CLI üzerinden de çalışır; ince ayar tarifleri ve görsel istemleme, argüman olarak bir eğitici veya tahminci sınıfı geçirir ve bunu yalnızca Python API kabul eder.

Eğitim Kullanımı#

Yayımlanan herhangi bir *-seg.pt kontrol noktasını kendi YOLO veri kümenle ince ayar yap. Bu işlem çoğunlukla standart YOLO eğitim prosedürünü izler; fark, hangi eğiticiyi ilettiğindir. YOLOEPESegTrainer sınıf adlarını kafaya birleştirir ve buradan ince ayar yapar; kendi etiketlerinle çalışırken istediğin yöntem budur. Varsayılan eğitici, senin sınıf adlarınla eğitim yapmaz.



İzle: Araba Parçaları Segmentasyon Veri Kümesinde YOLOE Nasıl Eğitilir | Açık Kelime Dağarcıklı Model, Tahmin ve Dışa Aktarma 🚀
Örnek
from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEPESegTrainer

model = YOLOE("yoloe-26s-seg.pt")

results = model.train(
    data="coco128-seg.yaml",
    epochs=80,
    patience=10,
    trainer=YOLOEPESegTrainer,  # <- Önemli: varsayılan eğitici değil, ince ayar eğiticisi
)
Bunun yerine bir algılama modeli eğitme

Yayımlanan her kontrol noktası bir segmentasyon modelidir. Bir algılayıcı eğitmek için modeli eşleşen YAML'den oluştur, aynı ölçekteki segmentasyon ağırlıklarını yükle ve algılama eğiticisini kullan. Diğer her şey aynı kalır.

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEPETrainer

model = YOLOE("yoloe-26s.yaml").load("yoloe-26s-seg.pt")

results = model.train(data="coco128.yaml", epochs=80, patience=10, trainer=YOLOEPETrainer)

Tahmin Kullanımı#

Metin istemi çağrısı, Hızlı Başlangıç bölümünde gösterilendir. Diğer iki modun her biri ek bir argüman gerektirir:

Örnek

Görsel istemler, modeli bir şeyi tarif etmek yerine ona örneğini gösterir. visual_prompts, örnek kutulardan oluşan bir bboxes dizisi ve her kutu için bir sınıf kimliği içeren cls dizisi alır. Kimlikler etiket değil, geçici gruplamalardır; 0'dan başlayarak sıralı olmalıdır ve sonuçlar seçtiğin adlarla değil, object0, object1, … biçiminde döner.

Örnek kutular, tahmin yaptığın görüntünün üzerinde olabilir:

import numpy as np

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEVPSegPredictor

model = YOLOE("yoloe-26l-seg.pt")

# Her hedef için bir örnek kutu; her kutunun kendi sınıf kimliği var
visual_prompts = {
    "bboxes": np.array([[221.52, 405.8, 344.98, 857.54], [120, 425, 160, 445]]),  # kişi, gözlük
    "cls": np.array([0, 1]),
}

results = model.predict(
    "ultralytics/assets/bus.jpg",
    visual_prompts=visual_prompts,
    predictor=YOLOEVPSegPredictor,
)
results[0].show()

Ya da refer_image olarak geçirilen ayrı bir referans görüntüde olabilir. Bu durumda bboxes ve cls, hedefteki değil referanstaki nesneleri tanımlar:

import numpy as np

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEVPSegPredictor

model = YOLOE("yoloe-26l-seg.pt")

visual_prompts = {"bboxes": np.array([[221.52, 405.8, 344.98, 857.54]]), "cls": np.array([0])}  # person

results = model.predict(
    "ultralytics/assets/zidane.jpg",  # Hedef görüntü
    refer_image="ultralytics/assets/bus.jpg",  # Örnek kutuların bulunduğu yer
    visual_prompts=visual_prompts,
    predictor=YOLOEVPSegPredictor,
)
results[0].show()

# refer_image sınıfları kalıcı olarak da ayarlar; böylece sonraki çağrılarda hiç istem gerekmez
results = model("ultralytics/assets/bus.jpg")
model.export(format="onnx")  # Dışa aktarma da sınıfları korur
Not

source bir video veya akış olduğunda ilk kare otomatik olarak refer_image olur; böylece ilettiğin istemler o kareye uygulanır ve videonun geri kalanında da kullanılır. Farklı bir kare seçmek için refer_image değerini açıkça ilet.

Hem source hem de refer_image, torch tensörlerini doğrudan kabul eder; bu, görüntüler zaten mevcut bir işlem hattından geliyorsa kullanışlıdır. Kutuları tensörün kendi piksel koordinatlarında ver:

import numpy as np
import torch

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEVPSegPredictor

model = YOLOE("yoloe-11l-seg.pt")

img_tensor = torch.rand(1, 3, 480, 480)  # (1, 3, H, W) [0, 1] aralığında float tensörü
visual_prompts = {"bboxes": np.array([[10, 10, 50, 50]]), "cls": np.array([0])}

results = model.predict(
    img_tensor,
    refer_image=img_tensor,
    visual_prompts=visual_prompts,
    predictor=YOLOEVPSegPredictor,
    imgsz=640,
)

Aynı anda birkaç görüntü üzerinde tahmin yapmak için istemleri bir seviye daha iç içe yerleştir: kaynaklarla aynı sırada olmak üzere her kaynak görüntü için bir bboxes dizisi ve bir cls dizisi kullan.

import numpy as np

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOEVPSegPredictor

model = YOLOE("yoloe-26l-seg.pt")

visual_prompts = {
    "bboxes": [
        np.array([[221.52, 405.8, 344.98, 857.54], [120, 425, 160, 445]]),  # bus.jpg: kişi, gözlük
        np.array([[150, 200, 1150, 700]]),  # zidane.jpg: kişi
    ],
    "cls": [np.array([0, 1]), np.array([0])],
}

results = model.predict(
    ["ultralytics/assets/bus.jpg", "ultralytics/assets/zidane.jpg"],
    visual_prompts=visual_prompts,
    predictor=YOLOEVPSegPredictor,
)
results[0].show()

Doğrulama Kullanımı#

Doğrulama, segmentasyon veri kümesindeki diğer modellerde olduğu gibi çalışır:

Örnek
from ultralytics import YOLOE

model = YOLOE("yoloe-26l-seg.pt")  # veya diğer boyutlar için yoloe-26s/m-seg.pt

metrics = model.val(data="coco128-seg.yaml")

Aynı çağrının iki çeşidi diğer istemleme modlarını kapsar:

  • Görsel istemler — model.val(data="coco128-seg.yaml", load_vp=True), veri kümesinin kendisinden her kategori için bir görsel gömme çıkarır. Gömme vektörlerini, tam olarak aynı kategorileri içermesi gereken farklı bir veri kümesinden almak için refer_data="coco.yaml" ekle.
  • İstemsiz — bir *-seg-pf.pt kontrol noktası yükle ve single_cls=True değerini ilet.

Dışa Aktarma Kullanımı#

İstem gömmeleri bir kez kaydedilip ONNX, OpenVINO, TensorRT, CoreML, LiteRT ve RKNN gibi statik dışa aktarımlar oluşturulurken yeniden kullanılabilir. NPZ profili, dışa aktarmadan önce özgün PyTorch modeli tarafından yüklenir; ek bir çalışma zamanı girdisi değildir ve dışa aktarılan model NPZ dosyasını gerektirmez.

Dışa aktarılan modeller statiktir

set_classes() ile (veya görsel istemler için refer_image üzerinden) yapılandırılan sınıflar dışa aktarılan ağırlıklara işlenir. Dışa aktarıldıktan sonra model yeni istemleri artık kabul edemez: yüklü bir dışa aktarım üzerinde set_classes() çağrısı yapmak veya predict() işlevine visual_prompts=... geçirmek başarısız olur. Algılanan sınıfları değiştirmek için yeni istemler yapılandırılmış halde özgün .pt kontrol noktasından yeniden dışa aktar. Dışa aktarılan dosya standart bir YOLO modeli gibi davranır ve YOLOE() yerine YOLO() ile de yüklenebilir.

İstem gömmelerini yeniden kullan
from ultralytics import YOLOE

model = YOLOE("yoloe-26n-seg.pt")
model.set_classes(["person", "bus"])
model.save_prompt_embeddings("person-bus.npz")

# Profil kaynak kontrol noktasına bağlıdır ve sonraki dışa aktarımlarda yeniden kullanılabilir.
model = YOLOE("yoloe-26n-seg.pt")
model.load_prompt_embeddings("person-bus.npz")
model.export(format="onnx")

Aynı istem profili, eşleşen YOLOE mimarisinden oluşturulmuş yalnızca algılama yapan bir modeli de yapılandırabilir. Böylece istem verilen sınıflar korunurken maske dalı kaldırılır:

from ultralytics import YOLOE

model = YOLOE("yoloe-26n.yaml").load("yoloe-26n-seg.pt")
model.load_prompt_embeddings("person-bus.npz")
model.export(format="rknn", name="rk3588", quantize=16)

Takip Kullanımı#

İstem verilen sınıflar doğrudan izlemeye aktarılır; böylece izleyicinin eğitim sırasında hiç görmediği nesneleri takip edebilirsin:

Örnek
from ultralytics import YOLOE

model = YOLOE("yoloe-26s-seg.pt")
model.set_classes(["forklift", "pallet"])

# persist=True kareler arasında izleme kimliklerini sabit tutar
for result in model.track("path/to/video.mp4", stream=True, persist=True):
    print(result.boxes.id)

YOLOE Karşılaştırması#

YOLOE, kapalı küme bir algılayıcıyla ağır, açık sözcük dağarcıklı bir model arasında yer alır. Senin için doğru seçim olup olmadığına üç karşılaştırma karar verir:

  • Kapalı küme bir YOLO'ya kıyasla. İstemler ayarlandıktan sonra YOLOE, sıradan algılama/segmentasyon yolundan tahmin yapar ve diğer modeller gibi dışa aktarılır. Eklediği özellik, yeniden eğitim yerine çıkarım sırasında sınıf listesini değiştirebilmendir; bunun bedeli ise kendi sınıfların üzerinde eğitilmiş bir modelden çok daha düşük sıfır örnekli doğruluktur.
  • Önceki YOLOE ailelerine kıyasla. YOLOE-26, YOLO26 modelinin NMS içermeyen uçtan uca başlığını devralır ve önceki üç ölçeğe (s/m/l) karşılık beş ölçeği (n/s/m/l/x) kapsar; ayrıca Performans bölümünde eşleşen her ölçekte daha iyi sonuç verir.
  • Transformer tabanlı açık sözcük dağarcıklı algılayıcılara kıyasla. GLIP ve OWL-ViT çıkarım sırasında görsel-dil Transformer'ı çalıştırır. YOLOE ise istemleri bir kez kodlar ve ardından evrişimli bir başlığın içindeki bölge özellikleriyle karşılaştırır.

En yakın alternatiflerin tümü metin istemi alır; ancak maske döndürenler yalnızca YOLOE ve SAM 3'tür ve bu üç model farklı soruları yanıtlar:

YOLOESAM 3YOLO-World
Kullanım amacıAdlandırılmış sınıfların gerçek zamanlı algılanması ve segmentasyonuKavram segmentasyonu ve istemlenebilir izlemeGerçek zamanlı, açık sözcük dağarcıklı algılama
MaskelerEvet, *-seg.pt kontrol noktalarıylaEvetHayır, yalnızca kutular
Görsel istemlerEvet (SAVPE)EvetHayır
İstemsiz modEvet, 4.585 adlı sözcük dağarcığıHayırHayır
Şu durumda seçYüksek verime ihtiyacın varsa ve sınıfları adlandırabiliyorsanEn güçlü kavram segmentasyonuna ihtiyacın varsa ve hesaplama maliyetini karşılayabiliyorsanZaten kullanıyorsan — aşağıdaki geçiş notuna bak

YOLO-World'den mi geçiyorsun? API'nin yapısı aynı: YOLOWorld yerine YOLOE kullan, bir *-seg.pt kontrol noktası yükle ve set_classes() çağrını değiştirme. Maske ve görsel istemler kazanırsın; sabitlenmiş sınıflarla ilgili dışa aktarma notu her ikisi için de geçerlidir.

Kullanım Alanları ve Uygulamalar#

Açık sözcük dağarcıklı algılama, her sınıf için yeniden eğitim adımını ortadan kaldırır; bu, özellikle hedef listesinin önceden bilinmediği durumlarda önemlidir:

  • Açık dünya algılama — eğitim sırasında kimsenin listelemediği nesnelerle karşılaşan robotik ve güvenlik sistemleri.
  • Örnekten tek atışlı algılama — görsel istemler, tek bir referans kutusundan belirli bir parçayı, logoyu veya kusuru bulur; bu özellik endüstriyel denetimde kullanışlıdır.
  • Uzun kuyruklu kataloglama — yerleşik 4.585 adlı sözcük dağarcığı, biyoçeşitlilik izleme veya perakende envanter taramaları için yeterince kapsamlıdır.
  • Veri kümesini başlatma — görüntüleri insan incelemesinden önce kutular ve maskelerle önceden etiketle, ardından sonuç üzerinde hızlı bir kapalı küme modeli eğit.
  • İstenen herhangi bir hedefi segmentasyon — yayımlanan *-seg.pt kontrol noktaları her tahminle birlikte maske döndürür; böylece tıbbi görüntüleme ve uydu analizi, ikinci bir modele gerek kalmadan piksel hassasiyetinde çıktı alır.

Yaygın bir yöntem iki modu birleştirir: önce mevcut olanları keşfetmek için bir kez istemsiz modu çalıştır, ardından önemli kategoriler için metin istemlerine geç.

Sınırlamalar#

YOLOE, çıkarım sırasında sınıfları değiştirebilme karşılığında doğruluktan ödün verir. Karar vermeden önce bilmen gereken sonuçlar şunlardır:

  • Sıfır örnekli doğruluk, kendi sınıfların üzerinde eğitilmiş bir modelden çok daha düşüktür. İstem verilen kontrol noktaları LVIS minival'de yaklaşık 22-40 mAP aralığında sonuç verir; kendi verilerinde eğitilmiş kapalı küme bir YOLO bu sınıflarda daha iyi sonuç alır. Eğitemediğin sınıfları kapsamak için YOLOE'yi kullan, eğitimin yerine değil.
  • Nadir kategoriler zayıf noktadır. Performans bölümündeki mAPr sütunu, özellikle LVIS'in nadir sınıflarındaki doğruluğu bildirir; metin istemlerinde her satırda yaygın ve sık görülen sınıflara ait sütunların altında kalır. Hedeflerin alışılmadıksa, manşet mAP yerine bu değeri kontrol et.
  • İstem, ilişkileri değil görünüşü tarif eder. Algılama, bölge özelliklerinin istem gömmesiyle karşılaştırılmasıyla çalışır; bu nedenle duruma, bağlama veya kıyaslamaya bağlı olan “hasarlı”, “en soldaki” ya da “taşınan nesne” gibi istemlerin eşleştirilecek güvenilir bir dayanağı yoktur. Günlük kategori adlarına yakın ifadeleri tercih et.
  • Büyük istem kümeleri gecikmeyi artırır. İstem gömmeleri bir kez hesaplanır, ancak her ileri geçişte bölge özellikleriyle karşılaştırılır. CPU üzerinde yoloe-26s-seg.pt ile ölçüldüğünde, 80 sınıftan 1,203 sınıfa geçişte ileri geçiş süresi yaklaşık %19, 4,585 adlı tam sözcük dağarcığında ise yaklaşık %89 artar. Bölge-metin benzerliği hesaba katılmadığı için bildirilen FLOP değeri hiç değişmez; bu nedenle profil bu konuda seni uyarmaz.
  • İstem verene kadar sınıf adları yer tutucudur. Yeni yüklenmiş bir *-seg.pt kontrol noktası, sayısal adlara sahip nc=80 değerini ("0", "1", …) bildirir; bu yüzden etiketleri okumadan önce set_classes() çağrısını yap. İstemsiz kontrol noktalarında sözcük dağarcığının tamamı önceden doldurulmuştur.

Dağıtım Notları#

  • Donanım. Çıkarım için 4-8 GB VRAM'e sahip bir NVIDIA GPU gerekir; n ve s ölçekleri Jetson gibi uç GPU'larda veya daha düşük çözünürlükte CPU üzerinde çalışır. İnce ayar için tek bir GPU gerekir.
  • NMS varsayılan olarak sınıftan bağımsızdır. YOLOE, agnostic_nms=True ile tahmin yapar. Varsayılan olarak bu yöntem, yalnızca aynı sınıftaki kutuları değil, farklı sınıflar arasında üst üste binen düşük puanlı kutuları da bastırır; böylece bir nesne birkaç kategoriyle eşleştiğinde yinelenen sonuçlar önlenir. nms=False ile YOLOE-26 IoU bastırması uygulamaz; sınıftan bağımsız mod, tek bir bağlantının birden fazla sınıf etiketi üretmesine izin vermek yerine her bağlantı için yalnızca en iyi sınıfı tutar. Bu davranışı geçersiz kılmak için agnostic_nms=False değerini ilet.
  • Toplu işleme. Toplu çıkarım doğrudan çalışır ve aynı çağrıda her görüntü için farklı görsel istemler kullanabilirsin.

Resmî Modelleri Sıfırdan Eğitme#

Okuyucuların çoğunun buna ihtiyacı olmaz. Bu işlem, Objects365, GQA ve Flickr30k veri kümelerindeki yayımlanmış açık sözcük dağarcıklı kontrol noktalarını yeniden üretir — 8× RTX 4090 üzerinde yaklaşık 1.4 M eğitim örneği — ve yukarıdaki Eğitim Kullanımı bölümünde ele alınan kendi verilerinle ince ayar yapmayla ilgili değildir.

Uyarı

YOLOETrainer sınıfından miras alan her eğitici, varsayılan YOLOESegTrainer ve aşağıdaki tüm sıfırdan eğitim eğiticileri dâhil, compile=True değerini reddeder. compile=False değerini ilet (varsayılan). Yukarıda kullanılan iki ince ayar eğiticisi YOLOEPESegTrainer ve YOLOEPETrainer bu kısıtlamaya tabi değildir.

Eğitim için segment açıklamaları gerekir. Aşağıdaki işlenmiş dosyaları indirebilir veya resmî ekibin sağladığı betiği kullanarak kendi açıklamalarını oluşturabilirsin; bu betik SAM 2.1 kullanır. Doğrulamada LVIS minival kullanılır.

Veri kümesiTürÖrneklerKutularİşlenmiş segment açıklamaları
Objects365v1Algılama609k9621kobjects365_train_segm.json
GQAGrounding621k3681kfinal_mixed_train_no_coco_segm.json
Flickr30kGrounding149k641kfinal_flickr_separateGT_train_segm.json

Önce metin istemli model eğitilir; diğer iki istemleme modu bu modelin iyileştirilmiş sürümleridir:

from ultralytics import YOLOE
from ultralytics.models.yolo.yoloe import YOLOESegTrainerFromScratch

data = {
    "train": {
        "yolo_data": ["Objects365.yaml"],
        "grounding_data": [
            {
                "img_path": "flickr/full_images/",
                "json_file": "flickr/annotations/final_flickr_separateGT_train_segm.json",
            },
            {
                "img_path": "mixed_grounding/gqa/images",
                "json_file": "mixed_grounding/annotations/final_mixed_train_no_coco_segm.json",
            },
        ],
    },
    "val": {"yolo_data": ["lvis.yaml"]},
}

model = YOLOE("yoloe-26l-seg.yaml")
model.train(
    data=data,  # veya aynı yapıyı içeren bir YAML dosyasının yolu
    batch=128,
    epochs=30,
    close_mosaic=2,
    optimizer="AdamW",
    lr0=2e-3,
    warmup_bias_lr=0.0,
    weight_decay=0.025,
    momentum=0.9,
    workers=4,
    trainer=YOLOESegTrainerFromScratch,
    device="0,1,2,3,4,5,6,7",
)

Görsel istemli ve istemsiz kontrol noktaları, eğitilmiş metin istemli modelden başlar ve her biri bir modülü günceller. YOLOESegVPTrainer, görsel istem tarifidir; YOLOEPEFreeTrainer ise istemsiz tarifidir, ancak bu sınıflardan hiçbiri tek başına herhangi bir şeyi dondurmaz: seçici eğitim, yanında ilettiğin ve savpe dışındaki her başlık alt modülünü (sırasıyla her sınıflandırma kulesini) belirten freeze listesinden gelir; istemsiz çalıştırma ayrıca single_cls=True gerektirir. YOLOE'nin üst kaynak deposu, v8 ölçeğindeki modeller için tariflerin tamamını içerir.

Tamamlanmış istemsiz çalıştırma, çıkarım sırasında adlarını istem olmadan bildiren bir kontrol noktasına yeniden parametrelendirilir; bunun için get_vocab ve set_vocab kullanılır:

from ultralytics import YOLOE

# İstemsiz çalıştırmanın ve onun başlangıç noktası olan metin istemli çalıştırmanın yazdığı ağırlıklar. Her
# yeniden çalıştırma yeni bir dizin oluşturur (train-2, train-3, ...); bu nedenle çalıştırmaların yazdırdığı yolları kullan.
model = YOLOE("runs/segment/train-2/weights/best.pt")  # istemsiz çalıştırma; başlığı zaten birleştirilmiş durumda
text_model = YOLOE("runs/segment/train/weights/best.pt")  # metin istemli çalıştırma; başlığı henüz birleştirilmemiş durumda

names = list(YOLOE("yoloe-26l-seg-pf.pt").model.names.values())  # 4.585 adlık söz varlığı veya kendi listen
vocab = text_model.get_vocab(names)

model.set_vocab(vocab, names)
model.save("yoloe-26l-seg-pf-custom.pt")  # yayımlanan kontrol noktasının üzerine asla yazma

get_vocab, modelin end2end bayrağının seçtiği dalı döndürür; set_vocab ise bu dalı yeniden parametrelendirir. Yayımlanan YOLOE-26 dosyalarında bunun yerine her dal için ayrı bir söz varlığı bulunur; böylece nms bu dallar arasında seçim yapabilir. Bunu yeniden üretmek için metin istemli modelin başka bir kopyasından ikinci söz varlığını al. YOLOE-11 ve YOLOE-v8 tek bir dala sahip olduğundan yukarıdaki çağrıyı değiştirmeden kullanırlar.

one2one_model = YOLOE("runs/segment/train/weights/best.pt")  # get_vocab okuduğu başlığı birleştirir; bu nedenle ikinci bir kopya yükle
one2one_model.model.end2end = True  # NMS içermeyen dalı oku

model.set_vocab(vocab, names, one2one_vocab=one2one_model.get_vocab(names))

Atıflar ve Teşekkürler#

YOLOE araştırmana veya projenize katkıda bulunduysa lütfen Tsinghua Üniversitesi'nden Ao Wang, Lihao Liu, Hui Chen, Zijia Lin, Jungong Han ve Guiguang Ding'in özgün makalesine atıfta bulun:

Alıntı
@misc{wang2025yoloerealtimeseeing,
      title={YOLOE: Real-Time Seeing Anything},
      author={Ao Wang and Lihao Liu and Hui Chen and Zijia Lin and Jungong Han and Guiguang Ding},
      year={2025},
      eprint={2503.07465},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2503.07465},
}

Daha fazla bilgi için özgün YOLOE makalesine arXiv üzerinden ulaşabilirsin. Projenin kaynak koduna ve ek kaynaklara GitHub deposundan erişebilirsin.

Sık Sorulan Sorular#

  • Ultralytics YOLOE, YOLO-World'de bulunmayan iki özellik sunar: sınıf adının yerine örnek bir kutunun kullanıldığı görsel istemler ve hiçbir istem olmadan yerleşik 4.585 adlık söz varlığından yanıt veren istemsiz kontrol noktaları. Yayımlanan *-seg.pt kontrol noktalarından gelen her tahmin ayrıca bir örnek segmentasyonu maskesi taşır. Doğruluk açısından özgün YOLOE makalesi, YOLOE-v8s'nin LVIS üzerinde YOLO-Worldv2-S'den 3,5 AP daha yüksek sonuç verdiğini, eğitim maliyetinin üçte biriyle eğitildiğini ve çıkarım hızının 1,4 katı olduğunu bildiriyor. Geçiş tek satırlık bir değişiklik gerektirir — YOLOE Karşılaştırması bölümüne bak.

  • Ultralytics YOLOE üç istem modunu destekler. Metin istemi, *-seg.pt kontrol noktasında dizeler olarak verilen sınıf adlarıdır ve genellikle tercih edilen seçenektir. Görsel istem, sözcüklerle ifade etmesi zor hedefler için referans görüntüdeki bir veya daha fazla örnek kutudur. İstemsiz çıkarım, dışarıdan hiçbir şey verilmeden yerleşik 4.585 adlık söz varlığından yanıt veren ayrı bir *-seg-pf.pt kontrol noktasını kullanır. Metin ve görsel istemler aynı kontrol noktalarını paylaşır; istemsiz mod için farklı dosyalar kullanılır ve bu dosyalar set_classes() öğesini kabul etmez. Karşılaştırmanın tamamı için İstem Modu Seçimi bölümüne bak.

  • yoloe-26s-seg.pt ile başla: YOLOE-26 ailesi her eşleşen ölçekte YOLOE-11 ve YOLOE-v8'in önünde yer alır; s ölçeği ise LVIS minival üzerinde 30 mAP değerini aşan en küçük ölçektir. Nadir kategorilerde doğruluk gecikmeden daha önemliyse m, l veya x ölçeğine geç — karşılaştırman gereken sütun Performans bölümündeki mAPr sütunudur. n ölçeğine yalnızca uç dağıtımı için in. Kendi sınıf adların yerine yerleşik söz varlığını kullanmak istiyorsan aynı ölçeğin *-seg-pf.pt dosyasını yükle.

  • object0 ve object1 gibi etiketler, tahminin görsel istemden geldiğini gösterir; bu durumda örnek kutular adlarını taşımak yerine geçici numaralı sınıflar altında gruplanır. visual_prompts["cls"] içinde verdiğin sınıf kimlikleri yalnızca bu gruplamayı yapar. Model bunları, atadığın kimliklerin sırasına göre object0, object1 ve devamı şeklinde bildirir; bu nedenle sonuçtaki kimlikleri kendi etiketlerinle eşleştir. Çıktıda kendi adlarının görünmesini istiyorsan bunun yerine metin istemi kullan.

  • İstemsiz kontrol noktaları (*-seg-pf.pt), sınıfları kendi yerleşik söz varlıkları üzerinden belirler ve AssertionError: Prompt-free model does not support setting classes. Please try with Text/Visual prompt models. ile gelen harici istemleri reddeder. Kendi sınıf listene ihtiyaç duyduğunda *-seg.pt kontrol noktasını yükle. İstem Modu Seçimi bölümüne bak.

  • İlk metin istemi, Ultralytics YOLOE'nin GitHub'dan ultralytics/CLIP yüklemesini ve pip ile geçerli çalışma dizinine bir TorchScript metin kodlayıcısı indirmesini sağlar — YOLOE-26 için yaklaşık 254 MB; her model ailesine ait tam varlık bilgisi için Kurulum ve Gereksinimler bölümüne bak. Görsel istemler ve istemsiz kontrol noktaları bunların hiçbirine ihtiyaç duymaz. Hedef makinede indirmeyi önlemek için istemleri bir kez ayarla ve save_prompt_embeddings() ile kaydet ya da modeli sınıflar önceden yapılandırılmış şekilde dışa aktar.

  • Hayır — YOLOE, istemle belirtilen sınıfları dışa aktarma sırasında ağırlıklara işler; bu nedenle yüklenen bir dışa aktarım hem set_classes() hem de visual_prompts= öğesini reddeder. Yeni istemleri yapılandırarak özgün .pt kontrol noktasından yeniden dışa aktar. Dışa aktarılan dosya standart bir YOLO modeli gibi davranır ve YOLO() ile YOLOE() kullanılarak yüklenebilir.

  • Gerçek zamanlı aktarım hızına ihtiyacın varsa ve sınıfları adlandırabiliyorsan YOLOE'yi; bir kavram üzerindeki segmentasyon kalitesi hızdan daha önemliyse SAM 3 kullan. İkisi de görsel örnekleri kabul eder; istemsiz modu yalnızca YOLOE sunar. Karşılaştırmanın tamamı YOLOE Karşılaştırması bölümündedir.

Yorumlar