Ultralytics YOLO27:
Get Started

Ultralytics YOLO26#

Tổng quan#

Ultralytics YOLO26 là một dòng model thị giác thời gian thực hợp nhất, được mô tả trong bài báo Ultralytics YOLO26. YOLO26 giới thiệu suy luận end-to-end gốc, detection head gọn nhẹ hơn, công thức huấn luyện được cập nhật và các head chuyên biệt theo tác vụ cho phát hiện, phân đoạn, ước lượng tư thế, phân loại và phát hiện đối tượng định hướng.

Trên năm scale phát hiện, YOLO26 đạt 40.9-57.5 mAP trên COCO với độ trễ TensorRT T4 1.7-11.8 ms. Bài báo cũng ghi nhận suy luận CPU ONNX nhanh hơn tới 43% cho YOLO26n so với YOLO11n trên CPU Intel Xeon @ 2.00 GHz.

Xem bản xem trước YOLO27 chưa phát hành để biết kiến trúc, tác vụ và benchmark sơ bộ dự kiến.

Biểu đồ so sánh Ultralytics YOLO26



Xem: Cách huấn luyện model YOLO26 trên dataset tùy chỉnh của bạn trong Google Colab.
Bắt đầu nhanh
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # nạp model YOLO26n được huấn luyện trước
results = model("path/to/bus.jpg")  # run inference
Dùng thử trên Ultralytics Platform

Khám phá và chạy các model YOLO26 trực tiếp trên Ultralytics Platform.

Dòng model YOLO26 được xây dựng xoay quanh bốn lĩnh vực thiết kế:

  • Suy luận end-to-end gốc: Detection head one-to-one tùy chọn tạo dự đoán mà không cần non-maximum suppression (NMS), giúp đơn giản hóa triển khai và giảm hậu xử lý.
  • Hồi quy box gọn nhẹ hơn: YOLO26 loại bỏ Distribution Focal Loss (DFL), giảm độ phức tạp của detection head mà vẫn giữ phạm vi hồi quy không bị giới hạn.
  • Cập nhật công thức huấn luyện: Pipeline huấn luyện kết hợp MuSGD (optimizer lai Muon + SGD), Progressive Loss và STAL (Gán nhãn có nhận biết mục tiêu nhỏ) để cải thiện quá trình tối ưu hóa, chuyển trọng tâm giám sát sang head tại thời điểm suy luận và duy trì độ bao phủ nhãn dương cho vật thể nhỏ. Toàn bộ siêu tham số của các checkpoint đã phát hành được ghi trong hướng dẫn Công thức huấn luyện YOLO26.
  • Head và loss chuyên biệt theo tác vụ: YOLO26 bổ sung các thiết kế chuyên biệt cho phân đoạn instance, các biến thể phân đoạn ngữ nghĩa, ước lượng tư thế và phát hiện đối tượng định hướng, đồng thời duy trì một pipeline model duy nhất cho mọi tác vụ.

Kết hợp lại, những cập nhật này cải thiện sự cân bằng giữa độ chính xác và độ trễ trên nhiều scale model và mục tiêu triển khai.

Tính năng chính#

  • Hồi quy không dùng DFL YOLO26 loại bỏ Distribution Focal Loss (DFL), giảm độ phức tạp của detection head và đơn giản hóa quá trình export.

  • Suy luận end-to-end không cần NMS YOLO26 hỗ trợ suy luận end-to-end gốc với nms=False, tạo dự đoán mà không cần bước NMS riêng. Nhánh one-to-many mặc định dùng NMS để đạt độ chính xác cao.

  • Progressive Loss + STAL Progressive Loss chuyển trọng tâm huấn luyện sang head tại thời điểm suy luận, trong khi STAL cải thiện độ bao phủ nhãn dương cho vật thể nhỏ.

  • Optimizer MuSGD Optimizer lai kết hợp SGD với Muon, điều chỉnh các ý tưởng tối ưu hóa từ quá trình huấn luyện mô hình ngôn ngữ lớn cho thị giác máy tính.

  • Triển khai hiệu quả Head được đơn giản hóa và tùy chọn không dùng NMS giúp giảm overhead suy luận trên các mục tiêu export và cấu hình phần cứng, bao gồm cả mức tăng tốc CPU ONNX được báo cáo trong bài báo cho YOLO26n so với YOLO11n.

  • Cải tiến phân đoạn instance Bổ sung loss phân đoạn ngữ nghĩa để cải thiện khả năng hội tụ của model và nâng cấp module proto, tận dụng thông tin đa tỷ lệ để tạo mask chất lượng cao hơn. Bài báo ghi nhận mức cải thiện so với YOLO11 lên tới +2.5 box AP và +3.7 mask AP trên tác vụ phân đoạn instance COCO.

  • Ước lượng tư thế chính xác Tích hợp Ước lượng hợp lý log dư (RLE) để định vị keypoint chính xác hơn và tối ưu hóa quy trình giải mã nhằm tăng tốc độ suy luận. Bài báo ghi nhận mức cải thiện lên tới +7.2 AP so với YOLO11 trên tác vụ ước lượng tư thế COCO.

  • Giải mã OBB được tinh chỉnh Bổ sung loss góc chuyên biệt để cải thiện độ chính xác phát hiện các vật thể hình vuông và tối ưu hóa giải mã OBB nhằm khắc phục vấn đề gián đoạn tại ranh giới. Bài báo ghi nhận mức cải thiện lên tới +3.4 mAP so với YOLO11 trên tác vụ phát hiện đối tượng định hướng DOTA-v1.0.

Biểu đồ so sánh end-to-end Ultralytics YOLO26

Các tác vụ và chế độ được hỗ trợ#

YOLO26 hỗ trợ bộ tác vụ Ultralytics tiêu chuẩn trên năm scale model:

ModelTên tệpTác vụHuấn luyệnValidationSuy luậnExport
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptPhát hiện✅✅✅✅
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptPhân đoạn đối tượng✅✅✅✅
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptPhân đoạn ngữ nghĩa✅✅✅✅
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptƯớc lượng độ sâu✅✅✅✅
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptPhân loại✅✅✅✅
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Keypoint✅✅✅✅
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptPhát hiện hộp định hướng✅✅✅✅

Framework hợp nhất này hỗ trợ phát hiện thời gian thực, phân đoạn instance, phân đoạn ngữ nghĩa, ước lượng độ sâu đơn ảnh, phân loại, ước lượng tư thế và phát hiện đối tượng định hướng, cùng các chức năng huấn luyện, validation, suy luận và export.

Các biến thể chỉ có kiến trúc

yolo26-p2.yaml và yolo26-p6.yaml bổ sung detection head P2 (vật thể nhỏ) hoặc P6 (đầu vào lớn) và chỉ được cung cấp dưới dạng kiến trúc YAML. Không có weights yolo26*-p2.pt hoặc yolo26*-p6.pt dành riêng cho scale nào được phát hành. Khởi tạo cấu hình đã scale từ YAML (ví dụ: YOLO("yolo26n-p6.yaml")), sau đó huấn luyện hoặc fine-tune khi cần.

Chỉ số hiệu năng#

Hiệu năng

Xem Tài liệu về Detection để biết ví dụ sử dụng các model này được huấn luyện trên COCO, bao gồm 80 class được huấn luyện trước.

Modelkích thước
(pixel)
mAPval
50-95
mAPval
50-95(e2e)
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.5
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.9
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.4
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.8
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7194.4

Các giá trị Params và FLOPs áp dụng cho model đã hợp nhất sau khi gộp Conv/BatchNorm và loại bỏ nhánh phát hiện không được sử dụng. Các phép đo tốc độ chọn head không dùng NMS với nms=False. Các checkpoint pretrained giữ nguyên kiến trúc huấn luyện đầy đủ và có thể hiển thị số liệu cao hơn.

Ví dụ sử dụng#

Phần này cung cấp các ví dụ đơn giản về huấn luyện và suy luận YOLO26. Để xem tài liệu đầy đủ về các chế độ này và các chế độ khác, hãy tham khảo các trang tài liệu Dự đoán, Huấn luyện, Đánh giá và Xuất.

Lưu ý rằng ví dụ dưới đây dành cho các model YOLO26 Phát hiện dùng cho phát hiện đối tượng. Để xem các tác vụ được hỗ trợ khác, hãy tham khảo tài liệu Phân đoạn, Phân đoạn ngữ nghĩa, Độ sâu, Phân loại, Tư thế và OBB.

Ví dụ

Có thể truyền các model *.pt pretrained PyTorch cũng như các file cấu hình *.yaml vào class YOLO() để tạo một instance model trong Python:

from ultralytics import YOLO

# Tải model YOLO26n pretrained trên COCO
model = YOLO("yolo26n.pt")

# Chạy suy luận bằng model YOLO26n trên ảnh 'bus.jpg'
results = model("path/to/bus.jpg")

# Huấn luyện model trên dataset mẫu COCO8 trong 100 epoch
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Kiến trúc hai head

Các model phát hiện YOLO26 sử dụng kiến trúc hai head, mang lại sự linh hoạt cho các kịch bản triển khai khác nhau:

  • Head One-to-Many (mặc định): Tạo đầu ra YOLO truyền thống cần hậu xử lý NMS, với đầu ra là (N, nc + 4, 8400), trong đó nc là số lớp. Head này thường đạt độ chính xác nhỉnh hơn một chút, đổi lại cần thêm xử lý.
  • Head One-to-One (nms=False): Tạo dự đoán end-to-end không cần NMS, với đầu ra là (N, 300, 6) và tối đa 300 đối tượng được phát hiện trên mỗi ảnh. Head này được tối ưu cho suy luận nhanh và đơn giản hóa triển khai.

Bạn có thể chuyển đổi giữa các head trong quá trình xuất, dự đoán hoặc đánh giá:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Dùng head one-to-many (mặc định, Ultralytics áp dụng NMS)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Chọn dùng head one-to-one không cần NMS
results = model.predict("image.jpg", nms=False)  # inference
metrics = model.val(data="coco.yaml", nms=False)  # validation
model.export(format="onnx", nms=False)  # export

Theo mặc định, dự đoán và đánh giá sử dụng head one-to-many để đảm bảo độ chính xác. Dùng nms=False để suy luận không cần NMS hoặc nms=True để tích hợp NMS trong một định dạng xuất được hỗ trợ. Cả hai head đều được huấn luyện bất kể lựa chọn này. Xem hướng dẫn Phát hiện end-to-end để biết các định dạng đầu ra và khả năng tương thích khi xuất.

YOLOE-26: Phát hiện và phân đoạn với từ vựng mở#

YOLO26 cũng là nền tảng cho YOLOE-26, một biến thể với từ vựng mở có thể phát hiện và phân đoạn các danh mục đối tượng từ prompt văn bản, prompt hình ảnh hoặc chế độ không cần prompt, thay vì dùng danh sách lớp cố định đã học trong quá trình huấn luyện. YOLOE-26 giữ lại head end-to-end (e2e) tùy chọn không cần NMS của YOLO26, nhờ đó suy luận với từ vựng mở vẫn đủ nhanh cho các môi trường động, nơi danh mục mục tiêu thay đổi theo thời gian. YOLOE-26x đạt 40.6 AP trên LVIS minival khi dùng prompt văn bản, 38.5 AP khi dùng prompt hình ảnh và 31.1 AP ở chế độ không cần prompt — đây là các số liệu Non-E2E trong bài báo; head end-to-end thấp hơn lần lượt 1.1, 2.3 và 1.2 AP.

Xem tài liệu YOLOE để biết bảng hiệu năng theo từng kích thước, các biến thể không cần prompt và ví dụ sử dụng đầy đủ.

Trích dẫn và lời cảm ơn#

Để xem mô tả kỹ thuật đầy đủ về kiến trúc YOLO26, quy trình huấn luyện, các head theo tác vụ và phần mở rộng từ vựng mở YOLOE-26, hãy đọc Ultralytics YOLO26: Các model thị giác end-to-end thời gian thực, thống nhất. Nếu sử dụng YOLO26 trong nghiên cứu, vui lòng trích dẫn:

Trích dẫn
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

Mã nguồn, model và tài liệu YOLO26 có trên repository GitHub của Ultralytics và Tài liệu Ultralytics, theo giấy phép AGPL-3.0 và Doanh nghiệp.

Câu hỏi thường gặp#

    • Hồi quy không DFL: Đơn giản hóa head phát hiện và quy trình xuất
    • Suy luận end-to-end không cần NMS: Hỗ trợ suy luận không cần NMS với nms=False
    • Progressive Loss + STAL: Cải thiện sự căn chỉnh trong huấn luyện và độ bao phủ nhãn cho đối tượng nhỏ
    • Optimizer MuSGD: Kết hợp SGD với phương pháp tối ưu lấy cảm hứng từ Muon để huấn luyện ổn định
    • Các head và loss theo tác vụ: Cải thiện khả năng hỗ trợ phân đoạn, pose và phát hiện đối tượng định hướng
  • YOLO26 là họ model thống nhất, hỗ trợ end-to-end nhiều tác vụ thị giác máy tính:

    Mỗi biến thể kích thước (n, s, m, l, x) đều hỗ trợ tất cả tác vụ, cùng các phiên bản từ vựng mở thông qua YOLOE-26.

  • YOLO26 cải thiện hiệu quả triển khai nhờ:

    • Tùy chọn suy luận end-to-end gốc không cần NMS (nms=False)
    • Hồi quy không DFL và head phát hiện nhẹ hơn
    • Xuất model đã hợp nhất, loại bỏ các thành phần phụ chỉ dùng trong huấn luyện
    • Tốc độ suy luận ONNX trên CPU của YOLO26n nhanh hơn tới 43% so với YOLO11n trên Intel Xeon CPU @ 2.00 GHz
    • Các định dạng xuất linh hoạt, bao gồm TensorRT, ONNX, CoreML, LiteRT và OpenVINO
  • Có thể tải các model YOLO26 thông qua package ultralytics. Cài đặt hoặc cập nhật package rồi tải model:

    from ultralytics import YOLO
    
    # Tải model YOLO26 nano pretrained
    model = YOLO("yolo26n.pt")
    
    # Chạy suy luận trên một ảnh
    results = model("image.jpg")

    Xem phần Ví dụ sử dụng để biết hướng dẫn huấn luyện, đánh giá và xuất model.

Bình luận