Ultralytics YOLO27:
Get Started

YOLO26 so với YOLO11#

Khi xây dựng các hệ thống thị giác máy tính tiên tiến nhất, việc chọn đúng model đóng vai trò then chốt để cân bằng độ chính xác, độ trễ và hiệu quả sử dụng tài nguyên. Trong bối cảnh trí tuệ nhân tạo phát triển nhanh chóng, Ultralytics tiếp tục mở rộng giới hạn của những gì có thể thực hiện. Bài so sánh kỹ thuật chi tiết này phân tích quá trình chuyển đổi từ YOLO11 rất thành công sang YOLO26 mang tính đột phá, cung cấp cho kỹ sư AI và nhà nghiên cứu những thông tin cần thiết để đưa ra quyết định kiến trúc sáng suốt.

Dòng phát triển và siêu dữ liệu của model#

Cả hai model đều do Ultralytics phát triển, nhưng đại diện cho những mô hình khác nhau trong tiến trình phát triển của các model phát hiện đối tượng và thị giác đa nhiệm.

Thông tin YOLO26:

Thông tin YOLO11:

Các kiến trúc khác

Mặc dù YOLO26 là model thời gian thực tiên tiến nhất của chúng tôi, người dùng làm việc với phần cứng chuyên dụng cao hoặc dung lượng bộ nhớ rất lớn cũng có thể khám phá các kiến trúc dựa trên Transformer như RT-DETR hoặc model tiên phong đột phá không cần NMS là YOLOv10.

Khác biệt và cải tiến về kiến trúc#

Bước tiến từ YOLO11 lên YOLO26 bao gồm những thay đổi căn bản cả về kiến trúc model lẫn quy trình huấn luyện nền tảng. Trong khi YOLO11 thiết lập một nền tảng vững chắc cho phát hiện đối tượng và học đa nhiệm, YOLO26 cải tiến toàn diện quy trình triển khai cho điện toán biên.

Thiết kế đầu-cuối không cần NMS#

Một trong những nâng cấp quan trọng nhất của YOLO26 là kiến trúc đầu-cuối được tích hợp sẵn. Không giống YOLO11, vốn dựa vào bước hậu xử lý Non-Maximum Suppression (NMS) để lọc các bounding box chồng lấn, YOLO26 có thể bỏ qua hoàn toàn bước này nhờ head một-một tùy chọn (nms=False). Ý tưởng này, lần đầu tiên được tiên phong trong YOLOv10, giúp giảm đáng kể độ biến thiên độ trễ và đơn giản hóa logic triển khai trên nhiều thiết bị biên khác nhau.

Loại bỏ DFL để tăng hiệu quả trên thiết bị biên#

YOLO11 sử dụng Distribution Focal Loss (DFL) để tinh chỉnh ước lượng bounding box. Tuy nhiên, DFL phụ thuộc vào các phép toán softmax phức tạp, thường không được các bộ tăng tốc biên công suất thấp hỗ trợ tốt. YOLO26 loại bỏ DFL thành công mà không làm giảm độ chính xác. Việc đơn giản hóa kiến trúc này giúp cải thiện đáng kể khả năng tương thích với các hệ thống nhúng và cho phép YOLO26 đạt tốc độ suy luận CPU nhanh hơn tới 43% so với phiên bản tiền nhiệm.

Optimizer MuSGD#

Độ ổn định và tốc độ huấn luyện có ý nghĩa then chốt. YOLO26 giới thiệu Optimizer MuSGD, một phương pháp kết hợp Stochastic Gradient Descent (SGD) và Muon, lấy cảm hứng sâu sắc từ những đổi mới trong huấn luyện LLM của Kimi K2 thuộc Moonshot AI. Optimizer này mang lại độ ổn định của quá trình huấn luyện model ngôn ngữ cho thị giác máy tính, đảm bảo hội tụ nhanh hơn và giảm dung lượng bộ nhớ sử dụng trong quá trình huấn luyện so với các model Transformer cồng kềnh.

ProgLoss và STAL#

Đối với các nhà nghiên cứu làm việc với ảnh chụp từ trên không hoặc ứng dụng drone, việc phát hiện các đặc trưng nhỏ là một thách thức lâu nay. YOLO26 kết hợp ProgLoss với STAL (Gán nhãn nhận biết đối tượng nhỏ), cải thiện đáng kể khả năng nhận diện đối tượng nhỏ so với YOLO11.

So sánh hiệu năng và chỉ số#

Khi so sánh trực tiếp hai model, YOLO26 cho thấy ưu thế rõ rệt về độ chính xác và hiệu quả trên thiết bị biên, đồng thời duy trì yêu cầu bộ nhớ cực thấp vốn là đặc trưng của hệ sinh thái Ultralytics.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Lưu ý: Model nano YOLO26 (YOLO26n) cải thiện tốc độ CPU khoảng ~31% so với YOLO11n (38.9ms so với 56.1ms), làm nổi bật triết lý thiết kế ưu tiên thiết bị biên.

Tính linh hoạt trên các tác vụ thị giác máy tính#

Cả hai model đều được hưởng lợi từ hệ sinh thái Ultralytics được duy trì tốt, mang đến trải nghiệm sử dụng dễ dàng vượt trội thông qua Python API thống nhất. Chúng không chỉ là các model phát hiện đối tượng mà còn là những công cụ đa nhiệm mạnh mẽ. Tuy nhiên, YOLO26 tích hợp một số cải tiến dành riêng cho từng tác vụ:

  • Phân đoạn đối tượng: YOLO26 sử dụng hàm loss phân đoạn ngữ nghĩa được tinh chỉnh và tạo nguyên mẫu đa tỷ lệ, tạo ra đường biên mask sắc nét hơn YOLO11. Tìm hiểu thêm về quy trình phân đoạn.
  • Ước lượng tư thế: Bằng cách tích hợp Residual Log-Likelihood Estimation (RLE), YOLO26 cải thiện đáng kể độ chính xác của keypoint trong các tư thế người phức tạp. Khám phá các khả năng ước lượng tư thế.
  • Bounding box định hướng (OBB): Hàm loss góc chuyên biệt khắc phục các vấn đề gián đoạn đường biên tồn tại lâu nay, giúp YOLO26 đặc biệt đáng tin cậy khi phát hiện đối tượng xoay trong ảnh vệ tinh. Tìm hiểu về các tác vụ OBB.
  • Phân loại ảnh: Cả hai model đều xử lý hiệu quả phân loại tốc độ cao, trong đó YOLO26 cải thiện nhẹ độ chính xác top-1 trên ImageNet.

Ví dụ mã huấn luyện và suy luận#

Ultralytics nổi tiếng với trải nghiệm dành cho nhà phát triển. Chỉ cần vài dòng mã để huấn luyện model SOTA hoặc chạy script suy luận, giảm thiểu mã lặp và tối đa hóa năng suất. Ngoài ra, huấn luyện các model YOLO cần ít bộ nhớ CUDA hơn đáng kể so với các mạng Transformer lớn.

from ultralytics import YOLO

# Tải model nano YOLO26 tiên tiến nhất
model = YOLO("yolo26n.pt")

# Huấn luyện model hiệu quả trên dataset COCO8
# optimizer="auto" chọn MuSGD cho các lần huấn luyện kéo dài
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Sử dụng GPU để tăng tốc huấn luyện
)

# Thực hiện suy luận không cần NMS trực tiếp trên ảnh
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Hiển thị các dự đoán rõ ràng ngay lập tức
results[0].show()

Trường hợp sử dụng lý tưởng và chiến lược triển khai#

Việc lựa chọn giữa YOLO26 và YOLO11 hoàn toàn phụ thuộc vào các ràng buộc của môi trường production.

Khi nào nên triển khai YOLO26#

YOLO26 là lựa chọn tối ưu cho các dự án mới hiện đại. Model được thiết kế chuyên biệt cho:

  • Điện toán biên và IoT: Hiệu năng CPU vượt trội và việc loại bỏ DFL khiến YOLO26 trở thành lựa chọn hàng đầu cho các thiết bị như Raspberry Pi, Coral NPU và bộ xử lý di động.
  • Phân tích drone và ảnh chụp từ trên không: Việc tích hợp ProgLoss + STAL giúp model có khả năng đặc biệt trong việc theo dõi các đối tượng nhỏ, di chuyển nhanh trên những khu vực rộng lớn.
  • Ứng dụng nhạy cảm với độ trễ: Trong robot tự hành hoặc kiểm soát chất lượng sản xuất, thiết kế không cần NMS đảm bảo độ trễ xác định, không có các đợt tăng đột biến ngoài dự kiến do hậu xử lý.

Khi nào nên tiếp tục sử dụng YOLO11#

Dù YOLO26 vượt trội hơn, YOLO11 vẫn là một model có năng lực đáng kể. Bạn có thể tiếp tục dùng YOLO11 nếu:

  • Pipeline cũ: Hạ tầng triển khai C++ hiện có của bạn liên kết chặt chẽ với định dạng đầu ra và logic NMS cụ thể của YOLO11.
  • Mốc chuẩn học thuật: Bạn đang công bố nghiên cứu và cần một chuẩn năm 2024 được công nhận rộng rãi để đánh giá các thuật toán mới của mình.

Sức mạnh của hệ sinh thái Ultralytics#

Dù triển khai YOLO11 hay YOLO26, sử dụng model Ultralytics đồng nghĩa với việc khai thác một hệ sinh thái được duy trì tốt, với các bản cập nhật thường xuyên và sự hỗ trợ rộng rãi từ cộng đồng.

Đối với các nhóm doanh nghiệp, Ultralytics Platform cung cấp giải pháp đầu-cuối cho gán nhãn dữ liệu, huấn luyện model và triển khai đám mây liền mạch. Từ xuất trọng số đã huấn luyện sang CoreML hoặc TensorRT, đến cấu hình tinh chỉnh siêu tham số nâng cao, các công cụ được cung cấp giúp quy trình AI của bạn được tinh gọn tối đa.

Người đóng góp

Bình luận