Ultralytics YOLO27:
Get Started

YOLO26 và RTDETRv2#

Lĩnh vực thị giác máy tính không ngừng phát triển, đặt ra cho các chuyên gia một lựa chọn quan trọng: nên tận dụng mạng nơ-ron tích chập (CNNs) được tối ưu hóa cao hay áp dụng các kiến trúc dựa trên Transformer mới hơn? Hai ứng viên nổi bật trong lĩnh vực này là Ultralytics YOLO26 tiên tiến và RTDETRv2 của Baidu. Cả hai model đều mở rộng giới hạn của khả năng phát hiện vật thể thời gian thực, nhưng dựa trên những triết lý kiến trúc hoàn toàn khác nhau.

Hướng dẫn này đi sâu về mặt kỹ thuật vào cả hai model, so sánh cấu trúc, các chỉ số hiệu năng và trường hợp sử dụng lý tưởng để giúp bạn chọn nền tảng phù hợp nhất cho dự án thị giác máy tính tiếp theo.

Ultralytics YOLO26: Đỉnh cao của AI thị giác ưu tiên thiết bị biên#

Được phát triển bởi Ultralytics, YOLO26 đánh dấu bước tiến thế hệ vượt bậc của dòng YOLO. Ra mắt vào tháng 1 năm 2026, model được thiết kế chuyên biệt để đạt tốc độ, độ chính xác và khả năng triển khai liền mạch trên môi trường cloud lẫn thiết bị biên.

Đổi mới và ưu điểm về kiến trúc#

YOLO26 giới thiệu một số tính năng đột phá giúp model khác biệt không chỉ với các model Transformer mà còn với những phiên bản trước đó như YOLO11:

  • Thiết kế đầu cuối không cần NMS: Head one-to-one tùy chọn của YOLO26 (nms=False) loại bỏ Non-Maximum Suppression (NMS) truyền thống trong quá trình hậu xử lý. Được tiên phong trong các model như YOLOv10, phương pháp đầu cuối này giảm biến thiên độ trễ suy luận và đơn giản hóa logic triển khai, đặc biệt trên phần cứng biên.
  • Suy luận CPU nhanh hơn tới 43%: Nhận thấy nhu cầu AI phi tập trung ngày càng tăng, YOLO26 được tối ưu hóa cao cho các thiết bị không có GPU chuyên dụng, chẳng hạn như Raspberry Pi.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 giúp đơn giản hóa quy trình export và cải thiện đáng kể khả năng tương thích với thiết bị biên công suất thấp cũng như vi điều khiển.
  • MuSGD Optimizer: Kết nối lĩnh vực huấn luyện Mô hình ngôn ngữ lớn (LLM) với thị giác máy tính, YOLO26 sử dụng optimizer MuSGD. Phương pháp lai giữa SGD và Muon này—lấy cảm hứng từ Kimi K2 của Moonshot AI—đảm bảo độ ổn định huấn luyện cao và hội tụ nhanh hơn.
  • ProgLoss + STAL: Các hàm loss tiên tiến giúp cải thiện đáng kể khả năng nhận diện vật thể nhỏ. Điều này rất quan trọng đối với các ngành phụ thuộc vào phân tích ảnh chụp từ trên không và cảm biến Internet vạn vật (IoT).

Tính linh hoạt trên nhiều tác vụ thị giác#

Không giống các model chỉ giới hạn ở hộp giới hạn, YOLO26 là một giải pháp đa năng mạnh mẽ. Model tích hợp các cải tiến chuyên biệt theo tác vụ, chẳng hạn như hàm loss phân đoạn ngữ nghĩa và proto đa tỷ lệ cho phân đoạn đối tượng, Residual Log-Likelihood Estimation (RLE) cho ước lượng tư thế và hàm loss góc chuyên biệt để xử lý vấn đề ranh giới trong các tác vụ hộp giới hạn định hướng (OBB).

Chiến lược triển khai trên thiết bị biên

Khi triển khai lên thiết bị biên, hãy sử dụng các biến thể YOLO26n (Nano) hoặc YOLO26s (Small). Việc export các model này sang CoreML hoặc LiteRT rất thuận lợi nhờ loại bỏ DFL và head không cần NMS tùy chọn, đảm bảo hiệu năng thời gian thực mượt mà trên iOS và Android.

RTDETRv2: Cải tiến Transformer phát hiện thời gian thực#

RTDETRv2, do các nhà nghiên cứu tại Baidu phát triển, được xây dựng dựa trên framework RT-DETR ban đầu. Model hướng tới việc chứng minh rằng Transformer phát hiện (DETR) có thể cạnh tranh, thậm chí đôi khi vượt qua tốc độ và độ chính xác của CNN được tối ưu hóa cao trong các tình huống thời gian thực.

Kiến trúc và năng lực#

RTDETRv2 sử dụng kiến trúc dựa trên Transformer, vốn xử lý ảnh khác với CNN bằng cách tận dụng cơ chế self-attention để nắm bắt ngữ cảnh toàn cục.

  • Bag-of-Freebies: Phiên bản v2 giới thiệu một loạt kỹ thuật huấn luyện được tối ưu hóa (bag-of-freebies), giúp cải thiện hiệu năng cơ sở mà không làm tăng chi phí suy luận.
  • Nhận biết ngữ cảnh toàn cục: Nhờ các lớp attention của Transformer, RTDETRv2 tự nhiên có khả năng xử lý tốt các cảnh phức tạp cần đến ngữ cảnh toàn cục để phân biệt vật thể chồng lấp hoặc bị che khuất.

Tìm hiểu thêm về RTDETRv2

Hạn chế của model Transformer#

Dù mạnh mẽ, các model phát hiện dựa trên Transformer như RTDETRv2 thường gặp khó khăn khi triển khai thực tế. So với CNN hiệu quả, các model này thường cần nhiều bộ nhớ CUDA hơn trong quá trình huấn luyện. Ngoài ra, việc tích hợp chúng vào các môi trường thiết bị biên đa dạng có thể phức tạp do các phép toán mà lớp attention yêu cầu, khiến những model như YOLO26 hấp dẫn hơn nhiều cho các triển khai bị giới hạn tài nguyên.

So sánh hiệu năng#

Đánh giá trực tiếp các model này cho thấy lợi ích thiết thực từ những tối ưu hóa CNN mới nhất. Bảng dưới đây trình bày hiệu năng của chúng trên các benchmark tiêu chuẩn.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Như kết quả cho thấy, YOLO26 luôn vượt trội hơn RTDETRv2 ở mọi biến thể kích thước. YOLO26x đạt 57.5 mAP ấn tượng với độ trễ thấp hơn (11.8 ms trên TensorRT) và số lượng tham số ít hơn đáng kể (55.7M) so với RTDETRv2-x (54.3 mAP, 15.03 ms, 76M tham số).

Trường hợp sử dụng và khuyến nghị#

Việc chọn YOLO26 hay RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLO26#

YOLO26 là lựa chọn phù hợp cho:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyến nghị cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
  • Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.

Lợi thế của Ultralytics#

Lựa chọn kiến trúc machine learning phù hợp chỉ là một phần của bài toán; hệ sinh thái xung quanh quyết định tốc độ một nhóm có thể chuyển từ tạo nguyên mẫu sang production.

Tính dễ sử dụng và hiệu quả huấn luyện#

Ultralytics Python API mang đến trải nghiệm tinh gọn đáng kể. Việc huấn luyện các model phức tạp không còn đòi hỏi lượng code boilerplate dài dòng. Hơn nữa, hiệu quả huấn luyện của YOLO26 tốt hơn đáng kể, sử dụng ít GPU VRAM hơn nhiều so với các cơ chế attention ngốn bộ nhớ của RTDETRv2, cho phép tăng batch size ngay cả trên phần cứng phổ thông.

from ultralytics import YOLO

# Khởi tạo model YOLO26 Nano tiên tiến nhất
model = YOLO("yolo26n.pt")

# Huấn luyện trên dataset COCO8 trong 100 epoch
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Thực hiện suy luận tốc độ cao, không cần NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Export sang ONNX để triển khai liền mạch
model.export(format="onnx")

Hệ sinh thái được duy trì tốt#

Khi sử dụng model Ultralytics, developer có thể tiếp cận framework được duy trì tích cực và tích hợp sẵn với các công cụ tracking hiện đại như Weights & Biases và Comet ML. Với những người muốn tiếp cận không cần code, Ultralytics Platform hỗ trợ huấn luyện trên cloud, quản lý dataset và triển khai chỉ bằng một cú nhấp.

Cân bằng hiệu năng#

YOLO26 đạt được sự cân bằng vượt trội giữa tốc độ suy luận và độ chính xác. Việc tùy chọn loại bỏ NMS kết hợp với optimizer MuSGD đảm bảo bạn triển khai một model vừa có độ chính xác cao với vật thể nhỏ (nhờ ProgLoss + STAL), vừa cực kỳ nhanh trong production, khiến YOLO26 trở thành lựa chọn vượt trội cho gần như mọi ứng dụng thị giác máy tính hiện đại.

Các model khác trong hệ sinh thái#

Trong khi YOLO26 và RTDETRv2 đại diện cho công nghệ tiên tiến nhất trong phát hiện thời gian thực, developer duy trì pipeline cũ hoặc khám phá các mức hiệu quả khác nhau cũng có thể cân nhắc YOLOv8 cho môi trường doanh nghiệp đã được thiết lập, hoặc tìm hiểu các kiến trúc khác như EfficientDet. Tuy nhiên, với mọi sáng kiến mới, YOLO26 vẫn là lựa chọn được khuyến nghị hàng đầu.

Người đóng góp

Bình luận