Ultralytics YOLO27:
Get Started

RTDETRv2 so với YOLO26#

Lĩnh vực phát hiện đối tượng thời gian thực đã phát triển vượt bậc, khi các nhà nghiên cứu không ngừng mở rộng giới hạn về tốc độ, độ chính xác và hiệu quả triển khai. Hai kiến trúc nổi bật hiện dẫn đầu xu hướng này là RTDETRv2 dựa trên Transformer và mạng neural tích chập (CNN) tiên tiến nhất Ultralytics YOLO26. Hướng dẫn này phân tích chuyên sâu kiến trúc, các chỉ số hiệu năng và trường hợp sử dụng lý tưởng của từng model, giúp bạn chọn model phù hợp cho dự án thị giác máy tính tiếp theo.

RTDETRv2: Transformer phát hiện thời gian thực#

RTDETRv2 được xây dựng dựa trên kiến trúc RT-DETR ban đầu, hướng đến việc kết hợp khả năng nắm bắt ngữ cảnh toàn cục của Transformer thị giác với tốc độ cần thiết cho các ứng dụng thời gian thực.

Đặc điểm chính:

  • Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
  • Tổ chức: Baidu
  • Ngày: 2024-07-24
  • Liên kết: Arxiv, GitHub, Tài liệu

Kiến trúc và ưu điểm#

Khác với các model phát hiện truyền thống dựa trên anchor, RTDETRv2 áp dụng phương pháp dựa trên Transformer, loại bỏ nguyên bản nhu cầu loại bỏ các dự đoán trùng lặp (NMS) trong quá trình hậu xử lý. Nhờ sử dụng cơ chế attention linh hoạt, model xử lý hiệu quả các cảnh phức tạp và đối tượng chồng lấn. Các cải tiến "Bag-of-Freebies" đã tăng đáng kể độ chính xác của model trên dataset COCO, đồng thời duy trì tốc độ inference chấp nhận được trên GPU cao cấp.

Hạn chế#

Dù RTDETRv2 đạt kết quả học thuật ấn tượng, model thường gây ra thách thức trong môi trường production. So với CNN, kiến trúc Transformer vốn đòi hỏi nhiều bộ nhớ hơn trong cả huấn luyện lẫn inference. Điều này có thể khiến việc triển khai trên thiết bị AI biên bị giới hạn tài nguyên trở nên khó khăn. Ngoài ra, huấn luyện Transformer thường cần batch size lớn hơn và nhiều CUDA memory hơn, có thể trở thành nút thắt với các nhà nghiên cứu có phần cứng hạn chế.

Tìm hiểu thêm về RTDETRv2

YOLO26: Đỉnh cao của AI thị giác ưu tiên thiết bị biên#

Ra mắt vào đầu năm 2026, Ultralytics YOLO26 định nghĩa lại những gì có thể đạt được với phát hiện đối tượng dựa trên CNN. Model tích hợp các tối ưu hóa tiên tiến được thiết kế riêng để triển khai production liền mạch và đạt hiệu quả phần cứng vượt trội.

Đặc điểm chính:

Những đột phá về kiến trúc#

YOLO26 giới thiệu một số tính năng mang tính cách mạng nhằm giải quyết các vấn đề phổ biến khi triển khai model:

  • Thiết kế end-to-end không cần NMS: Dựa trên các ý tưởng tiên phong trong YOLOv10, YOLO26 có kiến trúc end-to-end nguyên bản. Bằng cách bỏ qua bước hậu xử lý NMS với head một-một tùy chọn (nms=False), model giảm đáng kể biến động độ trễ, đảm bảo thời gian inference có tính dự đoán cao trong môi trường production.
  • Inference CPU nhanh hơn đến 43%: Nhờ tinh chỉnh kiến trúc có chủ đích và loại bỏ Distribution Focal Loss (DFL), YOLO26 đạt tốc độ CPU chưa từng có, trở thành lựa chọn hàng đầu cho điện toán biên mà không cần GPU chuyên dụng.
  • Bộ tối ưu hóa MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện Mô hình Ngôn ngữ Lớn (LLM) như Kimi K2 của Moonshot AI, YOLO26 sử dụng bộ tối ưu hóa MuSGD (kết hợp SGD và Muon). Cách này đảm bảo các lần chạy huấn luyện ổn định và hội tụ cực nhanh.
  • ProgLoss + STAL: Các hàm loss nâng cao này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, một nâng cấp thiết yếu cho các ứng dụng sử dụng ảnh chụp từ trên không và giám sát bằng drone.
Các cải tiến theo tác vụ trong YOLO26

Ngoài phát hiện tiêu chuẩn, YOLO26 còn có các cải tiến chuyên biệt: loss phân đoạn ngữ nghĩa và proto đa tỷ lệ cho tác vụ phân đoạn, Ước lượng Khả năng xảy ra Hậu nghiệm Phần dư (RLE) cho ước lượng pose và loss góc tùy chỉnh để xử lý vấn đề ranh giới trong phát hiện bounding box định hướng (OBB).

So sánh hiệu năng#

Khi đánh giá các model này, việc đạt được sự cân bằng hiệu năng tốt giữa độ chính xác (mAP) và hiệu quả tính toán là rất quan trọng. Bảng dưới đây cho thấy YOLO26 liên tục vượt trội hơn RTDETRv2 ở nhiều phiên bản kích thước khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Như trên đây cho thấy, model YOLO26x đạt 57.5 mAP ấn tượng, vượt xa model RTDETRv2-x trong khi sử dụng ít parameter hơn và duy trì tốc độ inference TensorRT nhanh hơn. Hơn nữa, nhu cầu bộ nhớ của YOLO26 thấp hơn đáng kể, khiến model trở thành lựa chọn tối ưu cho triển khai biên thời gian thực.

Hệ sinh thái và tính dễ sử dụng#

Dù hiệu năng thô rất quan trọng, hệ sinh thái hỗ trợ quyết định tốc độ chuyển model từ nghiên cứu sang production. Đây là điểm Ultralytics Platform mang lại lợi thế vượt trội.

Hệ sinh thái thống nhất, được duy trì tốt#

RTDETRv2 chủ yếu hoạt động dưới dạng kho lưu trữ phục vụ nghiên cứu, do đó có thể cần thiết lập môi trường phức tạp và viết script thủ công cho các tác vụ tùy chỉnh. Ngược lại, Ultralytics YOLO26 được hưởng lợi từ package Python trưởng thành, đã trải qua nhiều vòng kiểm thử. Hệ sinh thái Ultralytics mang đến trải nghiệm người dùng được tinh giản tối đa, cung cấp API đơn giản cho huấn luyện, xác thực, dự đoán và xuất model.

Với các tích hợp sẵn cho Weights & Biases và Comet ML, việc theo dõi thí nghiệm diễn ra liền mạch. Hơn nữa, model Ultralytics rất linh hoạt; trong khi RTDETRv2 tập trung vào phát hiện đối tượng, YOLO26 hỗ trợ nguyên bản phân đoạn instance, ước lượng pose và phân loại hình ảnh trong cùng một framework.

Ví dụ mã: Đơn giản trong thực tế#

API Ultralytics cho phép nhà phát triển tải, huấn luyện và chạy suy luận chỉ với vài dòng code. Điều này cải thiện đáng kể hiệu quả huấn luyện và rút ngắn thời gian đưa sản phẩm ra thị trường.

from ultralytics import RTDETR, YOLO

# Tải model RT-DETR
model_rtdetr = RTDETR("rtdetr-l.pt")

# Tải model YOLO26 hiện đại nhất
model_yolo = YOLO("yolo26n.pt")

# Chạy suy luận trên ảnh một cách liền mạch
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Hiển thị kết quả YOLO26
results_yolo[0].show()

# Xuất YOLO26 sang định dạng ONNX chỉ bằng một cú nhấp chuột
model_yolo.export(format="onnx")

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa RT-DETR và YOLO26 phụ thuộc vào các yêu cầu cụ thể của dự án, giới hạn triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn RT-DETR#

RT-DETR là lựa chọn phù hợp cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
  • Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn YOLO26#

YOLO26 được khuyến nghị cho:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Khám phá các kiến trúc khác#

Mặc dù YOLO26 hiện là đỉnh cao về hiệu năng, nhà phát triển cũng có thể thấy hữu ích khi tìm hiểu các phiên bản trước. YOLO11 rất thành công vẫn là một model mạnh mẽ, được hỗ trợ đầy đủ cho nhiều hệ thống cũ. Bạn có thể tìm hiểu sâu hơn về các khả năng của model này qua bài viết so sánh RT-DETR và YOLO11. Ngoài ra, nếu đang phân tích các kiến trúc cũ hơn, bài so sánh EfficientDet và YOLO26 sẽ cung cấp bối cảnh lịch sử hữu ích về quá trình phát triển của các kiến trúc phát hiện đối tượng.

Lời kết#

Cả RTDETRv2 và YOLO26 đều mang đến những tiến bộ đáng kể trong lĩnh vực AI. Tuy nhiên, với các nhóm ưu tiên chuyển đổi liền mạch sang môi trường production, footprint bộ nhớ nhỏ và khả năng hỗ trợ đa dạng tác vụ, Ultralytics YOLO26 là lựa chọn được khuyến nghị rõ ràng. Kiến trúc không cần NMS, tốc độ CPU nhanh và hệ sinh thái Ultralytics mạnh mẽ giúp các dự án AI thị giác của bạn có khả năng mở rộng, hiệu quả và sẵn sàng cho tương lai. Dù triển khai trên máy chủ đám mây hay Raspberry Pi có tài nguyên hạn chế, YOLO26 vẫn mang lại hiệu năng tối ưu ngay khi sử dụng.

Người đóng góp

Bình luận