Ultralytics YOLO27:

RTDETRv2 và YOLOv8#

Bối cảnh thị giác máy tính không ngừng thay đổi, thường được thể hiện qua sự cạnh tranh liên tục giữa các Mạng nơ-ron tích chập (CNNs) truyền thống và các kiến trúc dựa trên Transformer mới hơn. Trong phần so sánh kỹ thuật toàn diện này, chúng ta xem xét RTDETRv2, một vision transformer hàng đầu, so với Ultralytics YOLOv8, một trong những model CNN được áp dụng rộng rãi và linh hoạt nhất trong ngành. Cả hai model đều cung cấp các khả năng mạnh mẽ cho kỹ sư và nhà nghiên cứu, nhưng kiến trúc nền tảng của chúng dẫn đến những khác biệt rõ rệt về phương pháp training, ràng buộc triển khai và hiệu năng tổng thể.

Tổng quan về model: RTDETRv2#

RTDETRv2 (Transformer phát hiện thời gian thực phiên bản 2) được xây dựng dựa trên thành công nền tảng của phiên bản tiền nhiệm bằng cách tối ưu hóa kiến trúc vision transformer để đạt tốc độ inference theo thời gian thực.

Chi tiết kỹ thuật chính:

Kiến trúc và ưu điểm#

Về cốt lõi, RTDETRv2 sử dụng kiến trúc hybrid kết hợp backbone CNN với cấu trúc encoder-decoder dựa trên transformer. Điều này cho phép model xem xét toàn bộ ngữ cảnh của ảnh, giúp model đặc biệt hiệu quả trong việc xử lý các cảnh phức tạp có các đối tượng chồng lấn. Một trong những đặc điểm nổi bật nhất của model là thiết kế end-to-end nguyên bản, hoàn toàn bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS). Điều này làm giảm độ phức tạp thuật toán trong các giai đoạn cuối của pipeline detection. Ngoài ra, khả năng detection đa tỷ lệ cho phép model xác định hiệu quả cả các cấu trúc lớn và những thành phần nhỏ ở hậu cảnh.

Điểm yếu#

Mặc dù có khả năng hiểu ngữ cảnh mạnh mẽ, các kiến trúc dựa trên transformer như RTDETRv2 đòi hỏi chi phí tính toán rất lớn trong quá trình training. Chúng yêu cầu lượng bộ nhớ CUDA đáng kể, khiến việc training trên phần cứng dành cho người dùng phổ thông trở nên khó khăn. Ngoài ra, việc thiết lập custom dataset và tinh chỉnh hyperparameter training thường đòi hỏi chuyên môn sâu về lĩnh vực, vì model thiếu một software wrapper được hoàn thiện cao và thân thiện với người mới bắt đầu. Việc triển khai trên các edge device công suất thấp như phần cứng Raspberry Pi đời cũ cũng có thể gặp nhiều thách thức do các cơ chế attention nặng.

Tìm hiểu thêm về RTDETRv2

Tổng quan về model: YOLOv8#

Kể từ khi ra mắt, Ultralytics YOLOv8 đã khẳng định vị thế là tiêu chuẩn ngành cho các tác vụ thị giác máy tính cấp production, đồng thời ưu tiên trải nghiệm developer mượt mà bên cạnh độ chính xác hàng đầu.

Chi tiết kỹ thuật chính:

Kiến trúc và ưu điểm#

YOLOv8 sử dụng kiến trúc CNN anchor-free được tối ưu hóa cao với head tách biệt, cải thiện đáng kể độ chính xác định vị và phân loại đối tượng so với các thế hệ trước. Điểm mạnh lớn nhất của model nằm ở hiệu quả và tính linh hoạt đáng kinh ngạc. So với vision transformer, kiến trúc này yêu cầu ít bộ nhớ hơn đáng kể trong quá trình training, cho phép người dùng chạy batch size lớn hơn trên các GPU tiêu chuẩn. Hơn nữa, hệ sinh thái Ultralytics cung cấp một workflow liền mạch, thống nhất và vượt trội. Python API hợp nhất cho phép thực hiện tinh chỉnh hyperparameter, training, validation và export chỉ với vài dòng code.

Điểm yếu#

YOLOv8 vẫn sử dụng NMS truyền thống trong giai đoạn hậu xử lý. Mặc dù engine Ultralytics xử lý hiệu quả bước này ở phía backend, về mặt kỹ thuật, nó vẫn tạo ra một độ trễ hậu xử lý nhỏ khi so với các kiến trúc vốn không sử dụng NMS.

So sánh hiệu năng và các chỉ số#

Khi so sánh các con số thô, có thể thấy rõ rằng hai model ưu tiên những khía cạnh khác nhau của pipeline triển khai. Dưới đây là phân tích hiệu năng đặt cạnh nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
Diễn giải các chỉ số

Mặc dù RTDETRv2-x đạt mAP đỉnh cao hơn một chút là 54.3 so với 53.9 của YOLOv8x, dòng YOLOv8 vượt trội về tốc độ inference và hiệu quả sử dụng parameter. Ví dụ, YOLOv8s chạy trên engine TensorRT nhanh gần gấp đôi so với RTDETRv2-s trong khi chỉ yêu cầu gần một nửa số parameter.

Yêu cầu bộ nhớ và hiệu quả training#

Một trong những yếu tố quan trọng nhất đối với cả developer độc lập và các team doanh nghiệp là chi phí training. Các model Ultralytics YOLO yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình training so với các kiến trúc transformer. Một model RTDETRv2 tiêu chuẩn có thể dễ dàng trở thành nút thắt trên GPU phổ thông, trong khi YOLOv8 hội tụ nhanh và ổn định trên phần cứng như NVIDIA RTX 4070.

Hệ sinh thái, API và tính dễ sử dụng#

Yếu tố tạo khác biệt thực sự đối với các giải pháp AI hiện đại là framework phần mềm hỗ trợ. Hệ sinh thái Ultralytics đơn giản hóa các trở ngại kỹ thuật phức tạp. Với hoạt động phát triển tích cực và sự hỗ trợ cộng đồng mạnh mẽ trên các nền tảng như Discord, YOLOv8 đảm bảo dự án của bạn không bị đình trệ do tài liệu kém.

Hơn nữa, YOLOv8 vượt xa detection đối tượng tiêu chuẩn. Đây là một mạng multi-task thực thụ với hỗ trợ nguyên bản cho Instance Segmentation, Pose Estimation, Image ClassificationOriented Bounding Boxes (OBB). RTDETRv2 vẫn tập trung chủ yếu vào detection.

Ví dụ code: Tính đơn giản hợp nhất#

Sử dụng Python API của Ultralytics, bạn có thể dễ dàng thử nghiệm cả hai dòng model trong một môi trường hợp nhất.

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model and a YOLOv8 model seamlessly
model_transformer = RTDETR("rtdetr-l.pt")
model_cnn = YOLO("yolov8l.pt")

# Predict on a sample image using the exact same API
results_transformer = model_transformer("https://ultralytics.com/images/bus.jpg")
results_cnn = model_cnn("https://ultralytics.com/images/bus.jpg")

# Export YOLOv8 to ONNX for rapid edge deployment
model_cnn.export(format="onnx")

Sau khi training, YOLOv8 hỗ trợ export một cú nhấp chuột sang ONNX, TensorRTOpenVINO, đảm bảo inference thông lượng cao trên nhiều backend phần cứng khác nhau.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa RT-DETR và YOLOv8 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn RT-DETR#

RT-DETR là lựa chọn phù hợp cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn YOLOv8#

YOLOv8 được khuyến nghị cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án yêu cầu một model đã được kiểm chứng cho detection, segmentation, classificationpose estimation trong hệ sinh thái Ultralytics.
  • Hệ thống production đã ổn định: Các môi trường production hiện có đã được xây dựng trên kiến trúc YOLOv8 với pipeline triển khai ổn định và được kiểm thử kỹ lưỡng.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng: Các ứng dụng hưởng lợi từ hệ thống tutorial phong phú, tích hợp bên thứ ba và nguồn tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Định hướng tương lai: Lợi thế của YOLO26#

Mặc dù YOLOv8 vẫn là một cột mốc huyền thoại, thị giác máy tính phát triển nhanh chóng. Đối với các team muốn tiếp cận công nghệ tiên tiến nhất trong năm 2026, Ultralytics YOLO26 đại diện cho bước chuyển đổi paradigm tiếp theo.

Nếu bạn bị thu hút bởi thiết kế không sử dụng NMS của RTDETRv2, YOLO26 tích hợp Thiết kế End-to-End Không sử dụng NMS nguyên bản, kết hợp sự đơn giản của hậu xử lý từ transformer với tốc độ vượt trội của CNN. Ngoài ra, YOLO26 sử dụng MuSGD Optimizer đột phá, mang lại độ ổn định trong training theo phong cách LLM cho các model thị giác, giúp hội tụ nhanh đáng kể. Với Loại bỏ DFL (loại bỏ Distribution Focal Loss để đơn giản hóa việc export và cải thiện khả năng tương thích với edge device và thiết bị công suất thấp), YOLO26 đạt inference CPU nhanh hơn tới 43%. Kết hợp với các cơ chế ProgLoss + STAL tiên tiến để detection đối tượng nhỏ tốt hơn, YOLO26 chắc chắn là lộ trình nâng cấp được khuyến nghị thay cho cả YOLOv8 và RTDETRv2.

Để đọc thêm về các model thay thế, hãy tham khảo hướng dẫn của chúng tôi về YOLO11 hoặc đọc phân tích chi tiết YOLOv10 so với YOLOv8 để xem kiến trúc không sử dụng NMS đã phát triển như thế nào trong họ YOLO.

Những người đóng góp

Bình luận