Ultralytics YOLO27:

RTDETRv2 so với DAMO-YOLO#

Lĩnh vực thị giác máy tính không ngừng phát triển, khi các nhà nghiên cứu và kỹ sư nỗ lực xây dựng những model cân bằng hoàn hảo giữa tốc độ, độ chính xác và hiệu quả. Hai kiến trúc nổi bật tạo được tiếng vang lớn trong lĩnh vực này là RTDETRv2, do Baidu phát triển, và DAMO-YOLO, do Alibaba Group xây dựng. Cả hai model đều mở rộng giới hạn của phát hiện đối tượng thời gian thực, nhưng áp dụng những triết lý kiến trúc khác biệt về căn bản để đạt được các kết quả ấn tượng.

Trong bài so sánh kỹ thuật này, chúng ta sẽ đi sâu vào kiến trúc, phương pháp training và khả năng triển khai trong thực tế của chúng. Chúng ta cũng sẽ xem xét cách các model này so sánh với hệ sinh thái rộng lớn hơn, đặc biệt là Ultralytics Platform được tối ưu hóa cao và kiến trúc YOLO26 tiên tiến nhất.

Các cải tiến về kiến trúc#

Hiểu rõ các cơ chế cốt lõi của những mô hình này là điều quan trọng đối với các kỹ sư máy học được giao nhiệm vụ lựa chọn công cụ phù hợp cho môi trường sản xuất.

RTDETRv2: Phương pháp Transformer#

Dựa trên thành công của RT-DETR ban đầu, RTDETRv2 sử dụng encoder lai và decoder transformer. Thiết kế này cho phép model xử lý ngữ cảnh toàn cục cực kỳ hiệu quả, giúp model đặc biệt giỏi trong việc phân biệt các đối tượng chồng lấn trong những cảnh dày đặc. Ưu điểm đáng kể nhất của kiến trúc này là thiết kế NMS-free (loại bỏ triệt để NMS). Bằng cách loại bỏ bước hậu xử lý NMS, RTDETRv2 tinh gọn pipeline inference và đảm bảo độ trễ ổn định hơn trên các cấu hình phần cứng khác nhau.

Tìm hiểu thêm về RTDETRv2

DAMO-YOLO: Nâng cao hiệu quả CNN#

Mặt khác, DAMO-YOLO vẫn bắt nguồn từ dòng YOLO dựa trên CNN rất thành công, nhưng đưa vào một số cải tiến đột phá. Model tận dụng Neural Architecture Search (NAS) để tối ưu backbone, đảm bảo hiệu quả trích xuất feature tối đa. Ngoài ra, model tích hợp RepGFPN (Feature Pyramid Network tổng quát được tái tham số hóa) hiệu quả và thiết kế ZeroHead, cùng với các kỹ thuật cải thiện AlignedOTA và distillation. Những đổi mới này cho phép DAMO-YOLO đạt tốc độ inference nhanh, đồng thời duy trì điểm mAPval có tính cạnh tranh cao.

Tìm hiểu thêm về DAMO-YOLO

Sự khác biệt về kiến trúc

Trong khi RTDETRv2 tập trung tận dụng các cơ chế attention để hiểu feature toàn cục mà không cần NMS, DAMO-YOLO tối đa hóa hiệu quả CNN truyền thống thông qua NAS và distillation nâng cao, yêu cầu hậu xử lý tiêu chuẩn nhưng mang lại lợi thế tốc độ riêng biệt trên một số phần cứng nhất định.

So sánh hiệu năng và các chỉ số#

Khi đánh giá model để triển khai, các metric hiệu năng như Average Precision trung bình (mAP), tốc độ inference và số lượng parameter có vai trò then chốt. Dưới đây là phần so sánh chi tiết giữa hai họ model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Phân tích kết quả#

Như thể hiện trong bảng, RTDETRv2-x đạt độ chính xác cao nhất với mAPval là 54.3, cho thấy sức mạnh của kiến trúc transformer trên các tập validation phức tạp như dataset COCO. Tuy nhiên, điều này đi kèm số lượng parameter và FLOPs cao hơn đáng kể (76M).

Ngược lại, DAMO-YOLOt (Tiny) cực kỳ nhẹ, chỉ yêu cầu 8.5M parameter, khiến đây trở thành lựa chọn có tốc độ rất nhanh cho các môi trường bị giới hạn nghiêm ngặt về bộ nhớ CUDA. DAMO-YOLO nhìn chung mang lại sự cân bằng thuận lợi giữa tốc độ và độ chính xác cho các thiết bị edge thế hệ cũ.

Hệ sinh thái, khả năng sử dụng và lợi thế của Ultralytics#

Mặc dù các repository độc lập như RT-DETR GitHub chính thức và DAMO-YOLO GitHub cung cấp code thô để training các model này, việc tích hợp chúng vào pipeline production thường đòi hỏi nhiều boilerplate code và tối ưu hóa thủ công.

Đây là nơi hệ sinh thái Ultralytics đơn giản hóa đáng kể trải nghiệm developer. Ultralytics tích hợp trực tiếp các model như RTDETRv2 vào API thống nhất, cho phép người dùng training, validation và export model chỉ với một dòng code. Ngoài ra, các model Ultralytics được biết đến với yêu cầu bộ nhớ tối thiểu trong quá trình training so với các repository độc lập dựa trên transformer nặng.

Ví dụ code: Tích hợp liền mạch#

Dưới đây là cách bạn có thể dễ dàng tận dụng thư viện Python của Ultralytics để chạy inference. API vẫn nhất quán dù bạn sử dụng model transformer hay CNN tiên tiến nhất.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
Export model cho production

Sử dụng API Ultralytics, bạn có thể dễ dàng export các model đã training sang các format như TensorRT, ONNX hoặc CoreML bằng một lệnh model.export(format="engine") đơn giản, giảm đáng kể trở ngại khi triển khai.

Các trường hợp sử dụng lý tưởng#

Việc lựa chọn giữa các kiến trúc này hoàn toàn phụ thuộc vào yêu cầu cụ thể của dự án:

  • RTDETRv2 vượt trội trong xử lý phía server, nơi VRAM dồi dào. Khả năng nhận biết ngữ cảnh toàn cục của model hoàn toàn phù hợp với xử lý ảnh y tế và phân tích đám đông dày đặc, nơi hiện tượng che khuất thường xuyên xảy ra.
  • DAMO-YOLO đặc biệt phù hợp với ứng dụng IoT nhúng và các dây chuyền kiểm tra công nghiệp tốc độ cao, nơi số lượng parameter thấp và FPS cao là những yêu cầu bắt buộc.

Tương lai: Ultralytics YOLO26#

Mặc dù RTDETRv2 và DAMO-YOLO đều có những ưu điểm riêng, lĩnh vực thị giác máy tính vẫn phát triển nhanh chóng. Đối với các dự án mới, Ultralytics YOLO26 mới nhất đại diện cho sự kết hợp tối ưu giữa tốc độ, độ chính xác và trải nghiệm developer.

YOLO26 áp dụng Thiết kế End-to-End NMS-Free, nắm bắt lợi ích chính của transformer mà không phải chịu chi phí tính toán khổng lồ. Model tích hợp MuSGD Optimizer cải tiến—lấy cảm hứng từ quá trình training Large Language Model—để hội tụ ổn định và nhanh chóng. Ngoài ra, với DFL Removal (loại bỏ Distribution Focal Loss để đơn giản hóa việc export và cải thiện khả năng tương thích với các thiết bị edge/công suất thấp), YOLO26 đạt tốc độ inference CPU nhanh hơn tới 43%, trở thành lựa chọn hàng đầu cho edge computing. Bên cạnh đó, ProgLoss + STAL cung cấp các hàm loss được cải thiện, với những tiến bộ đáng kể trong nhận diện đối tượng nhỏ—yếu tố quan trọng đối với IoT, robotics và ảnh chụp từ trên không.

Không giống các model bị giới hạn nghiêm ngặt ở bounding box, dòng YOLO26 mang lại tính linh hoạt vượt trội, hỗ trợ các tác vụ từ instance segmentationước tính pose đến oriented bounding boxes (OBB), tất cả được quản lý liền mạch thông qua Ultralytics Platform trực quan.

Chi tiết model và tài liệu tham khảo#

RTDETRv2#

DAMO-YOLO#

Nếu bạn muốn tìm hiểu các bài so sánh khác, hãy xem hướng dẫn của chúng tôi về RTDETRv2 so với YOLO11 hoặc DAMO-YOLO so với YOLOv8 để biết các model này hoạt động như thế nào khi so sánh với những thế hệ trước trong họ Ultralytics.

Những người đóng góp

Bình luận