Ultralytics YOLO27:
Get Started

RTDETRv2 và DAMO-YOLO#

Lĩnh vực thị giác máy tính không ngừng phát triển khi các nhà nghiên cứu và kỹ sư nỗ lực xây dựng những model cân bằng hoàn hảo giữa tốc độ, độ chính xác và hiệu quả. Hai kiến trúc nổi bật tạo được dấu ấn đáng kể trong lĩnh vực này là RTDETRv2 do Baidu phát triển và DAMO-YOLO do Alibaba Group xây dựng. Cả hai model đều mở rộng giới hạn của phát hiện đối tượng thời gian thực, nhưng sử dụng những triết lý kiến trúc khác biệt căn bản để đạt được kết quả ấn tượng.

Trong bài so sánh kỹ thuật này, chúng ta sẽ phân tích sâu kiến trúc, phương pháp huấn luyện và khả năng triển khai trong thực tế của hai model. Chúng ta cũng sẽ tìm hiểu cách các model này so sánh với hệ sinh thái rộng hơn, đặc biệt là Ultralytics Platform được tối ưu hóa cao và kiến trúc YOLO26 tiên tiến nhất.

Các cải tiến kiến trúc#

Hiểu rõ cơ chế cốt lõi của các model này là điều thiết yếu đối với kỹ sư machine learning có nhiệm vụ lựa chọn công cụ phù hợp cho môi trường production.

RTDETRv2: Phương pháp tiếp cận Transformer#

Kế thừa thành công của RT-DETR ban đầu, RTDETRv2 sử dụng encoder lai và decoder Transformer. Thiết kế này cho phép model xử lý ngữ cảnh toàn cục rất hiệu quả, giúp model đặc biệt giỏi phân biệt các đối tượng chồng lấp trong cảnh có mật độ cao. Ưu điểm đáng kể nhất của kiến trúc này là thiết kế vốn không cần NMS (ức chế phi cực đại). Bằng cách loại bỏ bước hậu xử lý NMS, RTDETRv2 tinh giản pipeline suy luận và đảm bảo độ trễ ổn định hơn trên các cấu hình phần cứng khác nhau.

Tìm hiểu thêm về RTDETRv2

DAMO-YOLO: Nâng cao hiệu quả CNN#

Mặt khác, DAMO-YOLO vẫn thuộc dòng YOLO dựa trên CNN đã đạt được nhiều thành công, đồng thời giới thiệu một số cải tiến đột phá. Model tận dụng Tìm kiếm kiến trúc mạng (NAS) để tối ưu hóa backbone, đảm bảo hiệu quả trích xuất đặc trưng tối đa. Ngoài ra, model tích hợp RepGFPN (Mạng kim tự tháp đặc trưng tổng quát tái tham số hóa) hiệu quả và thiết kế ZeroHead, cùng với AlignedOTA và các kỹ thuật cải tiến chưng cất. Những đổi mới này giúp DAMO-YOLO đạt tốc độ suy luận nhanh trong khi vẫn duy trì điểm mAPval có tính cạnh tranh cao.

Tìm hiểu thêm về DAMO-YOLO

Khác biệt về kiến trúc

Trong khi RTDETRv2 tập trung tận dụng cơ chế attention để hiểu đặc trưng toàn cục mà không cần NMS, DAMO-YOLO tối đa hóa hiệu quả CNN truyền thống thông qua NAS và chưng cất nâng cao; model cần hậu xử lý tiêu chuẩn nhưng có lợi thế tốc độ riêng trên một số phần cứng.

So sánh hiệu năng và chỉ số#

Khi đánh giá model để triển khai, các chỉ số hiệu năng như Độ chính xác trung bình (mAP), tốc độ suy luận và số lượng tham số là yếu tố tối quan trọng. Dưới đây là phần so sánh chi tiết hai dòng model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Phân tích kết quả#

Như bảng cho thấy, RTDETRv2-x đạt độ chính xác cao nhất với mAPval là 54.3, cho thấy sức mạnh của kiến trúc Transformer trên các bộ kiểm định phức tạp như bộ dữ liệu COCO. Tuy nhiên, kết quả này đi kèm số lượng tham số (76M) và FLOPs cao hơn đáng kể.

Ngược lại, DAMO-YOLOt (Tiny) có kích thước cực kỳ nhỏ gọn, chỉ cần 8.5M tham số, trở thành lựa chọn rất nhanh cho các môi trường bị giới hạn nghiêm ngặt về bộ nhớ CUDA. DAMO-YOLO thường mang lại sự cân bằng thuận lợi giữa tốc độ và độ chính xác cho các thiết bị biên đời cũ.

Hệ sinh thái, khả năng sử dụng và lợi thế của Ultralytics#

Mặc dù các kho mã độc lập như RT-DETR GitHub chính thức và DAMO-YOLO GitHub cung cấp mã nguồn thô để huấn luyện các model này, việc tích hợp chúng vào pipeline production thường đòi hỏi lượng lớn mã boilerplate và tối ưu hóa thủ công.

Hệ sinh thái Ultralytics giúp đơn giản hóa đáng kể trải nghiệm của nhà phát triển. Ultralytics tích hợp trực tiếp các model phát hiện dựa trên Transformer như RT-DETR ban đầu vào API thống nhất, cho phép người dùng huấn luyện, kiểm định và xuất model chỉ bằng một dòng mã. Ngoài ra, so với các kho độc lập nặng về Transformer, các model Ultralytics nổi tiếng nhờ yêu cầu bộ nhớ tối thiểu trong quá trình huấn luyện.

Ví dụ mã: Tích hợp liền mạch#

Dưới đây là cách dễ dàng tận dụng thư viện Ultralytics Python để chạy suy luận. API vẫn nhất quán dù bạn sử dụng model Transformer hay CNN tiên tiến nhất.

from ultralytics import RTDETR, YOLO

# Tải model RT-DETR để hiểu các cảnh phức tạp
model_rtdetr = RTDETR("rtdetr-l.pt")

# Tải model Ultralytics YOLO26 mới nhất để đạt hiệu năng tối đa trên thiết bị biên
model_yolo26 = YOLO("yolo26n.pt")

# Chạy suy luận dễ dàng trên ảnh mẫu
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Hiển thị kết quả
results_yolo[0].show()
Xuất model để đưa vào production

Với API Ultralytics, bạn có thể dễ dàng xuất các model đã huấn luyện sang các định dạng như TensorRT, ONNX hoặc CoreML bằng lệnh model.export(format="engine") đơn giản, giúp giảm đáng kể trở ngại khi triển khai.

Các trường hợp sử dụng phù hợp nhất#

Việc lựa chọn giữa các kiến trúc này hoàn toàn phụ thuộc vào yêu cầu cụ thể của dự án:

  • RTDETRv2 vượt trội trong xử lý phía máy chủ, nơi VRAM dồi dào. Khả năng nhận biết ngữ cảnh toàn cục của model rất phù hợp cho chẩn đoán hình ảnh y tế và phân tích đám đông có mật độ cao, nơi thường xuyên xảy ra hiện tượng che khuất.
  • DAMO-YOLO rất phù hợp với ứng dụng IoT nhúng và các dây chuyền kiểm tra công nghiệp tốc độ cao, nơi số lượng tham số thấp và FPS cao là yêu cầu bắt buộc.

Tương lai: Ultralytics YOLO26#

Mặc dù RTDETRv2 và DAMO-YOLO đều có ưu điểm riêng, lĩnh vực thị giác máy tính phát triển nhanh chóng. Với các dự án mới, Ultralytics YOLO26 mới nhất là sự kết hợp tối ưu giữa tốc độ, độ chính xác và trải nghiệm nhà phát triển.

YOLO26 áp dụng Thiết kế đầu cuối không cần NMS, tận dụng ưu điểm chính của Transformer mà không phải chịu chi phí tính toán khổng lồ. Model tích hợp Optimizer MuSGD cải tiến—lấy cảm hứng từ quá trình huấn luyện Mô hình ngôn ngữ lớn—để hội tụ ổn định và nhanh chóng. Hơn nữa, với Loại bỏ DFL (loại bỏ Distribution Focal Loss để đơn giản hóa quá trình xuất và tăng khả năng tương thích với thiết bị biên/thiết bị công suất thấp), YOLO26 đạt tốc độ suy luận CPU nhanh hơn đến 43%, trở thành lựa chọn hàng đầu cho điện toán biên. Ngoài ra, ProgLoss + STAL cung cấp các hàm loss cải tiến, giúp nhận diện vật thể nhỏ tốt hơn rõ rệt—yếu tố thiết yếu đối với IoT, robot và ảnh chụp từ trên không.

Khác với các model chỉ giới hạn ở bounding box, dòng YOLO26 có tính linh hoạt vượt trội, hỗ trợ nhiều tác vụ từ phân đoạn instance và ước tính tư thế đến bounding box định hướng (OBB), tất cả đều được quản lý liền mạch thông qua Ultralytics Platform trực quan.

Chi tiết model và tài liệu tham khảo#

RTDETRv2#

  • Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
  • Tổ chức: Baidu
  • Ngày: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub: Repository RT-DETR

DAMO-YOLO#

Nếu muốn tìm hiểu các bài so sánh khác, hãy xem hướng dẫn của chúng tôi về RTDETRv2 và YOLO11 hoặc DAMO-YOLO và YOLOv8 để xem các model này hoạt động ra sao so với những thế hệ trước của dòng Ultralytics.

Người đóng góp

Bình luận