Ultralytics YOLO27:
Get Started

RTDETRv2 và EfficientDet#

Lựa chọn kiến trúc mạng nơ-ron tối ưu là quyết định mang tính định hướng cho mọi dự án thị giác máy tính. Bài so sánh kỹ thuật toàn diện này phân tích hai model phát hiện đối tượng có ảnh hưởng: RTDETRv2, bộ phát hiện dựa trên Transformer tiên tiến nhất, và EfficientDet, mạng nơ-ron tích chập có khả năng mở rộng cao. Chúng tôi sẽ đánh giá kiến trúc riêng biệt, chỉ số hiệu năng, phương pháp huấn luyện và kịch bản triển khai lý tưởng của hai model để giúp bạn đưa ra quyết định dựa trên dữ liệu cho các pipeline AI.

RTDETRv2: Transformer phát hiện thời gian thực#

Kế thừa thành công của RT-DETR ban đầu, RTDETRv2 cải tiến mô hình phát hiện đối tượng dựa trên Transformer. Bằng cách tối ưu hóa cấu trúc encoder và decoder, model mang lại độ chính xác cao trong khi vẫn duy trì tốc độ suy luận thời gian thực, qua đó thu hẹp hiệu quả khoảng cách giữa CNN truyền thống và vision Transformer.

Thông tin model

  • Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
  • Tổ chức: Baidu
  • Ngày: 2024-07-24
  • Liên kết: Arxiv, GitHub, Tài liệu

Kiến trúc và ưu điểm cốt lõi#

RTDETRv2 sử dụng kiến trúc lai kết hợp backbone CNN mạnh mẽ (thường là ResNet hoặc HGNet) với decoder Transformer hiệu quả. Đặc điểm nổi bật nhất của RTDETRv2 là khả năng vốn có giúp bỏ qua ức chế phi cực đại (NMS). Các bộ phát hiện truyền thống cần NMS để lọc các bounding box trùng lặp, làm phát sinh độ trễ suy luận biến thiên trong quá trình hậu xử lý. RTDETRv2 xây dựng bài toán phát hiện dưới dạng dự đoán tập hợp trực tiếp, sử dụng ghép cặp hai phía để tạo ra các dự đoán duy nhất.

Model này vượt trội trong triển khai phía máy chủ, nơi bộ nhớ GPU dồi dào. Cơ chế attention toàn cục mang lại khả năng nhận biết ngữ cảnh đặc biệt tốt, giúp model phân tách các đối tượng chồng lấp trong môi trường đông đúc, lộn xộn như hệ thống báo động an ninh tự động hoặc hệ thống giám sát đám đông quy mô lớn.

Hạn chế#

Mặc dù mạnh mẽ, kiến trúc Transformer vốn cần nhiều bộ nhớ CUDA hơn trong quá trình huấn luyện so với CNN tiêu chuẩn. Ngoài ra, việc tinh chỉnh RTDETRv2 có thể cần thời gian hội tụ dữ liệu huấn luyện kéo dài, khiến quá trình tạo mẫu nhanh tiêu tốn nhiều tài nguyên hơn đôi chút.

Tìm hiểu thêm về RTDETRv2

EfficientDet: CNN có khả năng mở rộng và hiệu quả#

EfficientDet giới thiệu một dòng model phát hiện đối tượng được tối ưu hóa đồng thời về độ chính xác và hiệu quả trên nhiều mức giới hạn tài nguyên. Đây vẫn là ví dụ kinh điển về thiết kế thị giác máy có khả năng mở rộng.

Thông tin model

Kiến trúc và ưu điểm cốt lõi#

Đổi mới của EfficientDet nằm ở hai lĩnh vực chính: Mạng kim tự tháp đặc trưng hai chiều (BiFPN) và phương pháp mở rộng hợp thành. BiFPN cho phép trích xuất đặc trưng đa tỷ lệ đơn giản và nhanh chóng bằng cách bổ sung các trọng số có thể học để xác định tầm quan trọng của các đặc trưng đầu vào khác nhau, đồng thời lặp lại quá trình hợp nhất đặc trưng đa tỷ lệ từ trên xuống và từ dưới lên. Phương pháp mở rộng hợp thành mở rộng đồng thời độ phân giải, độ sâu và chiều rộng của mạng theo cách đồng nhất.

Các model EfficientDet có nhiều quy mô, từ D0 siêu nhẹ đến D7 đồ sộ. Điều này giúp model linh hoạt cao khi triển khai AI biên, trong đó nhà phát triển phải cân bằng ngân sách tính toán hạn chế với yêu cầu độ chính xác, chẳng hạn như các ứng dụng thực tế tăng cường trên thiết bị di động đời đầu.

Hạn chế#

EfficientDet là kiến trúc đời cũ phụ thuộc nhiều vào bounding box anchor và pipeline hậu xử lý NMS truyền thống. Quá trình tạo anchor cần tinh chỉnh hyperparameter cẩn thận, còn bước NMS có thể trở thành nút thắt khi triển khai trên phần cứng nhúng như Raspberry Pi. Model cũng thiếu hỗ trợ gốc cho các tác vụ hiện đại như ước tính tư thế hoặc bounding box định hướng (OBB).

Tìm hiểu thêm về EfficientDet

So sánh hiệu năng và chỉ số#

Để hiểu chính xác sự đánh đổi giữa các model này, cần phân tích thông lượng và hiệu quả tham số. Bảng dưới đây trình bày cách dòng RTDETRv2 hiện đại so sánh với dòng EfficientDet có khả năng mở rộng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như trên đã thấy, RTDETRv2 đạt hoặc vượt Độ chính xác trung bình (mAP) của các model EfficientDet có kích thước tương đương, đồng thời chạy nhanh hơn nhiều trên GPU (ví dụ: RTDETRv2-l đạt 53.4 mAP trong 9.76 ms, trong khi EfficientDet-d6 đạt 52.6 mAP trong 89.29 ms), tận dụng mạnh mẽ kiến trúc Transformer để tăng độ chính xác.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa RT-DETR và EfficientDet phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn RT-DETR#

RT-DETR là lựa chọn phù hợp cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
  • Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn EfficientDet#

EfficientDet được khuyến nghị cho:

  • Pipeline Google Cloud và TPU: Các hệ thống tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet được tối ưu hóa nguyên bản.
  • Nghiên cứu mở rộng theo hệ số: Benchmark học thuật tập trung nghiên cứu tác động của việc mở rộng cân bằng độ sâu, chiều rộng và độ phân giải của mạng.
  • Triển khai di động qua LiteRT: Các dự án yêu cầu cụ thể việc xuất sang LiteRT (trước đây là TensorFlow Lite) cho Android hoặc thiết bị Linux nhúng.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Giải pháp thay thế của Ultralytics: Nâng cao công nghệ tiên tiến nhất#

Mặc dù cả RTDETRv2 và EfficientDet đều có những ưu điểm nổi bật, việc phát triển AI hiện đại đòi hỏi các framework mang lại trải nghiệm dành cho nhà phát triển liền mạch cùng hiệu năng tiên tiến. Hệ sinh thái Ultralytics cung cấp phương pháp tối ưu hơn đáng kể cho các tác vụ thị giác máy tính.

Nếu bạn đang tìm hiểu các giải pháp phát hiện tiên tiến nhất, Ultralytics YOLO26 mới ra mắt kết hợp những ưu điểm tốt nhất của cả CNN lẫn Transformer.

Vì sao nên chọn YOLO26?

YOLO26 triển khai Thiết kế end-to-end không cần NMS (nms=False) dưới dạng tùy chọn, mang lại sự đơn giản khi triển khai của RTDETRv2 cho kiến trúc YOLO siêu hiệu quả. Ngoài ra, model giới thiệu Optimizer MuSGD—lấy cảm hứng từ các cải tiến trong huấn luyện LLM—để tăng độ ổn định khi huấn luyện. Nhờ loại bỏ DFL (loại bỏ Distribution Focal Loss để đơn giản hóa quá trình export và tăng khả năng tương thích với thiết bị biên/tiêu thụ điện năng thấp), YOLO26 đạt tốc độ suy luận trên CPU nhanh hơn tới 43% so với các thế hệ trước, trở thành lựa chọn xuất sắc cho điện toán biên thay vì các model nặng hơn. Ngoài ra, ProgLoss + STAL cung cấp các hàm loss cải tiến, giúp nhận diện vật thể nhỏ tốt hơn đáng kể—điều thiết yếu đối với IoT, robotics và ảnh chụp từ trên không.

Tính dễ sử dụng của gói Python Ultralytics là vượt trội. Nhà phát triển có thể huấn luyện, xác thực và export model bằng API trực quan, giúp loại bỏ phần lớn boilerplate code thường cần có trong các repository nghiên cứu.

from ultralytics import RTDETR

# Tải model RT-DETR đã huấn luyện trước từ hệ sinh thái Ultralytics
model = RTDETR("rtdetr-l.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export để tối ưu suy luận trên TensorRT
model.export(format="engine")

Các model Ultralytics hỗ trợ sẵn nhiều tác vụ, bao gồm phân đoạn instance và phân loại ảnh, cung cấp bộ công cụ linh hoạt đáp ứng nhu cầu đa dạng của các ngành. Ngoài ra, việc loại bỏ Distribution Focal Loss (DFL) trong các model Ultralytics hiện đại giúp đơn giản hóa đồ thị tính toán, đảm bảo quá trình export sang NPU và TPU nhúng diễn ra trơn tru hơn.

Để gán nhãn dữ liệu và quản lý model liền mạch, Ultralytics Platform cung cấp môi trường cloud toàn diện để quản lý toàn bộ vòng đời machine learning, trở thành lựa chọn hàng đầu để triển khai các giải pháp thị giác máy tính mạnh mẽ trong môi trường production.

Người đóng góp

Bình luận