Ultralytics YOLO27:
Get Started

RTDETRv2 và YOLOv5#

Sự phát triển của thị giác máy tính phần lớn được định hình bởi nỗ lực không ngừng nhằm cân bằng độ chính xác với tốc độ suy luận thời gian thực. Khi so sánh RTDETRv2 với Ultralytics YOLOv5, về cơ bản developer đang cân nhắc giữa khả năng nắm bắt ngữ cảnh toàn cục tinh vi của kiến trúc Transformer và hiệu quả đã được tối ưu hóa, kiểm chứng qua thực tiễn của Mạng nơ-ron tích chập (CNN).

Hướng dẫn này cung cấp phân tích kỹ thuật chuyên sâu về hai kiến trúc nổi bật, trình bày chi tiết các chỉ số hiệu năng, phương pháp huấn luyện, yêu cầu bộ nhớ và kịch bản triển khai lý tưởng để giúp bạn chọn model phát hiện đối tượng phù hợp nhất với trường hợp sử dụng cụ thể.

RTDETRv2: Phương pháp Transformer cho phát hiện thời gian thực#

Dựa trên Real-Time Detection Transformer (RT-DETR) gốc, RTDETRv2 giới thiệu một loạt “bag-of-freebies” nhằm cải thiện kiến trúc cơ sở mà không làm giảm độ trễ suy luận.

Kiến trúc và năng lực#

RTDETRv2 tận dụng kiến trúc CNN-Transformer lai. CNN đóng vai trò backbone để trích xuất đặc trưng hình ảnh chi tiết, trong khi các lớp encoder-decoder Transformer xử lý toàn bộ feature map để nắm bắt ngữ cảnh toàn cục. Đặc điểm nổi bật của RTDETRv2 là thiết kế end-to-end, loại bỏ hoàn toàn nhu cầu hậu xử lý Non-Maximum Suppression (NMS).

RTDETRv2 đạt độ chính xác ấn tượng—đặc biệt trong các cảnh phức tạp, dày đặc với nhiều đối tượng chồng lấp—nhưng đi kèm những đánh đổi đáng kể. Cơ chế chú ý vốn có của Transformer đòi hỏi nhiều bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với CNN tiêu chuẩn. Hơn nữa, dù hoạt động tốt trên GPU cao cấp như NVIDIA A100 hoặc T4, kiến trúc này chậm hơn rõ rệt trên CPU tiêu chuẩn và bị hạn chế nghiêm trọng trên các thiết bị biên.

Tìm hiểu thêm về RTDETRv2

Ultralytics YOLOv5: Tiêu chuẩn ngành về hiệu quả#

Ultralytics YOLOv5 đã làm thay đổi căn bản lĩnh vực machine learning ứng dụng khi ra mắt, giúp developer trên toàn thế giới tiếp cận thị giác máy tính hiệu năng cao thông qua một framework đặc biệt trực quan.

Cân bằng hệ sinh thái và hiệu năng#

YOLOv5 được xây dựng hoàn toàn trên framework PyTorch và dựa vào kiến trúc CNN cực kỳ hiệu quả. Model được thiết kế ngay từ đầu để dễ sử dụng, với API tinh gọn và một trong những bộ tài liệu toàn diện nhất trong ngành AI.

Ưu điểm lớn nhất của YOLOv5 là tính linh hoạt vượt trội và yêu cầu bộ nhớ thấp. Huấn luyện model YOLOv5 cần ít VRAM hơn đáng kể so với model dựa trên Transformer, giúp model phù hợp với các nhà nghiên cứu và kỹ sư có ngân sách phần cứng hạn chế. Ngoài ra, trong khi RTDETRv2 chỉ tập trung vào phát hiện bounding box, YOLOv5 đã phát triển thành một model đa năng mạnh mẽ hỗ trợ phân đoạn instance và phân loại ảnh.

Quản lý model doanh nghiệp

Để trải nghiệm quy trình làm việc tinh gọn tối đa, bạn có thể huấn luyện, xác thực và triển khai YOLOv5 trực tiếp bằng Nền tảng Ultralytics. Nền tảng cung cấp khả năng huấn luyện trên cloud và các pipeline triển khai không cần code.

So sánh hiệu năng và chỉ số#

Khi phân tích hiệu năng thuần trên dataset COCO tiêu chuẩn, có thể thấy rõ sự khác biệt về cách các model ưu tiên tài nguyên.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Phân tích các yếu tố đánh đổi#

Dữ liệu cho thấy RTDETRv2-x đạt mean Average Precision (mAP) tối đa 54,3%, nhỉnh hơn một chút so với mức 50,7% của YOLOv5x. Tuy nhiên, mức tăng độ chính xác nhỏ này đi kèm chi phí tính toán rất lớn. YOLOv5x có độ trễ thấp hơn (11,89 ms so với 15,03 ms trên TensorRT) và chỉ cần một phần nhỏ dung lượng bộ nhớ. Đối với triển khai biên công suất siêu thấp, YOLOv5n (Nano) vẫn không có đối thủ, hoàn tất suy luận chỉ trong 1,12 ms với model chỉ có 1,9M tham số—một phân khúc mà RTDETRv2 thậm chí không hướng tới.

Hiệu quả huấn luyện và sự đơn giản của code#

Một trong những thế mạnh chính của hệ sinh thái Ultralytics là API hợp nhất. Ngay cả khi bạn chọn sử dụng kiến trúc Transformer của RT-DETR cho một tác vụ cần nhiều năng lực tính toán, bạn vẫn có thể thực hiện hoàn toàn trong package Python Ultralytics, dễ dàng chuyển đổi model chỉ bằng một dòng code.

from ultralytics import RTDETR, YOLO

# Tải model YOLOv5 small của Ultralytics
model_yolo = YOLO("yolov5su.pt")  # YOLOv5u: weight YOLOv5 không anchor dành cho package ultralytics

# Tải model RT-DETR large qua Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Huấn luyện YOLOv5 dễ dàng trên dữ liệu tùy chỉnh của bạn
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy suy luận liền mạch với cả hai model
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

Sử dụng thư viện Ultralytics giúp developer tự động tiếp cận hệ sinh thái được duy trì tốt, với các tích hợp theo dõi thử nghiệm (như Weights & Biases và Comet ML) và khả năng export chỉ bằng một cú nhấp sang các định dạng triển khai như ONNX và OpenVINO.

Ứng dụng thực tế và trường hợp sử dụng phù hợp#

RTDETRv2 phát huy thế mạnh ở đâu#

RTDETRv2 phù hợp nhất với môi trường không bị giới hạn về phần cứng, nơi mục tiêu duy nhất là đạt độ chính xác cao nhất có thể.

  • Chẩn đoán hình ảnh y tế phía máy chủ: Phát hiện các bất thường vi mô trong ảnh X-quang độ phân giải cao.
  • Ảnh vệ tinh: Theo dõi các đối tượng dày đặc, chồng lấp trong tác vụ giám sát trên không trên các cụm máy chủ cloud mạnh mẽ.

YOLOv5 vượt trội ở đâu#

YOLOv5 là lựa chọn vượt trội rõ ràng để triển khai thực tiễn trong thế giới thực trên nhiều loại phần cứng.

  • Thiết bị Edge AI: Triển khai hệ thống báo động an ninh trên Raspberry Pi hoặc thiết bị NVIDIA Jetson, nơi bộ nhớ bị giới hạn nghiêm ngặt.
  • Ứng dụng di động: Chạy suy luận bounding box và phân đoạn nhanh theo thời gian thực trực tiếp trên smartphone qua CoreML hoặc LiteRT.
  • Sản xuất công nghiệp tốc độ cao: Kiểm tra linh kiện trên các dây chuyền sản xuất nhanh, nơi độ trễ tính bằng mili giây đóng vai trò then chốt đối với thành công trong vận hành.
Khám phá các model Ultralytics khác

YOLOv5 là một model huyền thoại, nhưng hệ sinh thái Ultralytics không ngừng mở rộng giới hạn của AI. Nếu đang so sánh model cho dự án mới vào năm 2026, bạn nên cân nhắc khám phá Ultralytics YOLO26 tiên tiến nhất. YOLO26 tích hợp Thiết kế end-to-end không cần NMS thông qua head one-to-one tùy chọn (nms=False), tương tự Transformer nhưng có tốc độ của CNN; model còn có Optimizer MuSGD mang tính đột phá giúp huấn luyện cực kỳ ổn định và tăng tốc suy luận CPU lên đến 43%. Ngoài ra, YOLO11 vẫn là lựa chọn tuyệt vời, được hỗ trợ toàn diện cho các triển khai đa năng cần Ước tính tư thế và phát hiện OBB.

Tóm lại, dù RTDETRv2 nâng cao giới hạn độ chính xác bằng các lớp Transformer, framework Ultralytics YOLO mang đến sự cân bằng vượt trội giữa tốc độ, yêu cầu bộ nhớ nhẹ và trải nghiệm developer được thiết kế xuất sắc, giúp rút ngắn đáng kể thời gian từ nguyên mẫu đến production.

Người đóng góp

Bình luận