Ultralytics YOLO27:

So sánh RTDETRv2 và YOLOv5#

Sự phát triển của thị giác máy tính phần lớn được định hình bởi nỗ lực không ngừng nhằm cân bằng độ chính xác với tốc độ suy luận theo thời gian thực. Khi so sánh RTDETRv2 và Ultralytics YOLOv5, về cơ bản các nhà phát triển đang cân nhắc giữa khả năng nắm bắt ngữ cảnh toàn cục tinh vi của các kiến trúc Transformer và hiệu suất được tối ưu hóa cao, đã được kiểm chứng qua thực tế của mạng nơ-ron tích chập (CNNs).

Hướng dẫn này cung cấp phân tích kỹ thuật chuyên sâu về hai kiến trúc nổi bật này, trình bày chi tiết các chỉ số hiệu năng, phương pháp huấn luyện, yêu cầu bộ nhớ và các kịch bản triển khai phù hợp, giúp bạn lựa chọn model phát hiện đối tượng tốt nhất cho trường hợp sử dụng cụ thể.

RTDETRv2: Phương pháp Transformer cho Phát hiện theo thời gian thực#

Được xây dựng dựa trên Real-Time Detection Transformer (RT-DETR) ban đầu, RTDETRv2 giới thiệu một loạt "bag-of-freebies" để cải thiện kiến trúc cơ sở mà không làm tăng độ trễ suy luận.

Kiến trúc và khả năng#

RTDETRv2 sử dụng kiến trúc kết hợp CNN-Transformer. CNN đóng vai trò backbone để trích xuất các đặc trưng hình ảnh chi tiết, trong khi các lớp encoder-decoder của Transformer xử lý toàn bộ feature map để hiểu ngữ cảnh toàn cục. Một đặc điểm nổi bật của RTDETRv2 là bản chất end-to-end, loại bỏ hoàn toàn nhu cầu hậu xử lý Non-Maximum Suppression (NMS).

Mặc dù RTDETRv2 đạt độ chính xác ấn tượng—đặc biệt trong các cảnh phức tạp, dày đặc, nơi các đối tượng chồng lấn—model này đi kèm với những đánh đổi đáng kể. Cơ chế attention vốn có của Transformer đòi hỏi lượng bộ nhớ CUDA cao hơn đáng kể trong quá trình huấn luyện so với CNN tiêu chuẩn. Hơn nữa, dù hoạt động tốt trên các GPU cao cấp như NVIDIA A100 hoặc T4, kiến trúc này chậm hơn rõ rệt trên CPU tiêu chuẩn và bị hạn chế nghiêm trọng trên các thiết bị edge.

Tìm hiểu thêm về RTDETRv2

Ultralytics YOLOv5: Tiêu chuẩn ngành về hiệu quả#

Ultralytics YOLOv5 đã fundamentally thay đổi lĩnh vực machine learning ứng dụng khi ra mắt, giúp các nhà phát triển trên toàn thế giới tiếp cận thị giác máy tính hiệu năng cao thông qua một framework đặc biệt trực quan.

Cân bằng hệ sinh thái và hiệu năng#

YOLOv5 được xây dựng hoàn toàn trên framework PyTorch và sử dụng kiến trúc CNN cực kỳ hiệu quả. Model này được thiết kế ngay từ đầu để dễ sử dụng, với API tinh gọn và một trong những hệ thống tài liệu toàn diện nhất trong ngành AI.

Ưu điểm lớn nhất của YOLOv5 nằm ở tính linh hoạt vượt trội và yêu cầu bộ nhớ thấp. Việc huấn luyện model YOLOv5 cần VRAM ít hơn đáng kể so với các model dựa trên Transformer, giúp các nhà nghiên cứu và kỹ sư có ngân sách phần cứng hạn chế vẫn có thể sử dụng. Hơn nữa, trong khi RTDETRv2 chỉ tập trung vào phát hiện bounding box, YOLOv5 đã phát triển thành một model đa năng mạnh mẽ, hỗ trợ phân đoạn instancephân loại hình ảnh.

Quản lý model cho doanh nghiệp

Để trải nghiệm workflow tinh gọn tối ưu, bạn có thể huấn luyện, validation và triển khai YOLOv5 trực tiếp bằng Ultralytics Platform. Nền tảng này cung cấp khả năng huấn luyện trên cloud và các pipeline triển khai không cần code.

So sánh hiệu năng và các chỉ số#

Khi phân tích hiệu năng thô trên bộ dữ liệu COCO tiêu chuẩn, chúng ta có thể thấy rõ sự khác biệt trong cách các model này ưu tiên tài nguyên.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Phân tích sự đánh đổi#

Dữ liệu cho thấy RTDETRv2-x đạt Mean Average Precision (mAP) cao nhất là 54.3%, nhỉnh hơn một chút so với mức 50.7% của YOLOv5x. Tuy nhiên, mức tăng độ chính xác nhỏ này đi kèm chi phí tính toán khổng lồ. YOLOv5x hoạt động với độ trễ thấp hơn (11.89 ms so với 15.03 ms trên TensorRT) và yêu cầu lượng bộ nhớ ít hơn nhiều. Đối với các triển khai edge siêu tiết kiệm năng lượng, YOLOv5n (Nano) vẫn không có đối thủ, hoàn tất suy luận chỉ trong 1.12ms với footprint tham số cực nhỏ, chỉ 2.6M—một phân khúc mà RTDETRv2 thậm chí không hướng đến cạnh tranh.

Hiệu quả huấn luyện và tính đơn giản của code#

Một trong những thế mạnh chính của hệ sinh thái Ultralytics là API hợp nhất. Ngay cả khi bạn quyết định sử dụng kiến trúc Transformer của RT-DETR cho một tác vụ cần nhiều năng lực tính toán, bạn vẫn có thể thực hiện hoàn toàn trong package Ultralytics Python, chuyển đổi model liền mạch chỉ bằng một dòng code.

from ultralytics import RTDETR, YOLO

# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")

# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

Bằng cách sử dụng thư viện Ultralytics, các nhà phát triển tự động có quyền truy cập vào một hệ sinh thái được duy trì tốt, bao gồm tích hợp theo dõi thí nghiệm (chẳng hạn như Weights & Biases và Comet ML) cùng khả năng export chỉ bằng một cú nhấp chuột sang các format triển khai như ONNXOpenVINO.

Ứng dụng Thực tế và Các Trường hợp Sử dụng Lý tưởng#

Những điểm RTDETRv2 nổi bật#

RTDETRv2 phù hợp nhất với các môi trường không có hạn chế về phần cứng và trong đó mục tiêu duy nhất là đạt độ chính xác cao nhất có thể.

  • Chẩn đoán hình ảnh y tế phía server: Phát hiện các bất thường vi mô trong ảnh X-quang độ phân giải cao.
  • Ảnh vệ tinh: Theo dõi các đối tượng dày đặc, chồng lấn trong các tác vụ giám sát trên không trên các cluster cloud mạnh.

Những lĩnh vực YOLOv5 chiếm ưu thế#

YOLOv5 là lựa chọn hàng đầu không thể phủ nhận cho việc triển khai thực tế trên nhiều loại phần cứng.

  • Thiết bị Edge AI: Triển khai hệ thống cảnh báo an ninh trên Raspberry Pi hoặc thiết bị NVIDIA Jetson, nơi bộ nhớ bị giới hạn nghiêm ngặt.
  • Ứng dụng di động: Chạy suy luận bounding box và phân đoạn nhanh theo thời gian thực trực tiếp trên smartphone thông qua CoreML hoặc TFLite.
  • Sản xuất công nghiệp tốc độ cao: Kiểm tra linh kiện trên các dây chuyền sản xuất nhanh, nơi độ trễ tính bằng mili giây đóng vai trò then chốt đối với thành công trong vận hành.
Khám phá các model Ultralytics khác

Mặc dù YOLOv5 là một model huyền thoại, hệ sinh thái Ultralytics vẫn không ngừng mở rộng các giới hạn của AI. Nếu đang so sánh các model cho một dự án mới vào năm 2026, bạn nên cân nhắc khám phá Ultralytics YOLO26 tiên tiến nhất. YOLO26 tích hợp Thiết kế Native End-to-End Không cần NMS (tương tự Transformer nhưng có tốc độ của CNN), sở hữu MuSGD Optimizer mang tính cách mạng cho quá trình huấn luyện cực kỳ ổn định và mang lại tốc độ suy luận CPU nhanh hơn tới 43%. Ngoài ra, YOLO11 vẫn là một lựa chọn tuyệt vời, được hỗ trợ mạnh mẽ cho các triển khai đa năng yêu cầu Pose Estimationphát hiện OBB.

Tóm lại, trong khi RTDETRv2 đẩy giới hạn độ chính xác bằng các lớp Transformer, framework Ultralytics YOLO mang đến sự cân bằng vượt trội giữa tốc độ, yêu cầu bộ nhớ nhẹ và trải nghiệm dành cho nhà phát triển được thiết kế xuất sắc, qua đó rút ngắn đáng kể thời gian từ prototype đến production.

Những người đóng góp

Bình luận