RTDETRv2 và YOLOv7#
Lĩnh vực thị giác máy tính đã mở rộng đáng kể trong vài năm qua, nhờ những cải tiến liên tục trong Mạng nơ-ron tích chập (CNNs) và Vision Transformer (ViTs). Để chọn kiến trúc phù hợp cho hoạt động triển khai, cần hiểu rõ những đánh đổi tinh tế giữa tốc độ, độ chính xác và chi phí tính toán. Hướng dẫn này tìm hiểu khác biệt kỹ thuật giữa hai kiến trúc được đánh giá cao là RTDETRv2 và YOLOv7, đồng thời nêu bật những cải tiến hiện đại trong YOLO26 mới hơn của Ultralytics.
RTDETRv2: Phương pháp Transformer cho phát hiện thời gian thực#
RTDETRv2 (Transformer phát hiện thời gian thực phiên bản 2) kế thừa nền tảng của phiên bản tiền nhiệm, chứng minh rằng các kiến trúc dựa trên Transformer có thể cạnh tranh hiệu quả trong các tình huống thời gian thực mà không cần các bước hậu xử lý truyền thống.
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: Kho lưu trữ RTDETRv2
Điểm nổi bật về kiến trúc#
RTDETRv2 sử dụng kiến trúc encoder lai và decoder Transformer. Nhờ cơ chế self-attention, model xử lý toàn bộ hình ảnh một cách tổng thể, giúp hiểu các mối quan hệ không gian phức tạp tốt hơn các kernel tích chập chỉ hoạt động cục bộ. Một trong những đặc điểm nổi bật nhất của model là thiết kế gốc không cần NMS. Bằng cách loại bỏ Non-Maximum Suppression (NMS), RTDETRv2 loại bỏ một nút thắt phổ biến gây ra độ trễ suy luận không ổn định khi triển khai.
Ưu điểm và hạn chế#
Thế mạnh chính của RTDETRv2 là khả năng xử lý các vật thể dày đặc, chồng lấp trong những cảnh phức tạp. Ngữ cảnh toàn cục từ các lớp attention của Transformer giúp model đạt độ chính xác cao, đặc biệt trong các tình huống thường xuyên xảy ra che khuất.
Tuy nhiên, điều này đi kèm với chi phí tính toán. Theo truyền thống, model Transformer cần nhiều bộ nhớ hơn khi huấn luyện và suy luận so với CNN. Ngoài ra, RTDETRv2 thường cần nhiều epoch hơn để hội tụ trong quá trình huấn luyện phân tán, kéo dài chu kỳ lặp đối với nhà phát triển đang tinh chỉnh bộ dữ liệu tùy chỉnh.
YOLOv7: CNN cơ sở có tốc độ cao#
Được phát hành hai năm trước RTDETRv2, YOLOv7 đưa vào một số tối ưu hóa cấu trúc cho framework YOLO cổ điển, thiết lập một chuẩn mực vững chắc cho các bộ phát hiện thời gian thực dựa trên CNN tại thời điểm ra mắt.
- Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
- Ngày: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: Kho lưu trữ YOLOv7
Điểm nổi bật về kiến trúc#
Kiến trúc YOLOv7 được xây dựng dựa trên Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Phương pháp này tối ưu đường truyền gradient, giúp model học hiệu quả hơn mà không làm tăng đáng kể độ phức tạp tính toán. Các tác giả cũng giới thiệu "tập hợp các phương pháp miễn phí có thể huấn luyện", gồm những phương pháp cải thiện độ chính xác của model trong quá trình huấn luyện mà không ảnh hưởng đến tốc độ suy luận trên thiết bị edge.
Ưu điểm và hạn chế#
YOLOv7 vẫn là model có năng lực cao cho các tác vụ phát hiện vật thể tiêu chuẩn, với tốc độ xử lý xuất sắc trên GPU phổ thông. Do có bản chất là CNN, model này thường cần ít bộ nhớ CUDA hơn khi huấn luyện so với các model dựa trên Transformer như RTDETRv2.
Dù có những ưu điểm này, YOLOv7 vẫn cần NMS để hậu xử lý. Trong môi trường có mật độ dự đoán cao, bước NMS có thể làm thời gian xử lý dao động, gây khó khăn cho việc đảm bảo nghiêm ngặt hiệu năng thời gian thực. Ngoài ra, so với các framework hiện đại, quy trình xử lý những tác vụ đa dạng như phân đoạn đối tượng và ước lượng tư thế có thể bị chia rời.
So sánh hiệu năng#
Để đánh giá các model này, cần xem xét sự cân bằng giữa Độ chính xác trung bình (mAP), số lượng tham số và tốc độ suy luận.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
RTDETRv2-x đạt mAP cao nhất, nhưng cũng có số lượng tham số và FLOPs lớn nhất. Các biến thể nhỏ hơn như RTDETRv2-s có tốc độ cạnh tranh trên TensorRT, nhưng người dùng nhắm đến môi trường công suất thấp, không có GPU chuyên dụng, cần đánh giá cẩn thận khả năng suy luận trên CPU.
Giải pháp hiện đại: Giới thiệu YOLO26#
Mặc dù RTDETRv2 và YOLOv7 đóng vai trò then chốt trong việc mở rộng giới hạn của các ứng dụng thị giác máy tính, lĩnh vực AI vẫn phát triển nhanh chóng. Ra mắt vào tháng 1 năm 2026, YOLO26 kết hợp những ưu điểm tốt nhất của hiệu quả CNN và kiến trúc không cần NMS tương tự Transformer.
Đối với nhà phát triển và nhà nghiên cứu xây dựng hệ thống mới, Nền tảng Ultralytics tích hợp cùng hệ sinh thái Python mang lại trải nghiệm thống nhất, giúp giảm đáng kể nợ kỹ thuật.
Các cải tiến chính trong YOLO26#
- Thiết kế end-to-end không cần NMS: YOLO26 có kiến trúc end-to-end gốc, bỏ qua bước hậu xử lý NMS bằng head one-to-one tùy chọn (
nms=False) để triển khai nhanh và đơn giản hơn. Phương pháp đột phá này lần đầu được tiên phong trong YOLOv10, đảm bảo độ trễ ổn định bất kể mật độ vật thể. - Suy luận CPU nhanh hơn đến 43%: Được tối ưu riêng cho điện toán edge và các thiết bị không có GPU, giúp model linh hoạt hơn nhiều khi triển khai thực địa so với các model Transformer nặng.
- Optimizer MuSGD: Phương pháp kết hợp SGD và Muon (lấy cảm hứng từ Kimi K2 của Moonshot AI), đưa các cải tiến trong huấn luyện LLM vào thị giác máy tính để huấn luyện ổn định hơn và hội tụ nhanh hơn.
- Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, giúp đơn giản hóa đồ thị tính toán và xuất model trơn tru hơn sang NPU nhúng cũng như môi trường TensorRT.
- ProgLoss + STAL: Các hàm loss cải tiến giúp nhận diện vật thể nhỏ tốt hơn đáng kể, yếu tố then chốt trong robot, IoT và phân tích ảnh chụp từ trên không.
- Cải tiến theo từng tác vụ: YOLO26 không chỉ dành cho phát hiện. Model này có prototype đa tỷ lệ để phân đoạn, Ước lượng khả năng xảy ra của phần dư (RLE) cho ước lượng tư thế và hàm loss góc chuyên biệt để xử lý các vấn đề biên của hộp giới hạn có định hướng (OBB).
Trải nghiệm nhà phát triển tinh gọn#
Lợi thế thực sự khi chọn model Ultralytics như YOLO26 (hoặc YOLO11 rất phổ biến) là hệ sinh thái được duy trì tốt. Huấn luyện bộ dữ liệu tùy chỉnh chỉ cần rất ít code khung:
from ultralytics import YOLO
# Khởi tạo model YOLO26 tiên tiến nhất
model = YOLO("yolo26s.pt")
# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Xuất model liền mạch để triển khai trên thiết bị biên
model.export(format="onnx", dynamic=True)Trường hợp sử dụng và ứng dụng lý tưởng#
Việc lựa chọn giữa các kiến trúc này phụ thuộc nhiều vào phần cứng mục tiêu và yêu cầu vận hành cụ thể.
Khi nào nên cân nhắc RTDETRv2#
RTDETRv2 đặc biệt hiệu quả trong môi trường xử lý phía máy chủ được trang bị GPU mạnh. Cơ chế attention toàn cục khiến model phù hợp với việc hiểu các cảnh phức tạp, chẳng hạn như giám sát sự kiện đông người hoặc chẩn đoán hình ảnh y tế chuyên biệt, nơi các đặc trưng chồng lấp đòi hỏi phân tích ngữ cảnh sâu.
Khi nào nên cân nhắc YOLOv7#
YOLOv7 thường được duy trì trong các nghiên cứu học thuật cũ dưới dạng model cơ sở để so sánh. Model này cũng xuất hiện trong các hệ thống triển khai công nghiệp đời cũ, nơi pipeline hiện tại được viết cứng cho những phiên bản PyTorch cụ thể và không cần tính linh hoạt đa tác vụ của các framework mới hơn.
Vì sao YOLO26 là tiêu chuẩn được khuyến nghị#
Với hạ tầng đô thị thông minh, điều hướng drone và sản xuất tốc độ cao hiện đại, YOLO26 mang lại sự cân bằng vượt trội. Nhu cầu bộ nhớ thấp hơn giúp việc tinh chỉnh hyperparameter và huấn luyện có thể thực hiện trên phần cứng phổ thông, trong khi suy luận không cần NMS đảm bảo xử lý nhanh trên các thiết bị edge hạn chế tài nguyên như Raspberry Pi hoặc NVIDIA Jetson.
Bạn muốn biết các model này so sánh với kiến trúc khác ra sao? Hãy xem hướng dẫn chi tiết về YOLO11 và RT-DETR và YOLOv8 và YOLOv7 để tìm lựa chọn phù hợp nhất cho dự án AI thị giác của bạn.