YOLOv9 so với RTDETRv2#
Bối cảnh phát hiện đối tượng theo thời gian thực đã trải qua một sự chuyển đổi mô hình trong những năm gần đây. Hai triết lý kiến trúc riêng biệt đã nổi lên và chi phối lĩnh vực này: Mạng nơ-ron tích chập (CNNs) được tối ưu hóa cao và các Transformer phát hiện theo thời gian thực (DETRs). Đại diện cho đỉnh cao của hai hướng tiếp cận này là YOLOv9 và RTDETRv2.
Hướng dẫn toàn diện này so sánh hai model mạnh mẽ, phân tích các cải tiến về kiến trúc, chỉ số hiệu năng và các kịch bản triển khai lý tưởng để giúp bạn lựa chọn model phù hợp cho pipeline thị giác máy tính của mình.
Tóm tắt điều hành#
Cả hai model đều đạt kết quả tiên tiến nhất, nhưng phục vụ các ràng buộc triển khai và hệ sinh thái phát triển hơi khác nhau.
- Chọn YOLOv9 nếu: Bạn cần khả năng sử dụng tham số hiệu quả cao và suy luận nhanh trên các thiết bị edge. YOLOv9 đẩy giới hạn lý thuyết của hiệu quả CNN, khiến model này trở nên lý tưởng cho các môi trường có tài nguyên tính toán bị giới hạn nghiêm ngặt.
- Chọn RTDETRv2 nếu: Bạn cần khả năng nắm bắt ngữ cảnh tinh tế mà các Transformer cung cấp, đặc biệt trong những cảnh bị che khuất nghiêm trọng hoặc có mối quan hệ đối tượng phức tạp, đồng thời có phần cứng đủ để hỗ trợ một kiến trúc nặng hơn đôi chút.
- Chọn YOLO26 (Khuyến nghị) nếu: Bạn muốn có được điều tốt nhất của cả hai hướng tiếp cận. Là thế hệ mới nhất hiện có trên Ultralytics Platform, YOLO26 sở hữu Thiết kế End-to-End không cần NMS nguyên bản (tương tự các model DETR nhưng nhanh hơn nhiều), loại bỏ các nút thắt trong hậu xử lý và mang lại tốc độ suy luận CPU nhanh hơn tới 43% so với các thế hệ trước.
Thông số kỹ thuật và tác giả#
Việc hiểu nguồn gốc và mục đích thiết kế của các model này cung cấp bối cảnh quan trọng cho những lựa chọn kiến trúc của chúng.
YOLOv9#
- Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica
- Ngày: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Các cải tiến về kiến trúc#
YOLOv9: Giải quyết nút thắt thông tin#
Ultralytics YOLOv9 giới thiệu hai cải tiến lớn nhằm giải quyết tình trạng mất thông tin khi dữ liệu đi qua các mạng nơ-ron sâu:
- Thông tin gradient có thể lập trình (PGI): Framework giám sát phụ trợ này đảm bảo tạo ra các gradient đáng tin cậy để cập nhật trọng số mạng, bảo toàn thông tin đặc trưng quan trọng ngay cả trong các layer rất sâu của mạng.
- Mạng tổng hợp layer hiệu quả tổng quát (GELAN): Một kiến trúc mới kết hợp các ưu điểm của CSPNet và ELAN. GELAN tối ưu hóa hiệu quả tham số, cho phép YOLOv9 đạt độ chính xác cao hơn với ít FLOPs hơn so với các CNN truyền thống.
RTDETRv2: Nâng cao Transformer theo thời gian thực#
Dựa trên thành công của RT-DETR nguyên bản, RTDETRv2 sử dụng kiến trúc dựa trên Transformer, vốn tự nhiên loại bỏ nhu cầu sử dụng phép loại bỏ cực đại không tối đa (NMS). Các cải tiến bao gồm:
- Chiến lược Bag-of-Freebies: Phiên bản v2 tích hợp các kỹ thuật huấn luyện nâng cao và phép tăng cường dữ liệu giúp tăng đáng kể độ chính xác mà không làm tăng độ trễ suy luận.
- Encoder lai hiệu quả: Bằng cách xử lý các đặc trưng đa tỉ lệ thông qua cơ chế attention nội tỉ lệ và xuyên tỉ lệ được tách biệt, RTDETRv2 quản lý hiệu quả chi phí tính toán vốn cao của Vision Transformer.
Trong khi RTDETRv2 tận dụng Transformer để phát hiện không cần NMS, kiến trúc YOLO26 đạt được điều này nguyên bản trong một cấu trúc CNN được tối ưu hóa cao, cung cấp phương thức triển khai tinh gọn tương tự nhưng với tốc độ suy luận edge vượt trội hơn rất nhiều.
So sánh hiệu năng#
Khi đánh giá model cho môi trường production, sự đánh đổi giữa độ chính xác và yêu cầu tính toán là yếu tố then chốt. Bảng dưới đây trình bày hiệu năng của nhiều kích thước model trên các benchmark tiêu chuẩn.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | tham số (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Phân tích#
Dữ liệu cho thấy YOLOv9 duy trì lợi thế rõ rệt về hiệu quả tham số. Model YOLOv9c đạt 53.0 mAP ấn tượng với chỉ 25.3M tham số, khiến model này cực kỳ nhẹ.
Ngược lại, RTDETRv2 tạo ra sự cạnh tranh mạnh mẽ trong các nhóm model cỡ trung đến lớn. Tuy nhiên, điều này phải đánh đổi bằng số lượng tham số cao hơn và FLOPs lớn hơn đáng kể, vốn là đặc trưng của các model Transformer. Khác biệt về kiến trúc này cũng chuyển thành khác biệt về mức sử dụng bộ nhớ: các model YOLO thường yêu cầu ít bộ nhớ CUDA hơn rất nhiều trong cả quá trình huấn luyện lẫn suy luận so với các model Transformer tương ứng.
Lợi thế của Ultralytics: Hệ sinh thái và tính linh hoạt#
Mặc dù các chỉ số thuần túy về kiến trúc rất quan trọng, hệ sinh thái phần mềm thường quyết định thành công của một dự án AI. Việc truy cập các model nâng cao này thông qua Ultralytics Python API mang lại những lợi thế vượt trội.
Huấn luyện và triển khai tinh gọn#
Việc huấn luyện một Detection Transformer thường đòi hỏi các file cấu hình phức tạp và GPU cao cấp. Bằng cách sử dụng Ultralytics framework, các nhà phát triển có thể huấn luyện cả mô hình YOLOv9 và RT-DETR với cú pháp đơn giản, giống hệt nhau, đồng thời tận dụng các pipeline huấn luyện hiệu quả cao và trọng số đã được huấn luyện sẵn có sẵn.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")Tính linh hoạt vượt trội cho nhiều task#
Một hạn chế lớn của các model chuyên biệt như RTDETRv2 là chỉ tập trung vào việc phát hiện bounding box. Ngược lại, hệ sinh thái Ultralytics rộng lớn hơn, bao gồm các model như YOLO11 và YOLOv8, hỗ trợ nhiều tác vụ thị giác máy tính. Các tác vụ này bao gồm phân đoạn instance chính xác đến từng pixel, ước tính pose khung xương, phân loại toàn ảnh và phát hiện Hộp giới hạn định hướng (OBB) cho ảnh chụp từ trên không.
Ứng dụng thực tế#
Phân tích edge tốc độ cao#
Đối với môi trường bán lẻ hoặc dây chuyền sản xuất cần nhận dạng sản phẩm theo thời gian thực trên các thiết bị edge, YOLOv9 là lựa chọn vượt trội. Kiến trúc GELAN đảm bảo throughput cao trên phần cứng hạn chế như dòng NVIDIA Jetson, cho phép kiểm soát chất lượng tự động mà không bị trễ đáng kể.
Phân tích cảnh phức tạp#
Trong các tình huống như giám sát đám đông dày đặc hoặc các giao lộ phức tạp, nơi các đối tượng thường xuyên che khuất lẫn nhau, cơ chế attention toàn cục của RTDETRv2 phát huy hiệu quả. Khả năng suy luận tự nhiên về toàn bộ ngữ cảnh hình ảnh của model cho phép duy trì khả năng tracking và phát hiện ổn định ngay cả khi các đối tượng bị che khuất một phần.
Các trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOv9 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.
Khi nào nên chọn YOLOv9#
YOLOv9 là lựa chọn phù hợp cho:
- Nghiên cứu nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
- Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các layer sâu của network trong quá trình huấn luyện.
- Benchmark phát hiện độ chính xác cao: Các tình huống cần hiệu năng benchmark COCO mạnh của YOLOv9 làm mốc tham chiếu cho việc so sánh kiến trúc.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
- Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:
- Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
- Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
- Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.
Tương lai: YOLO26 xuất hiện#
Mặc dù YOLOv9 và RTDETRv2 là những thành tựu to lớn, lĩnh vực thị giác máy tính phát triển rất nhanh. Đối với các developer muốn bắt đầu dự án mới, YOLO26 là giải pháp tiên tiến nhất được khuyến nghị.
Được phát hành vào năm 2026, YOLO26 tích hợp những tính năng tốt nhất của cả CNN và DETR. Model này sở hữu Thiết kế End-to-End không cần NMS, loại bỏ hoàn toàn độ trễ hậu xử lý—một kỹ thuật lần đầu được tiên phong trong YOLOv10. Ngoài ra, YOLO26 loại bỏ Distribution Focal Loss (DFL) để tăng khả năng tương thích với edge và giới thiệu MuSGD Optimizer mang tính đột phá. Lấy cảm hứng từ quá trình huấn luyện Large Language Model (cụ thể là Kimi K2 của Moonshot AI), optimizer lai này đảm bảo độ ổn định huấn luyện chưa từng có và khả năng hội tụ nhanh hơn.
Kết hợp với các hàm loss được cải tiến như ProgLoss và STAL để nhận dạng đối tượng nhỏ vượt trội, YOLO26 mang lại tốc độ suy luận CPU nhanh hơn tới 43%, củng cố vị thế của model này như lựa chọn tối ưu cho các triển khai AI hiện đại.