YOLOv9 và RTDETRv2#
Lĩnh vực phát hiện vật thể thời gian thực đã trải qua một bước ngoặt lớn trong những năm gần đây. Hai triết lý kiến trúc khác biệt đã nổi lên và chiếm ưu thế: Mạng nơ-ron tích chập (CNNs) được tối ưu cao và Transformer phát hiện thời gian thực (DETRs). YOLOv9 và RTDETRv2 đại diện cho đỉnh cao của hai phương pháp này.
Hướng dẫn toàn diện này so sánh hai model mạnh mẽ, phân tích những đổi mới kiến trúc, chỉ số hiệu suất và các tình huống triển khai phù hợp để giúp bạn chọn model thích hợp cho pipeline thị giác máy tính của mình.
Tóm tắt điều hành#
Cả hai model đều đạt kết quả tiên tiến nhất, nhưng phù hợp với những ràng buộc triển khai và hệ sinh thái phát triển hơi khác nhau.
- Chọn YOLOv9 nếu: Bạn cần sử dụng tham số hiệu quả cao và suy luận nhanh trên thiết bị biên. YOLOv9 đẩy giới hạn lý thuyết về hiệu quả của CNN, khiến model phù hợp với môi trường có tài nguyên tính toán bị giới hạn nghiêm ngặt.
- Chọn RTDETRv2 nếu: Bạn cần khả năng hiểu ngữ cảnh tinh tế mà Transformer mang lại, đặc biệt trong các cảnh bị che khuất nghiêm trọng hoặc có mối quan hệ phức tạp giữa các vật thể, đồng thời có đủ phần cứng để hỗ trợ kiến trúc nặng hơn đôi chút.
- Chọn YOLO26 (được đề xuất) nếu: Bạn muốn có được những ưu điểm tốt nhất của cả hai thế giới. Là thế hệ mới nhất hiện có trên Nền tảng Ultralytics, YOLO26 có Thiết kế đầu-cuối không cần NMS (
nms=False) tùy chọn—tương tự model DETR nhưng nhanh hơn nhiều—giúp loại bỏ các nút thắt hậu xử lý và tăng tốc suy luận trên CPU lên đến 43% so với các thế hệ trước.
Thông số kỹ thuật và nhóm tác giả#
Hiểu nguồn gốc và mục đích thiết kế của các model này sẽ cung cấp bối cảnh quan trọng cho những lựa chọn kiến trúc.
YOLOv9#
- Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica
- Ngày: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Các cải tiến kiến trúc#
YOLOv9: Giải quyết nút thắt thông tin#
YOLOv9 giới thiệu hai cải tiến lớn nhằm giải quyết tình trạng mất thông tin khi dữ liệu đi qua các mạng neural sâu:
- Thông tin Gradient có thể lập trình (PGI): Framework giám sát phụ trợ này đảm bảo tạo ra các gradient đáng tin cậy để cập nhật trọng số mạng, đồng thời bảo toàn thông tin đặc trưng quan trọng ngay cả ở các lớp rất sâu của mạng.
- Mạng tổng hợp lớp hiệu quả tổng quát (GELAN): Một kiến trúc mới kết hợp các ưu điểm của CSPNet và ELAN. GELAN tối ưu hiệu quả tham số, cho phép YOLOv9 đạt độ chính xác cao hơn với ít FLOPs hơn so với các CNN truyền thống.
RTDETRv2: Nâng cao hiệu năng của Transformer thời gian thực#
Được phát triển dựa trên thành công của RT-DETR bản gốc, RTDETRv2 sử dụng kiến trúc dựa trên Transformer, vốn không cần đến Non-Maximum Suppression (NMS). Các cải tiến bao gồm:
- Chiến lược Bag-of-Freebies: Phiên bản v2 tích hợp các kỹ thuật huấn luyện tiên tiến và phương pháp tăng cường dữ liệu giúp cải thiện đáng kể độ chính xác mà không làm tăng độ trễ suy luận.
- Encoder lai hiệu quả: Bằng cách xử lý đặc trưng đa tỷ lệ thông qua cơ chế attention nội tỷ lệ và liên tỷ lệ được tách biệt, RTDETRv2 quản lý hiệu quả chi phí tính toán vốn thường rất cao của Vision Transformer.
Trong khi RTDETRv2 tận dụng Transformer để phát hiện không cần NMS, kiến trúc YOLO26 mới đạt được điều này bằng một head one-to-one tùy chọn (nms=False) trong cấu trúc CNN được tối ưu hóa cao, mang lại khả năng triển khai tinh gọn tương tự nhưng có tốc độ suy luận trên edge vượt trội đáng kể.
So sánh hiệu năng#
Khi đánh giá model cho môi trường production, sự đánh đổi giữa độ chính xác và yêu cầu tính toán là yếu tố then chốt. Bảng dưới đây trình bày hiệu năng của các kích thước model khác nhau trên những benchmark tiêu chuẩn.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Phân tích#
Như dữ liệu cho thấy, YOLOv9 duy trì lợi thế rõ rệt về hiệu quả tham số. Model YOLOv9c đạt 53.0 mAP ấn tượng chỉ với 25.5M tham số, nhờ đó có kích thước cực kỳ nhỏ gọn.
Ngược lại, RTDETRv2 cạnh tranh mạnh ở các nhóm model cỡ trung đến lớn. Tuy nhiên, điều này đi kèm số lượng tham số cao hơn và FLOPs lớn hơn đáng kể, vốn là đặc điểm thường thấy ở các model Transformer. Khác biệt kiến trúc này cũng ảnh hưởng đến mức sử dụng bộ nhớ: các model YOLO thường cần ít bộ nhớ CUDA hơn rất nhiều trong cả quá trình huấn luyện lẫn suy luận so với các model Transformer.
Ưu thế của Ultralytics: Hệ sinh thái và tính linh hoạt#
Dù các chỉ số kiến trúc thuần túy rất quan trọng, hệ sinh thái phần mềm thường quyết định thành công của một dự án AI. Việc truy cập các model tiên tiến này thông qua Ultralytics Python API mang lại những lợi thế vượt trội.
Tinh giản quy trình huấn luyện và triển khai#
Việc huấn luyện một Detection Transformer thường đòi hỏi các file cấu hình phức tạp và GPU cao cấp. Với framework Ultralytics, developer có thể huấn luyện cả model YOLOv9 và RT-DETR bằng cùng một cú pháp đơn giản, đồng thời tận dụng pipeline huấn luyện hiệu quả cao và các trọng số đã huấn luyện sẵn, luôn sẵn sàng sử dụng.
from ultralytics import RTDETR, YOLO
# Huấn luyện một model YOLOv9
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Huấn luyện một model RTDETR bằng chính API đó
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Xuất model sang OpenVINO hoặc TensorRT một cách liền mạch
model_yolo.export(format="openvino")Tính linh hoạt đa tác vụ vượt trội#
Một hạn chế lớn của các model chuyên biệt như RTDETRv2 là chỉ tập trung vào phát hiện bounding box. Ngược lại, hệ sinh thái Ultralytics rộng hơn, bao gồm các model như YOLO11 và YOLOv8, hỗ trợ nhiều tác vụ thị giác máy tính. Các tác vụ này bao gồm phân đoạn instance chính xác đến từng pixel, ước tính pose bộ xương, phân loại toàn ảnh và phát hiện Bounding Box định hướng (OBB) trong ảnh chụp từ trên không.
Ứng dụng thực tế#
Phân tích edge tốc độ cao#
Đối với môi trường bán lẻ hoặc dây chuyền sản xuất cần nhận diện sản phẩm theo thời gian thực trên thiết bị edge, YOLOv9 là lựa chọn vượt trội. Kiến trúc GELAN đảm bảo thông lượng cao trên phần cứng hạn chế như dòng NVIDIA Jetson, cho phép kiểm soát chất lượng tự động mà không bị trễ đáng kể.
Phân tích cảnh phức tạp#
Trong các tình huống như giám sát đám đông dày đặc hoặc giao lộ phức tạp, nơi các đối tượng thường che khuất lẫn nhau, cơ chế attention toàn cục của RTDETRv2 phát huy hiệu quả. Khả năng suy luận trực tiếp về ngữ cảnh toàn ảnh giúp model duy trì khả năng tracking và phát hiện ổn định ngay cả khi đối tượng bị che khuất một phần.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOv9 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và hệ sinh thái mà bạn ưu tiên.
Khi nào nên chọn YOLOv9#
YOLOv9 là lựa chọn phù hợp cho:
- Nghiên cứu về nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
- Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các lớp mạng sâu khi huấn luyện.
- Đánh giá hiệu năng phát hiện độ chính xác cao: Các tình huống cần hiệu năng mạnh của YOLOv9 trên benchmark COCO làm mốc tham chiếu để so sánh kiến trúc.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
- Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Tương lai: YOLO26 ra mắt#
Dù YOLOv9 và RTDETRv2 là những thành tựu lớn, lĩnh vực thị giác máy tính vẫn phát triển nhanh chóng. Với developer muốn bắt đầu dự án mới, YOLO26 là giải pháp tiên tiến nhất được khuyến nghị.
Ra mắt năm 2026, YOLO26 tích hợp những tính năng ưu việt của cả CNN lẫn DETR. Model có Thiết kế đầu-cuối không cần NMS tùy chọn (nms=False), loại bỏ bước hậu xử lý NMS — kỹ thuật được tiên phong lần đầu trong YOLOv10. Ngoài ra, YOLO26 loại bỏ Distribution Focal Loss (DFL) để tăng khả năng tương thích với thiết bị edge và giới thiệu Bộ tối ưu MuSGD mang tính đột phá. Lấy cảm hứng từ quá trình huấn luyện Large Language Model (cụ thể là Kimi K2 của Moonshot AI), bộ tối ưu lai này đảm bảo độ ổn định huấn luyện chưa từng có và hội tụ nhanh hơn.
Kết hợp ProgLoss và STAL (Progressive Loss và gán nhãn nhận biết đối tượng nhỏ) để nhận diện vật thể nhỏ vượt trội, YOLO26 cho tốc độ suy luận trên CPU nhanh hơn đến 43%, củng cố vị thế là model tối ưu cho các hoạt động triển khai AI hiện đại.