YOLO Vision 2026:

YOLOv9 so với RTDETRv2#

Bối cảnh phát hiện đối tượng thời gian thực đã trải qua một sự thay đổi mô hình trong những năm gần đây. Hai triết lý kiến trúc riêng biệt đã nổi lên để thống trị lĩnh vực này: Mạng nơ-ron tích chập (CNN) được tối ưu hóa cao và Transformer phát hiện thời gian thực (DETR). Đại diện cho đỉnh cao của hai phương pháp này là YOLOv9RTDETRv2.

Hướng dẫn toàn diện này so sánh hai mô hình mạnh mẽ này, phân tích các đổi mới về kiến trúc, chỉ số hiệu suất và các kịch bản triển khai lý tưởng để giúp bạn chọn mô hình phù hợp cho đường ống thị giác máy tính của mình.

Tóm tắt điều hành#

Cả hai mô hình đều đạt được kết quả hiện đại nhất, nhưng chúng phục vụ các ràng buộc triển khai và hệ sinh thái phát triển hơi khác nhau.

  • Chọn YOLOv9 nếu: Bạn cần sử dụng tham số hiệu quả cao và suy luận nhanh trên các thiết bị edge. YOLOv9 đẩy giới hạn lý thuyết về hiệu suất CNN lên mức tối đa, khiến nó trở nên lý tưởng cho các môi trường nơi tài nguyên tính toán bị giới hạn nghiêm ngặt.
  • Chọn RTDETRv2 nếu: Bạn yêu cầu sự hiểu biết ngữ cảnh chi tiết mà Transformer cung cấp, đặc biệt là trong các cảnh có sự che khuất nghiêm trọng hoặc các mối quan hệ đối tượng phức tạp, và bạn có phần cứng để hỗ trợ một kiến trúc nặng hơn một chút.
  • Chọn YOLO26 (Khuyên dùng) nếu: Bạn muốn có những tính năng tốt nhất từ cả hai thế hệ. Là thế hệ mới nhất có sẵn trên Ultralytics Platform, YOLO26 có Thiết kế không NMS đầu cuối nguyên bản (tương tự như các mô hình DETR nhưng nhanh hơn nhiều), loại bỏ các điểm nghẽn hậu xử lý và mang lại tốc độ suy luận CPU nhanh hơn tới 43% so với các thế hệ trước.

Thông số kỹ thuật và Quyền tác giả#

Hiểu về nguồn gốc và ý định thiết kế của các mô hình này cung cấp bối cảnh quan trọng cho các lựa chọn kiến trúc của chúng.

YOLOv9#

Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
Tổ chức: Institute of Information Science, Academia Sinica
Ngày: 2024-02-21
Arxiv: https://arxiv.org/abs/2402.13616
GitHub: WongKinYiu/yolov9

Tìm hiểu thêm về YOLOv9

RTDETRv2#

Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, và Yi Liu
Tổ chức: Baidu
Ngày: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR

Tìm hiểu thêm về RTDETR

Cải tiến kiến trúc#

YOLOv9: Giải quyết nút thắt thông tin#

Ultralytics YOLOv9 giới thiệu hai đổi mới chính được thiết kế để giải quyết vấn đề mất thông tin khi dữ liệu đi qua các mạng nơ-ron sâu:

  1. Programmable Gradient Information (PGI): Khung giám sát bổ trợ này đảm bảo rằng các gradient đáng tin cậy được tạo ra để cập nhật trọng số mạng, bảo tồn thông tin đặc trưng quan trọng ngay cả trong các lớp mạng rất sâu.
  2. Generalized Efficient Layer Aggregation Network (GELAN): Một kiến trúc mới kết hợp sức mạnh của CSPNet và ELAN. GELAN tối ưu hóa hiệu quả tham số, cho phép YOLOv9 đạt độ chính xác cao hơn với ít FLOPs hơn so với các CNN truyền thống.

RTDETRv2: Nâng cao các Transformer thời gian thực#

Dựa trên thành công của RT-DETR gốc, RTDETRv2 sử dụng kiến trúc dựa trên Transformer nhằm tránh việc cần dùng Bộ triệt lọc phi cực đại (NMS) từ bản chất. Các cải tiến của mô hình bao gồm:

  1. Chiến lược Bag-of-Freebies: Phiên bản v2 kết hợp các kỹ thuật huấn luyện nâng cao và tăng cường dữ liệu giúp tăng đáng kể độ chính xác mà không làm tăng thêm độ trễ suy luận.
  2. Efficient Hybrid Encoder: Bằng cách xử lý các đặc trưng đa quy mô thông qua cơ chế chú ý decoupled intra-scale và cross-scale, RTDETRv2 quản lý hiệu quả chi phí tính toán cao vốn có của Vision Transformers.
Phát hiện End-to-End tự nhiên

Trong khi RTDETRv2 tận dụng các Transformer để phát hiện không cần NMS, kiến trúc YOLO26 mới đạt được điều này một cách nguyên bản trong cấu trúc CNN được tối ưu hóa cao, mang lại quá trình triển khai tối ưu tương tự nhưng với tốc độ suy luận trên thiết bị biên vượt trội đáng kể.

So sánh hiệu năng#

Khi đánh giá các mô hình cho môi trường sản xuất, sự đánh đổi giữa độ chính xác và các yêu cầu tính toán là vô cùng quan trọng. Bảng dưới đây phác thảo hiệu suất của các kích thước mô hình khác nhau trên các chuẩn mực tiêu chuẩn.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Phân tích#

Như dữ liệu cho thấy, YOLOv9 duy trì lợi thế nghiêm ngặt về hiệu quả tham số. Mô hình YOLOv9c đạt 53.0 mAP ấn tượng chỉ với 25.3M tham số, khiến nó trở nên nhẹ đáng kinh ngạc.

Ngược lại, RTDETRv2 mang lại sự cạnh tranh mạnh mẽ trong các danh mục mô hình cỡ trung bình đến lớn. Tuy nhiên, điều này đi kèm với cái giá là số lượng tham số cao hơn và FLOP lớn hơn đáng kể, vốn là đặc trưng của các mô hình Transformer. Sự khác biệt về kiến trúc này cũng chuyển hóa thành mức sử dụng bộ nhớ: các mô hình YOLO thường yêu cầu ít bộ nhớ CUDA hơn rất nhiều trong cả quá trình huấn luyện và suy luận so với các đối thủ Transformer của chúng.

Lợi thế của Ultralytics: Hệ sinh thái và Tính linh hoạt#

Mặc dù các chỉ số kiến trúc thuần túy rất quan trọng, hệ sinh thái phần mềm thường quyết định thành công của một dự án AI. Việc truy cập các mô hình nâng cao này thông qua Ultralytics Python API mang lại những lợi thế chưa từng có.

Huấn luyện và Triển khai tinh gọn#

Huấn luyện một Detection Transformer thường đòi hỏi các tệp cấu hình phức tạp và GPU cao cấp. Bằng cách sử dụng Ultralytics framework, các nhà phát triển có thể huấn luyện cả mô hình YOLOv9 và RT-DETR với cú pháp đơn giản, giống hệt nhau, đồng thời hưởng lợi từ các đường ống huấn luyện hiệu quả cao và trọng số được huấn luyện sẵn có sẵn.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

Tính linh hoạt tác vụ chưa từng có#

Một hạn chế lớn của các mô hình chuyên biệt như RTDETRv2 là sự tập trung hẹp của chúng vào việc phát hiện bounding box. Ngược lại, hệ sinh thái Ultralytics rộng lớn hơn, bao gồm các mô hình như YOLO11YOLOv8, hỗ trợ một loạt các tác vụ thị giác máy tính. Điều này bao gồm phân đoạn thực thể chính xác đến từng pixel, ước lượng tư thế theo khung xương, phân loại toàn ảnh và phát hiện Oriented Bounding Box (OBB) cho hình ảnh trên không.

Ứng dụng trong thực tế#

Phân tích Edge tốc độ cao#

Đối với môi trường bán lẻ hoặc dây chuyền sản xuất yêu cầu nhận dạng sản phẩm thời gian thực trên các thiết bị biên, YOLOv9 là sự lựa chọn vượt trội. Kiến trúc GELAN của nó đảm bảo thông lượng cao trên phần cứng bị giới hạn như dòng NVIDIA Jetson, cho phép kiểm soát chất lượng tự động mà không bị chậm trễ đáng kể.

Phân tích cảnh phức tạp#

Trong các tình huống như giám sát đám đông dày đặc hoặc các giao lộ giao thông phức tạp nơi các đối tượng thường xuyên che khuất lẫn nhau, cơ chế chú ý toàn cục của RTDETRv2 thực sự tỏa sáng. Khả năng lập luận tự nhiên về toàn bộ ngữ cảnh hình ảnh của mô hình cho phép nó duy trì theo dõi và phát hiện mạnh mẽ ngay cả khi các đối tượng bị che khuất một phần.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa YOLOv9 và RT-DETR phụ thuộc vào các yêu cầu cụ thể của dự án, các ràng buộc triển khai và sở thích hệ sinh thái của bạn.

Khi nào nên chọn YOLOv9#

YOLOv9 là lựa chọn mạnh mẽ cho:

  • Nghiên cứu Nút thắt Thông tin (Information Bottleneck): Các dự án học thuật nghiên cứu về Programmable Gradient Information (PGI) và kiến trúc Generalized Efficient Layer Aggregation Network (GELAN).
  • Nghiên cứu Tối ưu hóa Luồng Gradient: Nghiên cứu tập trung vào việc hiểu và giảm thiểu tình trạng mất thông tin trong các lớp mạng sâu trong quá trình huấn luyện.
  • Đo lường Phát hiện Độ chính xác cao: Các kịch bản mà hiệu suất đo lường trên bộ dữ liệu COCO của YOLOv9 cần thiết làm điểm tham chiếu cho các so sánh kiến trúc.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyên dùng cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án khám phá cơ chế chú ý và kiến trúc transformer cho phát hiện vật thể end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng mà độ chính xác phát hiện là ưu tiên hàng đầu và độ trễ suy luận cao hơn một chút là có thể chấp nhận được.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể từ trung bình đến lớn, nơi cơ chế chú ý toàn cục của các transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Tương lai: Chào đón YOLO26#

Mặc dù YOLOv9 và RTDETRv2 đại diện cho những thành tựu lớn, lĩnh vực thị giác máy tính vẫn tiến triển rất nhanh. Đối với các nhà phát triển muốn bắt đầu các dự án mới, YOLO26 là giải pháp tối tân được khuyến nghị.

Ra mắt vào năm 2026, YOLO26 kết hợp các tính năng tốt nhất của cả CNN và DETR. Nó có Thiết kế không NMS đầu cuối, hoàn toàn loại bỏ độ trễ xử lý hậu kỳ—một kỹ thuật lần đầu tiên được tiên phong trong YOLOv10. Hơn nữa, YOLO26 loại bỏ Distribution Focal Loss (DFL) để tương thích với thiết bị biên tốt hơn và giới thiệu MuSGD Optimizer mang tính cách mạng. Lấy cảm hứng từ việc huấn luyện Mô hình Ngôn ngữ Lớn (đặc biệt là Kimi K2 của Moonshot AI), bộ tối ưu hóa kết hợp này đảm bảo tính ổn định huấn luyện chưa từng có và thời gian hội tụ nhanh hơn.

Kết hợp với các hàm mất mát cải tiến như ProgLoss và STAL cho khả năng nhận diện đối tượng nhỏ đặc biệt, YOLO26 mang lại tốc độ suy luận CPU nhanh hơn tới 43%, củng cố vị thế của nó là mô hình tối ưu cho các triển khai AI hiện đại.

Người đóng góp

Bình luận