Ultralytics YOLO27:
Get Started

RTDETRv2 và YOLOv9#

Lĩnh vực thị giác máy tính đã chứng kiến sự khác biệt thú vị về triết lý kiến trúc, chủ yếu giữa Mạng nơ-ron tích chập (CNN) và model dựa trên Transformer. Khi so sánh RTDETRv2 và YOLOv9, về cơ bản nhà phát triển đang đánh giá sự đánh đổi giữa cơ chế attention toàn cục và thông tin gradient có thể lập trình. Cả hai model đều đại diện cho đỉnh cao của hệ hình tương ứng, góp phần mở rộng giới hạn của tác vụ phát hiện đối tượng thời gian thực.

Giới thiệu các model#

RTDETRv2: Real-Time Detection Transformer#

Được các nhà nghiên cứu tại Baidu phát triển, RTDETRv2 kế thừa RT-DETR ban đầu và bổ sung phương pháp "Bag-of-Freebies" để cải thiện Real-Time Detection Transformer nền tảng. Model giải quyết nút thắt truyền thống của Transformer—tốc độ suy luận—giúp chúng phù hợp với các ứng dụng thời gian thực.

  • Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
  • Tổ chức: Baidu
  • Ngày: 2024-07-24
  • Liên kết: Arxiv, GitHub

Đặc điểm nổi bật của RTDETRv2 là thiết kế end-to-end không cần NMS ngay từ đầu. Việc loại bỏ hoàn toàn Ức chế phi cực đại (NMS) trong quá trình hậu xử lý giúp model ổn định độ trễ suy luận và đơn giản hóa pipeline triển khai. Cơ chế attention toàn cục giúp model vượt trội trong việc hiểu cảnh phức tạp và đám đông dày đặc, vì model đánh giá đồng thời ngữ cảnh của toàn bộ ảnh.

Tìm hiểu thêm về RTDETRv2

YOLOv9: Thông tin gradient có thể lập trình#

YOLOv9, một kiến trúc dựa trên CNN có hiệu quả cao, giải quyết vấn đề nút thắt thông tin vốn có trong mạng nơ-ron sâu. Model giới thiệu Thông tin gradient có thể lập trình (PGI) và Mạng tổng hợp lớp hiệu quả tổng quát (GELAN).

YOLOv9 dựa trên nền tảng mạng nơ-ron tích chập đã được kiểm chứng nhưng tối đa hóa hiệu quả tham số. Bằng cách giữ lại thông tin quan trọng trong quá trình truyền xuôi, model đảm bảo cập nhật trọng số đáng tin cậy, tạo nên model cực kỳ gọn nhẹ nhưng có độ chính xác cao. Tuy nhiên, khác với RTDETRv2, YOLOv9 vẫn sử dụng hậu xử lý NMS tiêu chuẩn.

Tìm hiểu thêm về YOLOv9

Hiệu năng và hiệu quả sử dụng tài nguyên#

Khi đánh giá các model cho môi trường production, việc cân bằng độ chính xác trung bình (mAP) với chi phí tính toán là yếu tố then chốt. Bảng dưới đây minh họa hiệu năng của chúng trên dataset MS COCO.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Yêu cầu bộ nhớ và hiệu quả huấn luyện#

Transformer như RTDETRv2 nổi tiếng là tiêu tốn nhiều bộ nhớ trong quá trình huấn luyện, thường cần lượng bộ nhớ CUDA đáng kể và lịch trình huấn luyện dài hơn để hội tụ hoàn toàn. Ngược lại, kiến trúc CNN như YOLOv9 và các model Ultralytics YOLO khác có mức sử dụng bộ nhớ thấp hơn đáng kể, cho phép nhà phát triển huấn luyện với batch size lớn hơn trên phần cứng phổ thông.

Huấn luyện hiệu quả

Để tối đa hóa khả năng khai thác phần cứng, hãy cân nhắc sử dụng Nền tảng Ultralytics để đơn giản hóa quy trình huấn luyện trên đám mây. Nền tảng tự động xử lý thiết lập môi trường và lựa chọn batch size tối ưu.

Lợi thế Ultralytics: Hệ sinh thái và tính dễ sử dụng#

Nghiên cứu các repository độc lập như trang GitHub chính thức của RTDETRv2 hoặc YOLOv9 có thể mang lại nhiều kiến thức, nhưng môi trường production đòi hỏi tính ổn định, dễ sử dụng và hệ sinh thái được duy trì tốt. Tích hợp các model này thông qua API Python của Ultralytics mang đến trải nghiệm phát triển liền mạch.

API thống nhất và tính linh hoạt#

Framework Ultralytics trừu tượng hóa những phức tạp trong việc tải dữ liệu, tăng cường dữ liệu và huấn luyện phân tán. Ngoài ra, trong khi RTDETRv2 ban đầu chỉ tập trung vào phát hiện, hệ sinh thái Ultralytics cho phép người dùng dễ dàng chuyển đổi giữa Phát hiện đối tượng, Phân đoạn instance và Ước tính tư thế.

from ultralytics import RTDETR, YOLO

# Huấn luyện model YOLOv9 trên dữ liệu tùy chỉnh
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Dễ dàng chuyển sang RT-DETR để đánh giá các cảnh phức tạp
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# Xuất sang các định dạng sẵn sàng cho production như TensorRT
model_yolo.export(format="engine")

Với tài liệu đầy đủ, tính năng theo dõi thử nghiệm tự động và khả năng xuất model liền mạch sang các định dạng như ONNX, TensorRT và OpenVINO, Ultralytics rút ngắn đáng kể thời gian từ giai đoạn tạo mẫu đến khi đưa vào production.

Các trường hợp sử dụng phù hợp nhất#

RTDETRv2 phát huy thế mạnh ở đâu#

Nhờ cơ chế attention toàn cục, RTDETRv2 đặc biệt phù hợp với xử lý phía máy chủ và các môi trường đòi hỏi ngữ cảnh toàn cục. Model này phát huy thế mạnh trong các lĩnh vực sau:

  • Chẩn đoán hình ảnh y tế: Phát hiện những bất thường khó nhận biết, nơi ngữ cảnh xung quanh đóng vai trò then chốt.
  • Giám sát trên không: Phát hiện vật thể nhỏ trong video drone độ phân giải cao mà không gặp các thiên lệch không gian thường thấy ở phép tích chập CNN truyền thống.
  • Phân tích đám đông đông đúc: Theo dõi từng cá nhân trong những tình huống mà hiện tượng che khuất nghiêm trọng thường gây nhầm lẫn cho các model dựa trên anchor.

YOLOv9 phát huy thế mạnh ở đâu#

YOLOv9 là lựa chọn hàng đầu cho triển khai edge với tài nguyên hạn chế. Hiệu quả tính toán giúp model này trở nên lý tưởng cho:

  • Robot: Điều hướng và tránh vật cản theo thời gian thực trong các ứng dụng đòi hỏi độ trễ tối thiểu.
  • IoT đô thị thông minh: Triển khai trên các thiết bị edge như NVIDIA Jetson để giám sát giao thông.
  • Kiểm tra công nghiệp: Kiểm soát chất lượng trên dây chuyền lắp ráp tốc độ cao, đòi hỏi FPS cao.

Tương lai: Giới thiệu Ultralytics YOLO26#

Mặc dù YOLOv9 và RTDETRv2 đánh dấu những bước tiến vượt bậc, lĩnh vực này đã phát triển nhanh chóng. Với các hoạt động triển khai hiện đại, Ultralytics YOLO26 mới ra mắt là sự kết hợp tối ưu của cả hai triết lý kiến trúc.

Kết hợp những ưu điểm tốt nhất của Transformer và CNN, YOLO26 thiết lập một tiêu chuẩn mới:

  • Thiết kế end-to-end không cần NMS: Tương tự RTDETRv2, YOLO26 hỗ trợ suy luận end-to-end gốc, bỏ qua bước hậu xử lý NMS bằng nms=False để tạo các pipeline triển khai nhanh hơn, đơn giản hơn và có tính dự đoán cao.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện Mô hình Ngôn ngữ Lớn (LLM) (chẳng hạn như Kimi K2 của Moonshot AI), YOLO26 sử dụng phương pháp kết hợp SGD và Muon. Phương pháp này mang lại độ ổn định huấn luyện vượt trội và khả năng hội tụ nhanh cho thị giác máy tính.
  • Suy luận CPU nhanh hơn đến 43%: Khác với Transformer nặng, YOLO26 được tối ưu mạnh cho điện toán edge và các thiết bị không có GPU.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa đáng kể đồ thị model, đảm bảo xuất model trơn tru sang các thiết bị edge công suất thấp và Bộ xử lý thần kinh (NPUs) nhúng.
  • ProgLoss + STAL: Các hàm loss cải tiến này nâng cao đáng kể khả năng nhận diện vật thể nhỏ, một tính năng thiết yếu đối với IoT và các bộ dữ liệu trên không.

Với các nhóm bắt đầu một dự án thị giác máy tính mới, chúng tôi đặc biệt khuyến nghị đánh giá YOLO26. Model này kết hợp sự tinh gọn tùy chọn, không cần NMS của Transformer với tốc độ vượt trội và hiệu quả huấn luyện của kiến trúc YOLO được tối ưu cao.

Tóm tắt#

Việc lựa chọn giữa RTDETRv2 và YOLOv9 phần lớn phụ thuộc vào phần cứng triển khai và yêu cầu độ chính xác cụ thể. RTDETRv2 mang lại độ chính xác tiên tiến nhất và khả năng nhận biết ngữ cảnh cho các ứng dụng sử dụng máy chủ, trong khi YOLOv9 có hiệu quả vượt trội trên thiết bị edge.

Tuy nhiên, nhờ tận dụng hệ sinh thái Ultralytics trưởng thành, nhà phát triển có thể dễ dàng thử nghiệm cả YOLOv9 lẫn RT-DETR bản gốc. Hơn nữa, với sự ra mắt của các model mới hơn như YOLO11 và YOLO26 end-to-end gốc, việc tìm ra sự cân bằng tối ưu giữa suy luận tốc độ cao, hỗ trợ tác vụ linh hoạt và mức tiêu thụ bộ nhớ thấp chưa bao giờ dễ dàng hơn.

Người đóng góp

Bình luận