Ultralytics YOLO27:
Get Started

RTDETRv2 và PP-YOLOE+#

Lĩnh vực thị giác máy tính phát triển nhanh chóng đã tạo ra nhiều hướng tiếp cận kiến trúc khác nhau để giải quyết các thách thức phát hiện đối tượng thời gian thực phức tạp. Trong số những tiến bộ gần đây đáng chú ý nhất là RTDETRv2 và PP-YOLOE+, hai model mạnh mẽ tiếp cận nhận dạng hình ảnh theo những triết lý thiết kế khác biệt căn bản. Cả hai model đều hướng tới khả năng phát hiện hiệu năng cao, nhưng cơ chế cốt lõi, phương pháp huấn luyện và kịch bản triển khai lý tưởng khác nhau đáng kể.

Hướng dẫn toàn diện này đi sâu vào các khía cạnh kỹ thuật của cả hai model, so sánh kiến trúc, chỉ số hiệu năng và mức độ hỗ trợ của hệ sinh thái để giúp developer và nhà nghiên cứu lựa chọn giải pháp tối ưu cho nhu cầu triển khai cụ thể.

Tổng quan về model#

Trước khi phân tích dữ liệu hiệu năng, cần hiểu nguồn gốc và mục tiêu kiến trúc của từng model. Cả hai đều bắt nguồn từ các nhóm nghiên cứu tại Baidu, nhưng đại diện cho những nhánh khác nhau trong hệ phân loại model phát hiện đối tượng.

RTDETRv2#

RTDETRv2 đánh dấu bước tiến đáng kể trong kiến trúc thị giác dựa trên Transformer. Dựa trên Real-Time Detection Transformer gốc, model kết hợp backbone CNN với hybrid encoder hiệu quả và decoder Transformer. Đặc điểm nổi bật nhất là khả năng dự đoán end-to-end vốn có, loại bỏ hoàn toàn nhu cầu sử dụng Non-Maximum Suppression (NMS) trong quá trình hậu xử lý.

  • Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
  • Tổ chức: Baidu
  • Ngày: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub: Repository RT-DETR

Tìm hiểu thêm về RTDETRv2

PP-YOLOE+#

PP-YOLOE+ là phiên bản cải tiến của dòng YOLO, được tối ưu mạnh mẽ cho các ứng dụng công nghiệp hiệu năng cao. Model có kiến trúc CNN có khả năng mở rộng với head phát hiện không cần anchor. Được thiết kế để mang lại sự cân bằng vượt trội giữa tốc độ và độ chính xác, model giới thiệu các kỹ thuật mạnh mẽ như ET-head và hàm generalized focal loss nhằm cải thiện khả năng phát hiện vật thể nhỏ.

Tìm hiểu thêm về PP-YOLOE+

Tích hợp hệ sinh thái

Dù mỗi model đều có repository nghiên cứu riêng, bạn vẫn có thể dễ dàng thử nghiệm RT-DETR gốc trực tiếp trong package Python Ultralytics, tận dụng API hợp nhất và các tùy chọn export tinh gọn.

Khác biệt về kiến trúc#

Khác biệt cơ bản giữa hai model này nằm ở cách xử lý ngữ cảnh hình ảnh và tạo dự đoán.

PP-YOLOE+ sử dụng backbone Mạng nơ-ron tích chập (CNN) truyền thống nhưng được tối ưu cao. Model dựa vào các trường tiếp nhận cục bộ để trích xuất đặc trưng, nhờ đó cực kỳ nhanh và hiệu quả khi triển khai tiêu chuẩn. Tuy nhiên, model vẫn cần hậu xử lý NMS tiêu chuẩn để lọc các bounding box chồng lấp, có thể gây nghẽn độ trễ trong các cảnh dày đặc.

Ngược lại, RTDETRv2 sử dụng Hybrid Encoder và Transformer Decoder. Nhờ đó, model có thể nắm bắt ngữ cảnh toàn cục trên toàn bộ ảnh cùng lúc. Các cơ chế chú ý vốn hiểu được mối quan hệ giữa các đối tượng, cho phép model xuất trực tiếp bounding box cuối cùng mà không cần NMS. Phương pháp end-to-end này đảm bảo độ trễ suy luận ổn định bất kể số lượng đối tượng được phát hiện.

Chỉ số hiệu năng và so sánh#

Khi đánh giá chỉ số hiệu năng YOLO, việc cân bằng độ chính xác (mAP) với chi phí tính toán (FLOPs) và tốc độ suy luận là rất quan trọng. Bảng dưới đây nêu bật hiệu năng của hai model ở nhiều kích thước khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

PP-YOLOE+x đạt mAPval cao hơn một chút, ở mức 54,7% trên dataset COCO, trong khi các model RTDETRv2 nhìn chung đạt độ chính xác cạnh tranh và có thêm lợi thế về độ trễ ổn định nhờ thiết kế không cần NMS. Tuy nhiên, PP-YOLOE+ có lợi thế rõ rệt về số lượng tham số và FLOPs ở các model nhỏ hơn, giúp model hoạt động hiệu quả cao khi triển khai trên thiết bị biên.

Lợi thế Ultralytics: Giới thiệu YOLO26#

Dù RTDETRv2 và PP-YOLOE+ đều có thế mạnh riêng, công nghệ tiên tiến nhất vẫn tiếp tục phát triển. Với developer muốn đạt sự cân bằng tối ưu giữa tốc độ, độ chính xác và hỗ trợ hệ sinh thái, Ultralytics YOLO26 là tiêu chuẩn công nghiệp mới.

YOLO26 kết hợp những ưu điểm tốt nhất của CNN và Transformer. Model áp dụng chế độ suy luận end-to-end không cần NMS tùy chọn (nms=False), được các kiến trúc hiện đại tiên phong, giúp loại bỏ nghẽn hậu xử lý khi bật chế độ này. Ngoài ra, model giới thiệu Optimizer MuSGD mang tính đột phá, phương pháp lai lấy cảm hứng từ các đổi mới trong huấn luyện LLM nhằm đảm bảo quá trình huấn luyện ổn định cao và hội tụ nhanh.

Tối ưu cho thiết bị biên

Khác với các model Transformer nặng cần nhiều bộ nhớ CUDA, YOLO26 loại bỏ DFL (Distribution Focal Loss) và được tối ưu chuyên biệt cho điện toán biên, giúp suy luận CPU nhanh hơn tới 43% so với các thế hệ trước.

Ngoài ra, YOLO26 không chỉ giới hạn ở tác vụ phát hiện đối tượng đơn giản. Model linh hoạt ngay từ đầu, hỗ trợ sẵn phân đoạn instance, ước tính tư thế và bounding box định hướng (OBB), trong khi PP-YOLOE+ chủ yếu tập trung vào phát hiện bounding box.

Phương pháp huấn luyện và hệ sinh thái#

Hiệu quả huấn luyện và tính dễ sử dụng là những điểm khiến hệ sinh thái Ultralytics thực sự nổi bật so với các repository nghiên cứu riêng lẻ. PP-YOLOE+ sử dụng framework PaddlePaddle, còn RTDETRv2 thường đòi hỏi thiết lập môi trường phức tạp; tích hợp model thông qua Ultralytics mang lại trải nghiệm liền mạch.

Với API Ultralytics, bạn được hưởng lợi từ yêu cầu bộ nhớ thấp hơn trong quá trình huấn luyện, xử lý dataset tự động và tinh chỉnh hyperparameter đơn giản hơn. Ngoài ra, có thể triển khai model sang các định dạng production như ONNX hoặc TensorRT chỉ bằng một lệnh.

Ví dụ code: Suy luận tinh gọn#

Dưới đây là minh họa cách dễ dàng sử dụng RT-DETR cùng model YOLO26 được khuyến nghị bằng package Python Ultralytics:

from ultralytics import RTDETR, YOLO

# Khởi tạo model RT-DETR (Ultralytics hỗ trợ RT-DETR-L và RT-DETR-X gốc)
model_rtdetr = RTDETR("rtdetr-l.pt")

# Thực hiện suy luận không cần NMS trên ảnh kiểm thử
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# Khởi tạo model YOLO26 mới nhất để có tốc độ và tính linh hoạt vượt trội
model_yolo26 = YOLO("yolo26n.pt")

# Huấn luyện model YOLO26 dễ dàng với mức sử dụng bộ nhớ được tối ưu hóa
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# Xuất sang TensorRT để triển khai trên thiết bị biên
model_yolo26.export(format="engine")

Ứng dụng và trường hợp sử dụng trong thực tế#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào phần cứng cụ thể và yêu cầu của ứng dụng.

  • RTDETRv2 vượt trội trong các môi trường phía máy chủ và khả năng hiểu cảnh phức tạp. Cơ chế attention toàn cục giúp model này hoạt động đặc biệt hiệu quả trong quản lý đám đông và phân tích ảnh y tế có mật độ cao, nơi các đối tượng chồng lấp thường khiến những thuật toán NMS tiêu chuẩn thất bại.
  • PP-YOLOE+ rất phù hợp cho hoạt động kiểm tra công nghiệp tốc độ cao và các môi trường đầu tư mạnh vào hệ sinh thái PaddlePaddle. Số lượng tham số thấp ở các quy mô nhỏ hơn giúp model này khả thi trong một số ứng dụng robot.
  • Ultralytics YOLO26 là giải pháp được khuyến nghị rộng rãi cho hoạt động triển khai thương mại toàn diện. Với các hàm ProgLoss + STAL được cải tiến, model này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt đối với hoạt động của drone trên không và giám sát giao thông đô thị thông minh.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa RT-DETR và PP-YOLOE+ phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn RT-DETR#

RT-DETR là lựa chọn phù hợp cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
  • Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ được khuyến nghị trong các trường hợp:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
  • Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Kết luận#

Cả RTDETRv2 và PP-YOLOE+ đều mở rộng giới hạn những gì có thể thực hiện trong thị giác máy tính, chứng minh tính khả thi của cả kiến trúc Transformer lẫn CNN được tối ưu hóa cao. Tuy nhiên, sự phức tạp khi triển khai các codebase nghiên cứu rời rạc có thể cản trở tiến độ đưa vào production.

Đối với các kỹ sư AI hiện đại, việc tận dụng Ultralytics Platform mang lại lợi thế vượt trội. Bằng cách chuyển sang các model được tích hợp liền mạch như YOLO11 hoặc YOLO26 tiên tiến nhất, các nhóm có thể đạt tỷ lệ độ chính xác trên tốc độ cao nhất có thể, đồng thời giảm đáng kể yêu cầu bộ nhớ và chi phí phát triển.

Người đóng góp

Bình luận