PP-YOLOE+ vs RTDETRv2#
Lĩnh vực thị giác máy tính đã chứng kiến sự phát triển vượt bậc trong những năm gần đây, đặc biệt là trong lĩnh vực phát hiện đối tượng thời gian thực. Việc chọn đúng kiến trúc cho quá trình triển khai có thể tạo nên khác biệt giữa một ứng dụng chậm chạp, ngốn bộ nhớ và một hệ thống phản hồi nhanh, được tối ưu hóa cao. Trong bài so sánh kỹ thuật này, chúng ta sẽ tìm hiểu hai model nổi bật của Baidu: PP-YOLOE+ dựa trên CNN và RTDETRv2 dựa trên Transformer. Chúng ta sẽ phân tích kiến trúc, chỉ số hiệu năng và các trường hợp sử dụng lý tưởng của hai model, đồng thời xem xét cách chúng so sánh với nền tảng Ultralytics YOLO26 hiện đại nhất.
PP-YOLOE+: Thúc đẩy mô hình CNN#
Được phát triển như một phiên bản cải tiến từ các thế hệ trước, PP-YOLOE+ mở rộng giới hạn những gì Mạng nơ-ron tích chập (CNNs) truyền thống có thể đạt được trong phát hiện đối tượng. Đây là một detector không cần anchor có năng lực cao, kế thừa cơ chế nền tảng của dòng YOLO đồng thời bổ sung các tối ưu hóa cụ thể cho hệ sinh thái PaddlePaddle.
Thông tin model:
- Tác giả: Nhóm tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Kho lưu trữ PaddleDetection
- Tài liệu: Tài liệu PP-YOLOE+
Kiến trúc và phương pháp#
PP-YOLOE+ dựa vào backbone được tối ưu hóa mạnh và mạng kim tự tháp đặc trưng tùy chỉnh để tổng hợp hiệu quả các đặc trưng đa tỷ lệ. Model sử dụng thiết kế không cần anchor, giúp đơn giản hóa quá trình tinh chỉnh heuristic thường cần thiết để tạo anchor box. Ngoài ra, phương pháp huấn luyện còn bao gồm các chiến lược gán nhãn nâng cao nhằm khớp dự đoán tốt hơn với các box ground truth trong giai đoạn học.
Ưu điểm và trường hợp sử dụng#
Ưu điểm chính của PP-YOLOE+ nằm ở hiệu năng ổn định trên phần cứng máy chủ tiêu chuẩn và khả năng tích hợp sâu với các công cụ của Baidu. Model phù hợp với các quy trình công nghiệp truyền thống, chẳng hạn như phát hiện lỗi tĩnh trong môi trường sản xuất, nơi giới hạn phần cứng không quá khắt khe.
PP-YOLOE+ có độ chính xác cao, nhưng việc triển khai model bên ngoài hệ sinh thái gốc đôi khi có thể cần thêm các bước chuyển đổi, không như những định dạng export gốc sẵn có trong các pipeline Ultralytics hiện đại.
RTDETRv2: Transformer phát hiện thời gian thực#
Rời xa các CNN thuần túy, RTDETRv2 (Transformer phát hiện thời gian thực phiên bản 2) đánh dấu bước tiến sang các cơ chế dựa trên attention cho những tác vụ thị giác máy tính. Model hướng tới kết hợp khả năng nắm bắt ngữ cảnh toàn cục của Transformer với độ trễ thấp cần thiết cho các ứng dụng thực tế.
Thông tin model:
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Kho lưu trữ RTDETRv2
- Tài liệu: README của RTDETRv2
Kiến trúc và phương pháp#
RTDETRv2 sử dụng kiến trúc lai, kết hợp backbone CNN để trích xuất đặc trưng với encoder-decoder Transformer tinh gọn. Đặc điểm nổi bật của RTDETRv2 là thiết kế end-to-end gốc, bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS) truyền thống. Model cũng bổ sung các tính năng như phát hiện đa tỷ lệ và xử lý cảnh phức tạp, sử dụng self-attention để nắm bắt quan hệ không gian giữa các đối tượng ở xa nhau.
Ưu điểm và trường hợp sử dụng#
Kiến trúc Transformer giúp RTDETRv2 hoạt động hiệu quả trong các tình huống cần hiểu ngữ cảnh toàn cục. Tuy nhiên, model Transformer thường đòi hỏi lượng bộ nhớ CUDA cao hơn đáng kể trong cả huấn luyện lẫn suy luận so với CNN gọn nhẹ. Model phù hợp nhất với môi trường không bị giới hạn về phần cứng, chẳng hạn như phân tích video trên nền tảng đám mây chạy bằng các máy chủ GPU mạnh.
So sánh hiệu năng và chỉ số#
Khi đánh giá các model này, sự đánh đổi giữa độ chính xác trung bình (mAP) và chi phí tính toán (đo bằng FLOPs và độ trễ suy luận) là yếu tố then chốt. Bảng dưới đây trình bày các chỉ số chính ở nhiều quy mô khác nhau của PP-YOLOE+ và RTDETRv2.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2 đạt mAP cao nhưng cần nhiều tham số và FLOPs hơn; trong khi đó, các nhà phát triển muốn triển khai trên thiết bị edge có tài nguyên hạn chế thường gặp nút thắt do nhu cầu bộ nhớ lớn vốn có của các lớp Transformer.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa PP-YOLOE+ và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và ưu tiên hệ sinh thái của bạn.
Khi nào nên chọn PP-YOLOE+#
PP-YOLOE+ là lựa chọn phù hợp trong các trường hợp:
- Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
- Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
- Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
- Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Ưu thế của Ultralytics: Giới thiệu YOLO26#
PP-YOLOE+ và RTDETRv2 đều là những cột mốc quan trọng, nhưng nhà phát triển hiện đại cần một hệ sinh thái cân bằng hoàn hảo giữa hiệu năng vượt trội và khả năng sử dụng đơn giản. Ultralytics Platform và model YOLO26 đột phá đáp ứng chính xác nhu cầu này.
Ra mắt vào tháng 1 năm 2026, YOLO26 thiết lập tiêu chuẩn mới cho AI thị giác ưu tiên edge. Model giải quyết hiệu quả các trở ngại triển khai gắn với kiến trúc cũ, đồng thời vượt trội hơn về cả tốc độ lẫn độ chính xác.
Các cải tiến kiến trúc#
YOLO26 giới thiệu một số cải tiến tiên phong vượt trội hơn CNN truyền thống và Transformer cồng kềnh:
- Thiết kế end-to-end không cần NMS: Tương tự RTDETRv2, YOLO26 hỗ trợ suy luận end-to-end gốc. Bằng cách bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS) với head one-to-one tùy chọn (
nms=False), model giúp triển khai nhanh hơn, đơn giản hơn và giảm dao động độ trễ, lý tưởng cho robotics thời gian thực và các hệ thống tự hành. - CPU inference nhanh hơn đến 43%: Nhờ các tối ưu hóa kiến trúc chuyên sâu, YOLO26 vượt trội đáng kể so với các model cạnh tranh trên thiết bị edge không có GPU rời, trở thành lựa chọn hàng đầu cho các ứng dụng IoT và thành phố thông minh.
- Optimizer MuSGD: Lấy cảm hứng từ các đổi mới trong huấn luyện LLM, YOLO26 sử dụng phương pháp kết hợp SGD và Muon. Phương pháp này giúp quá trình huấn luyện ổn định hơn và hội tụ nhanh đáng kể, giảm mạnh số giờ huấn luyện trên GPU.
- ProgLoss + STAL: Các hàm loss nâng cao này cải thiện đáng kể khả năng nhận diện vật thể nhỏ—lĩnh vực mà các model như PP-YOLOE+ thường gặp khó khăn—đồng thời đóng vai trò then chốt trong ảnh chụp từ trên không và các ứng dụng drone.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quy trình export, đảm bảo khả năng tương thích liền mạch trên nhiều thiết bị edge và thiết bị công suất thấp.
Không giống các detector chuyên biệt, YOLO26 rất linh hoạt, hỗ trợ phân đoạn instance, ước tính tư thế, phân loại và Oriented Bounding Box (OBB). Model bao gồm các cải tiến chuyên biệt như RLE cho Pose và loss góc dành riêng cho OBB.
Dễ sử dụng vượt trội#
Một trong những nhược điểm lớn nhất khi sử dụng kiến trúc phức tạp như RTDETRv2 là đường cong học tập dốc và quy trình tích hợp rời rạc. Hệ sinh thái Ultralytics trừu tượng hóa hoàn toàn những phức tạp này thông qua Python API trực quan và nền tảng web toàn diện.
Dù bạn đang huấn luyện dataset tùy chỉnh hay chạy suy luận nhanh, quy trình đều liền mạch:
from ultralytics import RTDETR, YOLO
# Khởi tạo model YOLO26 tiên tiến nhất
model_yolo = YOLO("yolo26n.pt")
# Hoặc khởi tạo model RT-DETR bằng cùng API đơn giản
model_rtdetr = RTDETR("rtdetr-l.pt")
# Chạy suy luận thời gian thực dễ dàng
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Export để triển khai trên edge chỉ với một dòng lệnh
model_yolo.export(format="engine", quantize=16)Nhu cầu bộ nhớ thấp hơn vốn có ở các model Ultralytics YOLO đồng nghĩa với việc bạn có thể huấn luyện nhanh hơn và triển khai trên phần cứng rẻ hơn so với các model Transformer tương ứng. Ngoài ra, quá trình phát triển tích cực và tài liệu đẳng cấp thế giới giúp pipeline production của bạn luôn ổn định.
Đối với các nhóm đang tìm hiểu những lựa chọn thay thế, YOLO11 vẫn là model tiền nhiệm được hỗ trợ rộng rãi và có năng lực vượt trội trong hệ sinh thái, cung cấp baseline xuất sắc cho việc tích hợp với phần cứng cũ. Bạn cũng có thể tham khảo bài so sánh YOLO11 vs RT-DETR.
Tóm tắt#
PP-YOLOE+ và RTDETRv2 đã đóng góp đáng kể vào sự phát triển của thị giác máy tính, lần lượt chứng minh tính khả thi của pipeline CNN tiên tiến và Transformer thời gian thực. Tuy nhiên, đối với các tổ chức muốn triển khai ứng dụng thị giác máy tính mạnh mẽ, linh hoạt và được tối ưu hóa cao vào năm 2026, Ultralytics YOLO26 mang đến giải pháp vượt trội. Khả năng suy luận tùy chọn không cần NMS, tốc độ CPU inference nhanh hơn đáng kể và hệ sinh thái tinh gọn giúp nhà phát triển chuyển từ ý tưởng sang production có thể mở rộng nhanh hơn bao giờ hết.