PP-YOLOE+ so với RTDETRv2#
Lĩnh vực thị giác máy tính đã chứng kiến sự phát triển mạnh mẽ trong những năm gần đây, đặc biệt là trong lĩnh vực phát hiện đối tượng theo thời gian thực. Việc lựa chọn kiến trúc phù hợp cho quá trình triển khai có thể tạo ra khác biệt giữa một ứng dụng chậm chạp, ngốn nhiều bộ nhớ và một hệ thống phản hồi nhanh, được tối ưu hóa cao. Trong bài so sánh kỹ thuật này, chúng ta sẽ tìm hiểu hai model nổi bật của Baidu: PP-YOLOE+ dựa trên CNN và RTDETRv2 dựa trên Transformer. Chúng ta sẽ phân tích kiến trúc, các chỉ số hiệu năng và trường hợp sử dụng lý tưởng của chúng, đồng thời xem xét cách chúng so sánh với nền tảng Ultralytics YOLO26 hiện đại nhất.
PP-YOLOE+: Thúc đẩy mô hình CNN#
Được phát triển như một phiên bản cải tiến dựa trên các thế hệ tiền nhiệm, PP-YOLOE+ mở rộng giới hạn những gì Mạng nơ-ron tích chập (CNNs) truyền thống có thể đạt được trong phát hiện đối tượng. Đây là một detector không phụ thuộc anchor có năng lực cao, được xây dựng trên các cơ chế nền tảng của dòng YOLO, đồng thời đưa vào những tối ưu hóa cụ thể cho hệ sinh thái PaddlePaddle.
Thông tin chi tiết về model:
- Tác giả: Các tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Repository PaddleDetection
- Tài liệu: Tài liệu PP-YOLOE+
Kiến trúc và phương pháp#
PP-YOLOE+ dựa trên backbone được tối ưu hóa mạnh và một feature pyramid network tùy chỉnh để tổng hợp hiệu quả các đặc trưng đa tỷ lệ. Model này sử dụng thiết kế không phụ thuộc anchor, giúp đơn giản hóa quá trình tinh chỉnh heuristic thường cần thiết để tạo anchor box. Ngoài ra, phương pháp training của model còn bao gồm các chiến lược gán label nâng cao nhằm ghép các prediction với ground truth box tốt hơn trong giai đoạn học.
Ưu điểm và trường hợp sử dụng#
Ưu điểm chính của PP-YOLOE+ nằm ở hiệu năng ổn định trên phần cứng server tiêu chuẩn và khả năng tích hợp sâu với các công cụ của Baidu. Model này phù hợp với các workflow công nghiệp truyền thống, chẳng hạn như phát hiện lỗi tĩnh trong môi trường sản xuất, nơi các hạn chế về phần cứng không quá nghiêm ngặt.
Mặc dù PP-YOLOE+ cung cấp độ chính xác cao, việc triển khai model này bên ngoài hệ sinh thái gốc đôi khi có thể yêu cầu thêm các bước chuyển đổi, không giống như những format export gốc sẵn có trong các pipeline Ultralytics hiện đại.
RTDETRv2: Transformer phát hiện theo thời gian thực#
Rời xa các CNN thuần túy, RTDETRv2 (Transformer phát hiện theo thời gian thực phiên bản 2) đánh dấu bước chuyển sang các cơ chế dựa trên attention cho những tác vụ thị giác máy tính. Model này cố gắng kết hợp khả năng hiểu ngữ cảnh toàn cục của Transformer với độ trễ thấp cần thiết cho các ứng dụng thực tế.
Thông tin chi tiết về model:
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 Repository
- Tài liệu: README RTDETRv2
Kiến trúc và phương pháp#
RTDETRv2 sử dụng kiến trúc hybrid, kết hợp backbone CNN để trích xuất đặc trưng với encoder-decoder Transformer được tinh gọn. Một đặc điểm nổi bật của RTDETRv2 là thiết kế end-to-end gốc, loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS) truyền thống. Model này cũng giới thiệu các tính năng như phát hiện đa tỷ lệ và xử lý cảnh phức tạp, sử dụng self-attention để hiểu mối quan hệ không gian giữa các đối tượng ở xa nhau.
Ưu điểm và trường hợp sử dụng#
Kiến trúc Transformer giúp RTDETRv2 hoạt động rất hiệu quả trong các tình huống mà việc hiểu ngữ cảnh toàn cục là yếu tố then chốt. Tuy nhiên, các model Transformer thường yêu cầu lượng bộ nhớ CUDA cao hơn đáng kể trong cả training và inference so với các CNN nhẹ. Model này phù hợp nhất với những môi trường không bị giới hạn về phần cứng, chẳng hạn như phân tích video trên nền tảng cloud chạy trên các server GPU mạnh.
So sánh hiệu năng và các chỉ số#
Khi đánh giá các model này, sự đánh đổi giữa Độ chính xác trung bình (mAP) và chi phí tính toán (đo bằng FLOPs và độ trễ inference) là yếu tố tối quan trọng. Bảng dưới đây trình bày các chỉ số chính cho nhiều quy mô khác nhau của cả PP-YOLOE+ và RTDETRv2.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | tham số (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Mặc dù RTDETRv2 đạt mAP cao với cái giá là số lượng parameter và FLOPs lớn hơn, các developer muốn triển khai trên những edge device bị giới hạn thường gặp phải nút thắt do yêu cầu bộ nhớ cao, vốn là đặc trưng của các layer Transformer.
Các trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa PP-YOLOE+ và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.
Khi nào nên chọn PP-YOLOE+#
PP-YOLOE+ là lựa chọn phù hợp cho:
- Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện có được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
- Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có các kernel suy luận được tối ưu cao, dành riêng cho engine suy luận Paddle Lite hoặc Paddle.
- Phát hiện phía server độ chính xác cao: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên các server GPU mạnh, nơi sự phụ thuộc vào framework không phải là vấn đề.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
- Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:
- Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
- Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
- Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.
Lợi thế của Ultralytics: Giới thiệu YOLO26#
Mặc dù PP-YOLOE+ và RTDETRv2 đều là những cột mốc quan trọng, developer hiện đại cần một hệ sinh thái cân bằng hoàn hảo giữa hiệu năng vượt trội và khả năng sử dụng được tinh gọn. Ultralytics Platform và model YOLO26 đột phá cung cấp chính xác điều đó.
Được phát hành vào tháng 1 năm 2026, YOLO26 thiết lập tiêu chuẩn mới cho AI thị giác ưu tiên edge. Model này giải quyết hiệu quả các trở ngại triển khai liên quan đến những kiến trúc cũ, đồng thời vượt qua chúng cả về tốc độ lẫn độ chính xác.
Các cải tiến về kiến trúc#
YOLO26 giới thiệu một số cải tiến tiên phong vượt trội hơn các CNN truyền thống và Transformer nặng:
- Thiết kế end-to-end không cần NMS: Giống như RTDETRv2, YOLO26 vốn được thiết kế end-to-end. Bằng cách loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS), model mang lại khả năng triển khai nhanh hơn, đơn giản hơn với jitter độ trễ thấp hơn, lý tưởng cho robotics theo thời gian thực và các hệ thống tự hành.
- Inference trên CPU nhanh hơn tới 43%: Thông qua các tối ưu hóa kiến trúc chuyên sâu, YOLO26 vượt trội đáng kể so với các model cạnh tranh trên edge device không có GPU rời, trở thành lựa chọn hàng đầu cho các ứng dụng IoT và thành phố thông minh.
- Optimizer MuSGD: Lấy cảm hứng từ những cải tiến trong training LLM, YOLO26 sử dụng phương pháp hybrid giữa SGD và Muon. Phương pháp này mang lại quỹ đạo training ổn định hơn và khả năng hội tụ nhanh hơn đáng kể, cắt giảm mạnh số giờ training trên GPU.
- ProgLoss + STAL: Các hàm loss nâng cao này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, một lĩnh vực mà các model như PP-YOLOE+ thường gặp khó khăn, đóng vai trò then chốt trong ảnh chụp từ trên không và các ứng dụng drone.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quá trình export, đảm bảo khả năng tương thích liền mạch trên nhiều edge device và thiết bị công suất thấp.
Không giống các detector chuyên biệt, YOLO26 có tính linh hoạt cao, hỗ trợ Instance Segmentation, Pose Estimation, Classification và Bounding Box định hướng (OBB). Model này bao gồm các cải tiến được điều chỉnh riêng như RLE cho Pose và hàm loss góc chuyên biệt cho OBB.
Dễ sử dụng vượt trội#
Một trong những hạn chế lớn nhất khi áp dụng các kiến trúc phức tạp như RTDETRv2 là đường cong học tập dốc và quy trình tích hợp rời rạc. Hệ sinh thái Ultralytics loại bỏ hoàn toàn những phức tạp này thông qua Python API trực quan và nền tảng web toàn diện.
Cho dù bạn đang training dataset tùy chỉnh hay chạy một inference nhanh, quy trình đều liền mạch:
from ultralytics import RTDETR, YOLO
# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)Yêu cầu bộ nhớ thấp hơn, vốn là đặc trưng của các model Ultralytics YOLO, cho phép bạn training nhanh hơn và triển khai trên phần cứng rẻ hơn so với các model tương ứng dựa trên Transformer. Ngoài ra, quá trình phát triển tích cực và tài liệu đẳng cấp thế giới đảm bảo các pipeline production của bạn luôn ổn định.
Đối với các đội ngũ đang tìm kiếm giải pháp thay thế, YOLO11 vẫn là một phiên bản tiền nhiệm được hỗ trợ rộng rãi và có năng lực vượt trội trong hệ sinh thái, cung cấp một nền tảng tuyệt vời cho việc tích hợp phần cứng cũ. Bạn cũng có thể thấy việc đọc bài so sánh của chúng tôi về YOLO11 vs RT-DETR là hữu ích.
Tóm tắt#
PP-YOLOE+ và RTDETRv2 đã có những đóng góp đáng kể cho sự phát triển của thị giác máy tính, lần lượt chứng minh tính khả thi của các pipeline CNN nâng cao và Transformer thời gian thực. Tuy nhiên, đối với các tổ chức muốn triển khai những ứng dụng thị giác máy tính mạnh mẽ, linh hoạt và được tối ưu hóa cao vào năm 2026, Ultralytics YOLO26 cung cấp một giải pháp vượt trội. Kiến trúc vốn không cần NMS, khả năng inference trên CPU nhanh hơn đáng kể và hệ sinh thái được tinh gọn giúp developer chuyển từ ý tưởng sang production có khả năng mở rộng nhanh hơn bao giờ hết.