PP-YOLOE+ so với YOLOv9#
Lĩnh vực computer vision thời gian thực không ngừng thay đổi, khi các nhà nghiên cứu và nhà phát triển liên tục mở rộng giới hạn về độ chính xác và tốc độ suy luận. Khi so sánh PP-YOLOE+ và YOLOv9, chúng ta đang xem xét hai triết lý khác biệt về kiến trúc model và thiết kế hệ sinh thái.
Bản so sánh kỹ thuật toàn diện này phân tích các đổi mới về kiến trúc, chỉ số hiệu năng, phương pháp training và các trường hợp sử dụng lý tưởng của hai model, nhằm giúp bạn lựa chọn model phát hiện đối tượng phù hợp cho lần triển khai tiếp theo.
Dòng model và nền tảng kỹ thuật#
Việc hiểu rõ nguồn gốc và các lựa chọn kiến trúc của những model này là yếu tố then chốt để xác định mức độ phù hợp của chúng với các dự án computer vision của bạn.
Tổng quan về PP-YOLOE+#
Được các tác giả PaddlePaddle tại Baidu phát triển, PP-YOLOE+ được giới thiệu vào ngày 2 tháng 4 năm 2022. Model này kế thừa các phiên bản trước trong framework PaddleDetection để mang lại khả năng phát hiện đối tượng hiệu năng cao.
- Tác giả: Các tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Repository PaddleDetection
PP-YOLOE+ giới thiệu một kiến trúc không sử dụng anchor mạnh mẽ, được tối ưu chuyên sâu cho việc triển khai trong hệ sinh thái PaddlePaddle. Model sử dụng backbone CSPRepResNet được sửa đổi và ET-head để cải thiện khả năng trích xuất đặc trưng cũng như hồi quy bounding box. Mặc dù đạt độ chính xác trung bình (mAP) cao, việc phụ thuộc vào framework PaddlePaddle đôi khi có thể gây khó khăn trong tích hợp cho các nhà phát triển đã quen với PyTorch hoặc TensorFlow.
Tổng quan về YOLOv9#
Được Chien-Yao Wang và Hong-Yuan Mark Liao thuộc Institute of Information Science, Academia Sinica, Đài Loan giới thiệu, YOLOv9 đánh dấu một bước tiến đáng kể trong việc xử lý hiệu quả các nút thắt thông tin của deep learning.
- Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
- Ngày: 2024-02-21
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
Đột phá lớn của YOLOv9 là Thông tin gradient có thể lập trình (PGI), giúp ngăn mất dữ liệu khi các đặc trưng đi qua mạng neural sâu. Kết hợp với Mạng tổng hợp lớp hiệu quả tổng quát hóa (GELAN), YOLOv9 tối đa hóa hiệu quả sử dụng parameter và luồng tính toán. Hơn nữa, model được tích hợp nguyên bản vào hệ sinh thái Ultralytics, giúp model dễ tiếp cận cho cả các ứng dụng nghiên cứu và thương mại.
So sánh hiệu năng và các chỉ số#
Khi phân tích hiệu năng thô, YOLOv9 cho thấy hiệu quả sử dụng parameter vượt trội. Model đạt độ chính xác tương đương hoặc cao hơn trong khi yêu cầu ít parameter và FLOPs hơn, qua đó giảm yêu cầu VRAM trong quá trình training model.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | tham số (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Như thể hiện trong bảng, YOLOv9c đạt 53.0 mAP ấn tượng với số lượng parameter thấp hơn đáng kể (25.3M) so với PP-YOLOE+l tương đương (52.2M). Mức sử dụng memory thấp hơn này khiến YOLOv9 trở thành lựa chọn vượt trội cho các nhà phát triển làm việc với tài nguyên GPU hạn chế.
Hệ sinh thái, tính linh hoạt và mức độ dễ sử dụng#
Lợi thế nổi bật của YOLOv9 nằm ở khả năng tích hợp liền mạch với hệ sinh thái Ultralytics được duy trì tốt. Trong khi PP-YOLOE+ yêu cầu làm việc với các file cấu hình PaddlePaddle phức tạp, YOLOv9 được hưởng lợi từ Python API tinh gọn.
Ultralytics Python API cho phép các nhà phát triển load weight đã pre-trained, quản lý data augmentation và bắt đầu training với lượng boilerplate code tối thiểu.
from ultralytics import YOLO
# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format
model.export(format="onnx")Ngoài ra, hệ sinh thái Ultralytics cung cấp tính linh hoạt vượt trội. Bên cạnh phát hiện bounding box, framework còn hỗ trợ nguyên bản phân đoạn instance, ước tính pose và phát hiện hộp giới hạn định hướng (OBB). Điều này giúp việc điều chỉnh model cho các pipeline thực tế phức tạp trở nên vô cùng hiệu quả.
Các trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa PP-YOLOE+ và YOLOv9 phụ thuộc vào các yêu cầu cụ thể của dự án, ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.
Khi nào nên chọn PP-YOLOE+#
PP-YOLOE+ là lựa chọn phù hợp cho:
- Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện có được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
- Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có các kernel suy luận được tối ưu cao, dành riêng cho engine suy luận Paddle Lite hoặc Paddle.
- Phát hiện phía server độ chính xác cao: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên các server GPU mạnh, nơi sự phụ thuộc vào framework không phải là vấn đề.
Khi nào nên chọn YOLOv9#
YOLOv9 được khuyến nghị cho:
- Nghiên cứu nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
- Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các layer sâu của network trong quá trình huấn luyện.
- Benchmark phát hiện độ chính xác cao: Các tình huống cần hiệu năng benchmark COCO mạnh của YOLOv9 làm mốc tham chiếu cho việc so sánh kiến trúc.
Khi nào nên chọn Ultralytics (YOLO26)#
Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:
- Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
- Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
- Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.
Định hướng tương lai: Lợi thế của YOLO26#
Mặc dù cả PP-YOLOE+ và YOLOv9 đều mạnh mẽ, YOLO26 mới được phát hành đại diện cho bước tiến tiếp theo mang tính quyết định đối với các môi trường production. Được phát hành vào tháng 1 năm 2026, YOLO26 thiết lập một tiêu chuẩn mới cho edge computing và triển khai trên cloud. Chúng tôi đặc biệt khuyến nghị YOLO26 cho tất cả các dự án computer vision mới nhờ những đổi mới mang tính đột phá:
- Thiết kế end-to-end không cần NMS: YOLO26 có kiến trúc end-to-end nguyên bản, loại bỏ hoàn toàn nhu cầu hậu xử lý Ức chế phi cực đại (NMS). Điều này đơn giản hóa đáng kể các pipeline triển khai và giảm độ trễ.
- Suy luận trên CPU nhanh hơn tới 43%: Bằng cách tối ưu riêng kiến trúc cho edge computing, YOLO26 nhanh hơn đáng kể trên hardware không có GPU chuyên dụng.
- Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, giúp đơn giản hóa quá trình export và cải thiện đáng kể khả năng tương thích với các thiết bị edge công suất thấp.
- Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật training large language model (chẳng hạn Kimi K2 của Moonshot AI), hybrid giữa SGD và Muon này đảm bảo động lực training ổn định cao và hội tụ nhanh.
- ProgLoss + STAL: Các hàm loss nâng cao này mang lại cải thiện đáng kể trong việc nhận diện đối tượng nhỏ, một nâng cấp thiết yếu cho ảnh chụp từ trên không và robotics.
- Cải tiến theo từng task: YOLO26 bao gồm các kiến trúc được tùy chỉnh cho từng task cụ thể, chẳng hạn như proto đa scale cho segmentation và Ước tính log-likelihood dư (RLE) cho pose estimation.
Bạn có thể dễ dàng training và triển khai các model YOLO26 thông qua Ultralytics Platform, một giải pháp all-in-one cho việc gắn nhãn dataset, training trên cloud và monitoring model.
Ứng dụng thực tế#
Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào môi trường triển khai mục tiêu của bạn.
PP-YOLOE+ thường được triển khai tại các trung tâm sản xuất công nghiệp, đặc biệt ở những khu vực mà tích hợp PaddlePaddle và hardware stack của Baidu đã được tích hợp sâu vào hạ tầng doanh nghiệp. Model này hoạt động hiệu quả trong phân tích ảnh tĩnh, nơi độ chính xác tuyệt đối được ưu tiên hơn các ràng buộc nghiêm ngặt về thời gian thực.
YOLOv9 hoạt động vượt trội trong các môi trường động yêu cầu suy luận thời gian thực nhanh. Hiệu quả sử dụng parameter vượt trội khiến model trở nên lý tưởng cho điều hướng drone tự hành và các hệ thống bảo mật dựa trên edge. Ngoài ra, mức tiêu thụ VRAM thấp hơn giúp các nhà nghiên cứu training trên GPU phổ thông dễ dàng bắt đầu hơn.
Đối với hiệu năng cao nhất trong quản lý giao thông thành phố thông minh và robotics tốc độ cao, YOLO26 mới hơn là lựa chọn không đối thủ, mang lại hiệu quả end-to-end mà không chịu overhead từ các bottleneck của NMS.