So sánh PP-YOLOE+ và YOLOv5#
Khi chọn framework deep learning phù hợp cho thị giác máy tính, các lập trình viên thường so sánh khả năng của các kiến trúc khác nhau để tìm ra sự cân bằng hoàn hảo giữa tốc độ, độ chính xác và tính dễ triển khai. Trong bài phân tích chuyên sâu này, chúng ta sẽ khám phá các sắc thái kỹ thuật giữa PP-YOLOE+ và YOLOv5. Bằng cách phân tích kiến trúc, số liệu hiệu năng và các kịch bản triển khai lý tưởng, bạn có thể đưa ra quyết định sáng suốt cho dự án tiếp theo của mình, cho dù đó là robot thời gian thực, triển khai tại biên hay phân tích video trên đám mây.
Nguồn gốc và Metadata của mô hình#
Cả hai mô hình đều xuất phát từ các đội ngũ kỹ thuật trình độ cao nhưng hướng đến các hệ sinh thái hơi khác nhau. Hiểu rõ nguồn gốc của chúng cung cấp bối cảnh giá trị cho các lựa chọn thiết kế kiến trúc của họ.
Chi tiết về PP-YOLOE+:
- Tác giả: Các tác giả của PaddlePaddle
- Tổ chức: Baidu
- Ngày: 02-04-2022
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Docs: PaddleDetection README
Chi tiết về YOLOv5:
- Tác giả: Glenn Jocher
- Tổ chức: Ultralytics
- Ngày: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Tài liệu: https://docs.ultralytics.com/models/yolov5
So sánh kiến trúc#
Kiến trúc PP-YOLOE+#
PP-YOLOE+ là một bước tiến trong hệ sinh thái của Baidu, được xây dựng trên nền tảng của các model trước đó như PP-YOLOv2. Nó giới thiệu một backbone CSPRepResNet được tối ưu hóa mạnh mẽ, giúp nâng cao khả năng trích xuất đặc trưng bằng cách kết hợp các nguyên lý của mạng Cross Stage Partial (CSP) với các kỹ thuật tái tham số hóa. Điều này cho phép model duy trì độ chính xác cao trong quá trình huấn luyện đồng thời thu gọn thành một kiến trúc tinh gọn hơn để suy luận nhanh hơn.
Ngoài ra, PP-YOLOE+ sử dụng Task Alignment Learning (TAL) và một Efficient Task-aligned head (ET-head). Sự kết hợp này nhằm giải quyết sự sai lệch giữa các tác vụ phân loại và định vị, một nút thắt phổ biến trong các bộ phát hiện đối tượng dày đặc. Mặc dù có cấu trúc ấn tượng, kiến trúc này gắn kết chặt chẽ với PaddlePaddle framework, điều này có thể gây ra những thách thức về tích hợp cho các team tiêu chuẩn hóa trên các thư viện ML chủ lực khác.
Kiến trúc YOLOv5#
Ngược lại, YOLOv5 được thiết kế nguyên bản bằng PyTorch, tiêu chuẩn công nghiệp cho cả nghiên cứu học thuật và môi trường production của doanh nghiệp. Nó tận dụng backbone CSPDarknet53 đã được sửa đổi, nổi tiếng với luồng gradient đặc biệt và hiệu suất tham số.
Một đặc điểm nổi bật của YOLOv5 là thuật toán AutoAnchor, tự động kiểm tra và điều chỉnh kích thước anchor box dựa trên tập dữ liệu tùy chỉnh cụ thể của bạn trước khi huấn luyện. Điều này loại bỏ việc điều chỉnh thủ công siêu tham số cho các bounding box. Neck Path Aggregation Network (PANet) của mô hình đảm bảo sự hợp nhất đặc trưng đa quy mô mạnh mẽ, làm cho nó cực kỳ hiệu quả trong việc phát hiện đối tượng với các kích thước khác nhau.
Vì YOLOv5 được xây dựng trực tiếp trên PyTorch, việc xuất sang các định dạng được tối ưu hóa như ONNX và TensorRT đòi hỏi cấu hình middleware ít hơn đáng kể so với các model bị ràng buộc với các framework cục bộ.
Phân tích Hiệu suất#
Việc đánh giá các mô hình này đòi hỏi phải xem xét sự đánh đổi giữa mean Average Precision (mAP) và độ trễ. Bảng dưới đây thể hiện các số liệu trên các kích thước mô hình khác nhau.
| Mô hình | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Trong khi PP-YOLOE+ đạt được điểm mAP có tính cạnh tranh cao ở các quy mô lớn hơn (như biến thể X), YOLOv5 cung cấp tốc độ vượt trội và số lượng tham số thấp hơn ở phân khúc nhỏ hơn. YOLOv5 Nano (YOLOv5n) chỉ yêu cầu 2,6 triệu tham số, làm cho nó rất phù hợp cho các thiết bị edge bị ràng buộc, nơi yêu cầu về bộ nhớ rất nghiêm ngặt. Hơn nữa, việc huấn luyện các YOLO model thường tiêu thụ ít bộ nhớ CUDA hơn so com với các giải pháp thay thế dựa trên transformer nặng như RT-DETR.
Lợi thế từ Ultralytics#
Khi chọn kiến trúc, các số liệu thô chỉ là một phần của phương trình. Trải nghiệm lập trình viên, hỗ trợ hệ sinh thái và đường ống triển khai thường quyết định thành công thực tế của một dự án. Đây là nơi các mô hình Ultralytics tỏa sáng.
Sự dễ sử dụng vô song#
The Python API cho Ultralytics giúp ẩn đi mã boilerplate phức tạp. Các developer có thể khởi tạo quá trình huấn luyện, xác thực hiệu năng và triển khai model một cách mượt mà. Tài liệu rất phong phú, được bảo trì cao và được hỗ trợ bởi một cộng đồng open-source toàn cầu lớn mạnh.
Tính linh hoạt giữa các tác vụ#
Trong khi PP-YOLOE+ là một bộ phát hiện đối tượng chuyên dụng, hệ sinh thái Ultralytics cho phép người dùng giải quyết nhiều tác vụ computer vision dưới một API hợp nhất duy nhất. Với YOLOv5 và các thế hệ kế nhiệm, bạn có thể dễ dàng chuyển đổi từ bounding box tiêu chuẩn sang quy trình Image Segmentation và phân loại.
Ví dụ mã: Huấn luyện YOLOv5#
Để bắt đầu chỉ cần vài dòng mã. Sự đơn giản này giúp tăng tốc đáng kể các chu kỳ nghiên cứu và phát triển.
from ultralytics import YOLO
# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run fast inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()Các trường hợp sử dụng thực tế#
Khi nào nên chọn PP-YOLOE+: Nếu tổ chức của bạn gắn liền với stack phần mềm Baidu hoặc phụ thuộc nhiều vào phần cứng chuyên dụng yêu cầu framework PaddlePaddle, PP-YOLOE+ là một lựa chọn hiệu quả. Nó thường được sử dụng trong các quy trình sản xuất chuyên dụng trên khắp châu Á, nơi tồn tại sự tích hợp kế thừa với Paddle.
Khi nào nên chọn YOLOv5: Đối với phần lớn các developer quốc tế, nhà nghiên cứu và doanh nghiệp, YOLOv5 vẫn là một cỗ máy mạnh mẽ. Gốc rễ PyTorch của nó có nghĩa là nó tương thích ngay lập tức với các công cụ như Weights & Biases để theo dõi, và nó xuất file sạch sẽ sang TensorRT để tăng tốc GPU NVIDIA hoặc CoreML cho các thiết bị Apple. Nó xuất sắc trong nhiều lĩnh vực đa dạng từ giám sát cây trồng nông nghiệp đến điều hướng drone tốc độ cao.
Tương lai của phát hiện đối tượng: Ultralytics YOLO26#
Trong khi YOLOv5 là một model mang tính biểu tượng, ranh giới của computer vision đã tiến xa. Đối với tất cả các phát triển mới, chúng tôi đặc biệt khuyên bạn nên chuyển đổi sang YOLO26, được phát hành vào tháng 1 năm 2026. Có sẵn một cách mượt mà thông qua Ultralytics Platform, YOLO26 định nghĩa lại hoàn toàn hiệu suất.
Những cải tiến chính trong YOLO26:
- Thiết kế End-to-End không cần NMS: YOLO26 loại bỏ hoàn toàn quá trình hậu xử lý Non-Maximum Suppression. Điều này làm giảm sự biến động độ trễ và đơn giản hóa đáng kể quy trình triển khai.
- Tốc độ suy luận trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ chiến lược Distribution Focal Loss (DFL), YOLO26 tăng tốc độ đáng kể trên các thiết bị biên không có GPU.
- Trình tối ưu hóa MuSGD: Lấy cảm hứng từ các Large Language Models hàng đầu, trình tối ưu hóa lai này giúp ổn định động lực học huấn luyện và cho phép hội tụ nhanh hơn nhiều trên các tập dữ liệu tùy chỉnh.
- Cải tiến dành riêng cho tác vụ: Tính năng các hàm mất mát nâng cao như ProgLoss và STAL, mang lại độ chính xác chưa từng có trên các đối tượng nhỏ. Nó hỗ trợ nguyên bản việc phát hiện Oriented Bounding Box (OBB) cho hình ảnh chụp từ trên không.
Nếu bạn đang khám phá các vision model tiên tiến, bạn cũng có thể quan tâm đến việc so sánh thế hệ trước YOLO11 hoặc các phương tiếp cận dựa trên transformer như RT-DETR. Cuối cùng, hệ sinh thái mạnh mẽ, kết hợp với các tiến bộ kiến trúc tiên tiến, củng cố vị thế của Ultralytics là lựa chọn hàng đầu cho các tác vụ computer vision hiện đại.