Ultralytics YOLO27:

So sánh PP-YOLOE+ với YOLOv5#

Khi lựa chọn framework deep learning phù hợp cho computer vision, các developer thường so sánh khả năng của những architecture khác nhau để tìm ra sự cân bằng tối ưu giữa tốc độ, độ chính xác và khả năng triển khai. Trong phần phân tích chuyên sâu này, chúng ta sẽ tìm hiểu những khác biệt về mặt kỹ thuật giữa PP-YOLOE+ và YOLOv5. Bằng cách phân tích architecture, các chỉ số hiệu năng và những kịch bản triển khai phù hợp, bạn có thể đưa ra quyết định sáng suốt cho dự án tiếp theo, dù dự án liên quan đến robotics thời gian thực, triển khai trên edge hay phân tích video trên cloud.

Nguồn gốc và metadata của model#

Cả hai model đều bắt nguồn từ những đội ngũ engineering có năng lực cao, nhưng hướng đến các ecosystem hơi khác nhau. Việc hiểu rõ nguồn gốc của chúng cung cấp bối cảnh hữu ích để lý giải các lựa chọn thiết kế architecture.

Thông tin chi tiết về PP-YOLOE+:

Tìm hiểu thêm về PP-YOLOE+

Thông tin chi tiết về YOLOv5:

So sánh kiến trúc#

Kiến trúc PP-YOLOE+#

PP-YOLOE+ là một bước phát triển trong ecosystem Baidu, được xây dựng trên nền tảng của các model trước đó như PP-YOLOv2. Model này giới thiệu backbone CSPRepResNet được tối ưu hóa mạnh, cải thiện khả năng trích xuất feature bằng cách kết hợp các nguyên lý của mạng Cross Stage Partial (CSP) với các kỹ thuật re-parameterization. Nhờ đó, model duy trì độ chính xác cao trong quá trình training, đồng thời có thể hợp nhất thành một architecture tinh gọn hơn để inference nhanh hơn.

Ngoài ra, PP-YOLOE+ sử dụng Task Alignment Learning (TAL) và một Efficient Task-aligned head (ET-head). Sự kết hợp này nhằm giải quyết sự lệch pha giữa các tác vụ classification và localization, một nút thắt phổ biến trong các dense object detector. Mặc dù có architecture ấn tượng, model này gắn chặt với framework PaddlePaddle, điều này có thể gây ra thách thức tích hợp cho các đội ngũ đang chuẩn hóa trên những thư viện ML phổ biến khác.

Architecture của YOLOv5#

Ngược lại, YOLOv5 được engineering nguyên bản trên PyTorch, tiêu chuẩn của ngành cho cả nghiên cứu học thuật lẫn production enterprise. Model sử dụng backbone CSPDarknet53 được sửa đổi, nổi tiếng nhờ khả năng lan truyền gradient vượt trội và hiệu quả về số lượng parameter.

Một đặc điểm nổi bật của YOLOv5 là algorithm AutoAnchor, tự động kiểm tra và điều chỉnh kích thước anchor box dựa trên dataset tùy chỉnh cụ thể trước khi training. Điều này loại bỏ việc tinh chỉnh hyperparameter thủ công cho bounding box. Phần neck Path Aggregation Network (PANet) của model đảm bảo việc fusion feature đa scale mạnh mẽ, giúp model đặc biệt hiệu quả trong việc phát hiện các object có kích thước khác nhau.

Triển khai PyTorch tinh gọn

Vì YOLOv5 được xây dựng trực tiếp trên PyTorch, việc export sang các format được tối ưu như ONNX và TensorRT yêu cầu cấu hình middleware ít hơn đáng kể so với các model phụ thuộc vào những framework chuyên biệt.

Phân tích hiệu năng#

Việc đánh giá các model này đòi hỏi phải xem xét sự đánh đổi giữa mean Average Precision (mAP) và latency. Bảng sau đây trình bày các metric trên những kích thước model khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Mặc dù PP-YOLOE+ đạt điểm mAP có tính cạnh tranh cao ở các scale lớn hơn, chẳng hạn biến thể X, YOLOv5 cung cấp tốc độ vượt trội và số lượng parameter thấp hơn ở phía scale nhỏ hơn. YOLOv5 Nano (YOLOv5n) chỉ yêu cầu 2,6 triệu parameter, rất phù hợp với các edge device bị giới hạn, nơi yêu cầu về bộ nhớ rất nghiêm ngặt. Hơn nữa, việc training các model YOLO thường tiêu tốn ít bộ nhớ CUDA hơn so với những lựa chọn thay thế nặng hơn dựa trên Transformer như RT-DETR.

Lợi thế của Ultralytics#

Khi lựa chọn architecture, các metric thô chỉ là một phần của bài toán. Developer experience, ecosystem support và deployment pipeline thường quyết định thành công thực tế của một dự án. Đây là điểm mà các model Ultralytics tỏa sáng.

Dễ sử dụng vượt trội#

Python API của Ultralytics trừu tượng hóa phần boilerplate code phức tạp. Developer có thể khởi chạy training, validation hiệu năng và triển khai model một cách liền mạch. Tài liệu đầy đủ, được duy trì thường xuyên và nhận được sự hỗ trợ của một cộng đồng open source toàn cầu đông đảo.

Tính linh hoạt trên nhiều tác vụ#

Trong khi PP-YOLOE+ là một object detector chuyên dụng, ecosystem Ultralytics cho phép người dùng xử lý nhiều tác vụ computer vision trong một API thống nhất duy nhất. Với YOLOv5 và các phiên bản kế nhiệm, bạn có thể dễ dàng chuyển từ bounding box tiêu chuẩn sang các workflow Image Segmentation và classification.

Ví dụ code: Training YOLOv5#

Để bắt đầu, bạn chỉ cần vài dòng code. Sự đơn giản này giúp tăng tốc đáng kể các chu kỳ nghiên cứu và phát triển.

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run fast inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

Các trường hợp sử dụng trong thực tế#

Khi nào nên chọn PP-YOLOE+: Nếu tổ chức của bạn gắn bó sâu với software stack của Baidu hoặc phụ thuộc nhiều vào phần cứng chuyên dụng yêu cầu framework PaddlePaddle, PP-YOLOE+ là một lựa chọn có hiệu năng đáng tin cậy. Model này thường được sử dụng trong các pipeline sản xuất chuyên biệt trên khắp châu Á, nơi vẫn tồn tại tích hợp legacy với Paddle.

Khi nào nên chọn YOLOv5: Đối với phần lớn developer, researcher và enterprise trên toàn thế giới, YOLOv5 vẫn là một model mạnh mẽ. Nền tảng PyTorch giúp model tương thích ngay với các công cụ như Weights & Biases để tracking, đồng thời export dễ dàng sang TensorRT để tăng tốc trên GPU NVIDIA hoặc sang CoreML cho các thiết bị Apple. Model phát huy hiệu quả trong nhiều lĩnh vực, từ giám sát cây trồng nông nghiệp đến điều hướng drone tốc độ cao.

Tương lai của object detection: Ultralytics YOLO26#

Mặc dù YOLOv5 là một model mang tính biểu tượng, lĩnh vực computer vision đã tiến xa hơn. Đối với mọi phát triển mới, chúng tôi đặc biệt khuyến nghị chuyển sang YOLO26, được phát hành vào tháng 1 năm 2026. Được cung cấp liền mạch thông qua Ultralytics Platform, YOLO26 hoàn toàn định nghĩa lại hiệu quả.

Các đổi mới chính trong YOLO26:

  • Thiết kế End-to-End không cần NMS: YOLO26 loại bỏ hoàn toàn bước post-processing Non-Maximum Suppression. Điều này làm giảm biến động latency và đơn giản hóa đáng kể deployment pipeline.
  • Inference trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ Distribution Focal Loss (DFL) một cách có chiến lược, YOLO26 tăng đáng kể tốc độ trên các edge device không có GPU.
  • Optimizer MuSGD: Lấy cảm hứng từ các Large Language Model hàng đầu, optimizer hybrid này ổn định động lực training và cho phép hội tụ nhanh hơn nhiều trên các dataset tùy chỉnh.
  • Các cải tiến theo từng tác vụ: Cung cấp những loss function nâng cao như ProgLoss và STAL, mang lại độ chính xác chưa từng có trên các object nhỏ. Model hỗ trợ nguyên bản khả năng phát hiện Oriented Bounding Box (OBB) cho ảnh chụp từ trên không.

Nếu bạn đang tìm hiểu các vision model hiện đại nhất, bạn cũng có thể quan tâm đến việc so sánh thế hệ trước YOLO11 hoặc các phương pháp dựa trên Transformer như RT-DETR. Sau cùng, ecosystem mạnh mẽ cùng những tiến bộ tiên phong trong architecture đã củng cố vị thế của Ultralytics như lựa chọn hàng đầu cho các tác vụ computer vision hiện đại.

Những người đóng góp

Bình luận