YOLO11 so với PP-YOLOE+#
Việc lựa chọn kiến trúc mạng neural tối ưu đóng vai trò then chốt khi triển khai các ứng dụng thị giác máy tính trong môi trường production. Trong phần so sánh kỹ thuật này, chúng tôi xem xét hai model nổi bật trong lĩnh vực phát hiện đối tượng theo thời gian thực: Ultralytics YOLO11 và PP-YOLOE+ của Baidu. Cả hai kiến trúc đều mang lại hiệu năng mạnh mẽ, nhưng tiếp cận các thách thức về độ chính xác, tốc độ inference và hệ sinh thái dành cho developer theo những cách khá khác nhau.
Dưới đây là biểu đồ tương tác thể hiện các ngưỡng hiệu năng của những model này, giúp bạn xác định lựa chọn phù hợp nhất với các giới hạn phần cứng của mình.
Nguồn gốc và dòng phát triển kỹ thuật của model#
Việc tìm hiểu nguồn gốc và triết lý thiết kế của các model này cung cấp bối cảnh hữu ích để hiểu rõ thế mạnh cũng như các trường hợp sử dụng lý tưởng của từng model.
Thông tin chi tiết về YOLO11#
Được phát triển bởi Ultralytics, YOLO11 là một phiên bản được tinh chỉnh cao của dòng YOLO, ưu tiên sự cân bằng giữa inference tốc độ cao, hiệu quả tham số vượt trội và tính dễ sử dụng unmatched. Model này được công nhận rộng rãi nhờ khả năng multi-task thống nhất và Python API thân thiện với developer.
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: Tài liệu YOLO11
Thông tin chi tiết về PP-YOLOE+#
PP-YOLOE+ là phiên bản phát triển từ PP-YOLOv2, được xây dựng trên framework PaddlePaddle. Model này giới thiệu các thay đổi về kiến trúc như backbone CSPRepResNet và Task Alignment Learning (TAL) để nâng cao giới hạn độ chính xác, đặc biệt trên các GPU cao cấp.
- Tác giả: Các tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Tài liệu: Tài liệu cấu hình PP-YOLOE+
Sự khác biệt về Architecture#
Các thiết kế kiến trúc nền tảng của YOLO11 và PP-YOLOE+ phản ánh những ưu tiên khác nhau của chúng trong lĩnh vực thị giác máy tính.
YOLO11 được xây dựng trên một backbone được tối ưu hóa cao và một detection head không sử dụng anchor. Model sử dụng các block C3k2 và Spatial Pyramid Pooling - Fast (SPPF) để thu thập các đặc trưng đa tỷ lệ với chi phí tính toán tối thiểu. Thiết kế này đặc biệt có lợi trong việc giảm độ trễ inference trên các thiết bị hạn chế tài nguyên như NPU edge và CPU di động. Ngoài ra, YOLO11 được thiết kế nguyên bản cho học multi-task, hỗ trợ phân đoạn instance, ước lượng pose và phát hiện bounding box có hướng (OBB) ngay từ đầu.
PP-YOLOE+ giới thiệu backbone CSPRepResNet và head căn chỉnh tác vụ hiệu quả (ET-head). PP-YOLOE+ tận dụng tối đa các kỹ thuật tái tham số hóa để tăng năng lực biểu diễn trong quá trình huấn luyện, đồng thời gộp các tham số đó vào các tích chập chuẩn để suy luận. Mặc dù điều này mang lại mean Average Precision (mAP) ấn tượng, các mô hình tạo ra có xu hướng nặng hơn về mặt tham số và dung lượng bộ nhớ, giúp chúng phù hợp hơn để triển khai trên các GPU máy chủ mạnh mẽ thay vì các thiết bị biên nhẹ.
Nếu project của bạn cần mở rộng vượt ra ngoài các bounding box tiêu chuẩn, Ultralytics YOLO11 cung cấp hỗ trợ nguyên bản cho segmentation, pose estimation và classification trong cùng một API, giúp giảm đáng kể chi phí phát triển so với việc tích hợp nhiều repository riêng biệt.
Hiệu năng và benchmark#
Khi đánh giá hiệu năng, chúng tôi xem xét độ chính xác (mAP), tốc độ inference trên nhiều loại phần cứng khác nhau và hiệu quả của model (số lượng tham số và FLOPs). Bảng dưới đây nêu bật các metric so sánh, trong đó các giá trị hiệu quả nhất hoặc có hiệu năng cao nhất được in đậm.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | tham số (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Phân tích#
YOLO11 cho thấy lợi thế rõ ràng về cân bằng hiệu năng và hiệu quả tham số. Chẳng hạn, YOLO11m đạt mAP cao hơn (51.5) so với PP-YOLOE+m (49.8), đồng thời sử dụng ít tham số hơn (20.1M so với 23.43M) và đạt tốc độ inference nhanh hơn đáng kể trên TensorRT (4.7ms so với 5.56ms). Bản chất nhẹ của các model YOLO11 giúp giảm yêu cầu bộ nhớ trong cả quá trình training model lẫn triển khai.
Hệ sinh thái training và tính dễ sử dụng#
Giá trị thực sự của một model thường nằm ở mức độ dễ dàng để developer training model đó trên các dataset thị giác máy tính tùy chỉnh và triển khai vào production.
Lợi thế của Ultralytics#
Ultralytics ưu tiên trải nghiệm developer tinh gọn. Việc training YOLO11 được thực hiện thông qua Python API hoặc CLI đơn giản, giúp che giấu phần boilerplate code phức tạp. Ultralytics Platform nâng cao hơn nữa trải nghiệm này bằng cách cung cấp training không cần code, quản lý dataset tự động và export chỉ với một cú nhấp chuột sang các format như ONNX, CoreML và TensorRT.
Hơn nữa, các mô hình YOLO rất tiết kiệm bộ nhớ trong quá trình huấn luyện, tránh được chi phí VRAM khổng lồ thường thấy ở kiến trúc dựa trên Transformer hoặc các mô hình tái tham số hóa nặng, cho phép huấn luyện trên phần cứng cấp độ người tiêu dùng.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Hệ sinh thái PP-YOLOE+#
PP-YOLOE+ hoạt động trong hệ sinh thái PaddleDetection. Mặc dù framework này mạnh mẽ và được tích hợp sâu với các giải pháp công nghiệp của Baidu, nó yêu cầu developer sử dụng framework deep learning PaddlePaddle cụ thể. Điều này có thể tạo ra đường cong học tập dốc hơn đối với các team đã tiêu chuẩn hóa trên PyTorch. Ngoài ra, việc export các model PP-YOLOE+ sang các format phổ quát tiêu chuẩn cho thiết bị edge có thể yêu cầu thêm các bước chuyển đổi so với các pipeline export native trong workflow của Ultralytics.
Các trường hợp sử dụng lý tưởng#
Việc lựa chọn giữa các model này phụ thuộc vào môi trường triển khai cụ thể của bạn.
- Chọn YOLO11 để phát triển linh hoạt, điện toán edge và các ứng dụng di động. Tốc độ inference cao, footprint bộ nhớ thấp và khả năng export đa dạng khiến model này lý tưởng cho các tác vụ như quản lý hàng tồn kho bán lẻ theo thời gian thực trên CPU tiêu chuẩn, phân tích ảnh trên không từ drone và các pipeline multi-task phức tạp.
- Chọn PP-YOLOE+ nếu toàn bộ pipeline production của bạn đã đầu tư sâu vào hệ sinh thái PaddlePaddle hoặc nếu bạn triển khai trên các inference server chuyên dụng, cao cấp, nơi các giới hạn bộ nhớ và khả năng tương thích phần cứng (ngoài phần cứng được tối ưu hóa cho Paddle) không phải là mối quan tâm chính.
Thế hệ tiếp theo: Giới thiệu YOLO26#
Mặc dù YOLO11 vẫn cực kỳ mạnh mẽ, lĩnh vực AI phát triển nhanh chóng. Đối với công nghệ phát hiện đối tượng tiên tiến nhất, Ultralytics đã giới thiệu YOLO26 mới. Được phát hành vào tháng 1 năm 2026, YOLO26 kế thừa những thành công của các thế hệ trước để mang lại hiệu quả và độ chính xác chưa từng có.
Các cải tiến chính của YOLO26:
- Thiết kế end-to-end không cần NMS: YOLO26 loại bỏ native bước hậu xử lý Non-Maximum Suppression (NMS). Điều này tăng tốc đáng kể inference và đơn giản hóa logic triển khai, đánh dấu một bước tiến kiến trúc lần đầu được tiên phong trong YOLOv10.
- Inference trên CPU nhanh hơn tới 43%: Được tối ưu cụ thể cho các thiết bị edge không có GPU, đảm bảo hiệu năng thời gian thực trên phần cứng tiêu thụ ít điện năng hơn.
- Optimizer MuSGD: Lấy cảm hứng từ tính ổn định trong quá trình training LLM, sự kết hợp giữa SGD và Muon này đảm bảo hội tụ nhanh hơn và training ổn định hơn.
- ProgLoss + STAL: Các hàm loss được cải thiện giúp nâng cao đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với các ứng dụng drone và giám sát an ninh.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss đơn giản hóa quá trình export model và cải thiện đáng kể khả năng tương thích trên nhiều loại thiết bị edge.
Đối với các project mới ưu tiên tốc độ, khả năng export liền mạch và độ chính xác tối đa, chúng tôi đặc biệt khuyến nghị khai thác các khả năng của YOLO26 thông qua Ultralytics Platform.
Nếu bạn đang đánh giá các kiến trúc khác, bạn cũng có thể quan tâm đến việc so sánh YOLO11 với RT-DETR hoặc tìm hiểu cách YOLOv8 thế hệ cũ hoạt động trong các benchmark hiện đại.