So sánh YOLO11 và PP-YOLOE+#
Việc lựa chọn kiến trúc mạng nơ-ron tối ưu là rất quan trọng khi triển khai các ứng dụng computer vision trong môi trường production. Trong phần so sánh kỹ thuật này, chúng tôi xem xét hai mô hình nổi bật trong không gian phát hiện đối tượng thời gian thực: Ultralytics YOLO11 và PP-YOLOE+ của Baidu. Cả hai kiến trúc đều mang lại hiệu năng mạnh mẽ, nhưng chúng tiếp cận các thách thức về độ chính xác, tốc độ inference và hệ sinh thái nhà phát triển theo những cách khá khác nhau.
Dưới đây là biểu đồ tương tác giới thiệu các giới hạn hiệu suất của những mô hình này để giúp bạn xác định lựa chọn phù hợp nhất với các hạn chế về phần cứng của mình.
Nguồn gốc mô hình và dòng dõi kỹ thuật#
Việc tìm hiểu nguồn gốc và triết lý thiết kế của các mô hình này cung cấp ngữ cảnh giá trị cho các điểm mạnh và trường hợp sử dụng lý tưởng tương ứng của chúng.
Chi tiết về YOLO11#
Được phát triển bởi Ultralytics, YOLO11 đại diện cho một bước lặp được tinh chỉnh cao của dòng YOLO, ưu tiên sự cân bằng giữa inference tốc độ cao, hiệu quả tham số cực hạn và tính dễ sử dụng vượt trội. Nó được công nhận rộng rãi nhờ các khả năng đa tác vụ thống nhất và API Python thân thiện với nhà phát triển.
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: YOLO11 Documentation
Chi tiết về PP-YOLOE+#
PP-YOLOE+ là phiên bản tiến hóa của PP-YOLOv2, được xây dựng trên framework PaddlePaddle. Nó giới thiệu các thay đổi kiến trúc như backbone CSPRepResNet và Task Alignment Learning (TAL) để đẩy giới hạn độ chính xác, đặc biệt là trên các GPU cao cấp.
- Tác giả: Các tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Docs: PP-YOLOE+ Configuration Docs
Sự khác biệt về kiến trúc#
Thiết kế kiến trúc nền tảng của YOLO11 và PP-YOLOE+ phản ánh các ưu tiên khác nhau của chúng trong bối cảnh computer vision.
YOLO11 được xây dựng dựa trên một backbone được tối ưu hóa cao và detection head không dùng anchor. Nó sử dụng các khối C3k2 và Spatial Pyramid Pooling - Fast (SPPF) để thu thập các đặc trưng đa tỷ lệ với mức chi phí tính toán tối thiểu. Thiết kế này mang lại lợi thế lớn trong việc giảm inference latency trên các thiết bị bị giới hạn tài nguyên như edge NPU và mobile CPU. Hơn nữa, YOLO11 được thiết kế nguyên bản cho việc học đa nhiệm, hỗ trợ instance segmentation, pose estimation và oriented bounding box (OBB) detection ngay khi vừa thiết lập.
PP-YOLOE+ giới thiệu backbone CSPRepResNet và Efficient Task-aligned head (ET-head). Nó tận dụng tối đa các kỹ thuật tái tham số hóa (rep-parameterization) để tăng năng lực biểu diễn trong quá trình training, đồng thời gom các tham số đó vào các phép tích chập chuẩn cho quá trình inference. Mặc dù điều này mang lại mean Average Precision (mAP) ấn tượng, các mô hình tạo ra thường có trọng lượng lớn hơn về mặt tham số và dung lượng bộ nhớ, khiến chúng phù hợp hơn để triển khai trên các server GPU mạnh mẽ thay vì các thiết bị edge nhẹ.
Nếu dự án của bạn yêu cầu mở rộng ra ngoài các hộp bao (bounding box) tiêu chuẩn, Ultralytics YOLO11 cung cấp hỗ trợ nguyên bản cho phân đoạn, ước tính tư thế và phân loại trong cùng một API, giảm đáng kể chi phí phát triển so với việc tích hợp nhiều repository riêng biệt.
Hiệu năng và Benchmark#
Khi đánh giá hiệu suất, chúng tôi xem xét độ chính xác (mAP), tốc độ inference trên các phần cứng khác nhau và hiệu quả mô hình (tham số và FLOPs). Bảng dưới đây nêu bật các chỉ số so sánh, với các giá trị hiệu quả nhất hoặc hiệu suất cao nhất được in đậm.
| Mô hình | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Phân tích#
YOLO11 thể hiện lợi thế rõ ràng về cân bằng hiệu năng và độ hiệu quả của tham số. Ví dụ, YOLO11m đạt mAP cao hơn (51.5) so với PP-YOLOE+m (49.8) trong khi sử dụng ít tham số hơn (20.1M so với 23.43M) và đạt tốc độ inference nhanh hơn đáng kể trên TensorRT (4.7ms so với 5.56ms). Bản chất nhẹ nhàng của các mô hình YOLO11 đương nhiên chuyển hóa thành yêu cầu bộ nhớ thấp hơn trong cả quá trình model training và triển khai.
Hệ sinh thái đào tạo và tính dễ sử dụng#
Giá trị thực sự của một mô hình thường nằm ở việc các nhà phát triển có thể dễ dàng train nó trên các computer vision datasets tùy chỉnh và triển khai nó lên production đến mức nào.
Lợi thế từ Ultralytics#
Ultralytics ưu tiên trải nghiệm nhà phát triển được tinh giản. Việc training YOLO11 được quản lý thông qua một Python API hoặc CLI đơn giản, giúp trừu tượng hóa các đoạn mã boilerplate phức tạp. Ultralytics Platform nâng cao hơn nữa điều này bằng cách cung cấp tính năng training không cần code, quản lý dataset tự động và xuất file một cú nhấp chuột sang các định dạng như ONNX, CoreML và TensorRT.
Hơn nữa, các mô hình YOLO rất hiệu quả về bộ nhớ trong quá trình huấn luyện, tránh được các chi phí VRAM khổng lồ điển hình của các kiến trúc dựa trên Transformer hoặc các mô hình rep-parameterized nặng, cho phép huấn luyện trên phần cứng cấp người tiêu dùng.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Hệ sinh thái PP-YOLOE+#
PP-YOLOE+ hoạt động trong hệ sinh thái PaddleDetection. Mặc dù framework này mạnh mẽ và được tích hợp sâu với các giải pháp công nghiệp của Baidu, nó yêu cầu các nhà phát triển phải chấp nhận framework học sâu PaddlePaddle cụ thể. Điều này có thể tạo ra một lộ trình học tập dốc hơn cho các nhóm đã được tiêu chuẩn hóa trên PyTorch. Ngoài ra, việc xuất các mô hình PP-YOLOE+ sang các định dạng phổ biến tiêu chuẩn cho các thiết bị edge có thể yêu cầu các bước chuyển đổi bổ sung so với các quy trình xuất nguyên bản được tìm thấy trong các quy trình làm việc của Ultralytics.
Các trường hợp sử dụng lý tưởng#
Việc lựa chọn giữa các mô hình này phụ thuộc vào môi trường triển khai cụ thể của bạn.
- Chọn YOLO11 cho phát triển linh hoạt, edge computing và các ứng dụng di động. Tốc độ inference cao, dung lượng bộ nhớ thấp và khả năng xuất file phong phú biến nó thành lựa chọn lý tưởng cho các tác vụ như retail inventory management thời gian thực trên CPU tiêu chuẩn, phân tích hình ảnh trên không bằng drone và các pipeline đa nhiệm phức tạp.
- Chọn PP-YOLOE+ nếu toàn bộ quy trình sản xuất của bạn đã được đầu tư mạnh mẽ vào hệ sinh thái PaddlePaddle hoặc nếu bạn đang triển khai cho các máy chủ inference chuyên dụng, cao cấp nơi các hạn chế về bộ nhớ và khả năng tương thích phần cứng (ngoài phần cứng đã tối ưu hóa của Paddle) không phải là mối quan tâm chính.
Thế hệ tiếp theo: Giới thiệu YOLO26#
Mặc dù YOLO11 vẫn cực kỳ mạnh mẽ, lĩnh vực AI phát triển rất nhanh. Đối với công nghệ tiên tiến nhất trong lĩnh vực phát hiện đối tượng, Ultralytics đã giới thiệu YOLO26 mới. Được phát hành vào tháng 1 năm 2026, YOLO26 kế thừa thành công từ những thế hệ tiền nhiệm để mang lại hiệu suất và độ chính xác chưa từng có.
Các cải tiến chính của YOLO26:
- Thiết kế End-to-End Không dùng NMS: YOLO26 loại bỏ nguyên bản quá trình xử lý hậu kỳ Non-Maximum Suppression (NMS). Điều này giúp tăng tốc đáng kể quá trình inference và đơn giản hóa logic triển khai, một bước nhảy vọt về kiến trúc lần đầu tiên được tiên phong trong YOLOv10.
- Tốc độ Inference CPU nhanh hơn tới 43%: Được tối ưu hóa đặc biệt cho các thiết bị edge không có GPU, đảm bảo hiệu suất thời gian thực trên phần cứng công suất thấp hơn.
- Trình tối ưu hóa MuSGD: Lấy cảm hứng từ sự ổn định trong huấn luyện LLM, sự kết hợp giữa SGD và Muon này đảm bảo sự hội tụ nhanh hơn và quá trình huấn luyện ổn định hơn.
- ProgLoss + STAL: Các hàm mất mát (loss function) được cải tiến giúp nâng cao đáng kể khả năng nhận diện đối tượng nhỏ, điều cốt yếu đối với các drone applications và giám sát an ninh.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa việc xuất mô hình và cải thiện đáng kể khả năng tương thích trên một loạt các thiết bị edge.
Đối với các dự án mới ưu tiên tốc độ, khả năng xuất file liền mạch và độ chính xác tối đa, chúng tôi đặc biệt khuyên dùng việc tận dụng các tính năng của YOLO26 thông qua Ultralytics Platform.
Nếu bạn đang đánh giá các kiến trúc khác, bạn cũng có thể quan tâm đến việc so sánh YOLO11 với RT-DETR hoặc khám phá xem YOLOv8 cũ thể hiện như thế nào trong các benchmark hiện đại.