YOLO11 và PP-YOLOE+#
Việc chọn kiến trúc mạng nơ-ron tối ưu là yếu tố then chốt khi triển khai ứng dụng thị giác máy tính trong môi trường sản xuất. Trong phần so sánh kỹ thuật này, chúng tôi xem xét hai model nổi bật trong lĩnh vực phát hiện vật thể thời gian thực: Ultralytics YOLO11 và PP-YOLOE+ của Baidu. Cả hai kiến trúc đều có hiệu năng mạnh mẽ, nhưng tiếp cận các thách thức về độ chính xác, tốc độ suy luận và hệ sinh thái developer theo những cách rất khác nhau.
Dưới đây là biểu đồ tương tác thể hiện giới hạn hiệu năng của các model này, giúp bạn xác định lựa chọn phù hợp nhất với giới hạn phần cứng.
Nguồn gốc model và quá trình phát triển kỹ thuật#
Việc tìm hiểu nguồn gốc và triết lý thiết kế của các model này cung cấp bối cảnh hữu ích về thế mạnh riêng và các trường hợp sử dụng phù hợp nhất của chúng.
Thông tin về YOLO11#
Được phát triển bởi Ultralytics, YOLO11 là một phiên bản cải tiến đáng kể của dòng YOLO, ưu tiên cân bằng giữa tốc độ suy luận cao, hiệu quả tham số vượt trội và tính dễ sử dụng khó có đối thủ. Model được công nhận rộng rãi nhờ khả năng đa tác vụ hợp nhất và API Python thân thiện với developer.
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: Tài liệu YOLO11
Thông tin chi tiết về PP-YOLOE+#
PP-YOLOE+ là phiên bản phát triển từ PP-YOLOv2, được xây dựng trên framework PaddlePaddle. Model đưa vào các thay đổi về kiến trúc như backbone CSPRepResNet và Học căn chỉnh tác vụ (TAL) để nâng cao độ chính xác, đặc biệt trên GPU cao cấp.
- Tác giả: Nhóm tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Tài liệu: Tài liệu cấu hình PP-YOLOE+
Khác biệt về kiến trúc#
Thiết kế kiến trúc nền tảng của YOLO11 và PP-YOLOE+ phản ánh những ưu tiên khác nhau trong lĩnh vực thị giác máy tính.
YOLO11 được xây dựng dựa trên backbone được tối ưu hóa cao và head phát hiện không cần anchor. Model sử dụng các block C3k2 và Spatial Pyramid Pooling - Fast (SPPF) để trích xuất đặc trưng đa tỷ lệ với chi phí tính toán tối thiểu. Thiết kế này đặc biệt có lợi trong việc giảm độ trễ suy luận trên các thiết bị hạn chế tài nguyên như NPU biên và CPU di động. Ngoài ra, YOLO11 được thiết kế sẵn để học đa tác vụ, hỗ trợ phân đoạn đối tượng, ước tính tư thế và phát hiện hộp giới hạn định hướng (OBB) ngay khi cài đặt.
PP-YOLOE+ đưa vào backbone CSPRepResNet và head căn chỉnh tác vụ hiệu quả (ET-head). Model tận dụng mạnh các kỹ thuật tái tham số hóa để tăng năng lực biểu diễn trong quá trình huấn luyện, đồng thời gộp các tham số đó vào các phép tích chập tiêu chuẩn khi suy luận. Dù đạt độ chính xác trung bình trung bình (mAP) ấn tượng, các model tạo ra thường có nhiều tham số hơn và chiếm nhiều bộ nhớ hơn, nên phù hợp triển khai trên GPU máy chủ mạnh thay vì thiết bị biên gọn nhẹ.
Nếu dự án cần mở rộng vượt ra ngoài các hộp giới hạn tiêu chuẩn, Ultralytics YOLO11 hỗ trợ sẵn phân đoạn, ước tính tư thế và phân loại trong cùng một API, giúp giảm đáng kể khối lượng phát triển so với việc tích hợp nhiều repository riêng biệt.
Hiệu năng và benchmark#
Khi đánh giá hiệu năng, chúng tôi xem xét độ chính xác (mAP), tốc độ suy luận trên nhiều phần cứng khác nhau và hiệu quả của model (số tham số và FLOPs). Bảng dưới đây nêu bật các chỉ số so sánh, trong đó các giá trị hiệu quả nhất hoặc có hiệu năng cao nhất được in đậm.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Phân tích#
YOLO11 cho thấy ưu thế rõ rệt về cân bằng hiệu năng và hiệu quả tham số. Chẳng hạn, YOLO11m đạt mAP cao hơn (51.5) so với PP-YOLOE+m (49.8), đồng thời sử dụng ít tham số hơn (20.1M so với 23.43M) và suy luận nhanh hơn đáng kể trên TensorRT (4.7ms so với 5.56ms). Bản chất gọn nhẹ của các model YOLO11 giúp giảm nhu cầu bộ nhớ trong cả quá trình huấn luyện model lẫn triển khai.
Hệ sinh thái huấn luyện và tính dễ sử dụng#
Giá trị thực sự của một model thường nằm ở mức độ dễ dàng để developer huấn luyện model đó trên dataset thị giác máy tính tùy chỉnh và triển khai vào môi trường production.
Lợi thế của Ultralytics#
Ultralytics ưu tiên trải nghiệm developer tinh gọn. Việc huấn luyện YOLO11 được thực hiện thông qua API Python hoặc CLI đơn giản, giúp ẩn đi phần lớn mã boilerplate phức tạp. Nền tảng Ultralytics còn cải thiện quy trình này bằng cách cung cấp tính năng huấn luyện không cần viết mã, quản lý dataset tự động và xuất chỉ bằng một cú nhấp chuột sang các định dạng như ONNX, CoreML và TensorRT.
Ngoài ra, các model YOLO sử dụng bộ nhớ rất hiệu quả trong quá trình huấn luyện, tránh mức tiêu thụ VRAM khổng lồ thường thấy ở kiến trúc dựa trên Transformer hoặc model tái tham số hóa cồng kềnh, nhờ đó có thể huấn luyện trên phần cứng phổ thông.
from ultralytics import YOLO
# Tải model YOLO11 đã huấn luyện trước
model = YOLO("yolo11n.pt")
# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Chạy suy luận trên một ảnh
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Hệ sinh thái PP-YOLOE+#
PP-YOLOE+ hoạt động trong hệ sinh thái PaddleDetection. Framework này mạnh mẽ và tích hợp sâu với các giải pháp công nghiệp của Baidu, nhưng yêu cầu developer sử dụng framework deep learning PaddlePaddle chuyên biệt. Điều này có thể khiến các nhóm đã tiêu chuẩn hóa PyTorch phải đối mặt với đường cong học tập dốc hơn. Ngoài ra, việc xuất model PP-YOLOE+ sang các định dạng phổ quát tiêu chuẩn cho thiết bị biên có thể đòi hỏi thêm các bước chuyển đổi so với pipeline xuất tích hợp sẵn trong quy trình làm việc của Ultralytics.
Các trường hợp sử dụng phù hợp nhất#
Việc lựa chọn giữa các model này phụ thuộc vào môi trường triển khai cụ thể của bạn.
- Chọn YOLO11 để phát triển linh hoạt, điện toán biên và ứng dụng di động. Tốc độ suy luận cao, dung lượng bộ nhớ thấp và khả năng xuất đa dạng khiến model này lý tưởng cho các tác vụ như quản lý tồn kho bán lẻ theo thời gian thực trên CPU tiêu chuẩn, phân tích ảnh hàng không từ drone và các pipeline đa tác vụ phức tạp.
- Chọn PP-YOLOE+ nếu toàn bộ pipeline production của bạn đã đầu tư mạnh vào hệ sinh thái PaddlePaddle, hoặc nếu bạn triển khai trên các máy chủ suy luận chuyên dụng cao cấp, nơi giới hạn bộ nhớ và khả năng tương thích phần cứng (ngoài phần cứng được Paddle tối ưu hóa) không phải là mối quan tâm chính.
Thế hệ tiếp theo: Giới thiệu YOLO26#
Dù YOLO11 vẫn rất mạnh mẽ, lĩnh vực AI phát triển nhanh chóng. Để tiếp cận công nghệ phát hiện đối tượng tiên tiến nhất, Ultralytics đã giới thiệu YOLO26 mới. Ra mắt vào tháng 1 năm 2026, YOLO26 kế thừa thành công của các phiên bản trước để mang lại hiệu quả và độ chính xác chưa từng có.
Các cải tiến chính của YOLO26:
- Thiết kế end-to-end không cần NMS: Head một-một tùy chọn của YOLO26 (
nms=False) bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS). Điều này giúp tăng đáng kể tốc độ suy luận và đơn giản hóa logic triển khai; đây là bước tiến kiến trúc được YOLOv10 tiên phong. - Suy luận CPU nhanh hơn đến 43%: Được tối ưu chuyên biệt cho thiết bị biên không có GPU, đảm bảo hiệu năng thời gian thực trên phần cứng công suất thấp.
- Optimizer MuSGD: Lấy cảm hứng từ độ ổn định khi huấn luyện LLM, phương pháp kết hợp SGD và Muon này giúp hội tụ nhanh hơn và huấn luyện ổn định hơn.
- ProgLoss + STAL: Các hàm loss cải tiến nâng cao đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt trong ứng dụng drone và giám sát an ninh.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quá trình xuất model và cải thiện đáng kể khả năng tương thích trên nhiều loại thiết bị biên.
Với các dự án mới ưu tiên tốc độ, khả năng xuất liền mạch và độ chính xác tối đa, chúng tôi đặc biệt khuyến nghị khai thác các khả năng của YOLO26 thông qua Nền tảng Ultralytics.
Nếu đang đánh giá các kiến trúc khác, bạn cũng có thể quan tâm đến việc so sánh YOLO11 với RT-DETR hoặc tìm hiểu khả năng của YOLOv8 thế hệ trước trong các benchmark hiện đại.