PP-YOLOE+ và YOLOv6-3.0#
Lĩnh vực thị giác máy tính thời gian thực phát triển nhanh chóng, dẫn đến sự ra đời của các kiến trúc chuyên biệt cao, được tối ưu cho nhiều kịch bản triển khai khác nhau. Nhà phát triển thường so sánh PP-YOLOE+ và YOLOv6-3.0 khi xây dựng ứng dụng cần cân bằng giữa thông lượng cao và độ chính xác đáng tin cậy. Cả hai model đều mang đến những cải tiến kiến trúc đáng kể khi ra mắt, tập trung nâng cao tốc độ suy luận cho các ứng dụng công nghiệp và edge.
Trước khi đi sâu vào phân tích chi tiết kiến trúc, hãy xem biểu đồ bên dưới để hình dung hiệu năng tương quan của các model này về tốc độ và độ chính xác.
PP-YOLOE+: Điểm mạnh và điểm yếu về kiến trúc#
Được phát triển bởi các tác giả PaddlePaddle, PP-YOLOE+ là một bộ phát hiện anchor-free nổi bật, kế thừa các thế hệ trước để mang lại hiệu năng ổn định ở nhiều yêu cầu quy mô khác nhau.
- Tác giả: Nhóm tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
Điểm nổi bật về kiến trúc#
PP-YOLOE+ giới thiệu một số cải tiến quan trọng so với thiết kế PP-YOLOE ban đầu. Model tận dụng backbone CSPRepResNet mạnh mẽ, giúp cân bằng hiệu quả chi phí tính toán và khả năng trích xuất đặc trưng. Ngoài ra, model tích hợp mạng kim tự tháp đặc trưng (FPN) tiên tiến cùng Mạng tổng hợp đường dẫn (PAN) để đảm bảo hợp nhất đặc trưng đa tỷ lệ. Một trong những tính năng nổi bật là ET-head (head căn chỉnh tác vụ hiệu quả), giúp cải thiện đáng kể sự phối hợp giữa phân loại và định vị trong quá trình phát hiện đối tượng.
Mặc dù PP-YOLOE+ đạt độ chính xác trung bình trung bình (mAP) ấn tượng, việc phụ thuộc vào hệ sinh thái PaddlePaddle đôi khi khiến các nhà nghiên cứu quen với quy trình PyTorch-native gặp khó khăn khi làm quen. Điều này có thể khiến quá trình triển khai model phức tạp hơn đôi chút khi nhắm đến các thiết bị edge không đồng nhất, thiếu hỗ trợ suy luận Paddle trực tiếp.
PP-YOLOE+ được tối ưu cao để triển khai trong hệ công nghệ của Baidu, nên là lựa chọn tuyệt vời nếu môi trường production của bạn phụ thuộc nhiều vào các công cụ suy luận Paddle.
YOLOv6-3.0: Thông lượng công nghiệp#
Được phát hành bởi Phòng Thị giác AI của Meituan, YOLOv6-3.0 được thiết kế rõ ràng như bộ phát hiện đối tượng thế hệ tiếp theo cho ứng dụng công nghiệp, ưu tiên thông lượng cực cao trên phần cứng GPU.
- Tác giả: Chuyi Li, Lulu Li, Yifei Geng, và cộng sự.
- Tổ chức: Meituan
- Ngày: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Điểm nổi bật về kiến trúc#
YOLOv6-3.0 có backbone EfficientRep được thiết kế riêng để tối đa hóa mức độ tận dụng phần cứng, đặc biệt trên GPU NVIDIA sử dụng TensorRT. Bản cập nhật v3.0 bổ sung module Kết nối hai chiều (BiC) vào neck, tăng cường khả năng giữ lại đặc trưng không gian mà không làm số lượng tham số tăng quá mức. Ngoài ra, model giới thiệu chiến lược Huấn luyện hỗ trợ anchor (AAT), kết hợp lợi ích về độ ổn định của phương pháp dựa trên anchor trong quá trình huấn luyện model mà vẫn duy trì kiến trúc anchor-free nhanh trong suy luận thời gian thực.
Tuy nhiên, do YOLOv6-3.0 được tối ưu cao cho GPU cấp máy chủ, mức cải thiện độ trễ đôi khi giảm đi khi triển khai trên các thiết bị edge chỉ có CPU với tài nguyên hạn chế nghiêm ngặt. Tính chuyên biệt này giúp model hoạt động xuất sắc trong những môi trường như phân tích video ngoại tuyến, nhưng có thể kém hơn các model được tối ưu động trên phần cứng nhỏ, cục bộ.
Bảng so sánh hiệu năng#
Bảng sau nêu bật các chỉ số hiệu năng chính, so sánh trực tiếp các biến thể tỷ lệ khác nhau của hai kiến trúc.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa PP-YOLOE+ và YOLOv6 phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và mức độ phù hợp với hệ sinh thái.
Khi nào nên chọn PP-YOLOE+#
PP-YOLOE+ là lựa chọn phù hợp trong các trường hợp:
- Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
- Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
- Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.
Khi nào nên chọn YOLOv6#
YOLOv6 được khuyến nghị cho:
- Triển khai tương thích với phần cứng công nghiệp: Các tình huống mà thiết kế nhận biết phần cứng và tái tham số hóa hiệu quả của model mang lại hiệu năng tối ưu trên phần cứng mục tiêu cụ thể.
- Detection một giai đoạn tốc độ cao: Các ứng dụng ưu tiên tốc độ suy luận GPU thô để xử lý video thời gian thực trong môi trường được kiểm soát.
- Tích hợp hệ sinh thái Meituan: Các nhóm đang làm việc trong ngăn xếp công nghệ và hạ tầng triển khai của Meituan.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Lợi thế của Ultralytics: Vượt xa các model cũ#
PP-YOLOE+ và YOLOv6-3.0 cung cấp các giải pháp chuyên biệt, nhưng việc phát triển AI hiện đại đòi hỏi quy trình làm việc linh hoạt và tiết kiệm bộ nhớ. Đây là lúc Ultralytics Platform mang đến trải nghiệm phát triển vượt trội. Với Python API thống nhất, bạn có thể dễ dàng huấn luyện, đánh giá và triển khai các model tiên tiến mà không cần xử lý khối lượng cấu hình khổng lồ thường thấy trong các repository nghiên cứu cũ.
Các model Ultralytics vốn hỗ trợ nhiều tác vụ thị giác ngoài phát hiện tiêu chuẩn, bao gồm phân đoạn instance, phân loại ảnh, ước tính tư thế và trích xuất hộp giới hạn xoay (OBB). Ngoài ra, các model được tối ưu cao để giảm mức sử dụng bộ nhớ trong quá trình huấn luyện—trái ngược rõ rệt với các model dựa trên Transformer như RT-DETR, vốn thường đòi hỏi lượng VRAM GPU khổng lồ.
Khám phá YOLO26: Tiêu chuẩn mới#
Đối với các tổ chức muốn triển khai những model thị giác tiên tiến hàng đầu, Ultralytics YOLO26 (ra mắt vào tháng 1 năm 2026) tái định nghĩa các giới hạn hiệu năng. Model vượt trội đáng kể so với các thế hệ cũ nhờ một số cải tiến quan trọng:
- Thiết kế end-to-end không cần NMS: Kế thừa các khái niệm từ YOLOv10, head one-to-one tùy chọn (
nms=False) của YOLO26 loại bỏ hoàn toàn bước hậu xử lý Ức chế phi cực đại (NMS). Phương pháp end-to-end vốn có này đảm bảo suy luận độ trễ cực thấp, có thể dự đoán—yếu tố thiết yếu cho các hệ thống an toàn thời gian thực. - Suy luận CPU nhanh hơn đến 43%: Nhờ loại bỏ Distribution Focal Loss (DFL) khỏi kiến trúc, YOLO26 được tối ưu mạnh mẽ cho điện toán edge và các môi trường không có GPU chuyên dụng.
- Optimizer MuSGD: Bằng cách tích hợp tính ổn định trong huấn luyện LLM vào model thị giác, optimizer lai này (lấy cảm hứng từ Moonshot AI) giúp hội tụ nhanh và duy trì độ ổn định cao trong các phiên huấn luyện tùy chỉnh.
- ProgLoss + STAL: Các công thức loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố thiết yếu cho các ứng dụng như ảnh chụp trên không bằng drone và phân tích cảnh đông người.
Nếu đang bắt đầu một dự án mới hôm nay, chúng tôi đặc biệt khuyến nghị bỏ qua các kiến trúc cũ và áp dụng YOLO26. Khả năng tiết kiệm bộ nhớ và tốc độ không cần NMS giúp đưa model vào production dễ dàng hơn đáng kể.
Triển khai liền mạch#
Việc huấn luyện và export các model tiên tiến bằng gói Python Ultralytics vô cùng đơn giản. Ví dụ sau minh họa cách huấn luyện model YOLO26 mới nhất và export sang ONNX để triển khai nhanh trên edge:
from ultralytics import YOLO
# Tải model YOLO26 small tiên tiến nhất
model = YOLO("yolo26s.pt")
# Huấn luyện model trên dataset ví dụ COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Chạy suy luận không cần NMS trên ảnh kiểm thử
predict_results = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)
# Export sang định dạng ONNX để triển khai trên edge
model.export(format="onnx")Đối với các nhóm gắn bó sâu với quy trình cũ nhưng muốn có độ ổn định hiện đại, khám phá Ultralytics YOLO11 cũng là một bước chuyển tiếp tuyệt vời, cung cấp khả năng xử lý đa dạng tác vụ toàn diện với sự hỗ trợ của toàn bộ hệ sinh thái Ultralytics.