EfficientDet và PP-YOLOE+#
Lĩnh vực thị giác máy tính chịu ảnh hưởng sâu sắc từ sự phát triển không ngừng của các model phát hiện vật thể. Hai cột mốc quan trọng trong quá trình này là EfficientDet của Google và PP-YOLOE+ của Baidu. Cả hai kiến trúc đều được thiết kế để cân bằng sự đánh đổi tinh tế giữa hiệu quả tính toán và độ chính xác phát hiện, nhưng tiếp cận thách thức này theo những triết lý thiết kế hoàn toàn khác nhau.
Hướng dẫn toàn diện này phân tích chi tiết kiến trúc, phương pháp huấn luyện và các kịch bản triển khai thực tế của hai model, giúp bạn chọn mạng neural tối ưu cho ứng dụng thị giác máy tính tiếp theo.
Đổi mới kiến trúc và triết lý thiết kế#
Hiểu rõ kiến trúc nền tảng của các model này là yếu tố then chốt để triển khai hiệu quả trong môi trường production, dù trên thiết bị biên hay máy chủ cloud.
EfficientDet: Sức mạnh của compound scaling#
Được phát triển bởi Google Research, EfficientDet tạo ra bước chuyển đổi mô hình bằng cách xem việc scale model không phải là một quy trình tùy tiện, mà là phương pháp compound scaling có cơ sở toán học.
- Tác giả: Mingxing Tan, Ruoming Pang và Quoc V. Le
- Tổ chức: Google Research
- Ngày: 2019-11-20
- Arxiv: 1911.09070
- GitHub: google/automl
- Tài liệu: Tài liệu EfficientDet
Đổi mới cốt lõi của EfficientDet nằm ở Mạng Kim tự tháp Đặc trưng Hai chiều (BiFPN). Không giống các FPN truyền thống chỉ cộng đặc trưng theo hướng từ trên xuống, BiFPN sử dụng trọng số có thể học để kết hợp đặc trưng đa tỉ lệ theo cả hai hướng từ trên xuống và từ dưới lên. Nhờ đó, mạng có thể tự nhận biết tầm quan trọng của các đặc trưng đầu vào khác nhau. Kết hợp với backbone EfficientNet, EfficientDet đồng thời scale độ phân giải, độ sâu và độ rộng, tạo ra một họ model (d0 đến d7) phù hợp với các mức ngân sách tính toán khác nhau.
Khi triển khai EfficientDet, hãy cân nhắc kỹ phần cứng mục tiêu. Trong khi d0 phù hợp với thiết bị di động, scale lên d7 đòi hỏi đáng kể bộ nhớ GPU và năng lực tính toán.
PP-YOLOE+: Mở rộng giới hạn của PaddlePaddle#
Tiếp nối thành công của các phiên bản trước, PP-YOLOE+ được đội ngũ PaddlePaddle tại Baidu phát triển để mang lại hiệu năng tiên tiến nhất, đặc biệt tối ưu cho triển khai máy chủ có thông lượng cao.
- Tác giả: Nhóm tác giả PaddlePaddle
- Tổ chức: Baidu
- Ngày: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- Tài liệu: Cấu hình PP-YOLOE+
PP-YOLOE+ có backbone CSPRepResNet, kết hợp mạng Cross Stage Partial với kỹ thuật tái tham số hóa để tăng cường trích xuất đặc trưng mà không làm tăng độ trễ suy luận. ET-head (đầu Efficient Task-aligned) cải thiện đáng kể sự căn chỉnh giữa các tác vụ phân loại và định vị. Ngoài ra, model sử dụng thiết kế không anchor kết hợp với gán nhãn động (TAL), giúp tinh gọn quy trình huấn luyện và cải thiện khả năng tổng quát hóa trên các dataset đa dạng.
Chỉ số hiệu năng và benchmark#
Khi chọn model cho suy luận thời gian thực, việc đánh giá sự cân bằng giữa độ chính xác trung bình (mAP) và tốc độ tính toán là tối quan trọng. Bảng dưới đây trình bày các chỉ số hiệu năng chính của cả hai họ model.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Như có thể thấy, PP-YOLOE+ thường đạt mức độ chính xác cao hơn với cùng số lượng tham số, đặc biệt ở các biến thể lớn hơn (l và x). Model được tối ưu mạnh cho thông lượng GPU, nên là lựa chọn xuất sắc cho triển khai xử lý theo lô trên máy chủ. Ngược lại, các model EfficientDet nhỏ hơn có tỷ lệ tham số trên FLOP rất hiệu quả, có thể hữu ích trong môi trường bị giới hạn nghiêm ngặt về bộ nhớ.
Trường hợp sử dụng lý tưởng và chiến lược triển khai#
Việc lựa chọn giữa các kiến trúc này thường phụ thuộc nhiều vào tech stack hiện có và phần cứng triển khai của bạn.
Khi nào nên chọn EfficientDet:
- Quy trình AutoML: Nếu bạn phụ thuộc nhiều vào hệ sinh thái Google và sử dụng khả năng tìm kiếm kiến trúc tự động.
- Thiết bị biên hạn chế tài nguyên: Các model cấp thấp hơn (d0, d1) mang lại hiệu năng có thể dự đoán trên CPU di động, nơi dung lượng tham số bị giới hạn nghiêm ngặt.
Khi nào nên chọn PP-YOLOE+:
- Máy chủ GPU cao cấp: Các kịch bản cần thông lượng tối đa trên phần cứng NVIDIA, chẳng hạn xử lý hàng trăm luồng video đồng thời để giám sát thành phố thông minh.
- Hệ sinh thái PaddlePaddle: Nếu đội ngũ phát triển của bạn đã sử dụng framework deep learning của Baidu, việc tích hợp PP-YOLOE+ sẽ rất thuận tiện.
Ưu thế của Ultralytics: Giới thiệu YOLO26#
Dù EfficientDet và PP-YOLOE+ là những model mạnh mẽ, tốc độ đổi mới AI nhanh chóng đòi hỏi các giải pháp vừa có hiệu năng tiên tiến vừa dễ sử dụng vượt trội. Đây là điểm mạnh của Ultralytics YOLO26, giúp model trở thành lựa chọn hàng đầu cho các ứng dụng thị giác máy tính hiện đại.
Ra mắt năm 2026, YOLO26 định nghĩa lại hoàn toàn khả năng phát hiện vật thể thời gian thực bằng cách giới thiệu Thiết kế đầu-cuối không cần NMS nguyên bản. Bằng cách tùy chọn bỏ qua bước hậu xử lý Non-Maximum Suppression (nms=False)—một nút thắt dai dẳng trong các model cũ—YOLO26 giúp đơn giản hóa đáng kể việc triển khai và giảm độ dao động độ trễ suy luận.
Ngoài ra, YOLO26 được tối ưu chuyên biệt cho triển khai trên thiết bị biên. Việc loại bỏ Distribution Focal Loss (DFL) giúp đơn giản hóa quy trình xuất model sang các định dạng như ONNX và TensorRT, mang lại khả năng suy luận CPU nhanh hơn tới 43% so với các thế hệ trước. Nhờ đó, YOLO26 đặc biệt mạnh mẽ trên thiết bị IoT chạy bằng pin.
YOLO26 tích hợp Optimizer MuSGD cải tiến, kết hợp SGD và Muon. Lấy cảm hứng từ những tiến bộ trong huấn luyện LLM, optimizer này đảm bảo quá trình huấn luyện có độ ổn định cao và hội tụ nhanh, tiết kiệm thời gian tính toán GPU quý giá.
Nhà phát triển cũng có thể tận dụng các hàm loss tiên tiến của YOLO26, bao gồm ProgLoss + STAL, cho thấy khả năng cải thiện đáng kể trong nhận diện vật thể nhỏ—một yêu cầu thiết yếu đối với ảnh chụp từ trên không và ứng dụng nông nghiệp chính xác.
Triển khai liền mạch với Ultralytics#
Sức mạnh thực sự của Ultralytics nằm ở hệ sinh thái hợp nhất. Không giống các model đòi hỏi script huấn luyện tùy chỉnh phức tạp, YOLO26 cung cấp API cực kỳ tinh gọn. Để huấn luyện model trên dataset tùy chỉnh, bạn chỉ cần vài dòng code Python:
from ultralytics import YOLO
# Tải model YOLO26 đã được huấn luyện trước
model = YOLO("yolo26n.pt")
# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Chạy suy luận trên ảnh mới
predictions = model("https://ultralytics.com/images/bus.jpg")
# Xuất sang định dạng ONNX để triển khai
model.export(format="onnx")Dù bạn cần phát hiện tiêu chuẩn hay các tác vụ chuyên biệt như phân đoạn instance và ước tính tư thế, YOLO26 đều hỗ trợ sẵn các tác vụ này bằng prototype đa tỉ lệ và Residual Log-Likelihood Estimation (RLE), tất cả trong cùng một framework thân thiện với người dùng.
Khám phá các model đáng chú ý khác#
Nếu đang đánh giá kiến trúc cho các yêu cầu doanh nghiệp cụ thể, bạn cũng nên cân nhắc thế hệ trước là Ultralytics YOLO11, một model mạnh mẽ, đã được kiểm chứng trong production. Với các ứng dụng cần kiến trúc dựa trên Transformer, RT-DETR là một lựa chọn thay thế đáng chú ý, dù thường đòi hỏi nhiều bộ nhớ CUDA hơn trong quá trình huấn luyện so với các biến thể YOLO hiệu quả cao.
Tóm lại, EfficientDet cung cấp phương pháp scale có cơ sở chặt chẽ và PP-YOLOE+ mang lại thông lượng GPU xuất sắc trong framework riêng, nhưng Ultralytics YOLO26 là giải pháp cân bằng, linh hoạt và thân thiện với nhà phát triển nhất hiện nay. Kiến trúc đầu-cuối nguyên bản cùng khả năng tích hợp rộng rãi khiến YOLO26 trở thành nền tảng được khuyến nghị cho AI thị giác thế hệ tiếp theo.