YOLO11 và EfficientDet#
Để lựa chọn mạng neural tối ưu cho các dự án thị giác máy tính, cần hiểu sâu về những kiến trúc hiện có. Hướng dẫn này cung cấp phần so sánh kỹ thuật chuyên sâu giữa Ultralytics YOLO11 và EfficientDet của Google. Chúng ta sẽ tìm hiểu sự khác biệt về kiến trúc, chỉ số hiệu năng, hiệu quả huấn luyện và các kịch bản triển khai lý tưởng để giúp bạn đưa ra quyết định sáng suốt cho workload machine learning của mình.
Thông tin nền và thông số kỹ thuật của model#
Cả hai model đều có ảnh hưởng đáng kể đến lĩnh vực học sâu, dù xuất phát từ những triết lý thiết kế và giai đoạn phát triển AI khác nhau.
Thông tin về YOLO11#
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: https://docs.ultralytics.com/models/yolo11
Thông tin về EfficientDet#
- Tác giả: Mingxing Tan, Ruoming Pang và Quoc V. Le
- Tổ chức: Google
- Ngày: 2019-11-20
- arXiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
- Tài liệu: https://github.com/google/automl/tree/master/efficientdet#readme
Khi làm việc với các model thị giác máy tính, hệ sinh thái xung quanh cũng quan trọng không kém bản thân model. Hệ sinh thái Ultralytics mang đến trải nghiệm developer vượt trội, với tài liệu phong phú, cộng đồng hỗ trợ tích cực và khả năng xuất liền mạch sang các định dạng như ONNX và TensorRT.
Các cải tiến kiến trúc#
EfficientDet: BiFPN và mở rộng theo hệ số#
Ra mắt vào cuối năm 2019, EfficientDet hướng tới tối đa hóa độ chính xác đồng thời giảm thiểu chi phí tính toán. Model đạt được mục tiêu này chủ yếu thông qua hai cơ chế. Thứ nhất, model sử dụng backbone EfficientNet để mở rộng đồng bộ độ sâu, chiều rộng và độ phân giải. Thứ hai, model giới thiệu Mạng kim tự tháp đặc trưng hai chiều (BiFPN), cho phép hợp nhất đặc trưng đa tỉ lệ dễ dàng và nhanh chóng.
Dù rất hiệu quả vào thời điểm đó, việc EfficientDet phụ thuộc vào thư viện AutoML của TensorFlow có thể khiến model kém linh hoạt. So với các framework hiện đại, dạng module dựa trên PyTorch, các nhà nghiên cứu thường gặp khó khăn khi tỉa model và tùy chỉnh.
YOLO11: Trích xuất đặc trưng nâng cao và tính linh hoạt#
YOLO11 đánh dấu bước tiến đáng kể trong các kiến trúc phát hiện đối tượng. Model kế thừa những thành tựu từ các phiên bản trước, đồng thời giới thiệu các block C3k2 được tinh chỉnh và module Spatial Pyramid Pooling cải tiến. Những cải tiến này giúp trích xuất đặc trưng vượt trội, cho phép YOLO11 nắm bắt các mẫu hình ảnh phức tạp với độ rõ nét xuất sắc.
Một ưu điểm lớn của YOLO11 là tính linh hoạt. EfficientDet chỉ là model phát hiện đối tượng, trong khi YOLO11 hỗ trợ nguyên bản phân đoạn instance, phân loại ảnh, ước lượng tư thế và hộp giới hạn có hướng (OBB). Hơn nữa, YOLO11 có nhu cầu bộ nhớ cực thấp trong cả quá trình huấn luyện lẫn suy luận, vượt trội hơn hẳn các model cũ và các vision Transformer cồng kềnh khi triển khai trong môi trường AI biên bị giới hạn tài nguyên.
Hiệu năng và benchmark#
Sự cân bằng giữa độ chính xác, được đo bằng độ chính xác trung bình (mAP), và tốc độ suy luận là yếu tố quyết định then chốt trong triển khai thực tế. Bảng dưới đây minh họa hiệu năng thực tế của cả hai dòng model trên bộ dữ liệu COCO tiêu chuẩn.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Như bảng cho thấy, YOLO11 đạt được sự cân bằng hiệu năng rất thuận lợi. YOLO11x có độ chính xác tổng thể cao nhất (54.7 mAP), trong khi các biến thể YOLO11 nhỏ hơn hoàn toàn vượt trội về tốc độ suy luận GPU (nhanh chỉ 1.5ms trên T4 khi sử dụng TensorRT).
Hiệu quả huấn luyện và hệ sinh thái#
Một trong những đặc điểm nổi bật của các model Ultralytics là tính dễ sử dụng. Việc huấn luyện model EfficientDet thường đòi hỏi phải xử lý các cấu hình đồ thị TensorFlow phức tạp và quản lý chuỗi dependency rắc rối. Ngược lại, YOLO11 được xây dựng trên nền tảng PyTorch hiện đại, rõ ràng và được chăm chút kỹ lưỡng.
Nhờ hệ sinh thái được duy trì tốt, developer có thể cài đặt package, tải model đã huấn luyện trước và bắt đầu huấn luyện trên bộ dữ liệu tùy chỉnh chỉ với vài dòng code.
Ví dụ code Python#
Sau đây là ví dụ có thể chạy đầy đủ, minh họa sự đơn giản của API Ultralytics. Script này tải model YOLO11 đã huấn luyện trước, huấn luyện model và chạy một lượt dự đoán nhanh.
from ultralytics import YOLO
# Khởi tạo model YOLO11 nano đã huấn luyện trước
model = YOLO("yolo11n.pt")
# Huấn luyện model hiệu quả bằng engine PyTorch tích hợp
# Hiệu quả huấn luyện cao, cần ít VRAM hơn các model cũ
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")
# Chạy suy luận thời gian thực trên ảnh mẫu
prediction = model.predict("https://ultralytics.com/images/bus.jpg")
# Hiển thị các hộp giới hạn đầu ra
prediction[0].show()Hướng tới tương lai: Ưu thế của YOLO26#
Dù YOLO11 có năng lực vượt trội, các nhóm bắt đầu dự án mới nên cân nhắc nghiêm túc Ultralytics YOLO26, phát hành vào tháng 1 năm 2026. YOLO26 đánh dấu sự chuyển đổi mô hình trong việc đơn giản hóa triển khai và nâng cao hiệu năng biên.
Các cải tiến chính của YOLO26 gồm:
- Thiết kế End-to-End không cần NMS: Head một-một tùy chọn (
nms=False) bỏ qua bước hậu xử lý triệt tiêu cực đại (NMS), giúp YOLO26 duy trì độ trễ cực thấp và ổn định, yếu tố then chốt cho robot học tốc độ cao và xe tự hành. - Suy luận CPU nhanh hơn tới 43%: Đối với các triển khai không có GPU chuyên dụng, YOLO26 được tối ưu hóa đặc biệt để tối đa hóa thông lượng trên các bộ xử lý tiêu chuẩn.
- Bộ tối ưu hóa MuSGD: Lấy cảm hứng từ Kimi K2 của Moonshot AI, bộ tối ưu hóa kết hợp này đưa độ ổn định trong huấn luyện LLM vào thị giác máy tính, giúp hội tụ nhanh hơn.
- ProgLoss + STAL: Các hàm loss cải tiến này nâng cao đáng kể khả năng nhận diện vật thể nhỏ, vốn thường là điểm khó trong phân tích ảnh vệ tinh và video từ drone.
- Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quy trình xuất model sang các thiết bị biên.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLO11 và EfficientDet phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và hệ sinh thái mà bạn ưu tiên.
Khi nào nên chọn YOLO11#
YOLO11 là lựa chọn phù hợp cho:
- Triển khai biên trong môi trường production: Các ứng dụng thương mại trên thiết bị như Raspberry Pi hoặc NVIDIA Jetson, nơi độ tin cậy và hoạt động bảo trì liên tục là ưu tiên hàng đầu.
- Ứng dụng thị giác đa nhiệm: Các dự án cần phát hiện, phân đoạn, ước tính tư thế và OBB trong một framework thống nhất.
- Tạo mẫu và triển khai nhanh: Các nhóm cần nhanh chóng chuyển từ thu thập dữ liệu sang production bằng Ultralytics Python API tinh gọn.
Khi nào nên chọn EfficientDet#
EfficientDet được khuyến nghị cho:
- Pipeline Google Cloud và TPU: Các hệ thống tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet được tối ưu hóa nguyên bản.
- Nghiên cứu mở rộng theo hệ số: Benchmark học thuật tập trung nghiên cứu tác động của việc mở rộng cân bằng độ sâu, chiều rộng và độ phân giải của mạng.
- Triển khai di động qua LiteRT: Các dự án yêu cầu cụ thể việc xuất sang LiteRT (trước đây là TensorFlow Lite) cho Android hoặc thiết bị Linux nhúng.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Kết luận#
EfficientDet là kiến trúc tiên phong chứng minh tính khả thi của việc mở rộng theo hệ số trong phát hiện đối tượng. Tuy nhiên, tốc độ phát triển nhanh chóng của nghiên cứu AI đã tạo ra những model mạnh hơn, dễ tích hợp hơn và chạy nhanh hơn.
Với khả năng đa tác vụ mạnh mẽ, tốc độ suy luận GPU vượt trội và có lẽ là API thân thiện với developer nhất trong ngành, YOLO11 là lựa chọn chiến thắng rõ ràng cho các pipeline thị giác hiện đại. Với những ai hướng tới công nghệ tiên tiến nhất—đặc biệt là triển khai ưu tiên thiết bị biên—nâng cấp lên YOLO26 mang lại sự kết hợp tối ưu giữa tốc độ không cần NMS và độ chính xác vượt trội.