YOLO26 so với EfficientDet#
Việc chọn đúng kiến trúc mạng nơ-ron đóng vai trò then chốt đối với thành công của mọi ứng dụng thị giác máy tính. Hướng dẫn kỹ thuật này phân tích sự đánh đổi, chỉ số hiệu năng và đổi mới kiến trúc của hai model nổi bật: Ultralytics YOLO26 tiên tiến và EfficientDet đã được Google khẳng định.
Dù triển khai trên máy chủ cloud thông lượng cao hay thiết bị AI biên bị giới hạn độ trễ, việc hiểu rõ khác biệt giữa các kiến trúc này sẽ giúp cân bằng tối ưu giữa tốc độ, độ chính xác và hiệu quả.
Tổng quan kiến trúc: YOLO26#
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: GitHub Ultralytics
- Tài liệu: Tài liệu chính thức về YOLO26
Ra mắt vào đầu năm 2026, YOLO26 là bước phát triển mới nhất của dòng YOLO, được thiết kế chuyên biệt để mang lại trải nghiệm người dùng vượt trội và độ chính xác trung bình trung bình (mAP) hàng đầu. Được thiết kế từ đầu cho phần cứng hiện đại, model có tính linh hoạt vượt trội với các tác vụ phát hiện đối tượng, phân đoạn instance, phân loại ảnh và ước tính tư thế.
YOLO26 giới thiệu một số tính năng đột phá giúp cải thiện đáng kể độ ổn định khi huấn luyện và tốc độ inference:
- Thiết kế end-to-end không cần NMS: Dựa trên các khái niệm được tiên phong trong YOLOv10, YOLO26 cung cấp head one-to-one end-to-end tùy chọn (
nms=False), loại bỏ nhu cầu hậu xử lý Non-Maximum Suppression (NMS). Điều này giúp logic triển khai đơn giản hơn và giảm đáng kể độ biến thiên độ trễ. - Inference trên CPU nhanh hơn tới 43%: Nhờ tối ưu hóa kiến trúc chuyên sâu, model đạt tốc độ inference chưa từng có trên các CPU phổ thông, rất phù hợp với môi trường IoT và hệ thống nhúng.
- Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, giúp quy trình export gọn gàng hơn và tăng khả năng tương thích với thiết bị biên công suất thấp sử dụng các công cụ như ONNX.
- Optimizer MuSGD: Lấy cảm hứng từ quy trình huấn luyện LLM của Kimi K2 thuộc Moonshot AI, sự kết hợp giữa SGD và Muon này đưa đổi mới trong huấn luyện model ngôn ngữ lớn trực tiếp vào thị giác máy tính, đảm bảo hội tụ nhanh hơn và quá trình huấn luyện ổn định hơn.
- ProgLoss + STAL: Các hàm loss nâng cao này giúp cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt trong các ứng dụng liên quan đến ảnh drone hàng không và robotics.
Nhờ loại bỏ DFL và sử dụng kiến trúc không cần NMS, việc export model YOLO26 sang các định dạng thân thiện với thiết bị biên như NVIDIA TensorRT hoặc Intel OpenVINO hầu như không cần phát triển plugin tùy chỉnh.
Tổng quan kiến trúc: EfficientDet#
- Tác giả: Mingxing Tan, Ruoming Pang và Quoc V. Le
- Tổ chức: Google Research
- Ngày: 2019-11-20
- Arxiv: Bài báo EfficientDet
- GitHub: Kho lưu trữ Google AutoML
Được Google giới thiệu, EfficientDet tận dụng tối đa hệ sinh thái TensorFlow và được thiết kế dựa trên khái niệm mở rộng theo tổ hợp. Kiến trúc này đồng thời mở rộng mạng backbone, mạng đặc trưng và các mạng dự đoán box/lớp tùy theo giới hạn tài nguyên.
Các cải tiến chính của EfficientDet gồm:
- BiFPN (Mạng kim tự tháp đặc trưng hai chiều): Cơ chế cho phép hợp nhất đặc trưng đa tỉ lệ nhanh chóng và dễ dàng, giúp mạng nhận biết tốt hơn các đối tượng có kích thước khác nhau.
- Mở rộng theo tổ hợp: Phương pháp heuristic để mở rộng đồng đều độ phân giải, độ sâu và độ rộng, tạo ra một họ model từ d0 (nhỏ nhất) đến d7 (lớn nhất).
Mặc dù EfficientDet vẫn là lựa chọn mạnh mẽ cho tác vụ phát hiện bounding box với yêu cầu nghiêm ngặt, model này nhìn chung thiếu tính linh hoạt đa tác vụ hiện đại (chẳng hạn như hỗ trợ gốc cho tác vụ OBB) và hệ sinh thái Python thống nhất, tinh gọn mà các nhà phát triển hiện nay mong đợi.
So sánh hiệu năng và chỉ số#
Để xác định biên Pareto giữa tốc độ và độ chính xác, chúng tôi benchmark cả hai kiến trúc trong môi trường tiêu chuẩn bằng bộ dữ liệu COCO. Bảng sau nêu bật khác biệt về kích thước model, độ chính xác và độ trễ; tốc độ CPU được đo bằng ONNX Runtime, còn tốc độ GPU được đo bằng TensorRT trên NVIDIA T4.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Như trên, YOLO26 đạt được sự cân bằng hiệu năng vượt trội. Model YOLO26x đạt độ chính xác cao nhất (57.5 mAP), vượt xa EfficientDet-d7 có kích thước lớn nhất. Ngoài ra, các model YOLO26 cần ít bộ nhớ hơn đáng kể và có tốc độ suy luận GPU nhanh hơn nhiều (chỉ 1.7 ms với TensorRT), cho thấy rõ lợi ích của thiết kế không cần NMS.
Hiệu quả huấn luyện và lợi thế hệ sinh thái#
Một khác biệt lớn giữa hai kiến trúc nằm ở môi trường phát triển. EfficientDet gắn chặt với hệ sinh thái Google AutoML và TensorFlow; dù mạnh mẽ, hệ sinh thái này có thể tạo ra đường cong học tập dốc và cấu hình cứng nhắc cho các bộ dữ liệu tùy chỉnh như DOTAv1.
Ngược lại, Ultralytics cung cấp một hệ sinh thái được duy trì rất tốt, xây dựng trên PyTorch. Mức sử dụng bộ nhớ trong quá trình huấn luyện được tối ưu chặt chẽ, cho phép kỹ sư huấn luyện các model mạnh mẽ mà không cần cấp phát VRAM quá mức như thường thấy ở các mạng dựa trên Transformer.
Thông qua Ultralytics Platform, nhà phát triển có thể sử dụng quy trình MLOps đầu cuối. Quy trình này bao gồm gán nhãn dữ liệu liền mạch, tinh chỉnh siêu tham số tự động và huấn luyện đám mây chỉ bằng một cú nhấp, giúp rút ngắn đáng kể lộ trình từ tạo mẫu đến triển khai thực tế.
Ví dụ triển khai#
API Ultralytics dễ sử dụng, cho phép bạn huấn luyện và đánh giá một model YOLO26 hiện đại chỉ với vài dòng code.
from ultralytics import YOLO
# Khởi tạo model YOLO26 đầu cuối, không cần NMS
model = YOLO("yolo26n.pt")
# Huấn luyện trên bộ dữ liệu tùy chỉnh (optimizer='auto' chọn MuSGD cho các lượt huấn luyện dài hơn)
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device="0", # Huấn luyện trên GPU
)
# Xuất trực tiếp sang TensorRT để triển khai với độ trễ cực thấp
model.export(format="engine")Các trường hợp sử dụng phù hợp nhất#
Khi nào nên dùng YOLO26:
- Điện toán biên và thiết bị di động: Với tốc độ suy luận CPU nhanh hơn đến 43% và không có phần xử lý NMS, YOLO26 hoạt động vượt trội trên các thiết bị có ngân sách tính toán rất hạn chế như Raspberry Pi hoặc điện thoại di động.
- Đa nhiệm: Khi một pipeline cần đồng thời bounding box, mask phân đoạn và theo dõi, tính linh hoạt của YOLO26 là không đối thủ.
- Ảnh từ drone và ảnh hàng không: Sự kết hợp giữa ProgLoss và STAL cải thiện đáng kể khả năng phát hiện các đối tượng cực nhỏ từ độ cao lớn.
Khi nào nên dùng EfficientDet:
- Pipeline TensorFlow cũ: Nếu hạ tầng của bạn được hardcode chủ yếu để chỉ hỗ trợ TensorFlow SavedModel hoặc yêu cầu các pipeline TensorFlow Serving cụ thể, EfficientDet cung cấp khả năng tương thích gốc.
- TPU bị giới hạn tài nguyên: EfficientDet được tối ưu hóa mạnh mẽ cho Tensor Processing Unit tùy chỉnh của Google (TPU).
Khám phá các lựa chọn thay thế khác#
Mặc dù hướng dẫn này tập trung nhiều vào mô hình YOLO26 so với EfficientDet, hệ sinh thái Ultralytics rộng lớn còn có nhiều kiến trúc ấn tượng khác. Nếu ứng dụng của bạn phụ thuộc nhiều vào Transformer, RT-DETR cung cấp khả năng phát hiện dựa trên Transformer theo thời gian thực. Nếu cần hỗ trợ các hệ thống cũ, YOLO11 vẫn được hỗ trợ đầy đủ và có hiệu quả cao. Để xem tổng quan rộng hơn, hãy truy cập Trung tâm so sánh model Ultralytics.
Tóm lại, với mọi pipeline thị giác máy tính hiện đại được xây dựng ngày nay, tốc độ vượt trội, tính dễ sử dụng và độ chính xác hiện đại của YOLO26 khiến model này trở thành lựa chọn được khuyến nghị hàng đầu cho cả nhà nghiên cứu lẫn nhà phát triển.