Ultralytics YOLO27:

YOLO26 so với EfficientDet#

Việc lựa chọn đúng kiến trúc mạng neural là yếu tố quan trọng đối với thành công của mọi ứng dụng thị giác máy tính. Hướng dẫn kỹ thuật này phân tích những đánh đổi, chỉ số hiệu năng và các cải tiến về kiến trúc của hai model nổi bật: Ultralytics YOLO26 tiên tiến và EfficientDet đã được Google xây dựng vững chắc.

Dù mục tiêu triển khai của bạn là các server cloud có thông lượng cao hay các thiết bị AI biên bị giới hạn về độ trễ, việc hiểu rõ sự khác biệt giữa các kiến trúc này sẽ giúp đảm bảo sự cân bằng tối ưu giữa tốc độ, độ chính xác và hiệu quả.

Tổng quan về kiến trúc: YOLO26#

Được phát hành vào đầu năm 2026, YOLO26 đại diện cho bước tiến hóa mới nhất trong dòng YOLO, được thiết kế chuyên biệt để mang lại trải nghiệm người dùng vượt trội và độ chính xác trung bình (mAP) hàng đầu. Được thiết kế từ đầu cho phần cứng hiện đại, model này mang đến tính linh hoạt xuất sắc trên các tác vụ phát hiện đối tượng, phân đoạn instance, phân loại ảnhước lượng tư thế.

YOLO26 giới thiệu một số tính năng đột phá giúp cải thiện đáng kể cả độ ổn định khi training lẫn tốc độ inference:

  • Thiết kế end-to-end không cần NMS: Dựa trên các khái niệm tiên phong trong YOLOv10, YOLO26 có kiến trúc end-to-end nguyên bản, loại bỏ hoàn toàn nhu cầu hậu xử lý triệt tiêu phi cực đại (NMS). Điều này giúp logic triển khai đơn giản hơn và giảm đáng kể biến thiên độ trễ.
  • Inference trên CPU nhanh hơn tới 43%: Thông qua các tối ưu hóa sâu về kiến trúc, model đạt tốc độ inference chưa từng có trên các CPU tiêu chuẩn, đặc biệt phù hợp với môi trường IoT và hệ thống nhúng.
  • Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, mang lại quy trình export gọn gàng hơn và khả năng tương thích nâng cao với các thiết bị biên công suất thấp sử dụng những công cụ như ONNX.
  • Optimizer MuSGD: Lấy cảm hứng từ các quy trình training LLM của Kimi K2 thuộc Moonshot AI, phương pháp kết hợp SGD và Muon này đưa các cải tiến trong training mô hình ngôn ngữ lớn trực tiếp vào thị giác máy tính, đảm bảo hội tụ nhanh hơn và chế độ training ổn định hơn.
  • ProgLoss + STAL: Các hàm loss nâng cao này mang lại cải thiện đáng kể trong khả năng nhận diện đối tượng nhỏ, một yếu tố quan trọng đối với các ứng dụng sử dụng hình ảnh từ drone trên không và robotics.
Export tinh gọn

Nhờ loại bỏ DFL và sử dụng kiến trúc không cần NMS, việc export các model YOLO26 sang những format thân thiện với thiết bị biên như NVIDIA TensorRT hoặc Intel OpenVINO hầu như không cần phát triển plugin tùy chỉnh.

Tổng quan về kiến trúc: EfficientDet#

Được Google giới thiệu, EfficientDet sử dụng mạnh mẽ hệ sinh thái TensorFlow và được thiết kế xoay quanh khái niệm compound scaling. Kiến trúc này đồng thời mở rộng backbone network, feature network và các network dự đoán box/class dựa trên các giới hạn về tài nguyên.

Các cải tiến chính của EfficientDet bao gồm:

  • BiFPN (Mạng kim tự tháp đặc trưng hai chiều): Một cơ chế cho phép fusion đặc trưng đa scale dễ dàng và nhanh chóng, giúp network hiểu rõ hơn các đối tượng có kích thước khác nhau.
  • Compound Scaling: Phương pháp heuristic để mở rộng đồng đều resolution, depth và width, tạo ra một họ model từ d0 (nhỏ nhất) đến d7 (lớn nhất).

Mặc dù EfficientDet vẫn là lựa chọn mạnh mẽ cho tác vụ phát hiện bounding box nghiêm ngặt, nhìn chung model này thiếu tính linh hoạt đa tác vụ hiện đại (chẳng hạn như các tác vụ OBB nguyên bản) và hệ sinh thái Python hợp nhất, tinh gọn mà các developer hiện đại kỳ vọng.

Tìm hiểu thêm về EfficientDet

So sánh hiệu năng và các chỉ số#

Để xác định Pareto frontier về tốc độ và độ chính xác, chúng tôi benchmark cả hai kiến trúc trên các môi trường tiêu chuẩn bằng dataset COCO. Bảng sau làm nổi bật sự khác biệt về kích thước model, precision và độ trễ được đo trên một instance AWS EC2 P4d.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như minh họa ở trên, YOLO26 đạt được sự cân bằng hiệu năng vượt trội. Model YOLO26x đạt độ chính xác cao nhất (57.5 mAP), vượt xa EfficientDet-d7 nặng nhất. Ngoài ra, các model YOLO26 yêu cầu ít memory hơn đáng kể và có tốc độ inference trên GPU nhanh hơn nhiều (thấp tới 1.7 ms trên TensorRT), nhấn mạnh lợi ích của thiết kế không cần NMS.

Hiệu quả Training và Lợi thế Hệ sinh thái#

Một khác biệt lớn giữa hai kiến trúc nằm ở môi trường phát triển. EfficientDet được tích hợp sâu trong hệ sinh thái Google AutoML và TensorFlow. Mặc dù mạnh mẽ, hệ sinh thái này có thể tạo ra đường cong học tập dốc và các cấu hình cứng nhắc cho những dataset tùy chỉnh như DOTAv1.

Ngược lại, Ultralytics cung cấp một hệ sinh thái được duy trì cực kỳ tốt, xây dựng trên PyTorch. Mức sử dụng memory trong quá trình training được tối ưu nghiêm ngặt, cho phép các kỹ sư training những model mạnh mẽ mà không cần phân bổ VRAM quá lớn như thường thấy ở các network dựa trên Transformer.

Tích hợp Nền tảng Hợp nhất

Thông qua Ultralytics Platform, developer có quyền truy cập vào workflow MLOps end-to-end. Workflow này bao gồm annotation dữ liệu liền mạch, tuning hyperparameter tự động và training cloud chỉ với một click, giúp rút ngắn đáng kể quá trình từ prototyping đến production.

Ví dụ Triển khai#

API Ultralytics mang lại sự dễ sử dụng, cho phép bạn training và validation một model YOLO26 hiện đại chỉ với vài dòng code.

from ultralytics import YOLO

# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")

# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Train on GPU
)

# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")

Các trường hợp sử dụng lý tưởng#

Khi nào nên sử dụng YOLO26:

  • Edge Computing & Mobile: Với inference trên CPU nhanh hơn tới 43% và không có overhead NMS, YOLO26 hoạt động xuất sắc trên các thiết bị có ngân sách tính toán bị giới hạn nghiêm ngặt, chẳng hạn như Raspberry Pi hoặc điện thoại di động.
  • Đa nhiệm: Khi một pipeline duy nhất yêu cầu bounding box, mask phân đoạn và tracking, tính linh hoạt của YOLO26 là không có đối thủ.
  • Drone & Hình ảnh trên không: Sự kết hợp giữa ProgLoss và STAL cải thiện đáng kể khả năng phát hiện các đối tượng cực nhỏ từ độ cao lớn.

Khi nào nên sử dụng EfficientDet:

  • Pipeline TensorFlow cũ: Nếu hạ tầng của bạn được hardcode chủ yếu để chỉ hỗ trợ TensorFlow SavedModels hoặc yêu cầu các pipeline TensorFlow Serving cụ thể, EfficientDet cung cấp khả năng tương thích nguyên bản.
  • TPU bị giới hạn tài nguyên: EfficientDet được tối ưu hóa mạnh mẽ cho các Tensor Processing Unit tùy chỉnh của Google (TPU).

Khám phá các Lựa chọn Thay thế khác#

Mặc dù hướng dẫn này tập trung nhiều vào mô hình YOLO26 so với EfficientDet, hệ sinh thái Ultralytics còn có nhiều kiến trúc ấn tượng khác. Nếu ứng dụng của bạn phụ thuộc nhiều vào Transformer, RT-DETR cung cấp khả năng phát hiện dựa trên Transformer theo thời gian thực. Ngoài ra, nếu bạn đang hỗ trợ các hệ thống cũ, YOLO11 vẫn được hỗ trợ đầy đủ và hoạt động rất hiệu quả. Để có cái nhìn tổng quan hơn, hãy truy cập Ultralytics Model Comparisons Hub.

Sau cùng, đối với mọi pipeline thị giác máy tính hiện đại được xây dựng ngày nay, tốc độ vượt trội, tính dễ sử dụng và độ chính xác tiên tiến của YOLO26 khiến model này trở thành lựa chọn được khuyến nghị không thể tranh cãi cho cả nhà nghiên cứu lẫn developer.

Những người đóng góp

Bình luận