Ultralytics YOLO27:
Get Started

EfficientDet và YOLOv5#

Lựa chọn kiến trúc mạng nơ-ron tối ưu là bước then chốt trong mọi sáng kiến thị giác máy tính. Sự cân bằng giữa độ trễ suy luận, hiệu quả tham số và độ chính xác phát hiện quyết định hiệu năng thực tế của model. Hướng dẫn kỹ thuật toàn diện này phân tích chuyên sâu hai framework phát hiện đối tượng có tầm ảnh hưởng lớn: EfficientDet của Google và Ultralytics YOLOv5.

Bằng cách so sánh các đổi mới về kiến trúc, phương pháp huấn luyện và khả năng triển khai, nhà phát triển có thể đưa ra quyết định phù hợp với môi trường triển khai cụ thể, dù là mở rộng quy mô trên các server đám mây hay chạy trên thiết bị biên có tài nguyên hạn chế.

EfficientDet: Kiến trúc mở rộng quy mô với BiFPN#

Được Google Research giới thiệu, EfficientDet được thiết kế để mở rộng có hệ thống cả backbone lẫn mạng đặc trưng, nhằm đạt độ chính xác cao với ít tham số hơn các model tiên tiến trước đó.

Chi tiết model#

Các cải tiến kiến trúc#

EfficientDet sử dụng model phân loại EfficientNet làm backbone và áp dụng phương pháp mở rộng kết hợp để điều chỉnh đồng đều độ rộng, độ sâu và độ phân giải của mạng. Đóng góp nổi bật nhất của EfficientDet cho phát hiện đối tượng là đưa vào Mạng Kim tự tháp Đặc trưng Hai chiều (BiFPN). Không giống các Mạng Kim tự tháp Đặc trưng tiêu chuẩn chỉ tổng hợp đặc trưng theo hướng từ trên xuống, BiFPN cho phép tạo các kết nối liên tỷ lệ phức tạp theo cả hai chiều và bổ sung các trọng số có thể học để xác định mức độ quan trọng của các đặc trưng đầu vào khác nhau.

Dù có độ chính xác cao, EfficientDet phụ thuộc nhiều vào hệ sinh thái TensorFlow và các thư viện AutoML cụ thể. Sự phụ thuộc này đôi khi gây khó khăn khi tích hợp model vào các pipeline triển khai tùy chỉnh, nhẹ hoặc các môi trường ưu tiên đồ thị tính toán động.

Tìm hiểu thêm về EfficientDet

Ultralytics YOLOv5: Phổ cập AI thời gian thực#

Ra mắt không lâu sau EfficientDet, Ultralytics YOLOv5 đã cách mạng hóa ngành bằng cách cung cấp bản triển khai YOLO nguyên bản trên PyTorch, dễ tiếp cận vượt trội. Model này thiết lập tiêu chuẩn mới về trải nghiệm nhà phát triển, hiệu quả huấn luyện và tính linh hoạt khi triển khai thời gian thực.

Chi tiết model#

Các cải tiến kiến trúc#

YOLOv5 mang đến những cải tiến đáng kể so với các phiên bản tiền nhiệm, sử dụng backbone CSPDarknet (Cross-Stage Partial) giúp cải thiện đáng kể luồng gradient đồng thời giảm tổng số tham số. Ngoài ra, YOLOv5 tích hợp Auto-Learning Anchor Boxes, tự động tính toán các prior bounding box tối ưu dựa trên dữ liệu huấn luyện tùy chỉnh cụ thể của bạn, loại bỏ nhu cầu tinh chỉnh siêu tham số thủ công.

YOLOv5 cũng sử dụng rộng rãi tăng cường dữ liệu Mosaic, kết hợp bốn hình ảnh riêng biệt thành một ô huấn luyện duy nhất. Kỹ thuật này cải thiện đáng kể khả năng phát hiện vật thể nhỏ và khái quát hóa hiểu biết về ngữ cảnh, giúp model hoạt động ổn định trong nhiều môi trường khác nhau.

Hiệu năng và benchmark#

Đánh giá model trên các benchmark tiêu chuẩn như dataset COCO là điều cốt yếu để hiểu sự đánh đổi giữa độ chính xác và tốc độ. Bảng dưới đây minh họa hiệu năng của các phiên bản EfficientDet và YOLOv5 với kích thước khác nhau trong điều kiện tiêu chuẩn hóa.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Phân tích các điểm đánh đổi#

EfficientDet-d7 đạt mAP tối đa ấn tượng 53.7, nhưng có độ trễ suy luận đáng kể trên GPU so với các kiến trúc YOLO. Ngược lại, YOLOv5 vượt trội về khả năng tăng tốc phần cứng. Biến thể YOLOv5n đạt thời gian suy luận nhanh đáng kinh ngạc, chỉ 1.12 ms trên GPU T4 khi dùng NVIDIA TensorRT, vượt trội rõ rệt trong các ứng dụng thời gian thực như xe tự hành hoặc dây chuyền sản xuất tốc độ cao.

Ngoài ra, các model YOLOv5 yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với các mạng mở rộng kết hợp phức tạp hoặc model Transformer lớn. Mức sử dụng bộ nhớ gọn nhẹ này giúp phổ cập AI tiên tiến, cho phép nhà nghiên cứu huấn luyện các model mạnh mẽ trên phần cứng tiêu dùng tiêu chuẩn.

Tối đa hóa hiệu quả phần cứng

Để khai thác tốc độ khung hình tối đa (FPS) từ model YOLOv5 trên thiết bị biên, hãy export trọng số PyTorch sang TensorRT cho GPU NVIDIA hoặc OpenVINO cho CPU Intel. Bước này thường có thể tăng gấp đôi tốc độ suy luận.

Hệ sinh thái huấn luyện và trải nghiệm nhà phát triển#

Lợi thế thực sự của hệ sinh thái Ultralytics nằm ở trải nghiệm người dùng được tinh giản. Trong khi EfficientDet đòi hỏi hiểu biết chuyên sâu về API phát hiện đối tượng của TensorFlow, YOLOv5 cung cấp Python API nhất quán và đơn giản.

Hệ sinh thái Ultralytics được duy trì tốt, đảm bảo nhà phát triển được tiếp cận các bản cập nhật thường xuyên, hỗ trợ tích cực từ cộng đồng và tích hợp liền mạch với những công cụ theo dõi thí nghiệm như Weights & Biases và ClearML.

Ví dụ mã: Bắt đầu với YOLOv5#

Chỉ cần vài dòng mã để chạy suy luận bằng model YOLOv5 đã huấn luyện thông qua gói Python Ultralytics:

from ultralytics import YOLO

# Tải model YOLOv5s có hiệu suất cao
model = YOLO("yolov5su.pt")  # YOLOv5u: weight YOLOv5 không anchor dành cho package ultralytics

# Chạy suy luận trên một ảnh
results = model("https://ultralytics.com/images/zidane.jpg")

# Hiển thị các bounding box đã phát hiện
results[0].show()

Tính linh hoạt và ứng dụng thực tế#

EfficientDet chỉ là một framework phát hiện đối tượng, điều này hạn chế khả năng ứng dụng của model trong các pipeline thị giác phức tạp. Ngược lại, YOLOv5 đã phát triển để hỗ trợ nhiều tác vụ thị giác máy tính. Các phiên bản hiện đại của model hỗ trợ phân đoạn instance và phân loại hình ảnh với độ chính xác cao, cho phép nhà phát triển hợp nhất toàn bộ hệ thống machine learning.

Các trường hợp sử dụng phù hợp nhất#

  • EfficientDet: Phù hợp nhất cho xử lý ngoại tuyến, nghiên cứu học thuật và phân tích trên đám mây, nơi ưu tiên độ chính xác tối đa hơn độ trễ và có sẵn TPU cấp server hoặc GPU dung lượng bộ nhớ cao.
  • YOLOv5: Lựa chọn hàng đầu cho triển khai AI biên. Sự kết hợp giữa độ trễ thấp, số lượng tham số nhỏ và độ chính xác cao khiến model này phù hợp với phân tích bằng drone, tự động hóa bán lẻ thời gian thực và ứng dụng di động thông qua CoreML hoặc LiteRT.

Thế hệ tiếp theo: Nâng cấp lên YOLO26#

Mặc dù YOLOv5 vẫn là model mạnh mẽ, được triển khai rộng rãi, lĩnh vực AI phát triển rất nhanh. Với các nhóm bắt đầu dự án mới hoặc muốn đạt hiệu năng hiện đại cao nhất, Ultralytics đã giới thiệu YOLO26, ra mắt vào tháng 1 năm 2026.

YOLO26 định hình lại biên Pareto giữa tốc độ và độ chính xác, đồng thời giới thiệu những thay đổi kiến trúc mang tính đột phá, giúp triển khai dễ dàng hơn và suy luận nhanh hơn.

Những cải tiến chính của YOLO26#

  • Thiết kế đầu cuối không cần NMS: Head đầu cuối tùy chọn của YOLO26 (nms=False) loại bỏ bước hậu xử lý Non-Maximum Suppression. Cách này đơn giản hóa đáng kể logic triển khai và giảm độ biến thiên độ trễ; đây là phương pháp đột phá được hoàn thiện từ những thử nghiệm ban đầu trên YOLOv10.
  • Suy luận CPU nhanh hơn tới 43%: Được thiết kế chuyên biệt cho điện toán biên và các thiết bị IoT công suất thấp hoạt động không có GPU chuyên dụng.
  • Bộ tối ưu MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện model ngôn ngữ lớn (như Kimi K2 của Moonshot AI), phương pháp kết hợp SGD và Muon này đưa những đổi mới của LLM vào thị giác máy tính, giúp hội tụ nhanh hơn và duy trì động lực huấn luyện ổn định vượt trội.
  • ProgLoss + STAL: Các hàm loss nâng cao này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt trong ảnh chụp từ trên không và robot.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, head của model được đơn giản hóa đáng kể, giúp tăng khả năng tương thích khi export sang phần cứng biên cũ hoặc có nhiều giới hạn.

Đối với các nhóm triển khai pipeline đa nhiệm, YOLO26 cũng bổ sung các nâng cấp riêng theo tác vụ, chẳng hạn như proto đa tỷ lệ cho phân đoạn và hàm loss góc chuyên biệt cho bounding box định hướng (OBB). Để tìm hiểu các lựa chọn hiện đại khác trong hệ sinh thái, bạn cũng có thể xem YOLO11 hoặc kiến trúc YOLOv8.

Kết luận#

Việc lựa chọn giữa EfficientDet và YOLOv5 phụ thuộc nhiều vào mục tiêu triển khai. EfficientDet cung cấp phương pháp mở rộng quy mô thanh nhã về mặt toán học, phù hợp với suy luận chủ yếu trên đám mây. Tuy nhiên, trải nghiệm nhà phát triển vượt trội, vòng lặp huấn luyện PyTorch cực nhanh và khả năng triển khai biên được tối ưu cao khiến YOLOv5 trở thành lựa chọn ưu tiên cho phần lớn ứng dụng thời gian thực trong thực tế. Bằng cách tận dụng bộ công cụ toàn diện do Ultralytics cung cấp, các nhóm có thể rút ngắn thời gian đưa sản phẩm ra thị trường và xây dựng hệ thống AI có khả năng phản hồi nhanh.

Người đóng góp

Bình luận