YOLO Vision 2026:

EfficientDet so với YOLOv5#

Lựa chọn kiến trúc mạng neural tối ưu là bước quyết định trong mọi dự án computer vision. Sự cân bằng giữa độ trễ suy luận, hiệu suất tham số và độ chính xác phát hiện quyết định mức độ hiệu quả của model trong thế giới thực. Hướng dẫn kỹ thuật toàn diện này cung cấp phân tích chi tiết về hai framework phát hiện đối tượng có ảnh hưởng lớn: EfficientDet của Google và Ultralytics YOLOv5.

Bằng cách so sánh các đổi mới về kiến trúc, phương pháp đào tạo và khả năng triển khai, các nhà phát triển có thể đưa ra quyết định sáng suốt cho môi trường triển khai cụ thể của mình, cho dù là mở rộng quy mô trên các máy chủ đám mây hay chạy trên các thiết bị edge bị giới hạn.

EfficientDet: Kiến trúc có thể mở rộng với BiFPN#

Được Google Research giới thiệu, EfficientDet được thiết kế để mở rộng một cách hệ thống cả backbone và mạng đặc trưng nhằm đạt được độ chính xác cao với ít tham số hơn so với các model tiên tiến trước đây.

Thông tin chi tiết về mô hình#

Cải tiến kiến trúc#

EfficientDet tận dụng model phân loại EfficientNet làm backbone, sử dụng phương pháp mở rộng kết hợp (compound scaling) để mở rộng đồng đều độ rộng, độ sâu và độ phân giải của mạng. Đóng góp nổi bật nhất của nó đối với object detection là việc giới thiệu Mạng Kim tự tháp Đặc trưng Hai chiều (BiFPN). Khác với các Mạng Kim tự tháp Đặc trưng tiêu chuẩn chỉ tổng hợp đặc trưng từ trên xuống dưới, BiFPN cho phép các kết nối chéo quy mô hai chiều phức tạp và giới thiệu các trọng số có thể học để xác định tầm quan trọng của các đặc trưng đầu vào khác nhau.

Dù có độ chính xác cao, EfficientDet phụ thuộc nhiều vào hệ sinh thái TensorFlow và các thư viện AutoML cụ thể. Sự phụ thuộc này đôi khi khiến việc tích hợp vào các pipeline triển khai tùy chỉnh, nhẹ nhàng hoặc các môi trường ưu tiên đồ thị tính toán động trở nên cồng kềnh.

Tìm hiểu thêm về EfficientDet

Ultralytics YOLOv5: Phổ cập hóa AI thời gian thực#

Được phát hành ngay sau EfficientDet, Ultralytics YOLOv5 đã cách mạng hóa ngành công nghiệp bằng cách cung cấp một triển khai PyTorch nguyên bản cực kỳ dễ tiếp cận của kiến trúc YOLO. Nó thiết lập một tiêu chuẩn mới cho trải nghiệm của developer, hiệu quả huấn luyện và tính linh hoạt trong triển khai thời gian thực.

Thông tin chi tiết về mô hình#

Cải tiến kiến trúc#

YOLOv5 đã giới thiệu những nâng cấp đáng kể so với các phiên bản tiền nhiệm, sử dụng backbone CSPDarknet (Cross-Stage Partial) giúp tăng cường đáng kể luồng gradient trong khi giảm tổng số lượng tham số. Hơn nữa, YOLOv5 kết hợp Auto-Learning Anchor Boxes, tự động tính toán các tiền đề bounding box tối ưu dựa trên dữ liệu đào tạo tùy chỉnh cụ thể của bạn, loại bỏ nhu cầu tinh chỉnh siêu tham số thủ công.

YOLOv5 cũng tận dụng mạnh mẽ Mosaic Data Augmentation, kết hợp bốn hình ảnh rời rạc thành một ô huấn luyện duy nhất. Điều này cải thiện đáng kể khả năng phát hiện các đối tượng nhỏ của model và tổng quát hóa khả năng hiểu ngữ cảnh, giúp nó cực kỳ mạnh mẽ trong các môi trường đa dạng.

Tìm hiểu thêm về YOLOv5

Hiệu năng và Benchmark#

Đánh giá các model trên các benchmark tiêu chuẩn như COCO dataset rất quan trọng để hiểu các sự đánh đổi giữa độ chính xác và tốc độ. Bảng dưới đây minh họa cách các kích thước khác nhau của EfficientDet và YOLOv5 hoạt động trong các điều kiện tiêu chuẩn hóa.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Phân tích các yếu tố đánh đổi#

Mặc dù EfficientDet-d7 đạt đến mức mAP đỉnh ấn tượng là 53.7, nó lại gặp phải độ trễ suy luận đáng kể trên phần cứng GPU so với các kiến trúc YOLO. Ngược lại, YOLOv5 vượt trội trong việc tăng tốc phần cứng. Biến thể YOLOv5n đạt thời gian suy luận cực nhanh 1.12 ms trên GPU T4 sử dụng NVIDIA TensorRT, giúp nó vượt trội hoàn toàn cho các ứng dụng thời gian thực như lái xe tự động hoặc dây chuyền sản xuất tốc độ cao.

Ngoài ra, các model YOLOv5 yêu cầu bộ nhớ CUDA thấp hơn nhiều trong quá trình đào tạo so với các mạng có quy mô hợp nhất phức tạp hoặc các model transformer lớn. Hồ sơ bộ nhớ gọn nhẹ này phổ cập hóa quyền truy cập vào AI tiên tiến, cho phép các nhà nghiên cứu đào tạo các model mạnh mẽ trên phần cứng tiêu dùng tiêu chuẩn.

Tối đa hóa hiệu quả phần cứng

Để khai thác số khung hình trên giây (FPS) tối đa từ model YOLOv5 trên các thiết bị edge, hãy xuất trọng số PyTorch của bạn sang TensorRT cho GPU NVIDIA hoặc OpenVINO cho CPU Intel. Bước này thường có thể gấp đôi tốc độ suy luận của bạn.

Hệ sinh thái đào tạo và trải nghiệm nhà phát triển#

Lợi thế thực sự của hệ sinh thái Ultralytics nằm ở trải nghiệm người dùng được tối ưu hóa. Trong khi EfficientDet yêu cầu kiến thức chuyên sâu về API phát hiện đối tượng TensorFlow, YOLOv5 cung cấp một Python API nhất quán và đơn giản.

Ultralytics ecosystem được bảo trì tốt đảm bảo các developer có quyền truy cập vào các bản cập nhật thường xuyên, hỗ trợ cộng đồng tích cực và tích hợp liền mạch với các công cụ theo dõi thử nghiệm như Weights & Biases và ClearML.

Ví dụ mã nguồn: Bắt đầu với YOLOv5#

Chạy suy luận với model YOLOv5 được huấn luyện trước chỉ yêu cầu vài dòng code thông qua PyTorch Hub:

from ultralytics import YOLO

# Load the highly efficient YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display the detected bounding boxes
results[0].show()

Tính linh hoạt và ứng dụng thực tế#

EfficientDet hoàn toàn là một framework phát hiện đối tượng, điều này hạn chế tiện ích của nó trong các pipeline thị giác phức tạp. Mặt khác, YOLOv5 đã tiến hóa để hỗ trợ nhiều tác vụ computer vision. Các bản phát hành hiện đại của model hỗ trợ instance segmentationimage classification cực kỳ chính xác, cho phép các developer hợp nhất stack machine learning của họ.

Các trường hợp sử dụng lý tưởng#

  • EfficientDet: Phù hợp nhất cho xử lý ngoại tuyến, nghiên cứu học thuật và phân tích dựa trên đám mây, nơi độ chính xác tối đa được ưu tiên hơn độ trễ, và nơi có sẵn các TPU cấp máy chủ hoặc GPU bộ nhớ cao.
  • YOLOv5: Lựa chọn dứt khoát cho edge AI deployments. Sự kết hợp giữa độ trễ thấp, dung lượng tham số nhỏ và độ chính xác cao làm cho nó lý tưởng cho phân tích drone, tự động hóa bán lẻ thời gian thực và các ứng dụng di động thông qua CoreML hoặc TFLite.

Thế hệ tiếp theo: Nâng cấp lên YOLO26#

Mặc dù YOLOv5 vẫn là một model mạnh mẽ và được triển khai rộng rãi, lĩnh vực AI di chuyển rất nhanh chóng. Đối với các team bắt đầu các dự án mới hoặc tìm kiếm đỉnh cao hiệu suất hiện đại tuyệt đối, Ultralytics đã giới thiệu YOLO26, phát hành vào tháng 1 năm 2026.

YOLO26 định nghĩa lại biên Pareto về tốc độ và độ chính xác, giới thiệu những thay đổi kiến trúc mang tính đột phá giúp việc triển khai dễ dàng hơn và suy luận nhanh hơn.

Những tiến bộ chính của YOLO26#

  • Thiết kế NMS-Free End-to-End: YOLO26 loại bỏ hoàn toàn việc hậu xử lý Non-Maximum Suppression. Điều này đơn giản hóa đáng kể logic triển khai và giảm độ biến thiên độ trễ, một phương pháp đột phá được tinh chỉnh từ các thử nghiệm ban đầu trong YOLOv10.
  • Suy luận CPU nhanh hơn tới 43%: Được thiết kế đặc biệt cho điện toán biên và các thiết bị IoT công suất thấp hoạt động mà không cần GPU chuyên dụng.
  • MuSGD Optimizer: Lấy cảm hứng từ các kỹ thuật đào tạo mô hình ngôn ngữ lớn (như Kimi K2 của Moonshot AI), sự kết hợp giữa SGD và Muon này mang đến những đổi mới LLM vào computer vision, cho phép hội tụ nhanh hơn và động lực đào tạo ổn định cao.
  • ProgLoss + STAL: Các hàm mất mát tiên tiến này mang lại những cải tiến đáng chú ý trong nhận dạng đối tượng nhỏ, vốn rất quan trọng đối với hình ảnh trên không và robot.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, đầu model được đơn giản hóa đáng kể, dẫn đến khả năng tương thích tốt hơn khi xuất sang phần cứng edge cũ hoặc bị hạn chế nghiêm ngặt.

Đối với các team triển khai pipeline đa nhiệm, YOLO26 cũng giới thiệu các bản nâng cấp dành riêng cho tác vụ, chẳng hạn như proto đa tỷ lệ cho segmentation và hàm mất mát góc chuyên dụng cho oriented bounding boxes (OBB). Để khám phá các giải pháp thay thế hiện đại khác trong hệ sinh thái, bạn cũng có thể xem lại YOLO11 hoặc kiến trúc YOLOv8.

Kết luận#

Việc lựa chọn giữa EfficientDet và YOLOv5 phụ thuộc rất nhiều vào mục tiêu triển khai của bạn. EfficientDet cung cấp một phương pháp mở rộng thanh lịch về mặt toán học, phù hợp cho suy luận nặng trên đám mây. Tuy nhiên, trải nghiệm nhà phát triển vượt trội của YOLOv5, các vòng lặp đào tạo PyTorch cực nhanh và khả năng triển khai edge được tối ưu hóa cao khiến nó trở thành lựa chọn ưu tiên cho đại đa số các ứng dụng thực tế, thời gian thực. Bằng cách tận dụng các công cụ toàn diện do Ultralytics cung cấp, các nhóm có thể tăng tốc thời gian đưa ra thị trường và xây dựng các hệ thống AI có phản hồi cao.

Người đóng góp

Bình luận