YOLO Vision 2026:

EfficientDet so với DAMO-YOLO#

Khi xây dựng các đường ống computer vision có khả năng mở rộng, việc lựa chọn kiến trúc mô hình phù hợp là một quyết định quan trọng ảnh hưởng đến cả khả năng triển khai lẫn độ chính xác của việc phát hiện. Hướng dẫn này cung cấp sự so sánh kỹ thuật có chiều sâu giữa hai kiến trúc nổi tiếng trong bối cảnh nhận diện hình ảnh: EfficientDet và DAMO-YOLO.

Mặc dù cả hai mô hình đều mang lại những đổi mới đáng kể cho lĩnh vực object detection, sự tiến bộ nhanh chóng của AI thị giác đã dọn đường cho các hệ sinh thái tích hợp hơn. Xuyên suốt phân tích này, chúng tôi sẽ khám phá các cơ chế cốt lõi của những mạng lưới kế thừa này đồng thời minh họa lý do tại sao các giải pháp hiện đại như Ultralytics PlatformUltralytics YOLO26 đã trở thành tiêu chuẩn ngành cho môi trường sản xuất.

EfficientDet: Phát hiện đối tượng có khả năng mở rộng và hiệu quả#

Được giới thiệu bởi các nhà nghiên cứu tại Google, EfficientDet được thiết kế để mở rộng kiến trúc model một cách có hệ thống trong khi vẫn duy trì hiệu suất cao. Nó đạt được điều này bằng cách tận dụng compound scaling trên chiều sâu mạng, chiều rộng và độ phân giải đầu vào.

Chi tiết về EfficientDet: Tác giả: Mingxing Tan, Ruoming Pang và Quoc V. Le
Tổ chức: Google Brain
Ngày: 2019-11-20
Arxiv: 1911.09070
GitHub: google/automl

Cải tiến kiến trúc#

Đóng góp chính của EfficientDet là Mạng lưới Kim tự tháp Đặc trưng Hai chiều (BiFPN). Khác với các FPN truyền thống, BiFPN cho phép hợp nhất đặc trưng đa tỷ lệ dễ dàng và nhanh chóng bằng cách tận dụng các trọng số có thể học để hiểu tầm quan trọng của các đặc trưng đầu vào khác nhau. Điều này được kết hợp với backbone EfficientNet, tạo ra một họ mô hình (từ D0 đến D7) có thể mở rộng một cách có thể dự đoán trước.

Điểm mạnh và điểm yếu#

Điểm mạnh cốt lõi của EfficientDet nằm ở hiệu quả về tham số. Đối với các tác vụ cần tối đa hóa mean Average Precision (mAP) trên các môi trường đám mây bị hạn chế nặng nề, phương pháp mở rộng hợp chất của nó mang lại khả năng dự đoán cao. Tuy nhiên, EfficientDet nổi tiếng là phức tạp để huấn luyện từ đầu và thường đòi hỏi hyperparameter tuning đáng kể. Hơn nữa, sự phụ thuộc nặng nề vào các thao tác TensorFlow cụ thể khiến việc chuyển sang triển khai biên thông qua ONNX hoặc TensorRT trở nên cồng kềnh hơn so với các export capabilities được hợp lý hóa có trong các mô hình YOLO hiện đại.

Tìm hiểu thêm về EfficientDet

DAMO-YOLO: Tự động tìm kiếm kiến trúc trong thực tiễn#

DAMO-YOLO đại diện cho một phương pháp tiếp cận khác biệt, sử dụng Neural Architecture Search (NAS) để tự động thiết kế các cấu trúc mạng tối ưu cho việc suy luận thời gian thực.

Chi tiết về DAMO-YOLO: Tác giả: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang và Xiuyu Sun
Tổ chức: Alibaba Group
Ngày: 2022-11-23
Arxiv: 2211.15444v2
GitHub: tinyvision/DAMO-YOLO

Cải tiến kiến trúc#

DAMO-YOLO giới thiệu một số công nghệ mới lạ. Nó sử dụng một backbone do NAS tạo ra có tên là MAE-NAS, một RepGFPN hiệu quả cho phần cổ mạng (neck), và thiết kế ZeroHead giúp giảm đáng kể chi phí tính toán của detection head. Hơn nữa, nó áp dụng AlignedOTA để gán nhãn và phụ thuộc nhiều vào việc nâng cao chưng cất kiến thức (knowledge distillation) để thúc đẩy hiệu suất của các biến thể nhỏ hơn.

Điểm mạnh và điểm yếu#

DAMO-YOLO nổi bật ở tốc độ suy luận GPU, được thiết kế đặc biệt để triển khai trên các kiến trúc NVIDIA sử dụng TensorRT. Bằng cách loại bỏ các cấu trúc đầu nặng nề, mô hình mang lại các dự đoán độ trễ thấp. Ngược lại, tìm kiếm kiến trúc tự động có thể làm cho cấu trúc mô hình trở nên mờ đục và khó gỡ lỗi thủ công hoặc tinh chỉnh cho các thiết bị biên tùy chỉnh. Khác với Ultralytics YOLO11 vô cùng linh hoạt, DAMO-YOLO chủ yếu tập trung vào phát hiện hộp giới hạn tiêu chuẩn, thiếu sự hỗ trợ bản địa cho các tác vụ nâng cao như pose estimation hoặc phát hiện oriented bounding box (OBB) ngay khi xuất xưởng.

Tìm hiểu thêm về DAMO-YOLO

So sánh hiệu năng#

Hiểu rõ các sự đánh đổi thực nghiệm là điều thiết yếu để lựa chọn mô hình. Bảng dưới đây so sánh họ EfficientDet với chuỗi DAMO-YOLO qua các performance metrics cốt yếu.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
Phân tích dữ liệu

EfficientDet-d7 đạt được độ chính xác lý thuyết cao nhất nhưng đòi hỏi sức mạnh tính toán khổng lồ, khiến nó không phù hợp cho edge AI. DAMO-YOLO cung cấp tốc độ TensorRT đặc biệt, mặc dù nó thường đòi hỏi nhiều tham số hơn so với các mô hình EfficientDet bậc thấp để đạt được độ chính xác tương đương.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa EfficientDet và DAMO-YOLO phụ thuộc vào các yêu cầu cụ thể của dự án, các ràng buộc triển khai và sở thích về hệ sinh thái của bạn.

Khi nào nên chọn EfficientDet#

EfficientDet là một lựa chọn mạnh mẽ cho:

  • Google Cloud và các đường ống TPU: Các hệ thống được tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet có sự tối ưu hóa gốc.
  • Nghiên cứu về Compound Scaling: Các nghiên cứu học thuật tập trung vào việc đánh giá tác động của độ sâu mạng, chiều rộng và khả năng mở rộng độ phân giải cân bằng.
  • Triển khai trên thiết bị di động qua TFLite: Các dự án đặc biệt yêu cầu xuất TensorFlow Lite cho Android hoặc các thiết bị Linux nhúng.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO được khuyến nghị cho:

  • Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên cơ sở hạ tầng GPU NVIDIA cố định, nơi thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các kịch bản với hạn chế độ trễ GPU nghiêm ngặt trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu tác động của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đối với hiệu năng phát hiện.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế của Ultralytics: Tiến xa hơn các model kế thừa#

Mặc dù EfficientDet và DAMO-YOLO cung cấp những thông tin chi tiết có giá trị về mặt học thuật, các nhà phát triển hiện đại đòi hỏi các framework cân bằng giữa hiệu suất tối tân và công thái học của nhà phát triển. Đây là điểm mà Ultralytics ecosystem vượt trội.

Sự dễ sử dụng và hệ sinh thái vô song#

Việc triển khai các mô hình từ các kho lưu trữ nghiên cứu riêng biệt và được tùy chỉnh nặng nề thường dẫn đến những cơn ác mộng tích hợp. Ultralytics cung cấp một hệ sinh thái đồng nhất, được well-maintained ecosystem sâu sắc với tài liệu phong phú và một API theo phong cách Python. Cho dù bạn đang sử dụng Google Colab để huấn luyện hay xuất sang CoreML để suy luận trên di động, đường ống chỉ yêu cầu một vài dòng mã.

from ultralytics import YOLO

# Load the highly recommended YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX for production
model.export(format="onnx")

Cuộc cách mạng YOLO26#

Đối với các nhà phát triển đang đánh giá EfficientDet hoặc DAMO-YOLO, Ultralytics YOLO26 đại diện cho bước tiến hóa tối thượng. Được phát hành vào đầu năm 2026, nó giới thiệu các khả năng thay đổi mô hình:

  • Thiết kế End-to-End Không cần NMS: Được tiên phong bởi YOLOv10, YOLO26 loại bỏ hoàn toàn nhu cầu xử lý hậu kỳ Non-Maximum Suppression (NMS) một cách tự nhiên. Điều này chuyển thành các kiến trúc triển khai đơn giản hơn rất nhiều và độ trễ nhất quán trên các phần cứng đa dạng.
  • Suy luận trên CPU nhanh hơn tới 43%: Đối với các triển khai tại edge thiếu GPU mạnh mẽ—những kịch bản mà DAMO-YOLO gặp khó khăn—YOLO26 được tối ưu hóa mạnh mẽ, mang lại tốc độ tăng tốc vượt bậc trên các CPU tiêu chuẩn.
  • Tối ưu hóa MuSGD: Thu hẹp khoảng cách giữa các đổi mới LLM và computer vision, YOLO26 tích hợp trình tối ưu hóa MuSGD (lấy cảm hứng từ Moonshot AI), đảm bảo việc huấn luyện cực kỳ ổn định và hội tụ nhanh chóng so với các vòng lặp huấn luyện kém bền vững của EfficientDet.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss đơn giản hóa quá trình xuất, đảm bảo khả năng tương thích vượt trội với các vi điều khiển công suất thấp và các thiết bị Raspberry Pi.
  • ProgLoss + STAL: Những hàm loss tiên tiến này mang lại sự cải thiện đáng kể trong nhận diện đối tượng nhỏ, một lĩnh vực mà các kiến trúc cũ thường thất bại.

Hiệu quả bộ nhớ và sự linh hoạt của tác vụ#

Không giống như các mô hình transformer hoặc các mạng lưới NAS được hợp nhất nặng nề, các mô hình Ultralytics được đặc trưng bởi hiệu quả bộ nhớ nghiêm ngặt của chúng. Chúng tiêu thụ bộ nhớ CUDA thấp hơn đáng kể trong quá trình huấn luyện, cho phép lặp lại nhanh chóng trên phần cứng cấp độ người tiêu dùng.

Hơn nữa, trong khi EfficientDet và DAMO-YOLO bị giới hạn cứng nhắc đối với các hộp giới hạn, Ultralytics hỗ trợ tự nhiên instance segmentationimage classification ngay trong cùng một framework trực quan. Đối với những người dùng duy trì các dự án cũ hơn, Ultralytics YOLOv8 vẫn là một sự thay thế vững chắc, được triển khai rộng rãi đáng để khám phá.

Kết luận#

Việc lựa chọn kiến trúc thị giác phù hợp bao gồm việc cân nhắc hiệu suất lý thuyết thô đối với thực tế triển khai. EfficientDet cung cấp một cách tiếp cận mở rộng thanh lịch về mặt toán học, và DAMO-YOLO mang lại tốc độ GPU thô hấp dẫn. Tuy nhiên, đối với các nhóm ưu tiên phát triển nhanh chóng, triển khai đáng tin cậy và các tính năng tiên tiến, Ultralytics models đứng vượt trội rõ ràng. Bằng cách kết hợp các đổi mới như suy luận không cần NMS và tối ưu hóa MuSGD, YOLO26 đảm bảo rằng các dự án computer vision của bạn được xây dựng trên nền tảng có năng lực nhất, dễ duy trì nhất và hiệu quả nhất hiện có.

Người đóng góp

Bình luận