YOLO Vision 2026:

EfficientDet so với YOLOX#

Khi thiết kế một pipeline computer vision hiện đại, việc lựa chọn đúng model là một quyết định quan trọng quyết định cả độ chính xác lẫn khả năng đáp ứng thời gian thực. Hướng dẫn kỹ thuật này cung cấp sự so sánh chi tiết giữa hai kiến trúc trọng yếu trong sự tiến hóa của mạng neural: EfficientDet của Google và YOLOX của Megvii. Chúng ta sẽ phân tích các mô hình kiến trúc của chúng, đánh giá hiệu năng trên benchmark và khám phá cách chúng so sánh với các giải pháp tiên tiến như Ultralytics YOLO26 mới được phát hành.

Tổng quan về EfficientDet#

Được giới thiệu bởi nhóm Google Brain, EfficientDet tiên phong trong cách tiếp cận có cấu trúc cao đối với việc scale model, chứng minh rằng accuracy cao có thể đạt được với số lượng tham số ít hơn đáng kể so với các mạng đương đại có nhiều tham số.

Chi tiết về EfficientDet:

Điểm nổi bật về kiến trúc#

EfficientDet được xây dựng dựa trên backbone EfficientNet, áp dụng phương pháp chia tỷ lệ hỗn hợp (compound scaling) để mở rộng đồng bộ độ phân giải, độ sâu và chiều rộng của mạng. Đặc điểm nổi bật của nó là Bi-directional Feature Pyramid Network (BiFPN), cho phép kết hợp các tính năng đa quy mô một cách nhanh chóng và hiệu quả. Bằng cách sử dụng các trọng số có thể học được cho các đầu vào khác nhau, BiFPN đảm bảo rằng mạng ưu tiên các dữ liệu không gian quan trọng hơn.

Mặc dù FLOPs lý thuyết của EfficientDet cực kỳ thấp, sự phụ thuộc của nó vào hệ sinh thái TensorFlow và các cấu hình AutoML cũ có thể khiến việc tích hợp vào các luồng công việc PyTorch hiện đại, tốc độ cao trở nên cồng kềnh. Hơn nữa, mạng nhiều nhánh phức tạp của nó thỉnh thoảng có thể dẫn đến mức tiêu thụ bộ nhớ cao hơn dự kiến trong quá trình huấn luyện so với các biến thể YOLO hiện đại.

Tìm hiểu thêm về EfficientDet

Tổng quan về YOLOX#

Được phát hành hai năm sau đó, YOLOX tìm cách thu hẹp khoảng cách giữa nghiên cứu học thuật và triển khai công nghiệp bằng cách chuyển đổi kiến trúc YOLO truyền thống thành một khung làm việc không cần anchor (anchor-free).

Chi tiết về YOLOX:

Điểm nổi bật về kiến trúc#

YOLOX đơn giản hóa đáng kể mô hình phát hiện đối tượng. Bằng cách chuyển sang thiết kế không cần anchor, YOLOX loại bỏ nhu cầu tinh chỉnh khung anchor phức tạp, đặc thù cho từng tập dữ liệu, giảm thiểu chi phí heuristic. Nó cũng tích hợp một decoupled head (tách biệt các tác vụ phân loại và định vị), giúp cải thiện đáng kể tốc độ hội tụ. Ngoài ra, việc giới thiệu chiến lược gán nhãn SimOTA đã tối ưu hóa việc phân bổ các mẫu dương tính một cách linh hoạt trong quá trình huấn luyện.

Bất chấp những tiến bộ này, việc quản lý các kho lưu trữ YOLOX thường đòi hỏi phải biên dịch các phần mở rộng C++ thủ công và xử lý các phụ thuộc phức tạp, điều này có thể cản trở quá trình model deployment nhanh chóng đối với các nhóm ít kinh nghiệm hơn.

Tìm hiểu thêm về YOLOX

So sánh hiệu năng#

Khi đánh giá các model cho môi trường production, việc cân bằng giữa mean Average Precision (mAP) và tốc độ inference là tối quan trọng. Bảng dưới đây cung cấp sự so sánh trực tiếp giữa các dòng EfficientDet và YOLOX trên các chuẩn benchmark COCO tiêu chuẩn.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
Thông tin chi tiết về hiệu suất

Mặc dù EfficientDet đạt độ chính xác cao trên các biến thể d7 lớn hơn của nó, YOLOX cung cấp độ trễ vượt trội hơn hẳn trên phần cứng GPU (thông qua TensorRT), biến nó thành lựa chọn tốt hơn cho các ứng dụng có FPS cao như xe tự lái hoặc theo dõi thể thao.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa EfficientDet và YOLOX phụ thuộc vào yêu cầu dự án cụ thể, hạn chế triển khai và tùy chọn hệ sinh thái của bạn.

Khi nào nên chọn EfficientDet#

EfficientDet là một lựa chọn mạnh mẽ cho:

  • Google Cloud và các đường ống TPU: Các hệ thống được tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet có sự tối ưu hóa gốc.
  • Nghiên cứu về Compound Scaling: Các nghiên cứu học thuật tập trung vào việc đánh giá tác động của độ sâu mạng, chiều rộng và khả năng mở rộng độ phân giải cân bằng.
  • Triển khai trên thiết bị di động qua TFLite: Các dự án đặc biệt yêu cầu xuất TensorFlow Lite cho Android hoặc các thiết bị Linux nhúng.

Khi nào nên chọn YOLOX#

YOLOX được khuyến nghị cho:

  • Nghiên cứu Phát hiện Anchor-Free: Nghiên cứu học thuật sử dụng kiến trúc anchor-free sạch, gọn của YOLOX làm baseline để thử nghiệm với các head phát hiện hoặc hàm mất mát mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động cũ nơi mà footprint cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là rất quan trọng.
  • Nghiên cứu Gán nhãn SimOTA: Các dự án nghiên cứu điều tra các chiến lược gán nhãn dựa trên vận chuyển tối ưu và tác động của chúng đến sự hội tụ trong đào tạo.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế của Ultralytics: Giới thiệu YOLO26#

Trong khi EfficientDet và YOLOX đại diện cho những bước nhảy vọt đáng kể trong thời đại của chúng, computer vision hiện đại đòi hỏi tính linh hoạt cao hơn, các luồng công việc được tối ưu hóa và tốc độ không khoan nhượng. Đối với các lập trình viên ưu tiên tính dễ sử dụng, yêu cầu bộ nhớ thấp hơn và một hệ sinh thái được bảo trì tốt, chúng tôi đặc biệt khuyên dùng việc nâng cấp lên Ultralytics YOLO26, được phát hành vào tháng 1 năm 2026.

YOLO26 đại diện cho một sự thay đổi mô hình trong dòng YOLO, vượt qua một cách có hệ thống các hạn chế được tìm thấy trong các mô hình cũ như YOLOX và EfficientDet:

  • Thiết kế NMS-Free End-to-End: Không giống như EfficientDet và YOLOX yêu cầu xử lý hậu kỳ Non-Maximum Suppression (NMS) tốn kém, YOLO26 vốn dĩ là end-to-end. Điều này loại bỏ các nút thắt độ trễ và đơn giản hóa đáng kể việc triển khai tại biên (edge).
  • Inference CPU nhanh hơn tới 43%: Thông qua việc tinh chỉnh kiến trúc chiến lược và Loại bỏ DFL (Distribution Focal Loss), YOLO26 được tối ưu hóa độc đáo cho các môi trường không có GPU chuyên dụng, vượt trội hoàn toàn so với EfficientDet trên phần cứng edge AI như Raspberry Pi.
  • Trình tối ưu hóa MuSGD: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM (như Kimi K2 của Moonshot AI), YOLO26 sử dụng sự kết hợp giữa SGD và Muon. Điều này đảm bảo quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh hơn, vượt xa so với các công cụ ước tính TensorFlow cũ.
  • ProgLoss + STAL: Các hàm loss tiên tiến mang lại những cải tiến đáng kể trong việc nhận diện đối tượng nhỏ, một điểm yếu lịch sử của cả YOLOX và EfficientDet. Điều này rất quan trọng đối với phân tích drone và IoT.
  • Tính linh hoạt đáng kinh ngạc: Trong khi EfficientDet và YOLOX hoàn toàn là các bộ dò bounding box, YOLO26 hỗ trợ nguyên bản Instance Segmentation, Pose Estimation (thông qua Residual Log-Likelihood Estimation), và Oriented Bounding Boxes (OBB).

Tìm hiểu thêm về YOLO26

Trải nghiệm người dùng tinh gọn và hiệu quả huấn luyện#

Một trong những rào cản lớn nhất với các model như YOLOX là thiết lập môi trường huấn luyện. Ultralytics Platform cung cấp một Python SDK thống nhất, nơi việc huấn luyện một model tiên tiến chỉ đòi hỏi vài dòng code. Thêm vào đó, các model YOLO có các bộ nạp dữ liệu được tối ưu hóa cao, đảm bảo mức sử dụng bộ nhớ CUDA thấp hơn đáng kể so với các model nặng về transformer hoặc các mạng nhiều nhánh cũ.

from ultralytics import YOLO

# Load the cutting-edge YOLO26n model (NMS-free!)
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with automated hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the model seamlessly to ONNX or OpenVINO for edge deployment
model.export(format="openvino")

Kết luận: Đưa ra lựa chọn đúng đắn#

Nếu bạn đang duy trì một hệ thống cũ gắn liền với hệ sinh thái TensorFlow, EfficientDet vẫn là một lựa chọn ổn định, đặc biệt là cho các kịch bản mà việc mở rộng quy mô hỗn hợp lớn là cần thiết về mặt lý thuyết. Ngược lại, nếu bạn cần tốc độ thuần túy trên các codebase cũ không cần anchor, YOLOX đóng vai trò là một bộ phát hiện nhanh và đáng tin cậy.

Tuy nhiên, đối với bất kỳ dự án mới nào chuyển sang giai đoạn production, sự lựa chọn rõ ràng là Ultralytics YOLO26 (hoặc YOLO11 cực kỳ ổn định để hỗ trợ doanh nghiệp cũ). Bằng cách cung cấp kiến trúc không cần NMS từ đầu đến cuối, tốc độ CPU được cải thiện đáng kể và một pipeline triển khai liền mạch thông qua các nền tảng như OpenVINO và TensorRT, YOLO26 đảm bảo các ứng dụng computer vision của bạn được chuẩn hóa cho tương lai, có độ chính xác cao và cực kỳ dễ bảo trì.

Những người đóng góp

Bình luận