YOLO Vision 2026:

YOLOv10 so với EfficientDet#

Lựa chọn mạng neural tối ưu cho object detection là một quyết định quan trọng quyết định sự thành công của các hệ thống computer vision hiện đại. Hai kiến trúc nổi bật đã tác động đáng kể đến lĩnh vực này là YOLOv10EfficientDet. Mặc dù cả hai đều nhằm mục đích tối đa hóa độ chính xác đồng thời giảm thiểu chi phí tính toán, chúng lại áp dụng các phương pháp tiếp cận kiến trúc rất khác nhau để đạt được các mục tiêu này.

Hướng dẫn toàn diện này đi sâu vào thiết kế độc đáo, phương pháp huấn luyện và đặc điểm triển khai của chúng, giúp các lập trình viên và kỹ sư ML đưa ra các quyết định dựa trên dữ liệu cho các vision AI applications. Chúng ta sẽ kiểm tra cách chúng hoạt động trên các phần cứng từ các edge AI devices nhúng cho đến các GPU đám mây mạnh mẽ.

YOLOv10: Người tiên phong không cần NMS#

Được phát triển nhằm đẩy lùi giới hạn về độ trễ thời gian thực, YOLOv10 giải quyết một trong những điểm nghẽn dai dẳng nhất trong dòng YOLO: Non-Maximum Suppression (NMS). Bằng cách loại bỏ bước xử lý hậu kỳ này, model đạt được độ trễ có thể dự đoán trước rất cao, điều quan trọng đối với autonomous vehicles và robot tốc độ cao.

Cải tiến kiến trúc#

YOLOv10 giới thiệu các gán ghép kép nhất quán cho việc huấn luyện không cần NMS. Trong quá trình huấn luyện, nó tận dụng cả gán ghép nhãn một-nhiều và một-một, cho phép mạng học các biểu diễn phong phú trong khi xuất ra nguyên bản một hộp bao (bounding box) tốt nhất cho mỗi đối tượng trong quá trình suy luận. Kiến trúc này cũng kết hợp thiết kế hướng tới hiệu quả-độ chính xác toàn diện, hợp lý hóa đầu phân loại và giảm sự dư thừa tính toán được tìm thấy trong các phiên bản trước.

Thông tin chi tiết về mô hình#

Triển khai hợp lý

Vì YOLOv10 loại bỏ bước NMS, nên nó vốn dĩ dễ dàng xuất sang các định dạng như ONNX formatNVIDIA TensorRT hơn mà không cần phụ thuộc vào các plugin runtime tùy chỉnh để lọc bounding box.

Điểm mạnh:

  • Suy luận có thể dự đoán: Việc loại bỏ NMS đảm bảo thời gian suy luận nhất quán bất kể số lượng đối tượng trong cảnh.
  • Lower Memory Usage: So với các model dựa trên Transformer như RT-DETR, YOLOv10 yêu cầu bộ nhớ thấp hơn đáng kể trong cả quá trình huấn luyện và suy luận.
  • Excellent Speed/Accuracy Trade-off: Được tối ưu hóa cụ thể cho các kịch bản độ trễ thấp mà không làm hy sinh performance metrics.

Điểm yếu:

Tìm hiểu thêm về YOLOv10

EfficientDet: Có khả năng mở rộng và cân bằng#

Được giới thiệu bởi Google Brain, EfficientDet tiếp cận việc phát hiện đối tượng thông qua lăng kính mở rộng mạng có hệ thống. Nó được xây dựng dựa trên backbone phân loại hình ảnh EfficientNet và giới thiệu một cơ chế hợp nhất đặc trưng mới.

Cải tiến kiến trúc#

Cốt lõi của EfficientDet là Bi-directional Feature Pyramid Network (BiFPN), cho phép hợp nhất đặc trưng đa quy mô dễ dàng và nhanh chóng. Không giống như các FPN truyền thống chỉ cộng các đặc trưng từ trên xuống dưới, BiFPN giới thiệu các kết nối chéo quy mô hai chiều và trọng số có thể huấn luyện để học tầm quan trọng của các đặc trưng đầu vào khác nhau. Hơn nữa, EfficientDet sử dụng phương pháp mở rộng phức hợp giúp mở rộng đồng nhất độ phân giải, chiều sâu và chiều rộng cho tất cả các backbone, mạng đặc trưng và mạng dự đoán hộp/lớp.

Thông tin chi tiết về mô hình#

Điểm mạnh:

  • High Efficiency: Tỷ lệ tham số trên độ chính xác xuất sắc, làm cho các biến thể -d0 đến -d2 nhỏ hơn trở nên rất nhẹ.
  • Mở rộng theo nguyên tắc: Việc mở rộng phức hợp cho phép người dùng dễ dàng chọn kích thước mô hình phù hợp với ngân sách tính toán chính xác của họ.

Điểm yếu:

  • Legacy Framework Integration: Bản cài đặt gốc phụ thuộc nhiều vào các phiên bản TensorFlow cũ hơn, điều này có thể làm phức tạp hóa các pipeline triển khai hiện đại.
  • Huấn luyện chậm hơn: Huấn luyện EfficientDet từ đầu nổi tiếng là chậm và đòi hỏi phải tinh chỉnh siêu tham số cẩn thận so với sự hội tụ nhanh chóng của các kiến trúc YOLO.
  • Tốc độ suy luận: Mặc dù hiệu quả về tham số, các hoạt động BiFPN phức tạp thường dẫn đến tốc độ suy luận thực tế chậm hơn trên phần cứng tiêu chuẩn so với các mô hình YOLO được tối ưu hóa cao.

Tìm hiểu thêm về EfficientDet

Hiệu năng và Benchmark#

Bài kiểm tra thực tế về các model này nằm ở hiệu suất thực nghiệm của chúng trên các benchmark tiêu chuẩn như COCO dataset. Bảng dưới đây minh họa các sự khác biệt quan trọng về số lượng tham số, các phép toán dấu chấm động (FLOPs) và độ trễ suy luận trên NVIDIA T4 GPUs.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như đã hiển thị ở trên, YOLOv10 duy trì lợi thế đáng kể về tốc độ suy luận thô. Ví dụ, YOLOv10-S đạt 46.7 mAP với độ trễ TensorRT chỉ 2.66ms, trong khi EfficientDet-d3 đạt 47.5 mAP tương tự nhưng mất gần 20ms—khiến YOLOv10 vượt trội hơn nhiều cho truyền phát video thời gian thực hoặc các quy trình sản xuất chuyển động nhanh.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa YOLOv10 và EfficientDet phụ thuộc vào yêu cầu dự án cụ thể, ràng buộc triển khai và sở thích về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là một lựa chọn mạnh mẽ cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ việc phát hiện đầu cuối (end-to-end) mà không cần NMS, giúp giảm độ phức tạp khi triển khai.
  • Sự cân bằng giữa tốc độ và độ chính xác: Các dự án yêu cầu sự cân bằng mạnh mẽ giữa tốc độ suy luận và độ chính xác của phát hiện trên nhiều quy mô model khác nhau.
  • Các ứng dụng có độ trễ nhất quán: Các kịch bản triển khai nơi thời gian suy luận có thể dự đoán được là tối quan trọng, chẳng hạn như robot hoặc các hệ thống tự hành.

Khi nào nên chọn EfficientDet#

EfficientDet được khuyến nghị cho:

  • Google Cloud và các đường ống TPU: Các hệ thống được tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet có sự tối ưu hóa gốc.
  • Nghiên cứu về Compound Scaling: Các nghiên cứu học thuật tập trung vào việc đánh giá tác động của độ sâu mạng, chiều rộng và khả năng mở rộng độ phân giải cân bằng.
  • Triển khai trên thiết bị di động qua TFLite: Các dự án đặc biệt yêu cầu xuất TensorFlow Lite cho Android hoặc các thiết bị Linux nhúng.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Tiêu chuẩn hiện đại: Ra mắt Ultralytics YOLO26#

Trong khi YOLOv10 giới thiệu mô hình không cần NMS mang tính đột phá và EfficientDet trưng bày việc mở rộng quy mô có nguyên tắc, bối cảnh computer vision tiếp tục tiến hóa. Đối với các lập trình viên bắt đầu các dự án mới ngày nay, Ultralytics YOLO26 đại diện cho trạng thái tối tân không thể bàn cãi. Ra mắt vào tháng 1 năm 2026, nó hợp nhất những gì tốt nhất của mọi thế giới thành một gói hoàn thiện, sẵn sàng cho sản xuất trong Ultralytics Platform.

Tại sao YOLO26 vượt trội hơn đối thủ#

  1. Thiết kế end-to-end không cần NMS: YOLO26 áp dụng nguyên bản kiến trúc end-to-end không cần NMS tiên phong trong YOLOv10, hợp lý hóa việc triển khai và tăng tốc suy luận.
  2. Tốc độ suy luận CPU nhanh hơn tới 43%: Đối với các thiết bị cạnh thiếu bộ tăng tốc chuyên dụng, YOLO26 được tối ưu hóa cụ thể để chạy hiệu quả trên các CPU tiêu chuẩn.
  3. Advanced MuSGD Optimizer: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM, YOLO26 sử dụng sự kết hợp giữa SGD và Muon để huấn luyện cực kỳ ổn định và hội tụ nhanh chóng, cải thiện lớn training efficiency so với EfficientDet.
  4. ProgLoss + STAL: Những hàm loss được cải tiến này mang lại sự thúc đẩy đáng kể trong việc nhận diện đối tượng nhỏ, một điểm yếu truyền thống của cả YOLOv10 và EfficientDet.
  5. DFL Removal: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 xuất liền mạch sang hầu hết mọi định dạng phần cứng, bao gồm OpenVINO và CoreML.

Hơn nữa, YOLO26 cung cấp sự đa dạng chưa từng có. Trong khi EfficientDet và YOLOv10 là các model phát hiện nghiêm ngặt, YOLO26 xử lý liền mạch oriented bounding boxes, image classification và instance segmentation bằng cách sử dụng Ultralytics Python package trực quan tương tự.

Hệ sinh thái được bảo trì tốt

Cả YOLO11YOLOv8 đều được hỗ trợ đầy đủ trong hệ sinh thái Ultralytics. Để có sự kết hợp tốt nhất giữa hiệu suất, độ ổn định và hỗ trợ dài hạn, chúng tôi khuyên dùng các model Ultralytics được duy trì chính thức.

Dễ sử dụng với Ultralytics#

Hệ sinh thái được duy trì tốt do Ultralytics cung cấp đảm bảo trải nghiệm lập trình viên mượt mà. Việc huấn luyện một model, xác thực nó và xuất sang TensorRT integration chỉ mất vài dòng code.

from ultralytics import YOLO

# Load a pre-trained YOLOv10 model (or upgrade to YOLO26 natively)
model = YOLO("yolov10n.pt")

# Train the model efficiently on a custom dataset
model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and immediately visualize results
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export for rapid deployment
model.export(format="engine", quantize=16)

Kết luận#

Khi so sánh YOLOv10 và EfficientDet, lựa chọn phụ thuộc nhiều vào sở thích framework và ràng buộc về tốc độ của bạn. EfficientDet cung cấp phương pháp tiếp cận có cấu trúc để mở rộng mô hình trong hệ sinh thái TensorFlow. Tuy nhiên, YOLOv10 cung cấp hiệu suất thời gian thực vượt trội, sử dụng bộ nhớ thấp hơn và lộ trình triển khai đơn giản hơn nhờ kiến trúc không cần NMS.

Để có sự cân bằng hiệu suất tuyệt đối tốt nhất, tính dễ sử dụng và tính linh hoạt đa nhiệm, việc nâng cấp lên Ultralytics Platform và tận dụng YOLO26 được khuyên dùng mạnh mẽ. Nó lấy các đổi mới không cần NMS của YOLOv10, áp dụng các kỹ thuật huấn luyện tối tân như bộ tối ưu hóa MuSGD và gói gọn nó trong một framework mã nguồn mở mạnh mẽ được hỗ trợ bởi một cộng đồng toàn cầu lớn mạnh.

Người đóng góp

Bình luận