Ultralytics YOLO27:
Get Started

YOLOv10 so với EfficientDet#

Lựa chọn mạng nơ-ron tối ưu cho phát hiện đối tượng là quyết định then chốt, ảnh hưởng trực tiếp đến thành công của các hệ thống thị giác máy tính hiện đại. Hai kiến trúc nổi bật có ảnh hưởng đáng kể đến lĩnh vực này là YOLOv10 và EfficientDet. Cả hai đều hướng đến tối đa hóa độ chính xác đồng thời giảm thiểu chi phí tính toán, nhưng sử dụng những cách tiếp cận kiến trúc rất khác nhau để đạt được mục tiêu đó.

Hướng dẫn toàn diện này đi sâu vào thiết kế riêng, phương pháp huấn luyện và đặc điểm triển khai của từng model, giúp nhà phát triển và kỹ sư ML đưa ra quyết định dựa trên dữ liệu cho các ứng dụng AI thị giác. Chúng ta sẽ xem xét hiệu năng của các model trên phần cứng từ thiết bị AI biên nhúng đến GPU cloud mạnh mẽ.

YOLOv10: Tiên phong không cần NMS#

Được phát triển nhằm mở rộng giới hạn về độ trễ thời gian thực, YOLOv10 xử lý một trong những nút thắt dai dẳng nhất của dòng YOLO: Non-Maximum Suppression (NMS). Bằng cách loại bỏ bước hậu xử lý này, model đạt độ trễ có tính dự đoán cao, yếu tố then chốt đối với xe tự hành và robot tốc độ cao.

Các cải tiến kiến trúc#

YOLOv10 giới thiệu phương pháp gán nhãn kép nhất quán để huấn luyện không cần NMS. Trong quá trình huấn luyện, model sử dụng cả phương pháp gán nhãn một-nhiều và một-một, cho phép mạng học các biểu diễn phong phú đồng thời xuất nguyên bản một bounding box tốt nhất cho mỗi đối tượng khi suy luận. Kiến trúc này cũng tích hợp thiết kế toàn diện cân bằng giữa hiệu quả và độ chính xác, tinh gọn head phân loại và giảm dư thừa tính toán so với các phiên bản trước.

Chi tiết model#

Triển khai tinh gọn

Vì YOLOv10 loại bỏ bước NMS, việc xuất model sang các định dạng như định dạng ONNX và NVIDIA TensorRT vốn dễ dàng hơn, không cần phụ thuộc vào plugin runtime tùy chỉnh để lọc bounding box.

Ưu điểm:

  • Suy luận có thể dự đoán: Loại bỏ NMS đảm bảo thời gian suy luận nhất quán bất kể số lượng đối tượng trong cảnh.
  • Mức sử dụng bộ nhớ thấp hơn: So với các model dựa trên Transformer như RT-DETR, YOLOv10 cần ít bộ nhớ hơn đáng kể trong cả quá trình huấn luyện lẫn suy luận.
  • Cân bằng tốc độ/độ chính xác xuất sắc: Được tối ưu đặc biệt cho các kịch bản độ trễ thấp mà không làm giảm các chỉ số hiệu năng.

Nhược điểm:

Tìm hiểu thêm về YOLOv10

EfficientDet: Có thể mở rộng và cân bằng#

Được Google Brain giới thiệu, EfficientDet tiếp cận bài toán phát hiện đối tượng theo hướng mở rộng quy mô mạng một cách có hệ thống. Model này xây dựng trên backbone phân loại ảnh EfficientNet và giới thiệu một cơ chế hợp nhất đặc trưng mới.

Các cải tiến kiến trúc#

Cốt lõi của EfficientDet là Mạng kim tự tháp đặc trưng hai chiều (BiFPN), cho phép hợp nhất đặc trưng đa tỷ lệ dễ dàng và nhanh chóng. Khác với FPN truyền thống chỉ cộng các đặc trưng theo hướng từ trên xuống, BiFPN bổ sung các kết nối hai chiều giữa các tỷ lệ và trọng số có thể huấn luyện để học mức độ quan trọng của các đặc trưng đầu vào khác nhau. Ngoài ra, EfficientDet sử dụng phương pháp mở rộng đồng bộ, điều chỉnh đồng đều độ phân giải, độ sâu và độ rộng của backbone, mạng đặc trưng và các mạng dự đoán box/lớp.

Chi tiết model#

Ưu điểm:

  • Hiệu quả cao: Tỷ lệ giữa số lượng tham số và độ chính xác rất tốt, giúp các biến thể -d0 đến -d2 nhỏ hơn có kích thước rất gọn nhẹ.
  • Mở rộng có cơ sở: Phương pháp mở rộng đồng bộ giúp người dùng dễ dàng chọn kích thước model phù hợp với ngân sách tính toán cụ thể.

Nhược điểm:

  • Tích hợp framework cũ: Bản triển khai gốc phụ thuộc nhiều vào các phiên bản TensorFlow cũ, có thể làm phức tạp pipeline triển khai hiện đại.
  • Huấn luyện chậm hơn: Huấn luyện EfficientDet từ đầu nổi tiếng là chậm và đòi hỏi tinh chỉnh hyperparameter cẩn thận so với tốc độ hội tụ nhanh của các kiến trúc YOLO.
  • Tốc độ suy luận: Dù tiết kiệm tham số, các phép toán BiFPN phức tạp thường khiến tốc độ suy luận thực tế trên phần cứng phổ thông chậm hơn các model YOLO được tối ưu cao.

Tìm hiểu thêm về EfficientDet

Hiệu năng và benchmark#

Thước đo thực sự của các model này là hiệu năng thực nghiệm trên những benchmark tiêu chuẩn như dataset COCO. Bảng dưới đây minh họa những khác biệt quan trọng về số lượng tham số, phép toán dấu phẩy động (FLOPs) và độ trễ suy luận trên GPU NVIDIA T4.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như đã trình bày ở trên, YOLOv10 duy trì ưu thế đáng kể về tốc độ suy luận thuần túy. Ví dụ, YOLOv10-S đạt 46.3 mAP với độ trễ TensorRT chỉ 2.49ms, trong khi EfficientDet-d3 đạt mức tương đương là 47.5 mAP nhưng mất gần 20ms — khiến YOLOv10 vượt trội hơn hẳn trong truyền phát video thời gian thực hoặc pipeline sản xuất tốc độ cao.

Trường hợp sử dụng và khuyến nghị#

Việc chọn YOLOv10 hay EfficientDet tùy thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là lựa chọn phù hợp cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
  • Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.

Khi nào nên chọn EfficientDet#

EfficientDet được khuyến nghị cho:

  • Pipeline Google Cloud và TPU: Các hệ thống tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet được tối ưu hóa nguyên bản.
  • Nghiên cứu mở rộng theo hệ số: Benchmark học thuật tập trung nghiên cứu tác động của việc mở rộng cân bằng độ sâu, chiều rộng và độ phân giải của mạng.
  • Triển khai di động qua LiteRT: Các dự án yêu cầu cụ thể việc xuất sang LiteRT (trước đây là TensorFlow Lite) cho Android hoặc thiết bị Linux nhúng.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Tiêu chuẩn hiện đại: Ultralytics YOLO26 ra mắt#

Dù YOLOv10 giới thiệu mô hình không cần NMS mang tính đột phá và EfficientDet thể hiện phương pháp mở rộng có cơ sở, lĩnh vực thị giác máy tính vẫn tiếp tục phát triển. Với nhà phát triển bắt đầu dự án mới hiện nay, Ultralytics YOLO26 đại diện cho công nghệ tiên tiến hàng đầu không thể tranh cãi. Ra mắt vào tháng 1 năm 2026, model kết hợp ưu điểm của mọi phương pháp thành một gói hoàn thiện cao, sẵn sàng cho production trên Ultralytics Platform.

Vì sao YOLO26 vượt trội hơn các đối thủ#

  1. Thiết kế end-to-end không cần NMS: YOLO26 cung cấp thiết kế end-to-end không cần NMS do YOLOv10 tiên phong dưới dạng head một-một tùy chọn (nms=False), giúp tinh gọn quá trình triển khai và tăng tốc suy luận.
  2. Suy luận CPU nhanh hơn đến 43%: Với các thiết bị biên không có bộ tăng tốc chuyên dụng, YOLO26 được tối ưu đặc biệt để chạy hiệu quả trên CPU tiêu chuẩn.
  3. Optimizer MuSGD tiên tiến: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM, YOLO26 sử dụng phương pháp lai giữa SGD và Muon để đạt quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh, cải thiện đáng kể hiệu quả huấn luyện so với EfficientDet.
  4. ProgLoss + STAL: Các hàm loss cải tiến này mang lại mức tăng đáng kể trong khả năng nhận diện đối tượng nhỏ, vốn là điểm yếu truyền thống của cả YOLOv10 và EfficientDet.
  5. Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 có thể xuất model liền mạch sang gần như mọi định dạng phần cứng, bao gồm OpenVINO và CoreML.

Ngoài ra, YOLO26 mang đến tính linh hoạt vượt trội. Trong khi EfficientDet và YOLOv10 chỉ là các model phát hiện, YOLO26 xử lý liền mạch bounding box có hướng, phân loại ảnh và phân đoạn đối tượng bằng cùng một package Python Ultralytics trực quan.

Hệ sinh thái được duy trì tốt

Cả YOLO11 và YOLOv8 đều tiếp tục được hỗ trợ đầy đủ trong hệ sinh thái Ultralytics. Để có được sự kết hợp tốt nhất giữa hiệu năng, độ ổn định và hỗ trợ lâu dài, chúng tôi khuyến nghị sử dụng các model Ultralytics được duy trì chính thức.

Dễ sử dụng với Ultralytics#

Hệ sinh thái được Ultralytics duy trì tốt đảm bảo trải nghiệm phát triển mượt mà. Chỉ cần vài dòng mã để huấn luyện model, đánh giá model và xuất model để tích hợp TensorRT.

from ultralytics import YOLO

# Tải model YOLOv10 đã huấn luyện trước (hoặc nâng cấp trực tiếp lên YOLO26)
model = YOLO("yolov10n.pt")

# Huấn luyện model hiệu quả trên dataset tùy chỉnh
model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Chạy inference và trực quan hóa kết quả ngay lập tức
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export để triển khai nhanh chóng
model.export(format="engine", quantize=16)

Kết luận#

Khi so sánh YOLOv10 và EfficientDet, lựa chọn phụ thuộc nhiều vào framework bạn ưu tiên và các giới hạn về tốc độ. EfficientDet cung cấp một phương pháp có cấu trúc để mở rộng quy mô model trong hệ sinh thái TensorFlow. Tuy nhiên, YOLOv10 mang lại hiệu năng thời gian thực vượt trội, mức sử dụng bộ nhớ thấp hơn và quy trình triển khai đơn giản hơn nhờ kiến trúc không cần NMS.

Để đạt được sự cân bằng tối ưu giữa hiệu năng, tính dễ sử dụng và khả năng xử lý đa tác vụ, bạn nên nâng cấp lên Nền tảng Ultralytics và sử dụng YOLO26. YOLO26 kế thừa các cải tiến không cần NMS của YOLOv10, áp dụng những kỹ thuật huấn luyện tiên tiến nhất như optimizer MuSGD, đồng thời được đóng gói trong một framework mã nguồn mở mạnh mẽ, được cộng đồng toàn cầu đông đảo hỗ trợ.

Người đóng góp

Bình luận