Ultralytics YOLO27:
Get Started

YOLOv9 và EfficientDet#

Lĩnh vực thị giác máy tính đã chứng kiến sự phát triển nhanh chóng của phát hiện đối tượng theo thời gian thực, khi các nhà nghiên cứu liên tục thúc đẩy giới hạn về độ chính xác và hiệu quả. Khi xây dựng hệ thống thị giác mạnh mẽ, lựa chọn kiến trúc tối ưu là quyết định then chốt. Hai model được thảo luận nhiều trong lĩnh vực này là YOLOv9, phiên bản tiên tiến của dòng YOLO tập trung vào thông tin gradient, và EfficientDet, framework có khả năng mở rộng do Google phát triển.

Hướng dẫn này cung cấp phân tích kỹ thuật chuyên sâu, so sánh hai kiến trúc, xem xét cơ chế hoạt động, chỉ số hiệu năng và tình huống triển khai lý tưởng để giúp bạn đưa ra quyết định sáng suốt cho dự án AI tiếp theo.

Nguồn gốc và thông số kỹ thuật của model#

Hiểu rõ dòng phát triển và triết lý thiết kế của một model sẽ cung cấp bối cảnh hữu ích về các quyết định cấu trúc và ứng dụng thực tiễn của model đó.

YOLOv9: Tối đa hóa luồng thông tin#

Được phát triển để giải quyết "nút thắt thông tin" trong deep learning, YOLOv9 giới thiệu các phương pháp mới nhằm đảm bảo dữ liệu không bị mất khi truyền qua các mạng neural sâu.

  • Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
  • Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
  • Ngày: 21 tháng 2, 2024
  • Liên kết: Ấn phẩm arXiv, GitHub chính thức

YOLOv9 giới thiệu Programmable Gradient Information (PGI), một framework giám sát phụ trợ đảm bảo thông tin gradient được bảo toàn đáng tin cậy qua các lớp sâu. Framework này kết hợp với Generalized Efficient Layer Aggregation Network (GELAN), tối ưu hiệu quả tham số bằng cách kết hợp thế mạnh của CSPNet và ELAN. Nhờ đó, YOLOv9 đạt độ chính xác cao nhưng vẫn có footprint gọn nhẹ, phù hợp cho xử lý thời gian thực trên thiết bị biên.

Tìm hiểu thêm về YOLOv9

EfficientDet: Mở rộng hợp thành và BiFPN#

Do Google Brain giới thiệu, EfficientDet tiếp cận bài toán phát hiện đối tượng bằng cách mở rộng có hệ thống các chiều của mạng để cân bằng tốc độ và độ chính xác.

EfficientDet sử dụng backbone EfficientNet kết hợp với Mạng kim tự tháp đặc trưng hai chiều (BiFPN). BiFPN cho phép hợp nhất đặc trưng đa tỷ lệ nhanh chóng và dễ dàng. Kiến trúc này sử dụng phương pháp mở rộng hợp thành, đồng thời mở rộng đồng đều độ phân giải, độ sâu và chiều rộng của backbone, mạng đặc trưng cũng như các mạng dự đoán box/class.

Tìm hiểu thêm về EfficientDet

Lựa chọn framework phù hợp

Dù kiến trúc lý thuyết rất quan trọng, hệ sinh thái phần mềm thường quyết định thành công của dự án. Ultralytics cung cấp trải nghiệm người dùng tối ưu và các công cụ triển khai mạnh mẽ, giúp rút ngắn đáng kể thời gian đưa sản phẩm ra thị trường so với các codebase phức tạp, thiên về nghiên cứu.

So sánh hiệu năng và chỉ số#

Khi phân tích hiệu năng model, cần cân bằng độ chính xác với độ trễ inference và chi phí tính toán. Bảng dưới đây minh họa sự đánh đổi giữa các kích thước YOLOv9 và EfficientDet khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Phân tích chuyên sâu các chỉ số#

  1. Ngưỡng độ chính xác: YOLOv9e đạt độ chính xác tổng thể cao nhất ở mức 55.6% mAP (độ chính xác trung bình), vượt qua model EfficientDet-d7 lớn nhất (53.7%) trong khi vẫn duy trì tốc độ TensorRT nhanh hơn.
  2. Tốc độ thời gian thực: YOLOv9t chỉ cần 2.3ms trên GPU T4 khi dùng TensorRT, thể hiện hiệu quả của kiến trúc GELAN với luồng video tốc độ cao. EfficientDet-d0 hoạt động nhanh nhưng phải hy sinh đáng kể mAP để đạt tốc độ đó.
  3. Độ phức tạp tính toán: Số lượng tham số và FLOPs của EfficientDet tăng mạnh khi hệ số hợp thành tăng. Biến thể d7 có độ trễ 128ms, chậm hơn khoảng 7.6 lần so với YOLOv9e chính xác hơn (16.77ms), làm hạn chế đáng kể khả năng sử dụng trong môi trường inference thời gian thực.

Hiệu quả huấn luyện và hệ sinh thái#

Việc lựa chọn model cần tính đến hệ sinh thái dành cho nhà phát triển. Hệ sinh thái Ultralytics mang lại lợi thế vượt trội về hiệu quả huấn luyện, tính linh hoạt khi triển khai và khả năng ứng dụng đa dạng.

Lợi thế của Ultralytics#

Các model được hỗ trợ trong framework Ultralytics, bao gồm YOLOv9, YOLOv8 và YOLO11, cần ít bộ nhớ hơn đáng kể trong quá trình huấn luyện so với các kiến trúc dựa trên Transformer hoặc kiến trúc TensorFlow cũ như EfficientDet. Backend PyTorch mạnh mẽ đảm bảo khả năng hội tụ nhanh và ổn định.

Ví dụ triển khai#

Huấn luyện một model thị giác máy tính tiên tiến không nên đòi hỏi hàng trăm dòng mã boilerplate. Sau đây là cách khởi chạy huấn luyện dễ dàng bằng package Python của Ultralytics:

from ultralytics import YOLO

# Tải model Ultralytics chính thức (ví dụ: YOLO11 hoặc YOLO26)
model = YOLO("yolo11n.pt")

# Huấn luyện model trực tiếp trên bộ dữ liệu tùy chỉnh
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export model đã huấn luyện sang định dạng ONNX để triển khai
model.export(format="onnx")

Trường hợp sử dụng lý tưởng và ứng dụng thực tế#

Các mô hình cấu trúc khác nhau khiến những model này phù hợp với các tình huống riêng biệt.

Khi nào nên dùng EfficientDet: EfficientDet vẫn là lựa chọn khả thi trong các hệ thống cũ phụ thuộc sâu vào hệ sinh thái TensorFlow, nơi không thể chuyển sang PyTorch. Model này cũng có ý nghĩa lịch sử trong nghiên cứu phân tích ảnh y tế, nơi có thể chấp nhận xử lý ngoại tuyến chậm hơn đối với ảnh quét độ phân giải cao.

Khi nào nên dùng YOLOv9: YOLOv9 phát huy thế mạnh trong môi trường cần trích xuất độ chính xác tối đa từ các lớp sâu mà không làm tăng quá mức số lượng tham số. Các ứng dụng như quản lý giao thông đô thị thông minh phức tạp và giám sát đám đông mật độ cao hưởng lợi rõ rệt từ khả năng bảo toàn tính toàn vẹn của đặc trưng nhờ PGI.

Đón đầu tương lai: Thế hệ AI thị giác tiếp theo#

Dù YOLOv9 và EfficientDet rất mạnh mẽ, các nhà phát triển tìm kiếm sự cân bằng tối ưu giữa tốc độ điện toán biên, độ ổn định huấn luyện và sự đơn giản khi triển khai nên hướng đến những đổi mới mới nhất.

Ra mắt vào tháng 1 năm 2026, Ultralytics YOLO26 đại diện cho công nghệ tiên tiến nhất hiện nay. Model này cải tiến các thế hệ trước (bao gồm YOLO11 và YOLOv8) với một số đột phá quan trọng:

  • Thiết kế end-to-end không cần NMS: YOLO26 cung cấp head one-to-one tùy chọn (nms=False), bỏ qua hoàn toàn Non-Maximum Suppression—khái niệm được tiên phong trong YOLOv10—giúp triển khai model nhanh và đơn giản hơn đáng kể.
  • Loại bỏ DFL: Distribution Focal Loss được loại bỏ để đơn giản hóa quá trình export và tăng khả năng tương thích với thiết bị biên, công suất thấp.
  • CPU inference nhanh hơn tới 43%: Được tối ưu hoàn hảo cho thiết bị IoT và môi trường không có GPU chuyên dụng.
  • Optimizer MuSGD: Phương pháp kết hợp mang tính cách mạng giữa SGD và Muon, lấy cảm hứng từ các đổi mới trong huấn luyện LLM, giúp hội tụ nhanh hơn và đảm bảo quá trình huấn luyện cực kỳ ổn định.
  • ProgLoss + STAL: Các hàm loss tiên tiến giúp cải thiện đáng kể khả năng phát hiện đối tượng nhỏ, yếu tố then chốt đối với ảnh chụp từ drone trên không và robot hoạt động ổn định.

Bằng cách tận dụng Ultralytics Platform toàn diện, các nhóm có thể dễ dàng quản lý bộ dữ liệu, theo dõi experiment và triển khai các model như YOLO26 trên nhiều hệ sinh thái phần cứng, đảm bảo pipeline thị giác máy tính luôn tiên tiến và sẵn sàng cho môi trường production.

Người đóng góp

Bình luận