Ultralytics YOLO27:
Get Started

YOLOv9 và DAMO-YOLO#

Sự phát triển nhanh chóng của thị giác máy tính đã tạo ra nhiều kiến trúc mạnh mẽ, phù hợp với các ràng buộc triển khai và yêu cầu độ chính xác khác nhau. Hai model đáng chú ý trong lĩnh vực này là YOLOv9, nổi bật với khả năng xử lý hiệu quả các nút thắt thông tin, và DAMO-YOLO, tập trung mạnh vào Tìm kiếm kiến trúc neural (NAS) và các kim tự tháp đặc trưng hiệu quả.

Hướng dẫn này so sánh chuyên sâu về kỹ thuật giữa YOLOv9 và DAMO-YOLO, làm rõ khác biệt kiến trúc, phương pháp huấn luyện và các kịch bản triển khai lý tưởng. Chúng ta cũng sẽ tìm hiểu cách hệ sinh thái Ultralytics tạo ra lộ trình liền mạch từ phát triển đến production, cũng như lý do các model hiện đại như YOLO26 đã trở thành tiêu chuẩn được khuyến nghị cho dự án mới.

Phân tích chuyên sâu về kiến trúc#

Tìm hiểu các cơ chế cốt lõi của từng model giúp lý giải sự khác biệt về hiệu năng trên nhiều chỉ số.

YOLOv9: Thông tin gradient có thể lập trình#

YOLOv9 được thiết kế để trực tiếp giải quyết tình trạng mất thông tin xảy ra khi dữ liệu truyền qua các mạng neural sâu.

  • Tác giả: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
  • Ngày: 21 tháng 2, 2024
  • Liên kết: Arxiv, GitHub, Tài liệu

Tìm hiểu thêm về YOLOv9

YOLOv9 giới thiệu Thông tin Gradient có thể lập trình (PGI) và Mạng tổng hợp lớp hiệu quả tổng quát (GELAN). PGI đảm bảo thông tin không gian và ngữ nghĩa quan trọng được giữ lại trong quá trình truyền xuôi, ngăn suy giảm gradient dùng để cập nhật trọng số. GELAN bổ trợ bằng cách tối đa hóa hiệu quả tham số, cho phép model đạt độ chính xác trung bình (mAP) tiên tiến nhất với ít FLOPs hơn nhiều CNN thông thường.

DAMO-YOLO: Hiệu quả dựa trên NAS#

Được phát triển bởi Alibaba Group, DAMO-YOLO áp dụng hướng tiếp cận khác, tận dụng tìm kiếm kiến trúc tự động để tìm ra sự cân bằng tối ưu giữa tốc độ và độ chính xác.

  • Tác giả: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang và Xiuyu Sun
  • Tổ chức: Alibaba Group
  • Ngày: 23 tháng 11 năm 2022
  • Liên kết: Arxiv, GitHub

Tìm hiểu thêm về DAMO-YOLO

DAMO-YOLO sử dụng backbone MAE-NAS (Tìm kiếm kiến trúc neural entropy cực đại) để tự động tạo ra các cấu trúc mạng hiệu quả. Model sử dụng RepGFPN (Mạng kim tự tháp đặc trưng tổng quát được tái tham số hóa) để hợp nhất đặc trưng ổn định và thiết kế "ZeroHead" nhằm giảm thiểu gánh nặng tính toán cho head phát hiện. Ngoài ra, model tích hợp AlignedOTA để gán nhãn và chưng cất tri thức nhằm cải thiện hiệu năng các biến thể nhỏ hơn.

Vai trò của NAS trong thị giác máy tính

Tìm kiếm kiến trúc neural (NAS) tự động hóa quá trình thiết kế mạng neural nhân tạo. Phương pháp này có thể tạo ra các model hiệu quả cao như DAMO-YOLO, nhưng thường đòi hỏi tài nguyên tính toán khổng lồ để tìm kiếm trong không gian kiến trúc, trái ngược với triết lý thiết kế mang tính xác định hơn của các model như YOLOv9.

So sánh hiệu năng và chỉ số#

Khi lựa chọn model phát hiện đối tượng, cần cân bằng giữa độ chính xác, tốc độ và mức tiêu thụ tài nguyên tính toán.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Phân tích#

  • Độ chính xác và số lượng tham số: YOLOv9 thường có tỷ lệ tham số trên độ chính xác vượt trội. Chẳng hạn, YOLOv9c đạt mAP 53.0% với 25.5M tham số, trong khi DAMO-YOLOl đạt mAP 50.8% nhưng cần nhiều tham số hơn đáng kể (42.1M).
  • Tốc độ suy luận: Kiến trúc DAMO-YOLO mang lại tốc độ suy luận TensorRT cạnh tranh trên GPU T4, nhỉnh hơn YOLOv9 một chút ở các kích thước trung bình. Tuy nhiên, hiệu quả FLOPs và số lượng tham số của YOLOv9 giúp tăng đáng kể hiệu quả sử dụng bộ nhớ GPU.
  • Yêu cầu bộ nhớ: Các model YOLO của Ultralytics, bao gồm YOLOv9, thường sử dụng ít bộ nhớ hơn trong cả quá trình huấn luyện lẫn suy luận so với các model phức tạp được tạo bằng NAS hoặc các kiến trúc Transformer nặng, nhờ đó rất phù hợp để triển khai trên phần cứng edge hạn chế.

Lợi thế của hệ sinh thái Ultralytics#

Dù các chỉ số lý thuyết rất quan trọng, việc triển khai thực tế có ảnh hưởng lớn đến thành công của dự án. Đây là điểm mà Ultralytics Platform cùng hệ sinh thái phần mềm toàn diện vượt trội hơn các repository độc lập như DAMO-YOLO.

Tính dễ sử dụng và hiệu quả huấn luyện#

Huấn luyện model YOLOv9 tùy chỉnh chỉ cần rất ít mã boilerplate. Ultralytics Python API trừu tượng hóa các quy trình phức tạp như tăng cường dữ liệu, huấn luyện phân tán và tối ưu hóa phần cứng.

from ultralytics import YOLO

# Tải model YOLOv9 đã được huấn luyện trước
model = YOLO("yolov9c.pt")

# Huấn luyện model trên dataset tùy chỉnh của bạn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Đánh giá hiệu năng model
metrics = model.val()

# Xuất model để triển khai trong môi trường production
model.export(format="onnx")

Ngược lại, việc sử dụng DAMO-YOLO thường đòi hỏi phải xử lý các tệp cấu hình cứng nhắc và chuỗi dependency phức tạp, vốn đặc thù cho pipeline huấn luyện riêng của model, dẫn đến đường cong học tập dốc hơn.

Tính linh hoạt trên nhiều tác vụ#

Điểm nổi bật của các model Ultralytics là tính linh hoạt vốn có. Ngoài khả năng phát hiện bounding box tiêu chuẩn, framework Ultralytics còn hỗ trợ liền mạch các tác vụ như phân đoạn đối tượng, ước tính tư thế, phân loại ảnh và phát hiện bounding box định hướng (OBB). DAMO-YOLO chỉ được tối ưu cho phát hiện đối tượng 2D, nên cần tái thiết kế đáng kể để thích ứng với các mô hình thị giác khác.

Xuất model sang thiết bị biên

Ultralytics đơn giản hóa pipeline triển khai bằng cách cung cấp tính năng xuất model chỉ với một cú nhấp chuột sang các định dạng như TensorRT, OpenVINO và CoreML, đảm bảo hiệu năng tối đa bất kể phần cứng mục tiêu của bạn là gì.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv9 và DAMO-YOLO phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOv9#

YOLOv9 là lựa chọn phù hợp cho:

  • Nghiên cứu về nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
  • Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các lớp mạng sâu khi huấn luyện.
  • Đánh giá hiệu năng phát hiện độ chính xác cao: Các tình huống cần hiệu năng mạnh của YOLOv9 trên benchmark COCO làm mốc tham chiếu để so sánh kiến trúc.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO được khuyến nghị cho:

  • Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các kịch bản có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu ảnh hưởng của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đến hiệu năng phát hiện.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Tương lai: Chuyển sang YOLO26#

Mặc dù YOLOv9 và DAMO-YOLO là những cột mốc quan trọng trong quá khứ, thị giác máy tính hiện đại đã chuyển hướng sang các kiến trúc end-to-end nguyên bản. Với mọi dự án phát triển mới, YOLO26 là tiêu chuẩn được khuyến nghị.

Ra mắt năm 2026, YOLO26 kế thừa những thành công của các phiên bản tiền nhiệm, tạo bước đột phá về cả độ chính xác lẫn sự đơn giản trong triển khai.

Những cải tiến chính của YOLO26#

  • Thiết kế end-to-end không cần NMS: Head one-to-one tùy chọn của YOLO26 (nms=False) loại bỏ hoàn toàn bước hậu xử lý Non-Maximum Suppression (NMS). Nhờ đó, pipeline triển khai được tinh gọn và end-to-end nguyên bản; bước đột phá này lần đầu được tiên phong trong YOLOv10.
  • Loại bỏ DFL: Distribution Focal Loss được loại bỏ để đơn giản hóa quá trình export và tăng khả năng tương thích với thiết bị biên, công suất thấp.
  • CPU inference nhanh hơn tới 43%: Nhờ loại bỏ DFL và tối ưu các phép tích chập cốt lõi, YOLO26 đặc biệt phù hợp với các tình huống điện toán biên không có GPU chuyên dụng.
  • Optimizer MuSGD: Lấy cảm hứng từ các đổi mới trong huấn luyện LLM, YOLO26 sử dụng phương pháp kết hợp SGD và Muon (MuSGD) để đảm bảo quá trình huấn luyện ổn định hơn và hội tụ nhanh hơn đáng kể.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, khiến YOLO26 trở thành lựa chọn lý tưởng cho ảnh hàng không chụp ở độ cao lớn và thiết bị IoT.

Nếu hiện đang tìm hiểu YOLO11 hoặc YOLOv8 cho dự án tiếp theo, nâng cấp lên YOLO26 sẽ giúp bạn sử dụng framework AI thị giác tiên tiến, tối ưu nhất hiện nay.

Tóm tắt#

Việc chọn model phù hợp phụ thuộc vào các giới hạn vận hành cụ thể của bạn:

  • DAMO-YOLO cho thấy một góc nhìn thú vị về tối ưu hóa dựa trên NAS, mang lại tốc độ cạnh tranh trên các cấu hình phần cứng rất cụ thể, nơi kiến trúc RepGFPN phát huy thế mạnh.
  • YOLOv9 là lựa chọn xuất sắc cho các nhà nghiên cứu tập trung bảo toàn chi tiết thị giác ở mức tinh vi, tận dụng kiến trúc PGI để ngăn mất thông tin trong các mạng sâu.
  • Ultralytics YOLO26 là lựa chọn hàng đầu cho các ứng dụng doanh nghiệp và nghiên cứu hiện đại. Tính dễ sử dụng vượt trội, kiến trúc không cần NMS và các tối ưu hóa huấn luyện MuSGD tiên tiến khiến model này trở thành model đáng tin cậy, chính xác và dễ triển khai nhất trong lĩnh vực thị giác máy tính.
Người đóng góp

Bình luận