Ultralytics YOLO27:
Get Started

DAMO-YOLO và YOLOv7#

Sự phát triển nhanh chóng của thị giác máy tính đã tạo ra các model phát hiện đối tượng hiệu quả cao, được thiết kế để cân bằng độ chính xác và chi phí tính toán. Hai model đáng chú ý ra mắt năm 2022 là DAMO-YOLO và YOLOv7. Mặc dù cả hai đều hướng đến việc mở rộng giới hạn của các tác vụ thị giác thời gian thực, chúng đạt được kết quả thông qua những mô hình kiến trúc và phương pháp huấn luyện rất khác nhau.

Bài so sánh kỹ thuật toàn diện này tìm hiểu các cách tiếp cận riêng biệt của hai model, xem xét kiến trúc, tiềm năng triển khai và chỉ số hiệu năng để giúp kỹ sư machine learning chọn công cụ phù hợp cho các ứng dụng thị giác máy tính cụ thể.

Nguồn gốc và siêu dữ liệu của model#

Trước khi đi sâu vào phân tích kỹ thuật, cần tìm hiểu bối cảnh ra đời của hai model thị giác máy tính này.

DAMO-YOLO#

Được các nhà nghiên cứu tại Alibaba Group phát triển, DAMO-YOLO ra mắt với mục tiêu tối ưu tốc độ và độ chính xác thông qua tìm kiếm kiến trúc tự động và chưng cất.

Tìm hiểu thêm về DAMO-YOLO

YOLOv7#

Ra mắt với vị thế tiên tiến nhất vào giữa năm 2022, YOLOv7 tiếp tục nâng cao suy luận thời gian thực bằng cách giới thiệu các kỹ thuật "lợi ích miễn phí" có thể huấn luyện mà không làm tăng chi phí triển khai.

Tìm hiểu thêm về YOLOv7

Hỗ trợ Ultralytics

Ultralytics không phát hành trọng số hoặc tệp YAML của YOLOv7, vì vậy không thể huấn luyện YOLOv7 nguyên bản bằng gói Ultralytics. Có thể xuất các model YOLOv7 được huấn luyện trong kho lưu trữ upstream sang ONNX hoặc TensorRT và chạy suy luận bằng Ultralytics.

Các cải tiến kiến trúc#

DAMO-YOLO: NAS và chưng cất#

DAMO-YOLO tích hợp một số kỹ thuật tiên tiến nhằm tối đa hóa hiệu quả:

  • Backbone NAS: Sử dụng Tìm kiếm kiến trúc mạng (NAS) để tự động thiết kế backbone tối ưu (MAE-NAS), phù hợp với các môi trường yêu cầu độ trễ thấp.
  • RepGFPN hiệu quả: Mạng kim tự tháp đặc trưng tổng quát được điều chỉnh, giúp cải thiện đáng kể hiệu quả hợp nhất đặc trưng ở nhiều tỷ lệ.
  • ZeroHead & AlignedOTA: Tích hợp head phát hiện gọn nhẹ và chiến lược gán nhãn tối ưu hóa (AlignedOTA) để giảm chi phí tính toán.
  • Cải thiện bằng chưng cất: Tận dụng mạnh mẽ phương pháp chưng cất tri thức trong quá trình huấn luyện để tăng hiệu năng của các biến thể model nhỏ hơn mà không làm tăng số lượng tham số.

YOLOv7: E-ELAN và các lợi ích miễn phí#

YOLOv7 áp dụng cách tiếp cận kỹ thuật cấu trúc hơn, tập trung vào tối ưu hóa đường đi gradient và các chiến lược huấn luyện mạnh mẽ.

  • Kiến trúc E-ELAN: Mạng tổng hợp lớp hiệu quả mở rộng cho phép model học được nhiều đặc trưng đa dạng hơn bằng cách kiểm soát đường đi gradient ngắn nhất và dài nhất, đảm bảo quá trình hội tụ học tập hiệu quả.
  • Mở rộng quy mô model: Giới thiệu phương pháp mở rộng quy mô kết hợp dành riêng cho các model dựa trên phép nối, đồng thời điều chỉnh độ sâu và độ rộng để đảm bảo sự tương thích về cấu trúc.
  • Các lợi ích miễn phí có thể huấn luyện: Sử dụng các kỹ thuật như tích chập tái tham số hóa (RepConv) không có kết nối đồng nhất và chiến lược gán nhãn động, giúp tăng độ chính xác trong quá trình huấn luyện mà không ảnh hưởng đến tốc độ suy luận.

Phân tích hiệu năng#

Khi đánh giá độ chính xác trung bình (mAP), tốc độ và hiệu quả, cả hai model đều có các chỉ số ấn tượng, dù nhắm đến những phân khúc hơi khác nhau. YOLOv7 tập trung nhiều vào triển khai GPU có độ chính xác cao, trong khi các cấu trúc bắt nguồn từ NAS của DAMO-YOLO hướng đến triển khai trên CPU và thiết bị biên với độ trễ cực thấp.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Như các chỉ số cho thấy, DAMO-YOLO có những biến thể cực kỳ gọn nhẹ (chẳng hạn model tiny chỉ có 8,5 triệu tham số), còn YOLOv7 đạt mức độ chính xác tổng thể cao hơn, trong đó YOLOv7x đạt 53,1 mAP ấn tượng trên bộ dữ liệu COCO.

Lợi thế của hệ sinh thái Ultralytics#

Mặc dù kiến trúc lý thuyết rất quan trọng, tính thực tiễn của model phụ thuộc vào hệ sinh thái. Các model Ultralytics nguyên bản như YOLO26 được hưởng lợi từ hệ sinh thái được duy trì tốt và khả năng sử dụng dễ dàng vượt trội.

  • Cân bằng hiệu năng: Các model Ultralytics luôn đạt được sự đánh đổi tối ưu giữa tốc độ suy luận và độ chính xác phát hiện, phù hợp cho cả thiết bị biên lẫn triển khai model trên đám mây.
  • Yêu cầu bộ nhớ: Khác với các model dựa trên Transformer nặng hơn, các model Ultralytics YOLO cần ít bộ nhớ CUDA trong quá trình huấn luyện. Nhờ vậy có thể sử dụng kích thước batch lớn hơn, giúp tinh gọn quy trình huấn luyện ngay cả trên phần cứng phổ thông.
  • Tính linh hoạt: Framework Ultralytics hỗ trợ nhiều hơn phát hiện đối tượng, bao gồm các tác vụ như Phân đoạn đối tượng và Ước tính tư thế, cung cấp cho nhà phát triển bộ công cụ thị giác máy tính hoàn chỉnh.
Hiệu quả huấn luyện

Gói Ultralytics giúp bạn chuyển liền mạch từ bộ dữ liệu sang model được huấn luyện hoàn chỉnh chỉ trong vài phút, nhờ các trình nạp dữ liệu được tối ưu cao và trọng số huấn luyện trước.

Ví dụ mã: Chạy YOLOv7 với Ultralytics#

Sau khi chuyển đổi bản xuất YOLOv7 ONNX từ upstream như mô tả trong các ví dụ sử dụng YOLOv7, bạn có thể chạy model bằng API Python của Ultralytics.

from ultralytics import YOLO

# Tải model YOLOv7 ONNX đã chuyển đổi cho Ultralytics
model = YOLO("yolov7-ultralytics.onnx", task="detect")

# Chạy suy luận
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

Tiêu chuẩn mới: Giới thiệu YOLO26#

Mặc dù YOLOv7 và DAMO-YOLO là những đột phá đáng kể trong năm 2022, lĩnh vực AI thị giác phát triển rất nhanh. Với các nhóm bắt đầu dự án mới hiện nay, model được khuyến nghị là Ultralytics YOLO26 tiên tiến, ra mắt vào tháng 1 năm 2026.

YOLO26 tạo ra bước tiến thế hệ mới về hiệu năng và khả năng sử dụng, đồng thời tích hợp các cải tiến tiên tiến nhất:

  • Thiết kế end-to-end không cần NMS: YOLO26 có head end-to-end nguyên bản (nms=False). Loại bỏ bước hậu xử lý loại bỏ phi cực đại (NMS) giúp logic triển khai nhanh hơn và đơn giản hơn—một bước chuyển đổi mô hình được YOLOv10 tiên phong ban đầu.
  • Bộ tối ưu MuSGD: Lấy cảm hứng từ những đổi mới trong mô hình ngôn ngữ lớn như Kimi K2 của Moonshot AI, YOLO26 sử dụng phương pháp kết hợp SGD và Muon. Bộ tối ưu này đảm bảo động lực huấn luyện ổn định và tốc độ hội tụ nhanh hơn đáng kể.
  • Suy luận CPU nhanh hơn tới 43%: Nhờ loại bỏ Distribution Focal Loss (DFL) có chủ đích cùng những cải tiến sâu rộng về cấu trúc, YOLO26 được tối ưu mạnh cho điện toán biên công suất thấp và vượt trội hơn các thế hệ trước trên phần cứng không có GPU.
  • ProgLoss + STAL: Tích hợp các hàm loss mới tiên tiến, tập trung trực tiếp vào việc cải thiện khả năng nhận diện đối tượng nhỏ—năng lực thiết yếu cho các ứng dụng ảnh hàng không, robot và giám sát an ninh.
  • Cải tiến theo tác vụ: Ngoài khả năng phát hiện tiêu chuẩn, YOLO26 còn có các cải tiến chuyên biệt cho nhiều tác vụ, bao gồm tạo mẫu đa tỷ lệ cho phân đoạn, RLE cho ước tính tư thế và các hàm loss góc riêng cho khung giới hạn có định hướng (OBB).

Các trường hợp sử dụng phù hợp nhất#

Việc chọn kiến trúc phù hợp hoàn toàn phụ thuộc vào môi trường triển khai mục tiêu và các giới hạn của dự án.

Khi nào nên chọn DAMO-YOLO:

  • Bạn đang làm việc trong môi trường biên bị giới hạn tài nguyên nghiêm ngặt, nơi cần giữ số lượng tham số cực thấp (ví dụ: vi điều khiển).
  • Bạn đang sử dụng các pipeline machine learning tự động được tích hợp riêng với dịch vụ đám mây độc quyền của Alibaba.

Khi nào nên chọn YOLOv7:

  • Bạn có các pipeline GPU cũ đã được tối ưu cho suy luận dựa trên anchor với độ chính xác cao.
  • Bạn đang vận hành trong những môi trường mà độ chính xác theo thời gian thực là tối quan trọng, chẳng hạn như xe tự hành tốc độ cao hoặc robotics tiên tiến.

Khi nào nên chọn YOLO26 (Được khuyến nghị):

  • Bạn đang xây dựng một ứng dụng thị giác máy tính mới từ đầu và cần công nghệ tiên tiến nhất cả về độ chính xác lẫn tốc độ suy luận trên CPU/edge.
  • Bạn cần triển khai nhanh chóng, liền mạch (chẳng hạn như xuất sang CoreML hoặc TensorRT) mà không phải xử lý các hạn chế của operator NMS.
  • Bạn muốn khai thác toàn bộ khả năng của Ultralytics Platform để huấn luyện trên cloud, quản lý dataset và tự động triển khai.

Bằng cách tận dụng hệ sinh thái mạnh mẽ gồm các model Ultralytics, nhà phát triển có thể rút ngắn đáng kể thời gian kỹ thuật mà vẫn đảm bảo hiệu suất dự đoán hàng đầu cho các ứng dụng thực tế.

Người đóng góp

Bình luận