YOLO Vision 2026:

So sánh DAMO-YOLO và YOLOv7#

Sự tiến hóa nhanh chóng của thị giác máy tính đã tạo ra các mô hình phát hiện đối tượng có độ hiệu quả cao, được thiết kế để cân bằng giữa độ chính xác và chi phí tính toán. Hai mô hình đáng chú ý ra mắt vào năm 2022 là DAMO-YOLOYOLOv7. Mặc dù cả hai đều nhằm mục đích đẩy lùi giới hạn của các tác vụ thị giác thời gian thực, chúng đạt được kết quả thông qua các mô hình kiến trúc và phương pháp huấn luyện hoàn toàn khác nhau.

So sánh kỹ thuật toàn diện này khám phá các cách tiếp cận khác nhau của cả hai mô hình, xem xét kiến trúc, tiềm năng triển khai và các chỉ số hiệu suất để giúp các kỹ sư học máy chọn đúng công cụ cho các ứng dụng thị giác máy tính cụ thể của họ.

Nguồn gốc và Metadata của mô hình#

Trước khi đi sâu vào phân tích kỹ thuật chi tiết, việc đặt bối cảnh về nguồn gốc của hai mô hình thị giác máy tính này là điều cần thiết.

DAMO-YOLO#

Được phát triển bởi các nhà nghiên cứu tại Alibaba Group, DAMO-YOLO được giới thiệu nhằm tối ưu hóa cả tốc độ và độ chính xác thông qua tìm kiếm kiến trúc tự động và chưng cất mô hình.

Tìm hiểu thêm về DAMO-YOLO

YOLOv7#

Được phát hành dưới dạng trạng thái của nghệ thuật (state-of-the-art) vào giữa năm 2022, YOLOv7 đẩy suy luận thời gian thực tiến xa hơn bằng cách giới thiệu các "bag-of-freebies" có thể huấn luyện mà không làm tăng chi phí triển khai.

Tìm hiểu thêm về YOLOv7

Hệ sinh thái được hỗ trợ

YOLOv7 được hỗ trợ chính thức trong hệ sinh thái Ultralytics, cho phép huấn luyện, xác thực và xuất mô hình liền mạch với một API thống nhất.

Cải tiến kiến trúc#

DAMO-YOLO: NAS và chưng cất mô hình#

DAMO-YOLO tích hợp một số kỹ thuật tiên tiến hướng tới hiệu quả tối đa:

  • NAS Backbones: Sử dụng Neural Architecture Search (NAS) để tự động thiết kế các backbone tối ưu (MAE-NAS) được tùy chỉnh cho các môi trường yêu cầu độ trễ thấp.
  • Efficient RepGFPN: Một Generalized Feature Pyramid Network đã sửa đổi giúp tăng đáng kể hiệu quả hợp nhất đặc trưng trên nhiều thang đo.
  • ZeroHead & AlignedOTA: Tích hợp đầu dò (detection head) nhẹ và chiến lược gán nhãn được tối ưu hóa (AlignedOTA) để giảm chi phí tính toán.
  • Distillation Enhancement: Tận dụng mạnh mẽ chưng cất kiến thức (knowledge distillation) trong quá trình huấn luyện để tăng cường hiệu suất của các biến thể mô hình nhỏ hơn mà không làm tăng số lượng tham số.

YOLOv7: E-ELAN và Bag-of-Freebies#

YOLOv7 thực hiện cách tiếp cận kỹ thuật cấu trúc hơn, tập trung vào tối ưu hóa đường dẫn gradient và các chiến lược huấn luyện mạnh mẽ.

  • Kiến trúc E-ELAN: Extended Efficient Layer Aggregation Network cho phép mô hình học các đặc trưng đa dạng hơn bằng cách kiểm soát các đường dẫn gradient ngắn nhất và dài nhất, đảm bảo sự hội tụ học tập hiệu quả.
  • Model Scaling: Giới thiệu phương pháp mở rộng quy mô hỗn hợp (compound scaling) được tùy chỉnh cho các mô hình dựa trên ghép nối (concatenation), mở rộng độ sâu và chiều rộng đồng thời để căn chỉnh cấu trúc.
  • Trainable Bag-of-Freebies: Sử dụng các kỹ thuật như các phép chập tái tham số hóa (RepConv) không có kết nối danh tính, và các chiến lược gán nhãn động, giúp nâng cao độ chính xác trong quá trình huấn luyện mà không ảnh hưởng đến tốc độ suy luận.

Phân tích Hiệu suất#

Khi đánh giá mean Average Precision (mAP), tốc độ và hiệu suất, cả hai mô hình đều thể hiện các chỉ số ấn tượng, dù chúng nhắm đến các phân khúc hơi khác nhau. YOLOv7 tập trung mạnh vào việc triển khai GPU độ chính xác cao, trong khi các cấu trúc dẫn xuất từ NAS của DAMO-YOLO hướng tới triển khai trên CPU và biên với độ trễ thấp mạnh mẽ.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Như đã thấy trong các số liệu, trong khi DAMO-YOLO cung cấp các biến thể cực nhẹ (như mô hình tiny chỉ với 8,5 triệu tham số), YOLOv7 đạt được đỉnh độ chính xác tổng thể cao hơn, với YOLOv7x đạt 53,1 mAP ấn tượng trên tập dữ liệu COCO.

Lợi thế từ hệ sinh thái Ultralytics#

Mặc dù kiến trúc lý thuyết là quan trọng, tính thực tiễn của một mô hình được quyết định bởi hệ sinh thái của nó. Các mô hình được hỗ trợ bởi Ultralytics, như YOLOv7, hưởng lợi từ một hệ sinh thái được bảo trì tốtdễ sử dụng chưa từng có.

  • Cân Bằng Hiệu Suất: Các mô hình Ultralytics luôn đạt được sự đánh đổi tối ưu giữa tốc độ suy luận và độ chính xác phát hiện, khiến chúng trở nên lý tưởng cho cả thiết bị biên và việc triển khai mô hình dựa trên đám mây.
  • Yêu Cầu Bộ Nhớ: Khác với các mô hình dựa trên Transformer nặng nề hơn, các mô hình Ultralytics YOLO duy trì yêu cầu bộ nhớ CUDA thấp trong quá trình huấn luyện. Điều này cho phép kích thước lô (batch size) lớn hơn, giúp quá trình huấn luyện diễn ra suôn sẻ ngay cả trên phần cứng cấp độ phổ thông.
  • Tính Đa Dụng: Khung làm việc Ultralytics mở rộng vượt ra ngoài việc phát hiện đối tượng sang các tác vụ như Phân Đoạn Thể Hiện (Instance Segmentation)Ước Tính Tư Thế (Pose Estimation), cung cấp cho các nhà phát triển một bộ công cụ thị giác máy tính hoàn chỉnh.
Hiệu quả huấn luyện

Gói phần mềm Ultralytics cho phép bạn di chuyển liền mạch từ tập dữ liệu đến một mô hình được huấn luyện đầy đủ chỉ trong vài phút, tận dụng các bộ nạp dữ liệu và trọng số được huấn luyện sẵn tối ưu hóa cao.

Ví dụ mã: Huấn luyện YOLOv7 với Ultralytics#

Việc tích hợp YOLOv7 vào đường ống thị giác máy tính của bạn cực kỳ đơn giản bằng cách sử dụng API Python của Ultralytics.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

Tiêu chuẩn mới: Giới thiệu YOLO26#

Mặc dù YOLOv7 và DAMO-YOLO đại diện cho những bước đột phá quan trọng vào năm 2022, lĩnh vực AI thị giác chuyển động rất nhanh. Đối với các nhóm khởi động dự án mới ngày nay, mô hình được khuyến nghị là Ultralytics YOLO26 tiên tiến, ra mắt vào tháng 1 năm 2026.

YOLO26 mang đến một bước nhảy vọt về hiệu suất và khả năng sử dụng, kết hợp các đổi mới hiện đại nhất:

  • Thiết Kế End-to-End Không NMS: YOLO26 hỗ trợ nguyên bản end-to-end. Bằng cách loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS), nó mang lại logic triển khai nhanh hơn, đơn giản hơn—một sự dịch chuyển mô hình lần đầu tiên được tiên phong bởi YOLOv10.
  • Bộ tối ưu hóa MuSGD: Lấy cảm hứng từ các đổi mới mô hình ngôn ngữ lớn như Kimi K2 của Moonshot AI, YOLO26 sử dụng sự kết hợp giữa SGD và Muon. Bộ tối ưu hóa này đảm bảo động lực huấn luyện cực kỳ ổn định và tốc độ hội tụ nhanh hơn đáng kể.
  • Suy luận CPU nhanh hơn tới 43%: Với việc loại bỏ có mục tiêu Distribution Focal Loss (DFL) và các cải tiến cấu trúc sâu sắc, YOLO26 được tối ưu hóa mạnh mẽ cho điện toán biên công suất thấp, vượt trội so với các thế hệ trước trên phần cứng không có GPU.
  • ProgLoss + STAL: Tích hợp các hàm mất mát (loss function) mới nâng cao, nhắm mục tiêu rõ ràng và cải thiện khả năng nhận dạng vật thể nhỏ, một năng lực thiết yếu cho các ứng dụng trong hình ảnh hàng không, robot và giám sát an ninh.
  • Cải Tiến Theo Tác Vụ: Ngoài tính năng phát hiện tiêu chuẩn, YOLO26 có các cải tiến được điều chỉnh riêng cho các tác vụ đa dạng, bao gồm tạo mẫu đa tỷ lệ cho phân đoạn, RLE cho ước tính tư thế, và các hàm mất mát góc cụ thể cho Hộp Bao Định Hướng (Oriented Bounding Boxes - OBB).

Tìm hiểu thêm về YOLO26

Các trường hợp sử dụng lý tưởng#

Việc chọn đúng kiến trúc hoàn toàn phụ thuộc vào môi trường triển khai mục tiêu và các ràng buộc dự án của bạn.

Khi nào nên chọn DAMO-YOLO:

  • Bạn đang làm việc trong các môi trường biên bị hạn chế tài nguyên nghiêm trọng, nơi số lượng tham số thô phải được giữ ở mức cực thấp (ví dụ: vi điều khiển).
  • Bạn đang sử dụng các đường ống học máy tự động được tích hợp cụ thể với các dịch vụ đám mây độc quyền của Alibaba.

Khi nào nên chọn YOLOv7:

  • Bạn có các đường ống GPU cũ đã được tối ưu hóa cho suy luận dựa trên neo (anchor-based) với độ chính xác cao.
  • Bạn đang vận hành trong các môi trường mà độ chính xác thời gian thực là tối quan trọng, chẳng hạn như xe tự hành tốc độ cao hoặc robot tiên tiến.

Khi nào nên chọn YOLO26 (Khuyến nghị):

  • Bạn đang xây dựng một ứng dụng thị giác máy tính mới hoàn toàn từ đầu và cần sự tân tiến tuyệt đối cả về độ chính xác lẫn tốc độ suy luận trên CPU/thiết bị biên.
  • Bạn yêu cầu triển khai nhanh chóng, liền mạch (chẳng hạn như xuất sang CoreML hoặc TensorRT) mà không phải xử lý các ràng buộc của toán tử NMS.
  • Bạn muốn tận dụng toàn bộ các tính năng của Ultralytics Platform cho việc huấn luyện trên đám mây, quản lý tập dữ liệu và triển khai tự động.

Bằng cách tận dụng hệ sinh thái mạnh mẽ của các mô hình Ultralytics, các nhà phát triển có thể cắt giảm đáng kể thời gian kỹ thuật trong khi vẫn đảm bảo hiệu suất dự đoán hàng đầu cho các ứng dụng thực tế của họ.

Người đóng góp

Bình luận