YOLO Vision 2026:

So sánh YOLOv7 và DAMO-YOLO#

Bối cảnh phát hiện đối tượng thời gian thực liên tục phát triển, với các nhà nghiên cứu và kỹ sư luôn cố gắng tìm kiếm sự cân bằng tối ưu giữa tốc độ và độ chính xác. Trong bài so sánh kỹ thuật này, chúng ta sẽ đi sâu vào hai kiến trúc đáng chú ý từ năm 2022: YOLOv7DAMO-YOLO. Cả hai mô hình đều giới thiệu những khái niệm mới cho cộng đồng thị giác máy tính, giải quyết các thách thức khác nhau trong việc huấn luyện mô hình, thiết kế kiến trúc và triển khai.

Bối cảnh mô hình và thông tin kỹ thuật#

Trước khi đi sâu vào kiến trúc của chúng, điều cần thiết là phải hiểu nguồn gốc của hai mô hình này. Cả hai đều được phát triển bởi các nhóm nghiên cứu hàng đầu và giới thiệu các phương pháp luận tiên tiến để thúc đẩy giới hạn của việc phát hiện đối tượng thời gian thực.

Chi tiết về YOLOv7#

Được phát triển như một sự kế thừa của dòng YOLO, YOLOv7 đã giới thiệu khái niệm "túi khôn" (bag-of-freebies) có thể huấn luyện để tăng cường đáng kể độ chính xác mà không làm tăng chi phí suy luận.

Tìm hiểu thêm về YOLOv7

Chi tiết về DAMO-YOLO#

Được tạo ra bởi các nhà nghiên cứu tại Alibaba Group, DAMO-YOLO tập trung mạnh vào Neural Architecture Search (NAS) và chưng cất tri thức nâng cao để xây dựng các mô hình hiệu quả cao cho phần cứng đa dạng.

Tìm hiểu thêm về DAMO-YOLO

Cải tiến kiến trúc#

YOLOv7: Phân tích đường truyền Gradient và Tái tham số hóa#

YOLOv7 tập trung mạnh mẽ vào Extended Efficient Layer Aggregation Networks (E-ELAN). Các tác giả đã thiết kế E-ELAN bằng cách phân tích các đường dẫn gradient của mạng, đảm bảo rằng mạng có thể liên tục học tập mà không làm suy giảm đường dẫn gradient ban đầu. Hơn nữa, YOLOv7 tận dụng hiệu quả việc tái tham số hóa model trong quá trình suy luận, kết hợp liền mạch các lớp để giảm FLOPs và tăng tốc độ thực thi. Điều này làm cho nó có khả năng cao cho real-time inference trên các GPU hiện đại.

DAMO-YOLO: Neural Architecture Search và RepGFPN#

DAMO-YOLO khác biệt bằng cách tận dụng mạnh mẽ Neural Architecture Search (NAS) dưới các ràng buộc về độ trễ. Nó sử dụng một framework có tên là MAE-NAS để khám phá các cấu trúc xương sống (backbone) tối ưu được thiết kế riêng cho phần cứng cụ thể, chẳng hạn như thiết bị di động hoặc các bộ tăng tốc biên cụ thể. Đối với phần cổ (neck), nó giới thiệu RepGFPN (Rep-parameterized Generalized Feature Pyramid Network) hiệu quả và sử dụng thiết kế ZeroHead để giảm thiểu gánh nặng tính toán trong các đầu ra dự đoán.

Sự khác biệt về chưng cất

Trong khi YOLOv7 dựa vào các tối ưu hóa kiến trúc nội tại mạnh mẽ, DAMO-YOLO phụ thuộc nhiều vào quy trình chưng cất tri thức đa giai đoạn phức tạp. Nó yêu cầu huấn luyện một mô hình giáo viên lớn để chưng cất tri thức vào một mô hình học sinh nhỏ hơn, điều này có thể tốn kém về mặt tính toán trong giai đoạn huấn luyện.

So sánh Hiệu năng và Chỉ số#

Khi so sánh các model này, điều quan trọng là phải xem xét mAP (Mean Average Precision), tốc độ suy luận và độ phức tạp của model.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Bảng trên cho thấy YOLOv7 mở rộng tốt vào các miền có độ chính xác cao (YOLOv7x), trong khi DAMO-YOLO cung cấp các mô hình nhỏ gọn đã được tối ưu hóa cao cho các môi trường bị hạn chế.

Hiệu quả đào tạo và yêu cầu bộ nhớ#

Một điểm khác biệt lớn giữa hai kiến trúc nằm ở phương pháp huấn luyện của chúng. Việc DAMO-YOLO phụ thuộc vào kỹ thuật chưng cất (distillation) đồng nghĩa với việc huấn luyện một model mới từ đầu hoặc tinh chỉnh trên một custom computer vision dataset thường đòi hỏi dung lượng VRAM và thời gian GPU compute lớn hơn đáng kể.

Ngược lại, các model được tích hợp vào hệ sinh thái Ultralytics, chẳng hạn như YOLOv7 và các phiên bản sau, được tối ưu hóa mạnh mẽ cho memory requirements. Chúng cho phép các nhà phát triển sử dụng kích thước batch lớn hơn trên phần cứng phổ thông mà không gặp phải lỗi hết bộ nhớ, đơn giản hóa quy trình experiment tracking và lặp.

Lợi thế từ Ultralytics#

Mặc dù cả YOLOv7 và DAMO-YOLO đều cung cấp các tính năng hấp dẫn, việc triển khai các model trong Ultralytics ecosystem mang lại trải nghiệm phát triển tuyệt vời.

  • Dễ sử dụng: Gói Python Ultralytics cung cấp một API đơn giản, thống nhất. Bạn có thể nhanh chóng chuyển đổi giữa các kiến trúc model, bắt đầu training loops, hoặc chạy inference chỉ với vài dòng code.
  • Hệ sinh thái được duy trì tốt: Ultralytics cung cấp các bản cập nhật thường xuyên, đảm bảo khả năng tương thích gốc với các bản phát hành PyTorch mới nhất và driver CUDA. Nó cũng đơn giản hóa việc xuất model sang các định dạng như ONNX, TensorRT, và OpenVINO.
  • Tính linh hoạt: Không giống như DAMO-YOLO, vốn chỉ là một bộ phát hiện đối tượng, hệ sinh thái Ultralytics hỗ trợ nhiều tác vụ khác nhau một cách nguyên bản. Các model từ gia đình Ultralytics có thể thực hiện phát hiện bounding box tiêu chuẩn, pose estimation, instance segmentation, và Oriented Bounding Boxes (OBB).

Ví dụ về Code: Bắt đầu nhanh chóng#

Dưới đây là cách bạn có thể dễ dàng tải, huấn luyện và chạy suy luận bằng các mô hình Ultralytics:

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model (or newer models like yolo26n.pt)
model = YOLO("yolov7.pt")

# Train the model on the COCO8 dataset with automated hyperparameter handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX format for deployment
model.export(format="onnx")
Xuất mô hình

Với Ultralytics, việc xuất các trọng số đã huấn luyện của bạn sang nhiều định dạng tăng tốc phần cứng (như TensorRT hoặc CoreML) được xử lý thông qua một tham số duy nhất trong lệnh xuất, tiết kiệm hàng giờ cấu hình script phức tạp.

Thế hệ tiếp theo: YOLO26#

Mặc dù YOLOv7 vẫn là một kiến trúc cũ mạnh mẽ, lĩnh vực này đã tiến bộ nhanh chóng. Đối với các triển khai mới, Ultralytics YOLO26 (phát hành tháng 1 năm 2026) là tiêu chuẩn được khuyến nghị, vượt trội hơn các thế hệ trước ở hầu hết mọi chỉ số.

  • Thiết kế End-to-End NMS-Free: Được tiên phong lần đầu trong YOLOv10, YOLO26 loại bỏ hoàn toàn quá trình xử lý hậu kỳ Non-Maximum Suppression (NMS). Điều này đảm bảo quá trình suy luận có độ trễ cực thấp, mang tính xác định, rất quan trọng cho công nghệ robot và xe tự lái.
  • Trình tối ưu hóa MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến (như Kimi K2 của Moonshot AI), trình tối ưu hóa lai này kết hợp SGD và Muon để mang lại quá trình huấn luyện ổn định cao và hội tụ nhanh hơn trên các tập dữ liệu.
  • Suy luận CPU nhanh hơn tới 43%: Bằng cách loại bỏ chiến lược Distribution Focal Loss (DFL), YOLO26 tăng cường đáng kể hiệu suất trên các nền tảng điện toán biên và CPU.
  • ProgLoss + STAL: Các hàm mất mát tiên tiến này mang lại những cải tiến đáng kể trong việc phát hiện các đối tượng nhỏ, làm cho YOLO26 cực kỳ phù hợp cho aerial imagery và giám sát chi tiết.

Tìm hiểu thêm về YOLO26

Các trường hợp sử dụng lý tưởng#

Khi nào nên chọn DAMO-YOLO#

  • Nghiên cứu học thuật về NAS: Nếu tổ chức của bạn đang đầu tư mạnh vào việc nghiên cứu các phương pháp luận Neural Architecture Search.
  • Độ trễ bị ràng buộc cực độ trên phần cứng cụ thể: Nếu bạn có nguồn lực để chạy các tìm kiếm NAS toàn diện nhằm tìm ra cấu trúc xương sống được thiết kế riêng cho chip tăng tốc AI tùy chỉnh.

Khi nào nên chọn YOLOv7#

  • Pipeline GPU hiện có: Dành cho các đội ngũ duy trì các pipeline sản xuất cũ đã được tối ưu hóa sâu sắc xung quanh kiến trúc E-ELAN cụ thể của YOLOv7 trên phần cứng NVIDIA cao cấp.

Tại sao nên chuyển sang các mô hình Ultralytics hiện đại (YOLO11 / YOLO26)#

Đối với đại đa số các ứng dụng doanh nghiệp—từ retail analyticssmart manufacturing đến y tế—các model Ultralytics hiện đại là không có đối thủ. Sự tích hợp với Ultralytics Platform cung cấp một pipeline ML hoàn chỉnh, mang lại sự dễ sử dụng, tài liệu vượt trội, sự hỗ trợ cộng đồng mạnh mẽ và tính linh hoạt đa tác vụ. Cho dù theo dõi hàng tồn kho trên Raspberry Pi hay chạy phân tích nặng trên đám mây, các model như YOLO26 mang lại sự cân bằng hiệu suất lý tưởng cho tương lai của computer vision.

Những người đóng góp

Bình luận