Ultralytics YOLO27:
Get Started

YOLOv6-3.0 và DAMO-YOLO#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của khả năng phát hiện vật thể thời gian thực. Hai đối thủ đáng chú ý trong lĩnh vực này là YOLOv6-3.0 và DAMO-YOLO. Cả hai model đều giới thiệu những đổi mới kiến trúc độc đáo nhằm tối đa hóa hiệu năng trên phần cứng công nghiệp. Hướng dẫn này cung cấp phần so sánh kỹ thuật toàn diện giữa hai model, phân tích kiến trúc, phương pháp huấn luyện và trường hợp sử dụng lý tưởng, đồng thời giới thiệu những lợi thế thế hệ mới của các model Ultralytics như YOLO26.

Tổng quan về model#

YOLOv6-3.0: Thông lượng cấp công nghiệp#

Được phát triển bởi Bộ phận Vision AI của Meituan, YOLOv6-3.0 được thiết kế chuyên biệt cho các ứng dụng công nghiệp thông lượng cao. Model tập trung tối đa hóa hiệu năng trên các bộ tăng tốc phần cứng như GPU NVIDIA.

YOLOv6-3.0 giới thiệu module Phép nối hai chiều (BiC) để cải thiện hợp nhất đặc trưng và sử dụng chiến lược Huấn luyện có hỗ trợ anchor (AAT). Chiến lược này kết hợp lợi ích của detector dựa trên anchor và detector không anchor trong quá trình huấn luyện, đồng thời giữ cho suy luận hoàn toàn không anchor. Backbone EfficientRep giúp model rất thân thiện với phần cứng khi xử lý batch trên GPU, lý tưởng để xử lý lượng lớn dữ liệu hiểu video.

Tìm hiểu thêm về YOLOv6

DAMO-YOLO: Nhanh và chính xác nhờ NAS#

Được tạo ra bởi Alibaba Group, DAMO-YOLO tận dụng Tìm kiếm kiến trúc mạng (NAS) để tự động khám phá các cấu trúc backbone hiệu quả nhất cho suy luận thời gian thực.

  • Tác giả: Xianzhe Xu, Yiqi Jiang, Weihua Chen và cộng sự.
  • Tổ chức: Alibaba Group
  • Ngày: 2022-11-23
  • Arxiv: 2211.15444v2
  • GitHub: tinyvision/DAMO-YOLO

DAMO-YOLO nổi bật với RepGFPN (Mạng tháp đặc trưng tổng quát được tái tham số hóa) để hợp nhất đặc trưng đa tỷ lệ hiệu quả và thiết kế ZeroHead giúp giảm đáng kể chi phí tính toán trong head phát hiện. Model cũng tích hợp cơ chế gán nhãn AlignedOTA và các kỹ thuật chưng cất tri thức mạnh mẽ để tăng độ chính xác mà không làm tăng số lượng tham số.

Tìm hiểu thêm về DAMO-YOLO

Chi phí chưng cất

Mặc dù DAMO-YOLO đạt độ chính xác xuất sắc, việc phụ thuộc nhiều vào chưng cất tri thức trong quá trình huấn luyện đòi hỏi một model "teacher" lớn hơn nhiều. Điều này làm tăng đáng kể bộ nhớ CUDA cần thiết trong giai đoạn huấn luyện so với các kiến trúc đơn giản hơn.

So sánh hiệu năng#

Khi đánh giá các model phát hiện đối tượng, việc cân bằng giữa độ chính xác trung bình (mAP) và tốc độ inference là yếu tố then chốt. Dưới đây là so sánh chi tiết YOLOv6-3.0 và DAMO-YOLO ở các quy mô model khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

YOLOv6-3.0 thể hiện tốc độ vượt trội trên GPU NVIDIA khi tận dụng các tối ưu hóa TensorRT, đặc biệt ở các biến thể nano và small. Tuy nhiên, các backbone được tối ưu bằng NAS của DAMO-YOLO thường cần ít FLOPs hơn ở quy mô medium và large, nhờ đó giảm nhẹ độ trễ trong các triển khai lớn hơn.

Lợi thế Ultralytics: Giới thiệu YOLO26#

Mặc dù YOLOv6-3.0 và DAMO-YOLO là những công cụ mạnh mẽ, developer thường gặp khó khăn với pipeline triển khai phức tạp, yêu cầu bộ nhớ cao trong quá trình huấn luyện và kiến trúc cứng nhắc, chỉ phục vụ một tác vụ. Hệ sinh thái Ultralytics mang đến trải nghiệm developer đơn giản và tinh gọn hơn đáng kể.

Với sự ra mắt của YOLO26, Ultralytics đã định nghĩa lại chuẩn mực tiên tiến nhất trong AI thị giác. Được phát hành vào tháng 1 năm 2026, Ultralytics YOLO26 mở rộng giới hạn về hiệu quả và tính linh hoạt.

Các cải tiến chính trong YOLO26#

  • Thiết kế end-to-end không cần NMS: Dựa trên các khái niệm được tiên phong trong YOLOv10, head one-to-one tùy chọn của YOLO26 (nms=False) loại bỏ bước hậu xử lý triệt tiêu cực đại không tối đa (NMS). Điều này giúp giảm đáng kể độ biến thiên độ trễ và đơn giản hóa việc triển khai trên thiết bị edge thông qua CoreML hoặc LiteRT.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 đơn giản hóa quy trình export và cải thiện đáng kể khả năng tương thích với vi điều khiển công suất thấp cũng như phần cứng edge.
  • Inference CPU nhanh hơn tới 43%: Với các ứng dụng không có phần cứng GPU chuyên dụng, các tối ưu hóa CPU của YOLO26 mang lại tốc độ vượt trội, nhanh hơn các model phụ thuộc nhiều vào GPU như YOLOv6.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM như Kimi K2 của Moonshot AI, YOLO26 sử dụng optimizer MuSGD (kết hợp SGD và Muon) để đảm bảo quá trình huấn luyện ổn định và hội tụ nhanh.
  • ProgLoss + STAL: Các hàm loss tiên tiến cải thiện đáng kể khả năng nhận diện vật thể nhỏ, khiến YOLO26 phù hợp cho hoạt động drone và theo dõi mục tiêu ở khoảng cách xa.
  • Tính linh hoạt đa tác vụ: Khác với DAMO-YOLO vốn chỉ là model phát hiện đối tượng, YOLO26 hỗ trợ sẵn phân đoạn instance, ước lượng tư thế (thông qua ước lượng log-likelihood dư) và bounding box định hướng (OBB) trong một API thống nhất.
Huấn luyện tiết kiệm bộ nhớ

Khác với các kiến trúc Transformer phức tạp như RT-DETR hoặc pipeline chưng cất nặng nề của DAMO-YOLO, model Ultralytics nổi tiếng nhờ mức sử dụng VRAM thấp. Bạn có thể dễ dàng huấn luyện model YOLO26 trên phần cứng phổ thông.

Quy trình Python tinh gọn#

Việc huấn luyện và triển khai model tiên tiến nhất không nên đòi hỏi hàng trăm dòng code rườm rà. Gói Python của Ultralytics đơn giản hóa toàn bộ vòng đời machine learning.

from ultralytics import YOLO

# Tải model YOLO26 small tiên tiến nhất
model = YOLO("yolo26s.pt")

# Huấn luyện model dễ dàng với khả năng xử lý dữ liệu tích hợp sẵn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy inference siêu nhanh và hiển thị kết quả
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export liền mạch sang ONNX hoặc TensorRT
model.export(format="onnx")

Các trường hợp sử dụng phù hợp nhất#

Việc chọn kiến trúc phù hợp hoàn toàn phụ thuộc vào các ràng buộc triển khai của bạn:

Khi nào nên sử dụng YOLOv6-3.0#

  • Phân tích video với batch lớn: Phù hợp để xử lý luồng video dày đặc trên máy chủ GPU doanh nghiệp, nơi có thể tận dụng tối đa TensorRT.
  • Tự động hóa công nghiệp: Phát hiện lỗi trên các dây chuyền sản xuất tốc độ cao để kiểm soát chất lượng.

Khi nào nên dùng DAMO-YOLO#

  • Silicon tùy chỉnh: Nghiên cứu ánh xạ Tìm kiếm kiến trúc mạng nơ-ron cho phần cứng NPU độc quyền, chuyên biệt.
  • Nghiên cứu học thuật: Đánh giá các kỹ thuật chưng cất tri thức mới cho mạng thời gian thực.

Khi nào nên dùng Ultralytics YOLO26#

  • Triển khai trên edge và thiết bị di động: Thiết kế không cần NMS, loại bỏ DFL và tăng tốc CPU 43% khiến model trở thành lựa chọn hàng đầu cho tích hợp với iOS, Android và Raspberry Pi.
  • Từ tạo mẫu nhanh đến production: Tích hợp liền mạch với Ultralytics Platform giúp các nhóm chuyển từ gắn nhãn dataset đến triển khai cloud toàn cầu chỉ trong vài ngày thay vì vài tháng.
  • Pipeline thị giác phức tạp: Khi dự án cần đồng thời phát hiện bounding box, keypoint tư thế người và mask phân đoạn chính xác.

Kết luận#

YOLOv6-3.0 và DAMO-YOLO đều đóng góp đáng kể cho lĩnh vực phát hiện đối tượng thời gian thực. YOLOv6 cải tiến việc tận dụng tối đa GPU, còn DAMO-YOLO cho thấy sức mạnh của tìm kiếm kiến trúc tự động.

Tuy nhiên, với developer tìm kiếm sự kết hợp tối ưu giữa độ chính xác, tốc độ inference và khả năng bảo trì hệ sinh thái, dòng Ultralytics YOLO vẫn là lựa chọn hàng đầu. Nhờ các tối ưu hóa đột phá được giới thiệu trong YOLO26, việc phát triển ứng dụng thị giác máy tính cấp doanh nghiệp trở nên dễ tiếp cận hơn bao giờ hết.

Nếu muốn tìm hiểu thêm, bạn cũng có thể so sánh các model này với những kiến trúc khác trong tài liệu của chúng tôi, chẳng hạn như YOLO11 hoặc các phương pháp dựa trên Transformer như RT-DETR.

Người đóng góp

Bình luận