Ultralytics YOLO27:
Get Started

DAMO-YOLO và YOLOv6-3.0#

Sự phát triển nhanh chóng của thị giác máy tính đã tạo ra các kiến trúc chuyên biệt cao, được thiết kế cho ứng dụng công nghiệp. Trong số đó, hai model nổi bật nhờ tập trung vào hiệu suất thời gian thực và hiệu quả triển khai: DAMO-YOLO và YOLOv6-3.0. Trang này cung cấp phần so sánh kỹ thuật chuyên sâu về kiến trúc, chỉ số hiệu suất và phương pháp huấn luyện của hai model, giúp bạn đưa ra lựa chọn triển khai phù hợp.

DAMO-YOLO: Kết hợp tìm kiếm kiến trúc mạng nơ-ron với phát hiện đối tượng#

Được phát triển bởi các nhà nghiên cứu tại Alibaba Group, DAMO-YOLO mang đến cách tiếp cận mới cho họ YOLO bằng cách tích hợp sâu Tìm kiếm kiến trúc mạng nơ-ron (NAS) vào thiết kế backbone.

Các cải tiến kiến trúc#

DAMO-YOLO sử dụng backbone MAE-NAS được tối ưu bằng NAS, tự động tìm kiếm cấu trúc mạng tối ưu trong các giới hạn độ trễ cụ thể. Nhờ đó, model có thể mở rộng hiệu quả trên nhiều cấu hình phần cứng khác nhau. Để cải thiện việc hợp nhất feature, kiến trúc này sử dụng Efficient RepGFPN (Mạng kim tự tháp feature tổng quát được tái tham số hóa), cải thiện đáng kể khả năng biểu diễn đa tỷ lệ.

Ngoài ra, model còn giới thiệu thiết kế "ZeroHead". Bằng cách loại bỏ các cấu trúc đa nhánh phức tạp trong detection head, thiết kế này giữ lại thông tin không gian hiệu quả hơn đồng thời giảm overhead tính toán. Phương pháp huấn luyện cũng tận dụng AlignedOTA (Gán nhãn bằng vận chuyển tối ưu có căn chỉnh) và chưng cất tri thức mạnh mẽ, cho phép các student model nhỏ hơn học từ những teacher network lớn hơn.

Tìm hiểu thêm về DAMO-YOLO

Độ phức tạp của quá trình chưng cất

Mặc dù chưng cất tri thức giúp DAMO-YOLO đạt độ chính xác cao, phương pháp này đòi hỏi pipeline huấn luyện nhiều giai đoạn. Điều đó làm tăng đáng kể lượng tính toán GPU cần thiết so với việc huấn luyện các model một giai đoạn thông thường.

YOLOv6-3.0: Tối đa hóa thông lượng công nghiệp#

Được tiên phong phát triển bởi Phòng AI Thị giác của Meituan, YOLOv6-3.0 được định vị rõ ràng là model phát hiện đối tượng công nghiệp, thiết kế chuyên biệt để tối đa hóa thông lượng trên phần cứng NVIDIA.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu và Xiangxiang Chu
  • Tổ chức: Meituan
  • Ngày: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Các tính năng và cải tiến chính#

YOLOv6-3.0 được xây dựng trên backbone EfficientRep thân thiện với phần cứng, nhờ đó đạt tốc độ đặc biệt cao khi tận dụng các tối ưu hóa như TensorRT trên GPU hiện đại. Trong phiên bản v3.0, mạng tích hợp module Bi-directional Concatenation (BiC) để cải thiện khả năng định vị đối tượng có kích thước khác nhau.

Một tính năng nổi bật khác là chiến lược Anchor-Aided Training (AAT). AAT kết hợp độ ổn định của các detector dựa trên anchor trong quá trình huấn luyện với tốc độ suy luận của thiết kế anchor-free. Cách tiếp cận kết hợp này giúp hội tụ tốt mà không làm giảm độ trễ triển khai, trở thành lựa chọn mạnh mẽ để xử lý luồng video khổng lồ trong phân tích đô thị thông minh và hệ thống thanh toán tự động.

Tìm hiểu thêm về YOLOv6

So sánh hiệu năng#

Khi đánh giá các model này cho suy luận thời gian thực, việc cân bằng số lượng tham số, FLOPs và độ chính xác là rất quan trọng. Dưới đây là phần đánh giá chi tiết để so sánh hiệu suất của chúng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

DAMO-YOLO nhỉnh hơn một chút ở phân khúc nhỏ (46.0 mAP so với 45.0 mAP), nhưng YOLOv6-3.0 có khả năng mở rộng tốt hơn, vượt trội ở phân khúc trung bình và lớn, đồng thời có số lượng tham số thấp nhất ở cấu hình nano.

Lựa chọn giữa hai model

Nếu môi trường phần cứng của bạn cho phép thực hiện các tìm kiếm tự động tốn nhiều tài nguyên để tùy chỉnh backbone, cách tiếp cận NAS của DAMO-YOLO rất hiệu quả. Tuy nhiên, nếu bạn hoàn toàn dựa vào tăng tốc GPU tiêu chuẩn (như T4 hoặc A100), các cấu trúc EfficientRep của YOLOv6 thường cho FPS cao hơn.

Trường hợp sử dụng và khuyến nghị#

Việc chọn DAMO-YOLO hay YOLOv6 phụ thuộc vào yêu cầu cụ thể của dự án, các hạn chế khi triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO là lựa chọn phù hợp cho:

  • Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các kịch bản có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu ảnh hưởng của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đến hiệu năng phát hiện.

Khi nào nên chọn YOLOv6#

YOLOv6 được khuyến nghị cho:

  • Triển khai tương thích với phần cứng công nghiệp: Các tình huống mà thiết kế nhận biết phần cứng và tái tham số hóa hiệu quả của model mang lại hiệu năng tối ưu trên phần cứng mục tiêu cụ thể.
  • Detection một giai đoạn tốc độ cao: Các ứng dụng ưu tiên tốc độ suy luận GPU thô để xử lý video thời gian thực trong môi trường được kiểm soát.
  • Tích hợp hệ sinh thái Meituan: Các nhóm đang làm việc trong ngăn xếp công nghệ và hạ tầng triển khai của Meituan.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Ưu thế của Ultralytics: Giới thiệu YOLO26#

Mặc dù DAMO-YOLO và YOLOv6-3.0 đều có năng lực cao, cả hai vẫn gặp hạn chế do hệ sinh thái phân mảnh, giới hạn ở một tác vụ và pipeline triển khai phức tạp. Với các nhóm kỹ thuật hiện đại, model Ultralytics mang đến trải nghiệm nhà phát triển tốt hơn đáng kể, nổi bật với YOLO26 đột phá.

Ra mắt vào tháng 1 năm 2026, YOLO26 thiết lập tiêu chuẩn mới cho triển khai trên edge và cloud, tối ưu mạnh yêu cầu bộ nhớ và hiệu quả tính toán.

Vì sao nên chọn YOLO26?#

  1. Thiết kế end-to-end không cần NMS: Kế thừa các ý tưởng từ YOLOv10, YOLO26 hỗ trợ suy luận end-to-end nguyên bản, bỏ qua bước hậu xử lý Non-Maximum Suppression thông qua one-to-one head tùy chọn (nms=False). Điều này giúp đơn giản hóa đáng kể code triển khai và giảm độ biến thiên độ trễ suy luận trên mọi thiết bị edge.
  2. Tối ưu hóa vượt trội: YOLO26 sử dụng MuSGD Optimizer, một phương pháp kết hợp SGD và Muon (lấy cảm hứng từ các mô hình ngôn ngữ lớn), giúp quá trình huấn luyện ổn định hơn và hội tụ nhanh hơn.
  3. Khả năng tương thích phần cứng linh hoạt: Bằng cách triển khai loại bỏ DFL (Distribution Focal Loss), các output head được đơn giản hóa, tăng khả năng tương thích với thiết bị edge. Trên thực tế, YOLO26 giúp suy luận trên CPU nhanh hơn đến 43%, vượt trội hơn hẳn YOLOv6 trong môi trường edge di động hoặc IoT.
  4. Độ chính xác được cải thiện: Nhờ sử dụng ProgLoss + STAL, YOLO26 cải thiện đáng kể khả năng phát hiện đối tượng nhỏ, trở thành lựa chọn tối ưu cho ảnh chụp từ trên không và kiểm tra lỗi.
  5. Tính linh hoạt vượt trội: Khác với các model công nghiệp chỉ xử lý bounding box, họ YOLO26 hỗ trợ nhiều tác vụ, bao gồm Phân loại ảnh, Phân đoạn instance, Ước lượng tư thế và Bounding box định hướng (OBB).

Trải nghiệm hệ sinh thái liền mạch#

Ultralytics Platform chuyển đổi toàn bộ vòng đời machine learning. Việc huấn luyện model không còn là quá trình chưng cất nhiều giai đoạn phức tạp. Với tăng cường dữ liệu tự động, tinh chỉnh siêu tham số thống nhất và xuất chỉ bằng một cú nhấp sang các định dạng như ONNX, OpenVINO và CoreML, bạn có thể đưa dataset vào production chỉ trong vài giờ thay vì vài tuần.

Ngoài ra, các model Ultralytics nổi tiếng nhờ hiệu quả sử dụng bộ nhớ, tránh được các nút thắt VRAM nghiêm trọng thường gặp ở kiến trúc Transformer như RT-DETR.

Ví dụ code khởi động nhanh#

Việc huấn luyện và chạy suy luận với model Ultralytics như YOLO26 rất đơn giản. Script Python sau đây minh họa cách bạn có thể bắt đầu huấn luyện, chạy suy luận và xuất model ngay chỉ với vài dòng code:

from ultralytics import YOLO

# Tải model nano YOLO26 có hiệu quả cao
model = YOLO("yolo26n.pt")

# Huấn luyện model trên bộ dữ liệu tùy chỉnh một cách dễ dàng
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy suy luận trên ảnh mẫu
prediction = model("https://ultralytics.com/images/bus.jpg")

# Xuất sang TensorRT để tối đa hóa thông lượng GPU
model.export(format="engine", dynamic=True)

Kết luận#

DAMO-YOLO và YOLOv6-3.0 đều là những thành tựu kỹ thuật ấn tượng, mở rộng giới hạn của bài toán phát hiện đối tượng công nghiệp. Tuy nhiên, đây là những công cụ chuyên biệt cao, thường đòi hỏi thiết lập phức tạp và các giới hạn phần cứng khắt khe.

Với các nhà phát triển và nhà nghiên cứu cần cân bằng hiệu suất tối ưu, khả năng đa tác vụ và một hệ sinh thái được duy trì tích cực, Ultralytics YOLO26 là lựa chọn vượt trội. Bằng cách kết hợp optimizer lấy cảm hứng từ LLM với kiến trúc tinh gọn hỗ trợ suy luận không cần NMS, YOLO26 đơn giản hóa việc triển khai AI đồng thời mang lại độ chính xác tiên tiến nhất trên môi trường edge và cloud.

Nếu đang đánh giá model cho một dự án thị giác máy tính mới, chúng tôi đặc biệt khuyến nghị bạn khám phá khả năng của hệ sinh thái Ultralytics YOLO. Bạn cũng có thể so sánh các model này với những kiến trúc khác như EfficientDet hoặc các cột mốc trước đó như YOLO11 để hiểu rõ hơn quá trình phát triển của AI thị giác thời gian thực.

Người đóng góp

Bình luận