Ultralytics YOLO27:

YOLOv6-3.0 so với DAMO-YOLO#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của những gì có thể thực hiện trong phát hiện đối tượng theo thời gian thực. Hai mô hình đáng chú ý trong lĩnh vực này là YOLOv6-3.0 và DAMO-YOLO. Cả hai mô hình đều giới thiệu những cải tiến kiến trúc độc đáo nhằm tối đa hóa hiệu năng trên phần cứng công nghiệp. Hướng dẫn này cung cấp một bản so sánh kỹ thuật toàn diện giữa hai mô hình, phân tích kiến trúc, phương pháp huấn luyện và các trường hợp sử dụng lý tưởng, đồng thời giới thiệu những lợi thế thế hệ mới của các mô hình Ultralytics như YOLO26.

Hồ sơ mô hình#

YOLOv6-3.0: Thông lượng cấp công nghiệp#

Được phát triển bởi Bộ phận AI Thị giác tại Meituan, YOLOv6-3.0 được thiết kế chuyên biệt cho các ứng dụng công nghiệp yêu cầu thông lượng cao. Mô hình tập trung mạnh vào việc tối đa hóa hiệu năng trên các bộ tăng tốc phần cứng như GPU NVIDIA.

YOLOv6-3.0 giới thiệu mô-đun Nối hai chiều (BiC) để cải thiện việc hợp nhất đặc trưng và sử dụng chiến lược Huấn luyện hỗ trợ bằng anchor (AAT). Chiến lược này kết hợp ưu điểm của các bộ phát hiện dựa trên anchor và bộ phát hiện không dùng anchor trong quá trình huấn luyện, đồng thời giữ cho quá trình suy luận hoàn toàn không dùng anchor. Backbone EfficientRep giúp mô hình đặc biệt tương thích với phần cứng khi xử lý batch trên GPU, lý tưởng để xử lý khối lượng lớn dữ liệu hiểu video.

Tìm hiểu thêm về YOLOv6

DAMO-YOLO: Nhanh và chính xác nhờ NAS#

Được tạo ra bởi Alibaba Group, DAMO-YOLO tận dụng Tìm kiếm kiến trúc neural (NAS) để tự động tìm ra các cấu trúc backbone hiệu quả nhất cho suy luận theo thời gian thực.

  • Tác giả: Xianzhe Xu, Yiqi Jiang, Weihua Chen và cộng sự.
  • Tổ chức: Alibaba Group
  • Ngày: 2022-11-23
  • Arxiv: 2211.15444v2
  • GitHub: tinyvision/DAMO-YOLO

DAMO-YOLO nổi bật với RepGFPN (Mạng tháp đặc trưng tổng quát hóa được tái tham số hóa) cho việc hợp nhất đặc trưng đa tỉ lệ hiệu quả, cùng thiết kế ZeroHead giúp giảm đáng kể chi phí tính toán trong đầu phát hiện. Mô hình cũng tích hợp phương pháp gán nhãn AlignedOTA và các kỹ thuật chưng cất tri thức mạnh mẽ để tăng độ chính xác mà không làm tăng số lượng tham số của model.

Tìm hiểu thêm về DAMO-YOLO

Chi phí chưng cất

Mặc dù DAMO-YOLO đạt độ chính xác xuất sắc, việc phụ thuộc nhiều vào chưng cất tri thức trong quá trình huấn luyện đòi hỏi một model “giáo viên” lớn hơn nhiều. Điều này làm tăng đáng kể bộ nhớ CUDA cần thiết trong giai đoạn huấn luyện so với các kiến trúc đơn giản hơn.

So sánh hiệu năng#

Khi đánh giá các model phát hiện đối tượng, sự cân bằng giữa độ chính xác trung bình (mAP) và tốc độ suy luận là yếu tố then chốt. Dưới đây là phần so sánh chi tiết YOLOv6-3.0 và DAMO-YOLO trên các quy mô model khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

YOLOv6-3.0 thể hiện tốc độ vượt trội trên GPU NVIDIA khi sử dụng các tối ưu hóa của TensorRT, đặc biệt ở các biến thể nano và small. Tuy nhiên, các backbone được tối ưu bằng NAS của DAMO-YOLO thường yêu cầu ít FLOPs hơn ở quy mô medium và large, mang lại lợi thế nhỏ về độ trễ trong các hệ thống triển khai lớn hơn.

Lợi thế của Ultralytics: Khám phá YOLO26#

Mặc dù YOLOv6-3.0 và DAMO-YOLO là những công cụ mạnh mẽ, các nhà phát triển thường gặp thách thức với quy trình triển khai phức tạp, yêu cầu bộ nhớ cao trong quá trình huấn luyện và các kiến trúc cứng nhắc chỉ phục vụ một tác vụ. Hệ sinh thái Ultralytics cung cấp trải nghiệm dành cho nhà phát triển được tinh gọn hơn đáng kể.

Với sự ra mắt của YOLO26, Ultralytics đã định nghĩa lại AI thị giác tiên tiến nhất. Được phát hành vào tháng 1 năm 2026, Ultralytics YOLO26 tiếp tục mở rộng giới hạn về hiệu quả và tính linh hoạt.

Các đổi mới chính trong YOLO26#

  • Thiết kế đầu-cuối không dùng NMS: Dựa trên các khái niệm tiên phong trong YOLOv10, YOLO26 loại bỏ nguyên bản bước hậu xử lý Loại bỏ các ứng viên không cực đại (NMS). Điều này làm giảm đáng kể độ biến thiên độ trễ và đơn giản hóa việc triển khai trên các thiết bị edge thông qua CoreML hoặc TFLite.
  • Loại bỏ DFL: Bằng cách loại bỏ Hàm mất mát tiêu điểm phân phối, YOLO26 đơn giản hóa quy trình export và cải thiện đáng kể khả năng tương thích với các vi điều khiển công suất thấp cùng phần cứng edge.
  • Suy luận trên CPU nhanh hơn tới 43%: Đối với các ứng dụng không có phần cứng GPU chuyên dụng, những tối ưu hóa CPU của YOLO26 mang lại tốc độ vượt trội, nhanh hơn các model phụ thuộc nhiều vào GPU như YOLOv6.
  • Bộ tối ưu MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM như Kimi K2 của Moonshot AI, YOLO26 sử dụng bộ tối ưu MuSGD (kết hợp giữa SGD và Muon) để bảo đảm quá trình huấn luyện ổn định và hội tụ nhanh.
  • ProgLoss + STAL: Các hàm mất mát nâng cao cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, khiến YOLO26 trở nên lý tưởng cho hoạt động drone và theo dõi mục tiêu ở xa.
  • Tính linh hoạt đa tác vụ: Khác với DAMO-YOLO, vốn chỉ là một bộ phát hiện, YOLO26 cung cấp hỗ trợ sẵn có cho Phân đoạn instance, Ước tính tư thế (thông qua Ước tính log-khả năng hợp lý dư) và Hộp giới hạn định hướng (OBB) trong một API thống nhất duy nhất.
Huấn luyện tiết kiệm bộ nhớ

Khác với các kiến trúc Transformer phức tạp như RT-DETR hoặc các pipeline phụ thuộc nhiều vào chưng cất của DAMO-YOLO, các model Ultralytics nổi tiếng nhờ mức sử dụng VRAM thấp. Bạn có thể dễ dàng huấn luyện model YOLO26 trên phần cứng cấp độ người dùng.

Quy trình Python tinh gọn#

Việc huấn luyện và triển khai các model tiên tiến nhất không nên đòi hỏi hàng trăm dòng mã boilerplate. Package Python Ultralytics đơn giản hóa vòng đời machine learning.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with built-in data handling
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run ultra-fast inference and display results
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export seamlessly to ONNX or TensorRT
model.export(format="onnx")

Các trường hợp sử dụng lý tưởng#

Việc lựa chọn kiến trúc phù hợp hoàn toàn phụ thuộc vào các ràng buộc triển khai của bạn:

Khi nào nên sử dụng YOLOv6-3.0#

  • Phân tích video với batch lớn: Rất phù hợp để xử lý các luồng video dày đặc trên server GPU doanh nghiệp, nơi TensorRT có thể được tận dụng tối đa.
  • Tự động hóa công nghiệp: Các dây chuyền sản xuất tốc độ cao thực hiện phát hiện lỗi trong kiểm soát chất lượng.

Khi nào nên sử dụng DAMO-YOLO#

  • Silicon tùy chỉnh: Nghiên cứu ánh xạ Tìm kiếm kiến trúc neural cho phần cứng NPU độc quyền và chuyên biệt.
  • Nghiên cứu học thuật: Đánh giá các kỹ thuật chưng cất tri thức mới cho các network thời gian thực.

Khi nào nên sử dụng Ultralytics YOLO26#

  • Triển khai trên edge và thiết bị di động: Thiết kế không dùng NMS, loại bỏ DFL và mức tăng tốc CPU 43% khiến model này trở thành lựa chọn hàng đầu cho các tích hợp iOS, Android và Raspberry Pi.
  • Từ tạo nguyên mẫu nhanh đến production: Khả năng tích hợp liền mạch với Ultralytics Platform cho phép các đội ngũ chuyển từ gán nhãn dataset đến triển khai cloud trên toàn cầu trong vài ngày thay vì vài tháng.
  • Pipeline thị giác phức tạp: Khi một dự án yêu cầu đồng thời phát hiện bounding box, keypoint tư thế người và mask phân đoạn chính xác.

Kết luận#

Cả YOLOv6-3.0 và DAMO-YOLO đều có những đóng góp đáng kể cho lĩnh vực phát hiện đối tượng theo thời gian thực. YOLOv6 cải tiến khả năng tối đa hóa GPU, trong khi DAMO-YOLO thể hiện sức mạnh của tìm kiếm kiến trúc tự động.

Tuy nhiên, đối với các nhà phát triển tìm kiếm sự kết hợp tối ưu giữa độ chính xác, tốc độ suy luận và khả năng duy trì hệ sinh thái, dòng Ultralytics YOLO vẫn là lựa chọn hàng đầu. Với những tối ưu hóa đột phá được giới thiệu trong YOLO26, rào cản gia nhập để xây dựng các ứng dụng thị giác máy tính cấp doanh nghiệp chưa bao giờ thấp hơn.

Để tìm hiểu thêm, bạn cũng có thể quan tâm đến việc so sánh các model này với những kiến trúc khác trong tài liệu của chúng tôi, chẳng hạn như YOLO11 hoặc các phương pháp dựa trên Transformer như RT-DETR.

Những người đóng góp

Bình luận