Ultralytics YOLO27:
Get Started

DAMO-YOLO và YOLOv8#

Bối cảnh thị giác máy tính thời gian thực liên tục thay đổi khi các nhà nghiên cứu và kỹ sư mở rộng giới hạn về tốc độ và độ chính xác. Hai cột mốc quan trọng trong quá trình này là DAMO-YOLO và Ultralytics YOLOv8. Mặc dù cả hai model đều hướng đến tối ưu sự đánh đổi giữa độ trễ và độ chính xác trung bình (mAP), chúng có cách tiếp cận hoàn toàn khác nhau về kiến trúc và triết lý để giải quyết các thách thức trong phát hiện đối tượng.

Bài phân tích kỹ thuật toàn diện này sẽ so sánh kiến trúc nền tảng, phương pháp huấn luyện và cách triển khai thực tế của hai model, giúp bạn chọn đúng công cụ cho dự án trí tuệ nhân tạo tiếp theo.

Nguồn gốc và thông số kỹ thuật của model#

Hiểu rõ nguồn gốc của các model học sâu này giúp làm sáng tỏ mục tiêu thiết kế và hệ sinh thái triển khai của chúng.

Thông tin về DAMO-YOLO#

Tìm hiểu thêm về DAMO-YOLO

Thông tin về Ultralytics YOLOv8#

Các cải tiến kiến trúc#

Đặc tính hiệu năng của hai kiến trúc bắt nguồn từ những quyết định cấu trúc riêng biệt.

DAMO-YOLO phụ thuộc nhiều vào Tìm kiếm kiến trúc mạng (NAS) để tự động khám phá cấu trúc mạng tối ưu. Model này giới thiệu khái niệm MAE-NAS, phương pháp tìm kiếm backbone có hiệu năng cao và độ trễ thấp. Ngoài ra, model sử dụng RepGFPN (Mạng kim tự tháp đặc trưng tổng quát được tái tham số hóa) hiệu quả để tăng cường hợp nhất đặc trưng ở các tỷ lệ không gian khác nhau.

Để cải thiện quá trình huấn luyện, nhóm Alibaba đã tích hợp thiết kế ZeroHead và cơ chế gán nhãn AlignedOTA. Ngoài ra, họ dựa nhiều vào quy trình chưng cất tri thức phức tạp, trong đó model giáo viên cỡ lớn hướng dẫn model học sinh gọn nhẹ, giúp cải thiện các chỉ số độ chính xác trên benchmark học thuật.

YOLOv8: Tinh gọn và linh hoạt#

Ultralytics áp dụng cách tiếp cận ưu tiên nhà phát triển hơn với YOLOv8. Model chuyển từ thiết kế dựa trên anchor của YOLOv5 sang kiến trúc không anchor, giúp giảm đáng kể số lượng dự đoán khung giới hạn và tăng tốc độ suy luận. Việc giới thiệu module C2f (Nút thắt cổ chai một phần qua các giai đoạn với 2 phép tích chập) cải thiện luồng gradient và biểu diễn đặc trưng mà không làm tăng quá nhiều chi phí tính toán.

Khác với các model chỉ nhắm đến khung giới hạn, YOLOv8 được thiết kế ngay từ đầu để hỗ trợ nhiều tác vụ. Một codebase PyTorch thống nhất hỗ trợ nguyên bản phân đoạn đối tượng, ước tính tư thế và phân loại ảnh, giúp kỹ sư không phải ghép nối các kho mã riêng biệt.

Huấn luyện hiệu quả

Các model Ultralytics vốn cần ít bộ nhớ hơn trong quá trình huấn luyện so với các kiến trúc dựa trên Transformer nặng, cho phép đạt kết quả hiện đại trên GPU phổ thông.

So sánh hiệu năng#

Khi so sánh các chỉ số thô, cần phân tích cách năng lực lý thuyết chuyển thành hiệu năng trên phần cứng. Bảng dưới đây minh họa sự đánh đổi giữa các kích thước model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8

Mặc dù DAMO-YOLO có tỷ lệ tham số trên độ chính xác cao nhờ các kỹ thuật chưng cất, YOLOv8 cung cấp nhiều kích thước model hơn (từ Nano đến Extra-large). Model YOLOv8 Nano là ví dụ điển hình về tối ưu hóa cho thiết bị biên: tiêu thụ ít tài nguyên hơn nhưng vẫn mang lại độ chính xác hữu ích cao.

Hệ sinh thái và trải nghiệm developer#

Điểm khác biệt thực sự giữa các bài báo học thuật và hệ thống sẵn sàng cho môi trường production là hệ sinh thái.

Việc DAMO-YOLO phụ thuộc vào các pipeline chưng cất tri thức quy mô lớn có thể khiến quá trình huấn luyện tùy chỉnh trở nên cồng kềnh. Tạo model giáo viên, chuyển giao tri thức và tinh chỉnh backbone dựa trên NAS đòi hỏi nhiều bộ nhớ CUDA cùng cấu hình nâng cao, thường làm chậm các nhóm kỹ thuật linh hoạt.

Ngược lại, hệ sinh thái Ultralytics ưu tiên tính dễ sử dụng. Thông qua Nền tảng Ultralytics, nhà phát triển có thể sử dụng API đơn giản, tài liệu toàn diện và các tích hợp theo dõi thử nghiệm mạnh mẽ. Framework Python thống nhất giúp việc xây dựng pipeline phức tạp trở nên đơn giản.

from ultralytics import YOLO

# Tải model YOLOv8 nano pretrained
model = YOLO("yolov8n.pt")

# Huấn luyện model trên bộ dữ liệu tùy chỉnh với các phép tăng cường tích hợp sẵn
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Export model đã huấn luyện sang định dạng ONNX để triển khai
model.export(format="onnx")

Quy trình làm việc tinh gọn này, kết hợp với khả năng xuất liền mạch sang OpenVINO và TensorRT, đảm bảo quá trình chuyển từ tạo mẫu cục bộ sang triển khai trên đám mây hoặc thiết bị biên diễn ra thuận lợi.

Ứng dụng thực tế và trường hợp sử dụng phù hợp#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào những giới hạn vận hành của môi trường.

DAMO-YOLO phù hợp với trường hợp nào#

DAMO-YOLO là lựa chọn tuyệt vời cho môi trường học thuật nghiên cứu Tìm kiếm kiến trúc mạng hoặc cho các nhà nghiên cứu muốn tái tạo những chiến lược tái tham số hóa phức tạp. Model này cũng có thể phát huy hiệu quả trong các ứng dụng công nghiệp được kiểm soát chặt chẽ, chẳng hạn như phát hiện lỗi tốc độ cao trên dây chuyền sản xuất, nếu nhóm có đủ tài nguyên tính toán để xử lý quy trình huấn luyện nhiều giai đoạn.

Vì sao Ultralytics dẫn đầu trong môi trường production#

Với phần lớn dự án thương mại, các model Ultralytics mang lại sự cân bằng hiệu năng vượt trội.

  • Bán lẻ thông minh: Sử dụng khả năng đa tác vụ của YOLOv8 để vừa phát hiện khung giới hạn cho hàng tồn kho, vừa ước tính tư thế nhằm phân tích hành vi khách hàng.
  • Nông nghiệp: Sử dụng phân đoạn đối tượng để phát hiện chính xác ranh giới cây trồng và cỏ dại theo thời gian thực từ luồng hình ảnh trên máy kéo.
  • Ảnh hàng không: Tận dụng khung giới hạn có định hướng (OBB) để theo dõi chính xác các phương tiện và tàu thuyền bị xoay lệch trong ảnh từ drone hoặc vệ tinh.
Các model đáng chú ý khác

Nếu đang tìm hiểu bối cảnh rộng hơn, bạn cũng có thể muốn so sánh YOLOv10 hoặc YOLO11, hai model mang đến những cải tiến tiếp theo cho khả năng phát hiện không anchor.

Đón đầu tương lai: YOLO26 ra mắt#

Mặc dù YOLOv8 vẫn là model nền tảng, lĩnh vực này đã không ngừng phát triển. Với mọi dự án mới, YOLO26 là tiêu chuẩn được khuyến nghị. Ra mắt vào tháng 1 năm 2026, model này đánh dấu bước tiến vượt bậc trong dòng sản phẩm Ultralytics.

YOLO26 có thiết kế end-to-end không cần NMS (nms=False) nguyên bản, loại bỏ nút thắt của bước loại bỏ phi cực đại truyền thống khi được bật. Đột phá về cấu trúc này giúp suy luận trên CPU nhanh hơn tới 43%, biến model thành giải pháp mạnh mẽ cho điện toán biên và phần cứng IoT.

Ngoài ra, YOLO26 giới thiệu bộ tối ưu MuSGD, lấy cảm hứng từ các kỹ thuật huấn luyện Mô hình ngôn ngữ lớn (LLM), giúp hội tụ nhanh hơn và vòng lặp huấn luyện ổn định hơn đáng kể. Kết hợp với các thuật toán ProgLoss + STAL mới, YOLO26 cải thiện rõ rệt khả năng nhận diện đối tượng nhỏ, đảm bảo các triển khai không chỉ nhanh mà còn có độ chính xác cao.

Người đóng góp

Bình luận