Ultralytics YOLO27:

DAMO-YOLO so với YOLOv8#

Bối cảnh thị giác máy tính thời gian thực không ngừng thay đổi khi các nhà nghiên cứu và kỹ sư liên tục mở rộng giới hạn về tốc độ và độ chính xác. Hai cột mốc quan trọng trong hành trình này là DAMO-YOLOUltralytics YOLOv8. Mặc dù cả hai model đều hướng đến việc tối ưu hóa sự cân bằng giữa độ trễ và độ chính xác trung bình (mAP), chúng áp dụng những cách tiếp cận hoàn toàn khác nhau về kiến trúc và triết lý để giải quyết các thách thức trong phát hiện đối tượng.

Phân tích kỹ thuật toàn diện này sẽ so sánh kiến trúc nền tảng, phương pháp training và các cách triển khai thực tế của chúng, giúp bạn lựa chọn công cụ phù hợp cho dự án trí tuệ nhân tạo tiếp theo.

Nguồn gốc và thông số kỹ thuật của model#

Việc tìm hiểu nguồn gốc của các model deep learning này cung cấp bối cảnh hữu ích về mục tiêu thiết kế và hệ sinh thái triển khai của chúng.

Chi tiết về DAMO-YOLO#

Tìm hiểu thêm về DAMO-YOLO

Thông tin chi tiết về Ultralytics YOLOv8#

Các cải tiến về kiến trúc#

Đặc tính hiệu năng của cả hai kiến trúc bắt nguồn từ những quyết định cấu trúc riêng biệt của chúng.

DAMO-YOLO: Phát triển dựa trên tìm kiếm kiến trúc#

DAMO-YOLO phụ thuộc nhiều vào Tìm kiếm kiến trúc neural (NAS) để tự động khám phá các cấu trúc mạng tối ưu. Model này giới thiệu một khái niệm có tên MAE-NAS, dùng để tìm kiếm các backbone mang lại hiệu năng cao với độ trễ thấp. Ngoài ra, model sử dụng RepGFPN (Mạng kim tự tháp đặc trưng tổng quát hóa được tái tham số hóa) hiệu quả để tăng cường việc hợp nhất đặc trưng trên các scale không gian khác nhau.

Để cải thiện quá trình training, đội ngũ Alibaba đã tích hợp thiết kế ZeroHead và phương pháp gán nhãn AlignedOTA. Bên cạnh đó, họ phụ thuộc nhiều vào quy trình knowledge distillation phức tạp, trong đó một teacher model lớn hướng dẫn student model nhẹ hơn, qua đó nâng cao các chỉ số độ chính xác trên những benchmark học thuật.

YOLOv8: Tinh gọn và đa năng#

Ultralytics áp dụng cách tiếp cận ưu tiên developer hơn với YOLOv8. Model chuyển từ thiết kế dựa trên anchor của YOLOv5 sang kiến trúc không anchor, giúp giảm đáng kể số lượng dự đoán bounding box và tăng tốc inference. Việc giới thiệu module C2f (Nút thắt cổ chai phân đoạn một phần theo stage với 2 phép tích chập) đã cải thiện luồng gradient và khả năng biểu diễn đặc trưng mà không làm tăng quá mức chi phí tính toán.

Không giống như các mô hình chỉ tập trung hoàn toàn vào khung giới hạn, YOLOv8 được thiết kế từ đầu để hỗ trợ đa tác vụ. Cơ sở mã PyTorch thống nhất hỗ trợ nguyên bản phân đoạn cá thể, ước tính tư thế và phân loại hình ảnh, giúp các kỹ sư không phải chắp vá các kho lưu trữ rời rạc.

Training hiệu quả

Các model Ultralytics vốn yêu cầu ít memory hơn trong quá trình training so với các kiến trúc dựa trên Transformer nặng, cho phép đạt kết quả tiên tiến trên các GPU phổ thông dành cho người dùng.

So sánh hiệu năng#

Khi so sánh các metric thô, điều quan trọng là phải phân tích cách năng lực lý thuyết chuyển hóa thành hiệu năng trên phần cứng. Bảng dưới đây minh họa sự đánh đổi giữa các kích thước model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

Mặc dù DAMO-YOLO có tỷ lệ parameter trên độ chính xác tốt nhờ các kỹ thuật knowledge distillation, YOLOv8 cung cấp dải kích thước model rộng hơn (Nano đến Extra-large). Model YOLOv8 Nano là một ví dụ xuất sắc về tối ưu hóa cho edge, tiêu thụ ít tài nguyên hơn nhưng vẫn cung cấp độ chính xác có tính ứng dụng cao.

Hệ sinh thái và trải nghiệm developer#

Điểm khác biệt thực sự giữa các bài báo học thuật và hệ thống sẵn sàng cho production nằm ở hệ sinh thái.

Việc DAMO-YOLO phụ thuộc vào các pipeline knowledge distillation quy mô lớn có thể khiến quá trình training tùy chỉnh trở nên cồng kềnh. Việc tạo teacher model, chuyển giao kiến thức và tinh chỉnh các backbone dựa trên NAS đòi hỏi nhiều CUDA memory cùng cấu hình nâng cao, thường làm chậm các đội ngũ kỹ thuật linh hoạt.

Ngược lại, hệ sinh thái Ultralytics đề cao tính dễ sử dụng. Thông qua Ultralytics Platform, các developer có thể truy cập các API đơn giản, tài liệu toàn diện và các tích hợp tracking experiment mạnh mẽ. Framework Python thống nhất giúp việc xây dựng các pipeline phức tạp trở nên đơn giản.

from ultralytics import YOLO

# Load a pretrained YOLOv8 nano model
model = YOLO("yolov8n.pt")

# Train the model on a custom dataset with built-in augmentations
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Workflow tinh gọn này, kết hợp với khả năng export liền mạch sang OpenVINOTensorRT, đảm bảo lộ trình không trở ngại từ tạo prototype cục bộ đến triển khai trên cloud hoặc edge.

Ứng dụng Thực tế và Các Trường hợp Sử dụng Lý tưởng#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào các ràng buộc vận hành trong môi trường của bạn.

DAMO-YOLO phù hợp với trường hợp nào#

DAMO-YOLO là sự lựa chọn tuyệt vời cho các môi trường học thuật nghiên cứu Tìm kiếm Kiến trúc Mạng Nơ-ron hoặc các nhà nghiên cứu đang cố gắng tái tạo các chiến lược tham số hóa lại phức tạp. Mô hình này cũng có thể xuất sắc trong các ứng dụng công nghiệp được kiểm soát chặt chẽ, chẳng hạn như phát hiện lỗi tốc độ cao trên các dây chuyền sản xuất, miễn là đội ngũ có đủ tài nguyên tính toán để xử lý quá trình huấn luyện nhiều giai đoạn.

Vì sao Ultralytics dẫn đầu trong production#

Đối với phần lớn dự án thương mại, các model Ultralytics cung cấp sự cân bằng hiệu năng vượt trội.

  • Bán lẻ thông minh: Sử dụng khả năng multi-task của YOLOv8 để thực hiện cả phát hiện bounding box cho hàng tồn kho và ước lượng pose nhằm phân tích hành vi khách hàng.
  • Nông nghiệp: Sử dụng instance segmentation để phát hiện chính xác ranh giới cây trồng và cỏ dại trong luồng hình ảnh thời gian thực từ máy kéo.
  • Ảnh chụp từ trên không: Tận dụng Bounding Box có hướng (OBB) để theo dõi chính xác các phương tiện và tàu thuyền bị xoay từ drone hoặc vệ tinh.
Các model đáng chú ý khác

Nếu đang khám phá bối cảnh rộng hơn, bạn cũng có thể quan tâm đến việc so sánh YOLOv10 hoặc YOLO11, những model mang đến các cải tiến hơn nữa cho việc phát hiện không anchor.

Đón đầu tương lai: YOLO26 xuất hiện#

Mặc dù YOLOv8 vẫn là một model nền tảng, lĩnh vực này đã tiếp tục phát triển. Đối với mọi phát triển mới, YOLO26 là tiêu chuẩn được khuyến nghị. Được phát hành vào tháng 1 năm 2026, model này đại diện cho một bước tiến vượt bậc trong dòng sản phẩm Ultralytics.

YOLO26 tiên phong với thiết kế end-to-end không cần NMS native, loại bỏ hoàn toàn nút thắt Suppression cực đại không tối đa truyền thống. Đột phá về cấu trúc này mang lại khả năng inference trên CPU nhanh hơn tới 43%, biến model thành một giải pháp mạnh mẽ cho điện toán edge và phần cứng IoT.

Ngoài ra, YOLO26 giới thiệu MuSGD Optimizer, một optimizer lai lấy cảm hứng từ các kỹ thuật training Mô hình ngôn ngữ lớn (LLM), đảm bảo hội tụ nhanh hơn và các vòng lặp training ổn định hơn đáng kể. Kết hợp với các thuật toán ProgLoss + STAL mới, YOLO26 cho thấy những cải thiện rõ rệt trong khả năng nhận diện đối tượng nhỏ, đảm bảo các bản triển khai của bạn không chỉ nhanh mà còn có độ chính xác cao.

Những người đóng góp

Bình luận