DAMO-YOLO và YOLO26#
Lĩnh vực thị giác máy tính không ngừng phát triển, được thúc đẩy bởi nhu cầu về các kiến trúc cân bằng giữa độ chính xác cao và inference độ trễ thấp. Bài so sánh này đi sâu vào chi tiết kỹ thuật của DAMO-YOLO và Ultralytics YOLO26, tìm hiểu các đổi mới trong kiến trúc, phương pháp train và trường hợp sử dụng lý tưởng.
Dù triển khai model thị giác trên thiết bị edge hay xây dựng pipeline cloud thông lượng cao, việc hiểu rõ khác biệt giữa các model này là yếu tố then chốt để đưa ra quyết định kiến trúc sáng suốt trong quá trình phát triển AI hiện đại.
DAMO-YOLO: Tìm kiếm kiến trúc mạng nơ-ron ở quy mô lớn#
DAMO-YOLO, do Alibaba Group phát triển, được phát hành vào ngày 23 tháng 11 năm 2022. Được thiết kế bởi Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang và Xiuyu Sun, model này tập trung mạnh vào việc tự động khám phá kiến trúc hiệu quả bằng Tìm kiếm kiến trúc neural (NAS).
Bạn có thể xem nghiên cứu gốc trong bài báo ArXiv hoặc tìm hiểu mã nguồn tại repository DAMO-YOLO trên GitHub.
Các đặc điểm kiến trúc chính#
DAMO-YOLO giới thiệu một số cải tiến kỹ thuật nhằm nâng cao giới hạn của object detection thời gian thực:
- Backbone MAE-NAS: DAMO-YOLO sử dụng phương pháp tìm kiếm được định hướng bởi entropy cực đại để tìm backbone tối ưu. Phương pháp NAS này khám phá các kiến trúc cân bằng chặt chẽ giữa độ chính xác detection và tốc độ inference trên phần cứng cụ thể.
- RepGFPN hiệu quả: Thiết kế neck lớn giúp cải thiện đáng kể khả năng hợp nhất đặc trưng, đặc biệt hữu ích khi phân tích các cảnh phức tạp như trong ảnh chụp từ trên không.
- Thiết kế ZeroHead: Detection head được đơn giản hóa đáng kể, giúp giảm thiểu độ phức tạp tính toán của các lớp dự đoán cuối cùng.
- AlignedOTA và distillation: DAMO-YOLO sử dụng Phân công vận chuyển tối ưu có căn chỉnh (AlignedOTA) để giải quyết sự mơ hồ trong việc gán nhãn, kết hợp với chiến lược cải thiện knowledge distillation mạnh mẽ nhằm tăng độ chính xác của các model student nhỏ hơn bằng cách dùng mạng teacher lớn hơn.
Ưu thế của Ultralytics: YOLO26#
Được Glenn Jocher và Jing Qiu phát hành ngày 14 tháng 1 năm 2026 tại Ultralytics, YOLO26 là đỉnh cao của AI thị giác hiệu năng cao, dễ tiếp cận. Kế thừa nền tảng của YOLO11 và YOLOv10, YOLO26 được thiết kế từ đầu để ưu tiên triển khai trên edge, linh hoạt đa tác vụ và dễ sử dụng vượt trội.
Các cải tiến của YOLO26#
Ultralytics YOLO26 mang đến một số tính năng đột phá, khiến model trở thành lựa chọn hàng đầu cho các ứng dụng thị giác máy tính hiện đại:
- Thiết kế end-to-end không cần NMS: Head one-to-one tích hợp sẵn của YOLO26 (
nms=False) loại bỏ khâu hậu xử lý Ức chế phi cực đại (NMS). Phương pháp end-to-end này, lần đầu được tiên phong trong YOLOv10, giúp đơn giản hóa đáng kể pipeline triển khai và đảm bảo inference xác định với độ trễ thấp. - Inference trên CPU nhanh hơn tới 43%: Được tối ưu về kiến trúc cho điện toán biên, YOLO26 đạt tốc độ vượt trội trên thiết bị edge và CPU thông thường, rất phù hợp với các thiết bị IoT dùng pin.
- Optimizer MuSGD: Lấy cảm hứng từ quá trình train LLM (chẳng hạn Kimi K2 của Moonshot AI), YOLO26 kết hợp SGD và Muon. Cách này đưa độ ổn định khi train mô hình ngôn ngữ lớn vào thị giác máy tính, giúp hội tụ nhanh và đáng tin cậy hơn.
- Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, đồ thị model được đơn giản hóa, cho phép xuất model thuận tiện sang các định dạng như ONNX và TensorRT.
- ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, một tính năng quan trọng trong hoạt động của drone và nông nghiệp.
YOLO26 có các cải tiến chuyên biệt cho nhiều phương thức: proto đa tỷ lệ cho Phân đoạn instance, Ước tính hợp lý logarit phần dư (RLE) cho Ước tính tư thế và hàm loss góc tiên tiến giúp giảm vấn đề ở ranh giới trong detection Bounding Box có định hướng (OBB).
So sánh hiệu năng#
Khi đánh giá các model này, việc cân bằng giữa độ chính xác (mAP) và hiệu quả tính toán (Tốc độ/FLOPs) là điều tối quan trọng. Bảng dưới đây cho thấy sự khác biệt giữa các model trên dataset COCO tiêu chuẩn của ngành.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Như trên đây cho thấy, YOLO26 luôn đạt độ chính xác cao hơn với số lượng tham số và FLOPs ít hơn đáng kể, nhờ đó tạo ra kiến trúc hiệu quả hơn nhiều cho cả quá trình train lẫn inference.
Hiệu quả train và tính dễ sử dụng#
Độ phức tạp của DAMO-YOLO#
Mặc dù DAMO-YOLO đạt độ chính xác cạnh tranh, phương pháp train của model này rất phức tạp. Việc phụ thuộc vào Tìm kiếm kiến trúc neural (NAS) và knowledge distillation quy mô lớn đồng nghĩa với việc train model tùy chỉnh thường cần nhiều tài nguyên GPU và kiến thức chuyên sâu. Quy trình nhiều giai đoạn này—train một model teacher khổng lồ để chắt lọc thành model student nhỏ hơn—có thể trở thành nút thắt với các nhóm kỹ thuật linh hoạt cần nhanh chóng lặp lại quy trình trên dataset tùy chỉnh.
Trải nghiệm tinh gọn của Ultralytics#
Ngược lại, Ultralytics YOLO26 được thiết kế để dễ sử dụng từ đầu đến cuối. Toàn bộ vòng đời train, validation và triển khai được đơn giản hóa thông qua Python API và CLI thống nhất, gọn gàng. Hơn nữa, khi train, YOLO26 cần ít bộ nhớ CUDA hơn đáng kể so với các model dựa trên Transformer như RT-DETR, cho phép nhà nghiên cứu train model tiên tiến nhất trên phần cứng phổ thông.
Sau đây là ví dụ cho thấy việc train, đánh giá và xuất model YOLO26 bằng Ultralytics SDK đơn giản như thế nào:
from ultralytics import YOLO
# Tải model nano YOLO26 mới nhất
model = YOLO("yolo26n.pt")
# Huấn luyện model trên tập dữ liệu COCO8 trong 50 epoch
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# # Đánh giá hiệu năng của model trên tập validation
metrics = model.val()
# Chạy suy luận trên ảnh mẫu
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Xuất model sang định dạng ONNX để triển khai
model.export(format="onnx")Với các nhóm muốn sử dụng môi trường không cần code, Ultralytics Platform cung cấp giao diện trực quan để gán nhãn dataset, train trên cloud và triển khai liền mạch.
Ứng dụng thực tế#
Việc lựa chọn kiến trúc phù hợp phụ thuộc nhiều vào môi trường triển khai mục tiêu và giới hạn phần cứng.
Kiểm soát chất lượng công nghiệp#
Với tự động hóa sản xuất tốc độ cao, DAMO-YOLO có thể hoạt động tốt trên phần cứng GPU chuyên dụng. Tuy nhiên, YOLO26 là lựa chọn ưu tiên cho dây chuyền lắp ráp hiện đại. Thiết kế end-to-end không cần NMS đảm bảo độ trễ ổn định, không bị dao động, rất cần thiết khi đồng bộ dữ liệu thị giác với cơ cấu chấp hành robot theo thời gian thực.
AI biên và thiết bị di động#
Triển khai thị giác máy tính trên thiết bị dùng pin đòi hỏi hiệu quả vượt trội. Trong khi DAMO-YOLO phụ thuộc vào các neck RepGFPN cụ thể, YOLO26n (Nano) được tối ưu chuyên biệt cho điện toán biên. Việc loại bỏ DFL và inference trên CPU nhanh hơn 43% khiến model trở thành giải pháp tối ưu cho camera thông minh, ứng dụng di động và hệ thống báo động an ninh.
Yêu cầu dự án đa tác vụ#
Nếu dự án cần nhiều hơn object detection—chẳng hạn phân tích kỹ thuật của vận động viên trong thể thao bằng ước tính tư thế hoặc trích xuất ranh giới pixel chính xác bằng phân đoạn instance—YOLO26 hỗ trợ trực tiếp tất cả tác vụ này trong một codebase thống nhất. DAMO-YOLO chỉ giới hạn ở detection bounding box.
Trường hợp sử dụng và khuyến nghị#
Việc chọn DAMO-YOLO hay YOLO26 phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và lựa chọn hệ sinh thái của bạn.
Khi nào nên chọn DAMO-YOLO#
DAMO-YOLO là lựa chọn phù hợp cho:
- Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
- Dây chuyền sản xuất công nghiệp: Các kịch bản có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
- Nghiên cứu Neural Architecture Search: Nghiên cứu ảnh hưởng của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đến hiệu năng phát hiện.
Khi nào nên chọn YOLO26#
YOLO26 được khuyến nghị cho:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Kết luận#
Cả hai kiến trúc đều là những thành tựu đáng kể trong lĩnh vực deep learning. DAMO-YOLO cho thấy tiềm năng thú vị của Tìm kiếm kiến trúc neural và các kỹ thuật distillation được điều chỉnh theo benchmark phần cứng cụ thể.
Tuy nhiên, với developer, nhà nghiên cứu và doanh nghiệp cần một giải pháp sẵn sàng đưa vào production, Ultralytics YOLO26 là lựa chọn vượt trội. Sự kết hợp giữa thiết kế end-to-end không cần NMS, mức tăng tốc inference trên CPU đáng kể, tính linh hoạt đa tác vụ và khả năng tích hợp vào hệ sinh thái Ultralytics được duy trì tốt khiến model trở thành công cụ mạnh mẽ và thiết thực nhất để giải quyết các thách thức thị giác máy tính trong thực tế hiện nay.
Người dùng muốn tìm hiểu các model khác trong hệ sinh thái Ultralytics có thể tham khảo tài liệu toàn diện về YOLO11, YOLOv8 và RT-DETR dựa trên Transformer.