Ultralytics YOLO27:
Get Started

YOLOv10 và DAMO-YOLO#

Khi xây dựng pipeline thị giác máy tính hiện đại, việc chọn kiến trúc detection vật thể thời gian thực phù hợp là yếu tố then chốt. Trong phân tích kỹ thuật toàn diện này, chúng tôi tìm hiểu kiến trúc, chỉ số hiệu năng và trường hợp sử dụng phù hợp của YOLOv10 và DAMO-YOLO. Cả hai model đều đánh dấu bước tiến lớn về năng lực detection vật thể, nhưng sử dụng những hướng tiếp cận kiến trúc khác nhau để đạt mục tiêu.

Dù dự án của bạn cần triển khai trên phần cứng AI biên có tài nguyên hạn chế hay yêu cầu độ chính xác tối đa trên GPU đám mây, việc hiểu rõ đặc điểm của các kiến trúc này sẽ giúp bạn đưa ra quyết định sáng suốt.

Khám phá YOLOv10#

Được giới thiệu bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 đã tạo bước đột phá cho dòng YOLO bằng cách áp dụng phương pháp end-to-end nguyên bản, qua đó loại bỏ hiệu quả nhu cầu sử dụng Non-Maximum Suppression (NMS) trong quá trình hậu xử lý.

Thông tin về YOLOv10:

Các đặc điểm kiến trúc chính#

Đổi mới chính của YOLOv10 là chiến lược gán kép nhất quán cho training không cần NMS. Các model detection vật thể truyền thống phụ thuộc nhiều vào NMS để lọc các bounding box chồng lấn, gây ra độ trễ khó dự đoán—một nút thắt đáng kể đối với các ứng dụng thời gian thực như xe tự hành và robot tốc độ cao. Bằng cách dự đoán trực tiếp một bounding box tối ưu duy nhất cho mỗi vật thể, YOLOv10 đạt được inference có độ trễ cực thấp và dễ dự đoán.

Ngoài ra, model sử dụng Thiết kế toàn diện hướng đến hiệu quả và độ chính xác. Kiến trúc tối ưu nhiều thành phần, bao gồm head phân loại gọn nhẹ và downsampling tách biệt không gian-kênh, giúp giảm đáng kể tính toán dư thừa. Nhờ vậy, kiến trúc có ít tham số và FLOPs hơn mà vẫn duy trì độ chính xác trung bình (mAP) cạnh tranh.

Đơn giản hóa quá trình export cho production

Vì YOLOv10 loại bỏ các thao tác NMS khỏi đồ thị inference, việc export model sang các định dạng như ONNX hoặc TensorRT trở nên đơn giản hơn nhiều, khiến model đặc biệt phù hợp để triển khai trên thiết bị biên.

Tìm hiểu thêm về YOLOv10

Ví dụ sử dụng#

YOLOv10 được tích hợp sâu vào hệ sinh thái Ultralytics, giúp bạn dễ dàng sử dụng thông qua package Python Ultralytics.

from ultralytics import YOLO

# Tải model nano YOLOv10 đã pre-train
model = YOLO("yolov10n.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy inference trên ảnh kiểm thử
results = model("https://ultralytics.com/images/bus.jpg")

# Export model sang định dạng TensorRT
model.export(format="engine", quantize=16)

Khám phá DAMO-YOLO#

Được phát triển bởi Alibaba Group, DAMO-YOLO tập trung khám phá các cấu trúc mạng có hiệu quả cao thông qua Tìm kiếm Kiến trúc Neural (NAS) tự động, nhằm mở rộng đường biên Pareto giữa tốc độ và độ chính xác.

Thông tin về DAMO-YOLO:

Các đặc điểm kiến trúc chính#

DAMO-YOLO giới thiệu một số công nghệ mới dành cho ứng dụng công nghiệp. Nền tảng của model là backbone MAE-NAS, được tạo ra thông qua quá trình tìm kiếm định hướng theo entropy cực đại. Quy trình tự động này khám phá các cấu trúc backbone tuân thủ nghiêm ngặt ngân sách tính toán được xác định trước, tạo nên sự cân bằng hợp lý giữa độ chính xác và độ trễ inference.

Ngoài ra, kiến trúc sử dụng neck Efficient RepGFPN. Mạng kim tự tháp đặc trưng này được thiết kế để cải thiện việc hợp nhất đặc trưng ở nhiều quy mô khác nhau, yếu tố then chốt trong các tác vụ phức tạp như phân tích ảnh chụp từ trên không, nơi kích thước vật thể rất đa dạng. Để bổ trợ, DAMO-YOLO triển khai ZeroHead, một head detection tối giản giúp giảm đáng kể độ phức tạp của các lớp dự đoán cuối cùng, tiết kiệm thời gian tính toán quý giá trong quá trình inference.

Tìm hiểu thêm về DAMO-YOLO

So sánh hiệu năng#

Khi đánh giá kiến trúc detection vật thể, việc tìm ra sự cân bằng phù hợp giữa tốc độ inference, hiệu quả tham số và độ chính xác detection là tối quan trọng. Bảng dưới đây so sánh hiệu năng của YOLOv10 và DAMO-YOLO ở các kích thước model tương ứng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Như kết quả benchmark cho thấy, YOLOv10 luôn mang lại độ trễ vượt trội trên TensorRT, đặc biệt ở biến thể nano, đồng thời cần ít tham số và FLOPs hơn đáng kể so với các model DAMO-YOLO tương đương. DAMO-YOLO đạt mAP cao ở biến thể tiny, nhưng hiệu quả tham số và độ trễ inference của dòng YOLOv10 tạo lợi thế rõ rệt trong môi trường triển khai bị giới hạn tài nguyên.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv10 và DAMO-YOLO phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và hệ sinh thái bạn ưu tiên.

Khi nào nên chọn YOLOv10#

YOLOv10 là lựa chọn phù hợp cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
  • Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO được khuyến nghị cho:

  • Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các kịch bản có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu ảnh hưởng của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đến hiệu năng phát hiện.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Lợi thế của Ultralytics#

Mặc dù cả hai model đều ấn tượng về mặt kỹ thuật, việc chọn kiến trúc cho production đòi hỏi phải xem xét nhiều hơn các chỉ số thô. Xây dựng giải pháp bằng các model được hệ sinh thái Ultralytics hỗ trợ trực tiếp mang lại lợi thế vượt trội cho cả developer và nhà nghiên cứu.

Dễ sử dụng và hệ sinh thái được duy trì tốt#

Khác với các repository học thuật độc lập thường bị bỏ bê, Ultralytics cung cấp một hệ sinh thái mạnh mẽ, được duy trì tích cực. Việc thiết lập môi trường phức tạp cho các model phụ thuộc nhiều vào pipeline NAS có thể gây khó khăn. Ngược lại, Ultralytics cung cấp Python API tiêu chuẩn, trực quan và CLI mạnh mẽ, cùng tài liệu toàn diện. Điều này giúp rút ngắn đáng kể thời gian đưa giải pháp thị giác tùy chỉnh ra thị trường.

Hiệu quả huấn luyện và yêu cầu bộ nhớ#

Training model lớn có thể nhanh chóng trở nên tốn kém về tính toán. Các kiến trúc Ultralytics YOLO từ lâu nổi tiếng nhờ footprint CUDA memory thấp trong quá trình training và inference. Hiệu quả này cho phép developer training model trên phần cứng dành cho người dùng phổ thông hoặc các instance đám mây tiết kiệm chi phí mà không gặp lỗi hết bộ nhớ, vốn thường xảy ra khi làm việc với các model dựa trên Transformer như RT-DETR.

Theo dõi thử nghiệm

Ultralytics tích hợp trực tiếp với các công cụ MLOps hàng đầu. Bạn có thể dễ dàng theo dõi tiến trình training model thông qua tích hợp với Weights & Biases, Comet hoặc ClearML mà không cần thêm code boilerplate.

Tính linh hoạt trên nhiều tác vụ#

Một hạn chế đáng kể của nhiều model detection chuyên biệt là phạm vi tập trung hẹp. Trong hệ sinh thái Ultralytics, bạn không bị giới hạn ở riêng detection vật thể. Các công cụ dễ dàng mở rộng sang nhiều tác vụ thị giác máy tính, bao gồm phân đoạn instance, phân loại ảnh, ước lượng pose và detection bounding box định hướng (OBB).

Nhìn về phía trước: Bước tiến của YOLO26#

Trong khi YOLOv10 tiên phong inference không cần NMS và DAMO-YOLO cho thấy sức mạnh của NAS, lĩnh vực thị giác máy tính vẫn phát triển nhanh chóng. Với các developer muốn tìm giải pháp tiên tiến nhất, chúng tôi đề xuất khám phá Ultralytics YOLO26.

Được phát hành như phiên bản kế nhiệm chính thức của YOLO11, YOLO26 xây dựng trên nền tảng không cần NMS do YOLOv10 đặt ra nhưng đưa công nghệ này tiến xa hơn đáng kể.

Các cải tiến chính trong YOLO26 bao gồm:

  • Inference CPU nhanh hơn tới 43%: Được tối ưu chuyên biệt cho điện toán biên và thiết bị công suất thấp.
  • Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, giúp export đơn giản hơn và tăng khả năng tương thích với nhiều mục tiêu triển khai.
  • Optimizer MuSGD: Kết hợp giữa SGD và Muon, đưa độ ổn định training LLM tiên tiến cùng khả năng hội tụ nhanh hơn trực tiếp vào thị giác máy tính.
  • ProgLoss + STAL: Các hàm loss được cải tiến đáng kể, giúp tăng cường rõ rệt khả năng nhận diện vật thể nhỏ, thiết yếu trong các trường hợp sử dụng như nông nghiệp và viễn thám.

Bằng cách sử dụng Ultralytics Platform vừa được nâng cấp toàn diện, developer có thể dễ dàng gán nhãn, training và triển khai các model thế hệ mới như YOLO26 chỉ với vài cú nhấp chuột, đảm bảo pipeline thị giác máy tính luôn tiên tiến và sẵn sàng cho tương lai.

Người đóng góp

Bình luận