Ultralytics YOLO27:

YOLOv5 so với DAMO-YOLO#

Bối cảnh thị giác máy tính thời gian thực không ngừng phát triển, khi các nhà nghiên cứu và kỹ sư nỗ lực tìm kiếm sự cân bằng hoàn hảo giữa độ chính xác, tốc độ và khả năng sử dụng. Hai model nổi bật đã định hình hành trình này là Ultralytics YOLOv5DAMO-YOLO của Alibaba.

Hướng dẫn này cung cấp phân tích kỹ thuật chuyên sâu về kiến trúc, các chỉ số hiệu năng và phương pháp training của chúng, nhằm giúp bạn lựa chọn model phù hợp cho lần triển khai tiếp theo.

Tổng quan về các model#

Trước khi đi sâu vào các khía cạnh kỹ thuật, điều quan trọng là phải hiểu nguồn gốc và triết lý thiết kế chính đằng sau mỗi model thị giác có tầm ảnh hưởng này.

Ultralytics YOLOv5#

Được Glenn Jocher và đội ngũ Ultralytics phát triển, YOLOv5 đã trở thành tiêu chuẩn ngành kể từ khi ra mắt. Được xây dựng nguyên bản trên framework PyTorch, model này ưu tiên trải nghiệm developer tinh gọn và khả năng triển khai mạnh mẽ ngay từ đầu.

DAMO-YOLO#

Được các nhà nghiên cứu tại Alibaba Group tạo ra, DAMO-YOLO tập trung mạnh vào Tìm kiếm kiến trúc neural (NAS) và các kỹ thuật distillation tiên tiến. Model này đẩy giới hạn lý thuyết của hiệu năng phụ thuộc phần cứng, đặc biệt phù hợp với các môi trường nghiên cứu và edge yêu cầu tinh chỉnh ở mức cao.

Tìm hiểu thêm về DAMO-YOLO

Các cải tiến về kiến trúc#

Cả hai model đều tận dụng các khái niệm cấu trúc độc đáo để đạt hiệu năng thời gian thực, dù cách tiếp cận của chúng khác biệt đáng kể.

YOLOv5: Ổn định và linh hoạt#

YOLOv5 sử dụng backbone CSP đã được biến đổi, kết hợp với neck PANet. Cấu trúc này đạt hiệu quả cao, giảm thiểu mức sử dụng bộ nhớ CUDA trong cả quá trình training và inference.

Một trong những điểm mạnh lớn nhất của YOLOv5 là tính linh hoạt trên nhiều tác vụ. Ngoài dự đoán bounding box, model còn cung cấp các kiến trúc chuyên biệt cho phân đoạn ảnhphân loại ảnh, cho phép developer chuẩn hóa các pipeline thị giác xoay quanh một framework thống nhất, đồng bộ.

DAMO-YOLO: Tìm kiếm kiến trúc tự động#

Cải tiến cốt lõi của DAMO-YOLO là MAE-NAS Backbone. Bằng cách sử dụng tìm kiếm dẫn hướng theo entropy tối đa, nhóm Alibaba đã khám phá ra các backbone cân bằng độ chính xác phát hiện và tốc độ suy luận một cách động.

Ngoài ra, model này có neck Efficient RepGFPN để cải thiện quá trình hợp nhất đặc trưng—đặc biệt hữu ích cho các biến thiên phức tạp về tỷ lệ thường xuất hiện trong phân tích ảnh vệ tinh. Thiết kế ZeroHead đơn giản hóa các layer dự đoán cuối nhằm giảm latency, dù việc sinh cấu trúc phức tạp này có thể khiến kiến trúc trở nên cứng nhắc và khó sửa đổi cho các ứng dụng tùy chỉnh.

Yêu cầu bộ nhớ

Các kiến trúc dựa trên Transformer thường gặp khó khăn do mức tiêu thụ VRAM cao. YOLOv5 và DAMO-YOLO đều sử dụng các thiết kế convolution hiệu quả để duy trì footprint bộ nhớ thấp, nhưng các model Ultralytics được tối ưu đáng kể cho GPU phổ thông, giúp chúng dễ tiếp cận hơn nhiều đối với các nhà nghiên cứu độc lập và startup.

Hiệu năng và các chỉ số#

Việc đánh giá các object detector thời gian thực đòi hỏi xem xét ma trận gồm mAP (độ chính xác trung bình), tốc độ inference và các tham số về kích thước model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Mặc dù DAMO-YOLO đạt điểm mAP rất cạnh tranh ở một số mức số lượng tham số nhất định, YOLOv5 liên tục thể hiện tốc độ TensorRT xuất sắc và số lượng tham số cực thấp ở các cấu hình nano và small. Sự cân bằng hiệu năng này đảm bảo YOLOv5 vận hành hiệu quả trong nhiều kịch bản triển khai edge khác nhau.

Hiệu quả huấn luyện và hệ sinh thái#

Độ chính xác lý thuyết của một model chỉ tốt tương đương với khả năng triển khai thực tế của nó. Đây là điểm mà hai model khác biệt đáng kể.

Độ phức tạp của distillation#

DAMO-YOLO phụ thuộc nhiều vào phương pháp huấn luyện nhiều giai đoạn. Phương pháp này kết hợp gán nhãn AlignedOTA với kỹ thuật chưng cất kiến thức giáo viên-học sinh. Mặc dù điều này khai thác hiệu suất tối đa từ model học sinh, nhưng nó đòi hỏi phải huấn luyện ban đầu một model giáo viên khổng lồ. Điều này làm tăng đáng kể thời gian tính toán, chi phí năng lượng và phần cứng cần thiết, tạo ra điểm nghẽn cho các team ML linh hoạt.

Lợi thế của Ultralytics: Dễ sử dụng#

Ngược lại, hệ sinh thái Ultralytics nổi tiếng toàn cầu nhờ các API trực quan và hiệu quả training. Với sự phát triển tích cực và cộng đồng mã nguồn mở đông đảo, developer có thể training, validation và deployment model một cách liền mạch.

from ultralytics import YOLO

# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to ONNX format for deployment
model.export(format="onnx")

Ultralytics cũng cung cấp hỗ trợ tích hợp cho theo dõi experiment thông qua các công cụ như Weights & Biases và Comet ML, tạo nên workflow mượt mà.

Các trường hợp sử dụng trong thực tế#

  • YOLOv5 nổi bật trong các môi trường production có nhịp độ cao. Khả năng export đơn giản giúp model trở thành lựa chọn hàng đầu cho phân tích bán lẻ thông minh, phát hiện lỗi sản xuất tốc độ cao và tích hợp vào ứng dụng mobile thông qua CoreML.
  • DAMO-YOLO đặc biệt phù hợp với benchmarking học thuật nghiêm ngặt và các kịch bản có sẵn nguồn lực compute lớn để thực hiện các phiên training distillation kéo dài, nhằm tối ưu từng phần nhỏ cải thiện mAP cho các mục tiêu phần cứng cụ thể, cố định.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv5 và DAMO-YOLO phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv5#

YOLOv5 là lựa chọn phù hợp cho:

  • Hệ thống production đã được kiểm chứng: Các triển khai hiện có, trong đó bề dày ổn định, tài liệu phong phú và sự hỗ trợ lớn từ cộng đồng của YOLOv5 được đánh giá cao.
  • Huấn luyện trong điều kiện hạn chế tài nguyên: Các môi trường có tài nguyên GPU hạn chế, nơi pipeline huấn luyện hiệu quả và yêu cầu bộ nhớ thấp hơn của YOLOv5 mang lại lợi thế.
  • Hỗ trợ đa dạng định dạng export: Các dự án yêu cầu triển khai trên nhiều định dạng, bao gồm ONNX, TensorRT, CoreMLTFLite.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO được khuyến nghị cho:

  • Phân tích video thông lượng cao: Xử lý các luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các tình huống có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng theo thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu tác động của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone được reparameterize hiệu quả đối với hiệu năng phát hiện.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Bước tiến hóa tiếp theo: YOLO26#

Nếu bắt đầu một dự án mới, bạn nên hướng tới tương lai. Ultralytics YOLO26 được xây dựng trên nền tảng vững chắc của YOLOv5, tích hợp những tiến bộ mang tính đột phá để định nghĩa lại AI thị giác hiện đại.

Tại sao nên nâng cấp lên YOLO26?

Được đón nhận rộng rãi, YOLO26 có kiến trúc end-to-end nguyên bản. Model này sở hữu Thiết kế end-to-end không cần NMS, loại bỏ hoàn toàn bước post-processing Non-Maximum Suppression để triển khai đơn giản hơn và nhanh hơn đáng kể.

Các đổi mới chính trong YOLO26 bao gồm:

  • MuSGD Optimizer: Lấy cảm hứng từ những đổi mới trong training LLM, hybrid giữa SGD và Muon này đảm bảo quá trình training ổn định cao và hội tụ nhanh.
  • Inference trên CPU nhanh hơn tới 43%: Được tối ưu mạnh cho edge computing, đặc biệt phù hợp với các thiết bị IoT hoạt động mà không có GPU chuyên dụng.
  • ProgLoss + STAL: Các hàm loss tiên tiến giúp cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt đối với ảnh chụp từ drone trên không và robotics.
  • Cải tiến theo từng tác vụ: Từ loss góc chuyên biệt cho Bounding Box định hướng (OBB) đến Ước lượng Log-Likelihood dư (RLE) cho ước lượng pose chính xác, YOLO26 dễ dàng xử lý các domain phức tạp.

Kết luận#

YOLOv5 và DAMO-YOLO đều đã khẳng định vị trí của mình trong lịch sử object detection. DAMO-YOLO vẫn là một nghiên cứu đáng chú ý về Tìm kiếm kiến trúc neural và distillation. Tuy nhiên, đối với các tổ chức ưu tiên một hệ sinh thái được duy trì tốt, tính dễ sử dụng và lộ trình nhanh chóng đến production, các model Ultralytics vẫn không có đối thủ.

Chúng tôi đặc biệt khuyến nghị sử dụng Ultralytics Platform để annotate, training và deployment thế hệ model tiếp theo, chẳng hạn như YOLO26, đảm bảo pipeline thị giác máy tính của bạn luôn sẵn sàng cho tương lai, nhanh và có độ chính xác vượt trội.

Đọc thêm#

  • Khám phá RT-DETR dựa trên Transformer cho các ứng dụng yêu cầu độ chính xác cao.
  • Tìm hiểu về model YOLO11 thế hệ trước.
  • Khám phá cách tối ưu triển khai với OpenVINO.
Những người đóng góp

Bình luận