YOLO Vision 2026:

So sánh DAMO-YOLO và PP-YOLOE+#

Trong bối cảnh cạnh tranh khốc liệt của thị trường thị giác máy tính thời gian thực, việc lựa chọn kiến trúc tối ưu cho nhu cầu triển khai cụ thể của bạn là rất quan trọng. Hướng dẫn này cung cấp bản so sánh kỹ thuật toàn diện giữa DAMO-YOLOPP-YOLOE+, đi sâu vào các thiết kế kiến trúc, phương pháp đào tạo và chỉ số hiệu suất. Chúng tôi cũng sẽ xem xét cách các mô hình này so sánh với các giải pháp hiện đại như Ultralytics YOLO26 vừa được ra mắt.

Tổng quan về mô hình#

Cả hai framework này đều xuất hiện vào năm 2022 như những giải pháp thay thế mạnh mẽ cho các ứng dụng công nghiệp, tận dụng các kỹ thuật tinh vi để đẩy giới hạn về độ chính xác và tốc độ suy luận.

DAMO-YOLO#

Được phát triển bởi Alibaba Group, DAMO-YOLO giới thiệu một số kỹ thuật mới để tối ưu hóa sự đánh đổi giữa độ trễ và độ chính xác, dựa nhiều vào các kỹ thuật tìm kiếm tự động và hợp nhất đặc trưng nâng cao.

DAMO-YOLO sử dụng cơ chế Tìm kiếm Kiến trúc Đa quy mô (MAE-NAS) để tự động thiết kế các backbone được tối ưu hóa cho hiệu suất phần cứng. Nó cũng có tính năng RepGFPN (Re-parameterized Generalized Feature Pyramid Network) hiệu quả cho việc hợp nhất đặc trưng ở phần neck và thiết kế "ZeroHead" nhẹ. Hơn nữa, nó dựa nhiều vào các kỹ thuật chưng cất (distillation) trong quá trình đào tạo để tăng cường khả năng biểu diễn của mô hình học viên (student model).

Tìm hiểu thêm về DAMO-YOLO

PP-YOLOE+#

Đến từ nhóm PaddlePaddle của Baidu, PP-YOLOE+ là một bản nâng cấp gia tăng cho kiến trúc PP-YOLOE. Nó tập trung vào việc huấn luyện trước quy mô lớn và các hàm mất mát được tinh chỉnh để mang lại mAP cao, đặc biệt là trong framework deep learning gốc của nó.

PP-YOLOE+ sử dụng backbone CSPRepResNet và đầu ra ET-head (Efficient Task-aligned head). Phiên bản "plus" giới thiệu chiến lược tiền đào tạo mạnh mẽ trên tập dữ liệu Objects365, giúp tăng đáng kể khả năng tổng quát hóa trong nhiều môi trường thực tế khác nhau.

Tìm hiểu thêm về PP-YOLOE+

So sánh kiến trúc#

Sự khác biệt trong triết lý thiết kế giữa hai mô hình này ảnh hưởng đáng kể đến các trường hợp sử dụng lý tưởng và khả năng tương thích phần cứng của chúng.

Hợp nhất đặc trưng và Backbones#

Các backbone được tạo ra bởi MAE-NAS của DAMO-YOLO được tinh chỉnh cao cho các thiết bị edge, thường mang lại tỷ lệ tốc độ trên số lượng tham số thuận lợi. Tuy nhiên, các kiến trúc tùy chỉnh này có thể cứng nhắc và phức tạp để thích ứng cho các tác vụ mới như instance segmentation. Phần neck RepGFPN cải thiện việc hợp nhất đặc trưng đa tỷ lệ nhưng làm tăng độ phức tạp trong giai đoạn xuất tái tham số hóa.

PP-YOLOE+ dựa trên CSPRepResNet truyền thống nhưng cực kỳ hiệu quả. Mặc dù backbone này yêu cầu số lượng tham số lớn hơn so với DAMO-YOLO để đạt được độ chính xác tương đương, nhưng nó rất ổn định để đào tạo và dễ dàng tích hợp vào các pipeline hiện có. ET-head của nó xử lý phân loại và hồi quy hiệu quả, nhưng vẫn yêu cầu các bước xử lý hậu kỳ như Non-Maximum Suppression (NMS).

Loại bỏ độ trễ xử lý hậu kỳ

Cả DAMO-YOLO và PP-YOLOE+ đều yêu cầu NMS cho việc hậu xử lý bounding boxes. Nếu độ trễ inference là tối quan trọng, hãy cân nhắc sử dụng Ultralytics YOLO26, có tính năng End-to-End NMS-Free Design nguyên bản. Cách tiếp cận đột phá này loại bỏ bước hậu xử lý NMS để có một pipeline triển khai nhanh hơn và đơn giản hơn.

Phân tích hiệu suất và các chỉ số#

Khi đánh giá các mô hình này cho sản xuất, sự cân bằng giữa độ chính xác (mAP), tốc độ suy luận và kích thước tham số là rất quan trọng. Dưới đây là bảng so sánh trực tiếp các biến thể chính của chúng.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Như bảng minh họa, DAMO-YOLO thường đạt được độ trễ thấp hơn trên các quy mô nhỏ (s) và siêu nhỏ (t), nhờ vào các backbone được tối ưu hóa bằng NAS. Tuy nhiên, PP-YOLOE+ mở rộng quy mô cực kỳ tốt ở các phân khúc trung bình (m) và lớn (l), tự hào với điểm mAP cao hơn đáng kể, mặc dù có chi phí đánh đổi nhẹ về tốc độ T4 TensorRT.

Yêu cầu bộ nhớ và hiệu quả huấn luyện#

Việc DAMO-YOLO phụ thuộc vào distillation có nghĩa là bạn thường cần huấn luyện một model giáo viên lớn hơn nhiều trước khi huấn luyện model học sinh nhỏ hơn. Điều này làm tăng đáng kể CUDA memory requirements và ngân sách tính toán tổng thể. PP-YOLOE+ đơn giản hóa điều này với việc huấn luyện đơn giai đoạn tiêu chuẩn nhưng vẫn gắn chặt với framework PaddlePaddle, điều này có thể hạn chế tính linh hoạt đối với các nhóm đã quen thuộc với PyTorch.

Ngược lại, model Ultralytics YOLO26 hiện đại giải quyết các điểm nghẽn này. Sử dụng MuSGD Optimizer mới—sự kết hợp giữa SGD và Muon lấy cảm hứng từ các đổi mới trong huấn luyện LLM—YOLO26 đạt được thời gian hội tụ nhanh hơn và huấn luyện cực kỳ ổn định mà không cần các pipeline distillation rườm rà. Ngoài ra, các model YOLO thường yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với các detector dựa trên transformer như RT-DETR.

Các ứng dụng thực tế và trường hợp sử dụng lý tưởng#

Khi nào nên dùng DAMO-YOLO#

DAMO-YOLO rất lý tưởng cho inference edge thông lượng cao, nơi độ trễ là điểm nghẽn lớn nhất. Các biến thể nhỏ của nó xuất sắc trong các môi trường như traffic management systems hoặc giám sát bằng drone cơ bản, miễn là nhóm kỹ thuật của bạn có đủ năng lực để quản lý các quy trình distillation và tái tham số hóa phức tạp của nó.

Khi nào sử dụng PP-YOLOE+#

PP-YOLOE+ tỏa sáng khi bạn đã đầu tư sâu vào hệ sinh thái Baidu hoặc đang chạy các hệ thống server quy mô lớn. Chỉ số mAP ấn tượng của nó làm cho nó phù hợp cho medical image analysis phức tạp hoặc manufacturing defect detection dày đặc.

Lợi thế từ Ultralytics#

Mặc dù cả DAMO-YOLO và PP-YOLOE+ đều mang lại những ưu điểm cục bộ cụ thể, các lập trình viên tìm kiếm tính linh hoạt tối đa, tốc độ và sự dễ sử dụng luôn hướng tới Ultralytics Platform.

Khi nâng cấp pipeline thị giác máy tính của bạn, Ultralytics YOLO26 mang đến trải nghiệm nhà phát triển vô song:

  • Suy luận CPU nhanh hơn tới 43%: Với việc loại bỏ hoàn toàn Distribution Focal Loss (DFL), YOLO26 hoạt động cực nhanh trên các CPU biên và thiết bị IoT công suất thấp.
  • Phát hiện vật thể nhỏ được cải thiện: Sự tích hợp của các hàm mất mát ProgLoss và STAL mang lại những cải tiến đáng kể trong việc nhận diện vật thể nhỏ, điều rất quan trọng đối với aerial imagery.
  • Tính linh hoạt mở rộng: Khác với PP-YOLOE+ vốn chỉ tập trung nghiêm ngặt vào detection, YOLO26 xử lý mượt mà pose estimation, oriented bounding boxes (OBB), và semantic segmentation với các cải tiến kiến trúc dành riêng cho từng tác vụ.

Kết luận#

DAMO-YOLO và PP-YOLOE+ đại diện cho những cột mốc quan trọng trong sự phát triển của phát hiện đối tượng không cần neo (anchor-free). DAMO-YOLO đã đẩy giới hạn của việc tìm kiếm kiến trúc thần kinh cho độ trễ biên, trong khi PP-YOLOE+ đã chứng minh sức mạnh của việc tiền đào tạo quy mô lớn.

Tuy nhiên, đối với các lập trình viên tìm kiếm sự cân bằng tốt nhất giữa tốc độ, độ chính xác và sự đơn giản trong triển khai, model Ultralytics YOLO26 là sự lựa chọn dứt khoát. Kiến trúc không cần NMS, Python API mạnh mẽ, và khả năng tích hợp mượt mà với các công cụ như Weights & BiasesTensorRT đảm bảo các dự án của bạn chuyển đổi suôn sẻ từ nguyên mẫu sang môi trường production.

Sẵn sàng để bắt đầu? Khám phá Ultralytics Quickstart Guide hoặc so sánh thêm các model trong tổng quan YOLO11 vs DAMO-YOLO của chúng tôi.

Người đóng góp

Bình luận