Ultralytics YOLO27:
Get Started

PP-YOLOE+ vs DAMO-YOLO#

Sự phát triển liên tục của thị giác máy tính đã tạo ra hàng loạt kiến trúc chuyên biệt cao cho phát hiện đối tượng thời gian thực. Khi đánh giá model cho ứng dụng công nghiệp và nghiên cứu, hai framework nổi bật từ năm 2022 thường được nhắc đến: PP-YOLOE+ của Baidu và DAMO-YOLO của Alibaba Group. Cả hai model đều mở rộng giới hạn của phương pháp phát hiện không cần anchor bằng cách giới thiệu backbone mới, chiến lược gán nhãn nâng cao và kỹ thuật hợp nhất đặc trưng chuyên biệt.

Hướng dẫn này phân tích kỹ thuật chi tiết PP-YOLOE+ và DAMO-YOLO, tìm hiểu kiến trúc, phương pháp huấn luyện và ưu điểm triển khai của hai model. Chúng ta cũng sẽ xem xét cách các framework này so sánh với những giải pháp hiện đại như Ultralytics YOLO26, giúp bạn chọn công cụ phù hợp với các giới hạn triển khai cụ thể.

PP-YOLOE+: Phát hiện đối tượng công nghiệp được cải tiến#

Được phát triển trong hệ sinh thái Baidu, PP-YOLOE+ là phiên bản cải tiến lặp lại của PP-YOLOE gốc, được tối ưu hóa mạnh cho framework deep learning PaddlePaddle. Model được thiết kế để tối đa hóa độ chính xác và tốc độ suy luận trên phần cứng cấp máy chủ, trở thành lựa chọn phù hợp cho kiểm tra công nghiệp và các ứng dụng bán lẻ thông minh.

Các cải tiến kiến trúc#

PP-YOLOE+ giới thiệu một số cải tiến kiến trúc nhằm nâng cấp các detector không cần anchor thế hệ trước:

  • Backbone CSPRepResNet: Backbone này sử dụng kiến trúc kiểu RepVGG kết hợp với các kết nối Cross Stage Partial (CSP), tạo nên sự cân bằng tốt giữa khả năng trích xuất đặc trưng và độ trễ suy luận.
  • Task Alignment Learning (TAL): PP-YOLOE+ sử dụng chiến lược gán nhãn động nâng cao, căn chỉnh các tác vụ phân loại và hồi quy trong quá trình huấn luyện, thu hẹp khoảng cách giữa hiệu năng huấn luyện và suy luận.
  • Head Efficient Task-aligned (ET-head): Head phát hiện tinh gọn, được thiết kế để xử lý đặc trưng nhanh mà không làm giảm độ phân giải không gian, rất hữu ích để duy trì các chỉ số mAP cao.

Thông tin chi tiết về PP-YOLOE+:

Tìm hiểu thêm về PP-YOLOE+

DAMO-YOLO: Tìm kiếm kiến trúc mạng trên thiết bị edge#

Được tạo ra bởi Alibaba DAMO Academy, DAMO-YOLO có cách tiếp cận khác biệt rõ rệt. Thay vì thiết kế backbone thủ công, nhóm nghiên cứu sử dụng Neural Architecture Search (NAS) để tìm ra các cấu trúc mạng hiệu quả cao, phù hợp với những giới hạn độ trễ nghiêm ngặt.

Các tính năng chính và pipeline huấn luyện#

DAMO-YOLO chú trọng độ trễ thấp và độ chính xác cao thông qua phương pháp tự động hóa, sử dụng nhiều kỹ thuật distillation:

  • Backbone MAE-NAS: Bằng cách sử dụng Maximum Entropy Neural Architecture Search, DAMO-YOLO xây dựng backbone được tối ưu hóa riêng cho sự đánh đổi giữa số lượng tham số và độ chính xác.
  • RepGFPN hiệu quả: Generalized Feature Pyramid Network được tái tham số hóa cho phép hợp nhất đặc trưng đa tỷ lệ ổn định, giúp model phát hiện các đối tượng có kích thước rất khác nhau trong cùng một khung hình.
  • Thiết kế ZeroHead: Head phát hiện được đơn giản hóa tối đa, giúp giảm đáng kể chi phí tính toán trong giai đoạn suy luận.
  • Cải tiến bằng distillation: Để nâng cao hiệu năng của các biến thể nhỏ hơn, DAMO-YOLO phụ thuộc nhiều vào quy trình knowledge distillation phức tạp, trong đó một model teacher lớn hơn hướng dẫn model student.

Thông tin về DAMO-YOLO:

Tìm hiểu thêm về DAMO-YOLO

Phụ thuộc vào framework

PP-YOLOE+ và DAMO-YOLO đều có những cải tiến lý thuyết vững chắc, nhưng gắn chặt với framework tương ứng (PaddlePaddle và các môi trường Alibaba cụ thể). Điều này có thể gây trở ngại khi chuyển các model sang triển khai cloud hoặc edge theo tiêu chuẩn.

Phân tích hiệu năng#

Khi đánh giá các model này, sự đánh đổi giữa độ trễ, độ phức tạp tính toán (FLOPs) và độ chính xác trung bình (mAP) quyết định môi trường triển khai lý tưởng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

DAMO-YOLOt có độ trễ TensorRT thấp hơn PP-YOLOE+t, còn DAMO-YOLO chính xác hơn ở quy mô tiny và small, khiến model có tính cạnh tranh cao với luồng video thông lượng lớn. Tuy nhiên, PP-YOLOE+ mở rộng rất tốt sang biến thể extra-large (x), đạt độ chính xác hàng đầu trên hình ảnh phức tạp khi thời gian suy luận không phải ưu tiên chính.

Lợi thế Ultralytics: Vượt xa kiến trúc năm 2022#

PP-YOLOE+ và DAMO-YOLO là những cột mốc quan trọng, nhưng hoạt động phát triển hiện đại đòi hỏi tính linh hoạt cao hơn, pipeline huấn luyện dễ dàng hơn và nhu cầu bộ nhớ thấp hơn. Ultralytics Platform đáp ứng những nhu cầu này bằng trải nghiệm liền mạch, vượt xa đáng kể quy trình distillation phức tạp và cấu hình đặc thù framework mà các model cũ yêu cầu.

Đối với nhà phát triển muốn đạt được sự cân bằng hiệu năng tốt nhất hiện nay, Ultralytics YOLO26 tạo ra bước đột phá mang tính cách mạng về hiệu quả triển khai thực tế.

Vì sao YOLO26 dẫn đầu ngành#

Ra mắt vào đầu năm 2026, YOLO26 kế thừa di sản của YOLO11 và giới thiệu các công nghệ đột phá dành riêng cho production:

  • Thiết kế end-to-end không cần NMS: YOLO26 có thể bỏ hoàn toàn bước hậu xử lý Non-Maximum Suppression (NMS) bằng head one-to-one tùy chọn (nms=False). Điều này giúp đơn giản hóa logic triển khai và duy trì độ trễ suy luận ổn định, dễ dự đoán.
  • Optimizer MuSGD: Lấy cảm hứng từ kỹ thuật huấn luyện model ngôn ngữ lớn, YOLO26 sử dụng optimizer MuSGD kết hợp. Phương pháp này đảm bảo quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh, tiết kiệm đáng kể thời gian GPU.
  • CPU inference vượt trội: Bằng cách loại bỏ Distribution Focal Loss (DFL) và tối ưu hóa đồ thị mạng, YOLO26 đạt tốc độ CPU inference nhanh hơn đến 43%, trở thành lựa chọn hàng đầu cho thiết bị AI edge.
  • ProgLoss + STAL: Các hàm loss nâng cao này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt trong hoạt động drone và viễn thám.
  • Tính linh hoạt vượt trội: Không giống PP-YOLOE+ vốn chỉ tập trung vào phát hiện, YOLO26 hỗ trợ gốc và liền mạch ước tính tư thế, phân đoạn instance, phân loại hình ảnh và Oriented Bounding Box (OBB).

Tính dễ sử dụng và hiệu quả huấn luyện#

Huấn luyện model DAMO-YOLO đòi hỏi quản lý pipeline distillation teacher-student cồng kềnh. Ngược lại, để huấn luyện model Ultralytics chỉ cần vài dòng Python, với mức sử dụng bộ nhớ CUDA tối thiểu so với các kiến trúc cạnh tranh.

from ultralytics import YOLO

# Khởi tạo model YOLO26 tiên tiến nhất
model = YOLO("yolo26n.pt")

# Huấn luyện model bằng optimizer MuSGD
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, optimizer="MuSGD")

# Chạy suy luận end-to-end không cần NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Xuất sang ONNX hoặc TensorRT liền mạch
model.export(format="onnx")

Trường hợp sử dụng và khuyến nghị lý tưởng#

Việc chọn kiến trúc thị giác máy tính tối ưu phụ thuộc nhiều vào mức độ tích hợp với hệ sinh thái và mục tiêu triển khai của nhóm.

  • Chọn PP-YOLOE+ nếu toàn bộ pipeline của bạn được tích hợp sâu vào hệ sinh thái Baidu PaddlePaddle. Model vẫn là lựa chọn xuất sắc cho phân tích ảnh tĩnh trên máy chủ mạnh, khi mục tiêu chính là tối đa hóa độ chính xác.
  • Chọn DAMO-YOLO nếu bạn đang nghiên cứu chuyên sâu các thuật toán Neural Architecture Search hoặc có đủ nguồn lực kỹ thuật để duy trì pipeline distillation phức tạp nhằm đạt mục tiêu độ trễ TensorRT đầy tham vọng.
  • Chọn Ultralytics YOLO26 cho hầu hết tình huống production hiện đại. Hệ sinh thái Ultralytics cung cấp tài liệu vượt trội, nhu cầu bộ nhớ thấp hơn và API tinh gọn. Dù bạn đang xây dựng hệ thống kiểm soát chất lượng tự động hay chạy tracking thời gian thực trên Raspberry Pi, kiến trúc không cần NMS của YOLO26 đảm bảo kết quả nhanh, ổn định và có độ chính xác cao ngay từ đầu.

Đối với nhà phát triển đang tìm hiểu các giải pháp hiện đại hàng đầu khác, tài liệu Ultralytics cũng cung cấp nhiều tài nguyên chuyên sâu về YOLOv8 được ứng dụng rộng rãi và YOLO11 mạnh mẽ, giúp bạn chọn đúng model cho mọi thách thức thị giác máy tính.

Người đóng góp

Bình luận