Ultralytics YOLO27:

PP-YOLOE+ so với DAMO-YOLO#

Sự phát triển không ngừng của thị giác máy tính đã tạo ra nhiều kiến trúc chuyên biệt cao cho bài toán phát hiện đối tượng theo thời gian thực. Khi đánh giá các model cho ứng dụng công nghiệp và nghiên cứu, hai framework nổi bật từ năm 2022 thường được đưa ra thảo luận là: PP-YOLOE+ của Baidu và DAMO-YOLO của Alibaba Group. Cả hai model đều mở rộng giới hạn của phương pháp phát hiện không anchor bằng cách giới thiệu backbone mới, chiến lược gán nhãn nâng cao và các kỹ thuật hợp nhất đặc trưng chuyên biệt.

Hướng dẫn này cung cấp phân tích kỹ thuật chi tiết về PP-YOLOE+ và DAMO-YOLO, tập trung vào kiến trúc, phương pháp training và thế mạnh triển khai của chúng. Chúng tôi cũng sẽ xem xét cách các framework này so sánh với những giải pháp hiện đại như Ultralytics YOLO26 để giúp bạn lựa chọn công cụ phù hợp với các ràng buộc triển khai cụ thể.

PP-YOLOE+: Phát hiện đối tượng công nghiệp được tinh chỉnh#

Được phát triển trong hệ sinh thái Baidu, PP-YOLOE+ là phiên bản cải tiến lặp lại từ PP-YOLOE ban đầu, được tối ưu mạnh cho framework deep learning PaddlePaddle. Model này được thiết kế để tối đa hóa độ chính xác và tốc độ inference trên phần cứng cấp server, trở thành lựa chọn phù hợp cho kiểm tra công nghiệp và các ứng dụng bán lẻ thông minh.

Các cải tiến về kiến trúc#

PP-YOLOE+ giới thiệu một số cải tiến kiến trúc nhằm nâng cao hiệu quả so với các bộ phát hiện không anchor trước đây:

  • Backbone CSPRepResNet: Backbone này sử dụng kiến trúc theo phong cách RepVGG kết hợp với các kết nối Partial giữa các stage (CSP), mang lại sự cân bằng tốt giữa năng lực trích xuất đặc trưng và độ trễ inference.
  • Task Alignment Learning (TAL): PP-YOLOE+ sử dụng chiến lược gán nhãn động nâng cao, căn chỉnh các task classification và regression trong quá trình training, qua đó giảm khoảng cách giữa hiệu năng training và inference.
  • Efficient Task-aligned Head (ET-head): Detection head tinh gọn được thiết kế để xử lý đặc trưng nhanh chóng mà không làm giảm độ phân giải không gian, đặc biệt có lợi cho việc duy trì các metric mAP cao.

Thông tin chi tiết về PP-YOLOE+:

Tìm hiểu thêm về PP-YOLOE+

DAMO-YOLO: Tìm kiếm kiến trúc neural trên thiết bị edge#

Được tạo ra bởi Alibaba DAMO Academy, DAMO-YOLO áp dụng một hướng tiếp cận khác biệt rõ rệt. Thay vì tự thiết kế backbone, nhóm nghiên cứu sử dụng Tìm kiếm kiến trúc neural (NAS) để tìm ra các topology mạng hiệu quả cao, được điều chỉnh cho những ràng buộc nghiêm ngặt về độ trễ.

Các tính năng chính và pipeline training#

DAMO-YOLO nhấn mạnh độ trễ thấp và độ chính xác cao thông qua phương pháp tự động hóa với mức độ sử dụng distillation cao:

  • MAE-NAS Backbones: Bằng cách tận dụng Maximum Entropy Neural Architecture Search, DAMO-YOLO xây dựng các backbone được tối ưu hóa đặc biệt cho trade-off between parameters and accuracy.
  • Efficient RepGFPN: Generalized Feature Pyramid Network được tái tham số hóa cho phép hợp nhất đặc trưng đa tỷ lệ mạnh mẽ, giúp model phát hiện các đối tượng có kích thước rất khác nhau trong cùng một frame.
  • Thiết kế ZeroHead: Detection head được đơn giản hóa cao, giúp cắt giảm đáng kể overhead tính toán trong giai đoạn inference.
  • Cải tiến bằng distillation: Để nâng cao hiệu năng của các biến thể nhỏ hơn, DAMO-YOLO phụ thuộc nhiều vào quy trình knowledge distillation phức tạp, trong đó một model teacher lớn hơn hướng dẫn model student.

Thông tin DAMO-YOLO:

Tìm hiểu thêm về DAMO-YOLO

Phụ thuộc chặt vào framework

Mặc dù PP-YOLOE+ và DAMO-YOLO đều mang đến những đổi mới lý thuyết mạnh mẽ, chúng bị liên kết chặt với các framework tương ứng (PaddlePaddle và những môi trường riêng của Alibaba). Điều này có thể gây khó khăn khi chuyển các model này sang những môi trường triển khai cloud hoặc edge tiêu chuẩn hóa.

Phân tích hiệu năng#

Khi đánh giá các model này, sự đánh đổi giữa độ trễ, độ phức tạp tính toán (FLOPs) và Độ chính xác trung bình (mAP) sẽ quyết định môi trường triển khai lý tưởng của chúng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

DAMO-YOLO thường đạt độ trễ TensorRT thấp hơn ở các quy mô nano và tiny, khiến model này có tính cạnh tranh cao đối với các luồng video thông lượng lớn. Tuy nhiên, PP-YOLOE+ mở rộng rất tốt lên biến thể extra-large (x), đạt độ chính xác hàng đầu cho hình ảnh phức tạp trong những trường hợp thời gian inference không phải ưu tiên chính.

Lợi thế của Ultralytics: Vượt qua các kiến trúc năm 2022#

Mặc dù PP-YOLOE+ và DAMO-YOLO từng là những cột mốc quan trọng, quá trình phát triển hiện đại đòi hỏi tính linh hoạt cao hơn, pipeline training dễ dàng hơn và yêu cầu bộ nhớ thấp hơn. Ultralytics Platform đáp ứng các nhu cầu này bằng cách cung cấp trải nghiệm không ma sát, vượt trội rõ rệt so với quy trình distillation phức tạp và thiết lập phụ thuộc framework cần thiết cho các model cũ hơn.

Đối với các developer muốn đạt được sự cân bằng hiệu năng tốt nhất hiện nay, Ultralytics YOLO26 mang đến bước tiến đột phá về hiệu quả triển khai trong thực tế.

Vì sao YOLO26 dẫn đầu ngành#

Được phát hành vào đầu năm 2026, YOLO26 kế thừa nền tảng của YOLO11 bằng cách giới thiệu các công nghệ đột phá được thiết kế cho môi trường production:

  • Thiết kế end-to-end không cần NMS: YOLO26 loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS). Điều này giúp logic triển khai đơn giản hơn và mang lại độ trễ inference ổn định, dễ dự đoán.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật training large language model, YOLO26 sử dụng optimizer MuSGD lai. Điều này bảo đảm quá trình training cực kỳ ổn định và hội tụ nhanh, tiết kiệm nhiều giờ GPU có giá trị.
  • Inference CPU vượt trội: Bằng cách loại bỏ Distribution Focal Loss (DFL) và tối ưu graph của mạng, YOLO26 đạt inference CPU nhanh hơn tới 43%, trở thành lựa chọn hàng đầu cho các thiết bị AI edge.
  • ProgLoss + STAL: Các hàm loss nâng cao này mang lại cải thiện đáng kể trong việc nhận diện đối tượng nhỏ, yếu tố quan trọng đối với hoạt động của drone và viễn thám.
  • Tính linh hoạt vượt trội: Không giống PP-YOLOE+ vốn chỉ tập trung vào detection, YOLO26 hỗ trợ nguyên bản ước lượng pose, phân đoạn instance, classification ảnhbounding box định hướng (OBB) một cách liền mạch.

Tính dễ sử dụng và hiệu quả huấn luyện#

Training một model DAMO-YOLO yêu cầu quản lý pipeline distillation teacher-student nặng và phức tạp. Ngược lại, training một model Ultralytics chỉ cần vài dòng Python, với mức sử dụng bộ nhớ CUDA tối thiểu so với các kiến trúc cạnh tranh.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model with native MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run an end-to-end NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")

Các trường hợp sử dụng lý tưởng và khuyến nghị#

Việc lựa chọn kiến trúc thị giác máy tính tối ưu phụ thuộc nhiều vào khả năng tích hợp với hệ sinh thái của team và mục tiêu triển khai.

  • Chọn PP-YOLOE+ nếu toàn bộ pipeline của bạn được tích hợp sâu trong hệ sinh thái Baidu PaddlePaddle. Đây vẫn là lựa chọn xuất sắc cho việc phân tích ảnh tĩnh trên các server mạnh, nơi tối đa hóa độ chính xác là mục tiêu hàng đầu.
  • Chọn DAMO-YOLO nếu bạn đang thực hiện nghiên cứu chuyên sâu về các thuật toán Tìm kiếm kiến trúc neural, hoặc nếu bạn có đủ nguồn lực engineering để duy trì các pipeline distillation phức tạp nhằm đạt mục tiêu độ trễ TensorRT ở mức rất thấp.
  • Chọn Ultralytics YOLO26 cho hầu hết mọi kịch bản sản xuất hiện đại. Ultralytics ecosystem cung cấp tài liệu vô song, yêu cầu bộ nhớ thấp hơn và một API được hợp lý hóa. Cho dù bạn đang xây dựng các hệ thống automated quality control hay chạy tính năng theo dõi thời gian thực trên Raspberry Pi, kiến trúc không cần NMS của YOLO26 đảm bảo kết quả nhanh chóng, ổn định và có độ chính xác cao ngay khi xuất xưởng.

Đối với các developer đang tìm hiểu những giải pháp hiện đại khác, tài liệu Ultralytics cũng cung cấp nhiều tài nguyên chuyên sâu về YOLOv8 được áp dụng rộng rãi và YOLO11 mạnh mẽ, giúp bạn có model phù hợp cho mọi thách thức về thị giác máy tính.

Những người đóng góp

Bình luận