YOLO Vision 2026:

PP-YOLOE+ so với DAMO-YOLO#

Sự phát triển không ngừng của thị giác máy tính đã tạo ra hàng loạt các kiến trúc chuyên biệt cao cho việc phát hiện đối tượng thời gian thực. Khi đánh giá các model cho các ứng dụng công nghiệp và nghiên cứu, hai framework nổi bật từ năm 2022 thường được đưa ra thảo luận: PP-YOLOE+ của Baidu và DAMO-YOLO của Alibaba Group. Cả hai model này đều mở rộng giới hạn của kỹ thuật phát hiện không sử dụng anchor bằng cách giới thiệu các backbone mới, chiến lược gán nhãn tiên tiến và các kỹ thuật kết hợp đặc trưng chuyên biệt.

Hướng dẫn này cung cấp phân tích kỹ thuật chi tiết về PP-YOLOE+ và DAMO-YOLO, khám phá kiến trúc, phương pháp huấn luyện và thế mạnh triển khai của chúng. Chúng tôi cũng sẽ kiểm tra cách các framework này so sánh với các giải pháp hiện đại như Ultralytics YOLO26 để giúp bạn chọn công cụ phù hợp với các ràng buộc triển khai cụ thể của mình.

PP-YOLOE+: Phát hiện đối tượng công nghiệp đã được tinh chỉnh#

Được phát triển trong Baidu ecosystem, PP-YOLOE+ là một bản cải tiến lặp đi lặp lại dựa trên PP-YOLOE ban đầu, được tối ưu hóa mạnh mẽ cho deep learning framework PaddlePaddle. Nó được thiết kế để tối đa hóa độ chính xác và tốc độ suy luận trên phần cứng cấp máy chủ, biến nó thành một ứng cử viên sáng giá cho các ứng dụng kiểm tra công nghiệp và smart retail.

Cải tiến kiến trúc#

PP-YOLOE+ giới thiệu một số cải tiến về kiến trúc để cải thiện so với các detector không sử dụng anchor trước đây:

  • Backbone CSPRepResNet: Backbone này sử dụng kiến trúc kiểu RepVGG kết hợp với các kết nối Cross Stage Partial (CSP), mang lại sự cân bằng tốt giữa khả năng trích xuất đặc trưng và độ trễ suy luận.
  • Task Alignment Learning (TAL): PP-YOLOE+ sử dụng chiến lược gán nhãn động tiên tiến giúp căn chỉnh các tác vụ phân loại và hồi quy trong quá trình huấn luyện, giảm khoảng cách giữa hiệu suất huấn luyện và suy luận.
  • Efficient Task-aligned Head (ET-head): Một detection head được tinh giản thiết kế để xử lý các đặc trưng nhanh chóng mà không làm giảm độ phân giải không gian, điều này rất có lợi cho việc duy trì các mAP metrics cao.

Chi tiết về PP-YOLOE+:

Tìm hiểu thêm về PP-YOLOE+

DAMO-YOLO: Tìm kiếm kiến trúc thần kinh tại biên#

Được tạo ra bởi Alibaba DAMO Academy, DAMO-YOLO áp dụng một cách tiếp cận hoàn toàn khác. Thay vì thiết kế backbone thủ công, nhóm nghiên cứu đã sử dụng Neural Architecture Search (NAS) để khám phá các cấu trúc mạng cực kỳ hiệu quả được điều chỉnh phù hợp cho các ràng buộc độ trễ nghiêm ngặt.

Các tính năng chính và Pipeline huấn luyện#

DAMO-YOLO nhấn mạnh độ trễ thấp và độ chính xác cao thông qua một phương pháp tự động và tập trung nhiều vào chưng cất:

  • MAE-NAS Backbones: Bằng cách sử dụng phương pháp tự động hóa tìm kiếm kiến trúc mạng hiệu quả (Method of Automating Efficient Neural Architecture Search), DAMO-YOLO xây dựng các backbone được tối ưu hóa riêng cho trade-off between parameters and accuracy.
  • Efficient RepGFPN: Một Generalized Feature Pyramid Network được tham số hóa lại cho phép kết hợp đặc trưng đa quy mô mạnh mẽ, giúp model phát hiện các đối tượng có kích thước rất khác nhau trong một khung hình duy nhất.
  • Thiết kế ZeroHead: Một head phát hiện được đơn giản hóa cao độ giúp cắt giảm đáng kể chi phí tính toán trong giai đoạn suy luận.
  • Tăng cường chưng cất: Để tăng hiệu suất của các biến thể nhỏ hơn, DAMO-YOLO dựa nhiều vào quy trình chưng cất tri thức phức tạp, nơi một model giáo viên lớn hơn hướng dẫn model học viên.

Thông tin chi tiết về DAMO-YOLO:

Tìm hiểu thêm về DAMO-YOLO

Sự phụ thuộc vào Framework

Mặc dù cả PP-YOLOE+ và DAMO-YOLO đều cung cấp các cải tiến lý thuyết mạnh mẽ, chúng lại gắn chặt với framework tương ứng của mình (PaddlePaddle và các môi trường cụ thể của Alibaba). Điều này có thể gây ra khó khăn khi cố gắng chuyển đổi các model này sang các triển khai cloud hoặc biên tiêu chuẩn hóa.

Phân tích Hiệu suất#

Khi đánh giá các model này, sự cân bằng giữa độ trễ, độ phức tạp tính toán (FLOPs) và mean Average Precision (mAP) sẽ quyết định môi trường triển khai lý tưởng của chúng.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

DAMO-YOLO thường đạt độ trễ TensorRT thấp hơn ở các quy mô nano và tiny, khiến nó có tính cạnh tranh cao cho các video stream thông lượng cao. Tuy nhiên, PP-YOLOE+ mở rộng quy mô cực kỳ tốt sang biến thể extra-large (x), đạt độ chính xác hàng đầu cho các hình ảnh phức tạp nơi thời gian suy luận là yếu tố phụ.

Lợi thế của Ultralytics: Vươn xa hơn các kiến trúc năm 2022#

Mặc dù PP-YOLOE+ và DAMO-YOLO đại diện cho các cột mốc quan trọng, quá trình phát triển hiện đại đòi hỏi tính linh hoạt cao hơn, các pipeline huấn luyện dễ dàng hơn và yêu cầu bộ nhớ thấp hơn. Ultralytics Platform giải quyết các nhu cầu này bằng cách cung cấp trải nghiệm không ma sát, vượt trội hoàn toàn so với quá trình chưng cất phức tạp và thiết lập dành riêng cho framework vốn bắt buộc ở các mô hình cũ.

Đối với các lập trình viên muốn đạt được sự cân bằng hiệu suất tốt nhất hiện nay, Ultralytics YOLO26 mang đến một bước nhảy vọt mang tính cách mạng về hiệu quả triển khai trong thế giới thực.

Tại sao YOLO26 dẫn đầu ngành#

Ra mắt vào đầu năm 2026, YOLO26 kế thừa di sản của YOLO11 bằng cách giới thiệu các công nghệ đột phá được thiết kế riêng cho môi trường production:

  • Thiết kế End-to-End NMS-Free: YOLO26 loại bỏ hậu xử lý Non-Maximum Suppression (NMS). Điều này giúp logic triển khai đơn giản hơn và độ trễ suy luận nhất quán, có thể dự đoán cao.
  • Trình tối ưu hóa MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện mô hình ngôn ngữ lớn, YOLO26 sử dụng trình tối ưu hóa MuSGD lai. Điều này đảm bảo việc huấn luyện cực kỳ ổn định và hội tụ nhanh, giúp tiết kiệm số giờ GPU quý giá.
  • Superior CPU Inference: Bằng cách loại bỏ Distribution Focal Loss (DFL) và tối ưu hóa biểu đồ mạng, YOLO26 đạt hiệu suất suy luận trên CPU nhanh hơn tới 43%, biến nó thành lựa chọn hàng đầu cho edge AI devices.
  • ProgLoss + STAL: Các hàm loss nâng cao này mang lại những cải tiến đáng kể trong việc nhận diện vật thể nhỏ, điều rất quan trọng đối với drone operations và viễn thám.
  • Unmatched Versatility: Không giống như PP-YOLOE+ chỉ tập trung hoàn toàn vào detection, YOLO26 hỗ trợ nguyên bản pose estimation, instance segmentation, image classification, và oriented bounding boxes (OBB) một cách mượt mà.

Dễ sử dụng và hiệu quả huấn luyện#

Huấn luyện một model DAMO-YOLO đòi hỏi phải quản lý một pipeline chưng cất giáo viên-học viên nặng nề. Ngược lại, huấn luyện một model Ultralytics chỉ cần vài dòng code Python, với mức sử dụng bộ nhớ CUDA tối thiểu so với các kiến trúc cạnh tranh.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model with native MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run an end-to-end NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")

Tìm hiểu thêm về YOLO26

Các trường hợp sử dụng lý tưởng và khuyến nghị#

Việc lựa chọn kiến trúc thị giác máy tính tối ưu phụ thuộc phần lớn vào sự tích hợp hệ sinh thái và mục tiêu triển khai của đội ngũ bạn.

  • Chọn PP-YOLOE+ nếu toàn bộ pipeline của bạn được nhúng sâu trong hệ sinh thái Baidu PaddlePaddle. Nó vẫn là lựa chọn tuyệt vời cho phân tích hình ảnh tĩnh trên các máy chủ mạnh mẽ, nơi việc tối đa hóa độ chính xác là mục tiêu chính.
  • Chọn DAMO-YOLO nếu bạn đang thực hiện nghiên cứu cụ thể về các thuật toán Neural Architecture Search, hoặc nếu bạn có đủ nguồn lực kỹ thuật để duy trì các pipeline chưng cất phức tạp nhằm đạt được các mục tiêu độ trễ TensorRT khắt khe.
  • Choose Ultralytics YOLO26 cho hầu hết mọi kịch bản production hiện đại. Ultralytics ecosystem cung cấp tài liệu chưa từng có, yêu cầu bộ nhớ thấp hơn và một API được tinh giản. Cho dù bạn đang xây dựng các hệ thống automated quality control hay chạy tracking thời gian thực trên Raspberry Pi, kiến trúc không cần NMS của YOLO26 đảm bảo kết quả nhanh chóng, ổn định và có độ chính xác cao ngay khi mở hộp.

Đối với các lập trình viên đang khám phá các giải pháp state-of-the-art khác, tài liệu của Ultralytics cũng cung cấp các nguồn tài nguyên phong phú về YOLOv8 được áp dụng rộng rãi và YOLO11 mạnh mẽ, đảm bảo bạn có mô hình phù hợp cho mọi thử thách computer vision.

Những người đóng góp

Bình luận