Ultralytics YOLO27:

So sánh YOLOv9 và PP-YOLOE+#

Hệ sinh thái phát hiện đối tượng theo thời gian thực tiếp tục phát triển nhanh chóng, mang đến cho các kỹ sư thị giác máy tính nhiều lựa chọn để triển khai các model có độ chính xác cao trên hạ tầng edge và cloud. Hai model nổi bật trong lĩnh vực này là YOLOv9PP-YOLOE+. Mặc dù cả hai đều mở rộng giới hạn về độ chính xác và tốc độ, chúng xuất phát từ các dòng nghiên cứu và hệ sinh thái phần mềm khác nhau.

Bài so sánh kỹ thuật toàn diện này phân tích kiến trúc, phương pháp training, các metric hiệu năng và những ứng dụng thực tế phù hợp của hai model. Chúng tôi cũng sẽ tìm hiểu cách hệ sinh thái Ultralytics mang lại những lợi thế đáng kể cho các developer ưu tiên tính dễ sử dụng, hiệu quả bộ nhớ và khả năng triển khai linh hoạt.

Nguồn gốc và thông số kỹ thuật của model#

Việc hiểu bối cảnh hình thành của các model này giúp làm rõ những quyết định về kiến trúc và các dependency framework của chúng.

YOLOv9: Giải quyết nút thắt thông tin#

Được giới thiệu vào đầu năm 2024, YOLOv9 giải quyết vấn đề mất dữ liệu xảy ra khi thông tin truyền qua các mạng neural sâu. Đây là một mạng neural tích chập được tối ưu hóa cao, được thiết kế để tối đa hóa hiệu quả sử dụng parameter.

Tìm hiểu thêm về YOLOv9

PP-YOLOE+: Thúc đẩy hệ sinh thái Paddle#

Được Baidu phát hành vào năm 2022, PP-YOLOE+ là một cải tiến lặp trên PP-YOLOv2. Model này sử dụng mô hình không anchor và đưa vào chiến lược gán label động để cải thiện khả năng hội tụ và độ chính xác trong framework PaddlePaddle.

Tìm hiểu thêm về PP-YOLOE+

So sánh kiến trúc#

Programmable Gradient Information và CSPRepResStage#

Đổi mới cốt lõi trong YOLOv9 là Thông tin Gradient Có thể Lập trình (PGI). PGI hoạt động như một framework supervision bổ trợ, đảm bảo thông tin gradient quan trọng được bảo toàn và truyền chính xác ngược về các layer nông trong quá trình training. Cơ chế này kết hợp với Mạng Tổng hợp Layer Hiệu quả Tổng quát (GELAN), tận dụng ưu điểm của CSPNet và ELAN để đạt độ chính xác cao đồng thời giảm mạnh chi phí tính toán (FLOPs).

PP-YOLOE+ dựa trên một backbone chuyên biệt có tên là CSPRepResStage. Model này tận dụng các kỹ thuật tái tham số hóa (tương tự những kỹ thuật trong RepVGG) để tăng tốc inference bằng cách hợp nhất các layer convolution trong quá trình deployment. Ngoài ra, model sử dụng head Efficient Task-aligned (ET-head) để cân bằng các tác vụ classification và regression.

Mặc dù PP-YOLOE+ mạnh mẽ, kiến trúc GELAN của YOLOv9 thường yêu cầu dấu chân bộ nhớ nhỏ hơn trong cả training và inference, khiến model này đặc biệt phù hợp với thiết bị edge AI.

So sánh hiệu năng#

Khi đánh giá model cho môi trường production, sự cân bằng giữa mAP (Độ chính xác trung bình) , tốc độ inference và kích thước model là yếu tố then chốt.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Phân tích#

  • Hiệu quả parameter: YOLOv9 đạt hiệu quả cao hơn đáng kể. Chẳng hạn, YOLOv9c đạt mAP 53,0% chỉ với 25,3M parameter, trong khi PP-YOLOE+l cần hơn gấp đôi số parameter (52,2M) để đạt mAP thấp hơn một chút là 52,9%. Điều này làm giảm đáng kể yêu cầu bộ nhớ của YOLOv9.
  • Tốc độ inference: Các model YOLOv9 được tối ưu hóa xuất sắc cho các hardware accelerator như TensorRT, mang lại tốc độ inference cạnh tranh trên GPU NVIDIA T4, yếu tố quan trọng đối với inference theo thời gian thực.

Phương pháp huấn luyện và hệ sinh thái#

Việc lựa chọn giữa các model này thường phụ thuộc vào hệ sinh thái phần mềm.

PP-YOLOE+ và PaddlePaddle#

PP-YOLOE+ được tích hợp chặt chẽ với bộ PaddleDetection. Dù mạnh mẽ, framework này yêu cầu người dùng làm việc trong một môi trường nặng về configuration và vận hành qua command line. Đối với các team gắn bó sâu với hệ sinh thái PyTorch hoặc TensorFlow, việc chuyển sang PaddlePaddle tạo ra nhiều trở ngại đáng kể và đường cong học tập dốc hơn.

Lợi thế của Ultralytics: Workflow tinh gọn#

Ngược lại, YOLOv9 hoạt động trong hệ sinh thái Ultralytics được hoàn thiện cao. Được thiết kế cho developer và researcher, Ultralytics ưu tiên tính dễ sử dụng vượt trội. Python API loại bỏ hoàn toàn phần boilerplate code phức tạp.

from ultralytics import YOLO

# Load a pre-trained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Run inference and visualize results
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for production deployment
model.export(format="onnx")

Workflow này làm nổi bật Hiệu quả Training vượt trội của các model Ultralytics. Hỗ trợ native cho data augmentation, distributed training và tự động logging lên các nền tảng như Weights & Biases hoặc MLflow được cung cấp sẵn.

Khám phá những tiến bộ mới nhất trong Vision AI

Mặc dù YOLOv9 mang lại hiệu năng xuất sắc, chúng tôi đặc biệt khuyến nghị cân nhắc Ultralytics YOLO26 mới phát hành cho các project mới. YOLO26 có Thiết kế End-to-End không cần NMS native, giúp đơn giản hóa đáng kể việc deployment. Với Loại bỏ DFL (loại bỏ Distribution Focal Loss để đơn giản hóa quá trình export và cải thiện khả năng tương thích với các thiết bị edge/low-power), model này mang lại inference CPU nhanh hơn tới 43% cho edge computing. Được hỗ trợ bởi Optimizer MuSGD, model đảm bảo training ổn định và hội tụ nhanh. Ngoài ra, ProgLoss + STAL cung cấp các loss function cải tiến, với những cải thiện đáng kể trong khả năng nhận diện object nhỏ—yếu tố quan trọng đối với IoT, robotics và ảnh chụp từ trên không.

Tính linh hoạt và hỗ trợ tác vụ#

Các project thị giác máy tính hiện đại hiếm khi chỉ dừng ở những bounding box đơn giản.

PP-YOLOE+ chủ yếu được thiết kế cho tác vụ phát hiện đối tượng tiêu chuẩn. Việc điều chỉnh kiến trúc cho các tác vụ khác đòi hỏi nhiều công sức engineering tùy chỉnh.

Ngược lại, framework Ultralytics là một nền tảng multi-task mạnh mẽ. Thông qua API thống nhất, developer có thể dễ dàng chuyển từ phát hiện đối tượng tiêu chuẩn sang Instance Segmentation phức tạp, Pose Estimation có độ chính xác cao, phát hiện Bounding Box Định hướng (OBB) cho ảnh chụp từ trên không và Classification hình ảnh. Tính linh hoạt vượt trội này là lý do các team doanh nghiệp liên tục lựa chọn những model Ultralytics như YOLOv9, YOLO11 và YOLO26.

Các trường hợp sử dụng và ứng dụng lý tưởng#

  • Phân tích thành phố thông minh và quản lý giao thông: Hiệu quả parameter cao và độ trễ thấp của YOLOv9 (và YOLO26 kế nhiệm) khiến chúng lý tưởng để triển khai trên hardware edge hạn chế tài nguyên (như các thiết bị NVIDIA Jetson) nhằm giám sát luồng giao thông và an ninh đô thị.
  • Hệ thống quản lý hàng tồn kho bán lẻ: Để phát hiện các tập hợp dày đặc của những mặt hàng nhỏ trên kệ, PGI của YOLOv9 duy trì hiệu quả các chi tiết không gian ở mức tinh, vượt trội PP-YOLOE+ trong các tác vụ phát hiện object nhỏ.
  • Triển khai hệ thống legacy: PP-YOLOE+ vẫn là một lựa chọn khả thi, nhưng chỉ dành cho các team bắt buộc phải sử dụng stack phần mềm Baidu/PaddlePaddle trong hạ tầng legacy hiện có.

Đối với các researcher khám phá kiến trúc dựa trên Transformer, Ultralytics cũng hỗ trợ native RT-DETR trong cùng một API dễ sử dụng, đảm bảo bạn luôn có quyền truy cập vào model tối ưu cho các yêu cầu deployment cụ thể của mình.

Những người đóng góp

Bình luận