Ultralytics YOLO27:
Get Started

PP-YOLOE+ và YOLOv9#

Lĩnh vực thị giác máy tính thời gian thực không ngừng thay đổi, khi các nhà nghiên cứu và nhà phát triển liên tục mở rộng giới hạn về độ chính xác và tốc độ inference. Khi so sánh PP-YOLOE+ và YOLOv9, chúng ta đang xem xét hai triết lý khác biệt về kiến trúc model và thiết kế hệ sinh thái.

Bài so sánh kỹ thuật toàn diện này phân tích các cải tiến kiến trúc, chỉ số hiệu năng, phương pháp huấn luyện và trường hợp sử dụng lý tưởng của chúng, giúp bạn chọn model phát hiện đối tượng phù hợp cho lần triển khai tiếp theo.

Dòng dõi model và nền tảng kỹ thuật#

Hiểu rõ nguồn gốc và lựa chọn kiến trúc của các model này là yếu tố then chốt để xác định mức độ phù hợp với các dự án thị giác máy tính của bạn.

Tổng quan về PP-YOLOE+#

Được phát triển bởi các tác giả PaddlePaddle tại Baidu, PP-YOLOE+ ra mắt vào ngày 2 tháng 4 năm 2022. Model này kế thừa các phiên bản trước trong framework PaddleDetection để mang lại khả năng phát hiện đối tượng hiệu năng cao.

PP-YOLOE+ giới thiệu kiến trúc không anchor mạnh mẽ, được tối ưu sâu cho việc triển khai trong hệ sinh thái PaddlePaddle. Model sử dụng backbone CSPRepResNet được điều chỉnh và ET-head để cải thiện trích xuất đặc trưng cũng như hồi quy hộp giới hạn. Dù đạt độ chính xác trung bình (mAP) cao, việc phụ thuộc vào framework PaddlePaddle đôi khi gây khó khăn tích hợp cho các nhà phát triển quen dùng PyTorch hoặc TensorFlow.

Tìm hiểu thêm về PP-YOLOE+

Tổng quan về YOLOv9#

Được giới thiệu bởi Chien-Yao Wang và Hong-Yuan Mark Liao thuộc Viện Khoa học Thông tin, Academia Sinica, Đài Loan, YOLOv9 đánh dấu bước tiến đáng kể trong việc xử lý hiệu quả các nút thắt thông tin của deep learning.

  • Tác giả: Chien-Yao Wang và Hong-Yuan Mark Liao
  • Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
  • Ngày: 2024-02-21
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Bước đột phá chính của YOLOv9 là Programmable Gradient Information (PGI), giúp ngăn mất dữ liệu khi đặc trưng đi qua các mạng nơ-ron sâu. Kết hợp với Generalized Efficient Layer Aggregation Network (GELAN), YOLOv9 tối đa hóa hiệu quả tham số và luồng tính toán. Ngoài ra, model được tích hợp sẵn vào hệ sinh thái Ultralytics, giúp cả ứng dụng nghiên cứu lẫn thương mại đều dễ dàng tiếp cận.

Tìm hiểu thêm về YOLOv9

Các model Ultralytics khác

Nếu đang tìm hiểu các lựa chọn tiên tiến nhất, bạn cũng có thể quan tâm đến YOLO11 và RT-DETR, hai model mang lại những mức cân bằng khác nhau giữa độ chính xác dựa trên Transformer và hiệu năng thời gian thực trên thiết bị biên.

So sánh hiệu năng và chỉ số#

Khi phân tích hiệu năng thuần, YOLOv9 cho thấy hiệu quả tham số vượt trội. Model đạt độ chính xác tương đương hoặc cao hơn trong khi cần ít tham số và FLOPs hơn, từ đó giảm yêu cầu VRAM khi huấn luyện model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Như bảng cho thấy, YOLOv9c đạt mAP 53.0 với số lượng tham số ít hơn đáng kể (25.5M) so với PP-YOLOE+l tương đương (52.2M). Mức sử dụng bộ nhớ thấp hơn này khiến YOLOv9 trở thành lựa chọn vượt trội cho các nhà phát triển làm việc với tài nguyên GPU hạn chế.

Hệ sinh thái, tính linh hoạt và mức độ dễ sử dụng#

Ưu thế nổi bật của YOLOv9 nằm ở khả năng tích hợp liền mạch với hệ sinh thái Ultralytics được duy trì tốt. Trong khi PP-YOLOE+ đòi hỏi phải xử lý các file cấu hình PaddlePaddle phức tạp, YOLOv9 có lợi thế từ Python API tinh gọn.

Python API của Ultralytics cho phép nhà phát triển tải trọng số đã huấn luyện trước, quản lý tăng cường dữ liệu và bắt đầu huấn luyện chỉ với lượng code khung tối thiểu.

from ultralytics import YOLO

# Tải model YOLOv9 đã được huấn luyện trước
model = YOLO("yolov9c.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy suy luận trên một ảnh
results = model("https://ultralytics.com/images/bus.jpg")

# # Xuất model sang định dạng ONNX
model.export(format="onnx")

Ngoài ra, hệ sinh thái Ultralytics mang đến tính linh hoạt vượt trội. Ngoài phát hiện hộp giới hạn, framework còn hỗ trợ sẵn phân đoạn đối tượng, ước tính tư thế và phát hiện hộp giới hạn định hướng (OBB). Nhờ vậy, việc điều chỉnh model cho các pipeline thực tế phức tạp trở nên vô cùng hiệu quả.

Các tùy chọn xuất model

Các model được huấn luyện bằng framework Ultralytics có thể xuất sang nhiều định dạng, bao gồm TensorRT và OpenVINO, đảm bảo inference được tối ưu cao trên nhiều loại phần cứng.

Trường hợp sử dụng và khuyến nghị#

Việc chọn PP-YOLOE+ hay YOLOv9 phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và lựa chọn hệ sinh thái.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ là lựa chọn phù hợp trong các trường hợp:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
  • Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.

Khi nào nên chọn YOLOv9#

YOLOv9 được khuyến nghị cho:

  • Nghiên cứu về nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
  • Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các lớp mạng sâu khi huấn luyện.
  • Đánh giá hiệu năng phát hiện độ chính xác cao: Các tình huống cần hiệu năng mạnh của YOLOv9 trên benchmark COCO làm mốc tham chiếu để so sánh kiến trúc.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Nhìn về phía trước: Ưu thế của YOLO26#

Dù PP-YOLOE+ và YOLOv9 đều mạnh mẽ, YOLO26 mới ra mắt là bước tiến tiếp theo mang tính định hướng cho môi trường production. Ra mắt vào tháng 1 năm 2026, YOLO26 thiết lập tiêu chuẩn mới cho điện toán biên và triển khai trên cloud. Chúng tôi đặc biệt khuyến nghị YOLO26 cho mọi dự án thị giác máy tính mới nhờ những cải tiến đột phá:

  • Thiết kế đầu cuối không cần NMS: YOLO26 hỗ trợ inference đầu cuối gốc, loại bỏ nhu cầu hậu xử lý Non-Maximum Suppression (NMS) khi chạy với nms=False. Điều này giúp đơn giản hóa đáng kể pipeline triển khai và giảm độ trễ.
  • CPU inference nhanh hơn tới 43%: Nhờ tối ưu kiến trúc chuyên biệt cho điện toán biên, YOLO26 nhanh hơn đáng kể trên phần cứng không có GPU chuyên dụng.
  • Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ, giúp đơn giản hóa việc xuất model và cải thiện đáng kể khả năng tương thích với thiết bị biên công suất thấp.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện model ngôn ngữ lớn (như Kimi K2 của Moonshot AI), phương pháp kết hợp SGD và Muon này đảm bảo quá trình huấn luyện ổn định và hội tụ nhanh.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, nâng cấp thiết yếu cho ảnh chụp từ trên không và robotics.
  • Cải tiến theo tác vụ: YOLO26 bao gồm các kiến trúc được tùy chỉnh cho những tác vụ cụ thể, chẳng hạn proto đa tỷ lệ cho segmentation và Residual Log-Likelihood Estimation (RLE) cho ước tính tư thế.

Bạn có thể dễ dàng huấn luyện và triển khai model YOLO26 thông qua Ultralytics Platform, giải pháp tất cả trong một cho gán nhãn dataset, huấn luyện trên cloud và giám sát model.

Ứng dụng thực tế#

Việc chọn giữa các kiến trúc này thường phụ thuộc vào môi trường triển khai mục tiêu của bạn.

PP-YOLOE+ thường được triển khai tại các trung tâm sản xuất công nghiệp, đặc biệt ở những khu vực mà tích hợp PaddlePaddle và bộ phần cứng của Baidu đã ăn sâu vào hạ tầng doanh nghiệp. Model này hoạt động xuất sắc trong phân tích ảnh tĩnh, nơi độ chính xác tuyệt đối được ưu tiên hơn các yêu cầu thời gian thực nghiêm ngặt.

YOLOv9 hoạt động hiệu quả trong các môi trường năng động đòi hỏi inference thời gian thực nhanh. Hiệu quả tham số vượt trội khiến model trở nên lý tưởng cho điều hướng drone tự hành và hệ thống an ninh chạy trên thiết bị biên. Ngoài ra, mức tiêu thụ VRAM thấp hơn giúp các nhà nghiên cứu dễ dàng bắt đầu huấn luyện trên GPU phổ thông.

Để đạt hiệu năng tốt nhất trong quản lý giao thông đô thị thông minh và robotics tốc độ cao, YOLO26 mới hơn là lựa chọn vượt trội, cung cấp inference đầu cuối tùy chọn mà không gặp phải chi phí phát sinh do nút thắt NMS.

Người đóng góp

Bình luận