Ultralytics YOLO27:
Get Started

PP-YOLOE+ và YOLOv7#

Khi xây dựng pipeline thị giác máy tính, việc chọn đúng model phát hiện đối tượng là rất quan trọng. Hai kiến trúc nổi bật ra mắt năm 2022, PP-YOLOE+ và YOLOv7, đã mang đến những cải tiến mạnh mẽ cho tác vụ phát hiện đối tượng thời gian thực. Bài so sánh kỹ thuật này phân tích chuyên sâu kiến trúc, phương pháp huấn luyện và hiệu năng thực tế của hai model, giúp bạn đưa ra quyết định sáng suốt cho ứng dụng của mình.

Tổng quan về các model#

Cả PP-YOLOE+ và YOLOv7 đều được thiết kế để nâng cao giới hạn về độ chính xác và tốc độ, nhưng chúng xuất phát từ các hệ sinh thái phát triển và triết lý thiết kế khác nhau.

PP-YOLOE+#

Được phát triển bởi các tác giả PaddlePaddle tại Baidu, PP-YOLOE+ kế thừa model PP-YOLOv2 ban đầu. Model này được giới thiệu nhằm cung cấp một bộ phát hiện đối tượng hiệu quả, có độ chính xác cao và được tối ưu cho hệ sinh thái PaddlePaddle.

Tìm hiểu thêm về PP-YOLOE+

YOLOv7#

Được phát triển bởi Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao, YOLOv7 đã giới thiệu “trainable bag-of-freebies” để thiết lập các chuẩn mực tiên tiến nhất vào thời điểm phát hành cho bộ phát hiện đối tượng thời gian thực.

Tìm hiểu thêm về YOLOv7

Các cải tiến kiến trúc#

Kiến trúc PP-YOLOE+#

PP-YOLOE+ chủ yếu dựa trên phương pháp anchor-free, giúp đơn giản hóa quá trình triển khai bằng cách loại bỏ nhu cầu tinh chỉnh anchor box cho các dataset tùy chỉnh. Model tích hợp backbone RepResNet mạnh mẽ và PAN theo phong cách CSPNet (Mạng tổng hợp đường dẫn) để hợp nhất đặc trưng đa tỷ lệ hiệu quả. Ngoài ra, model tận dụng khái niệm Học căn chỉnh tác vụ (TAL) để căn chỉnh động các tác vụ phân loại và định vị trong quá trình huấn luyện, đảm bảo độ chính xác cao trên nhiều tác vụ thị giác máy tính.

Kiến trúc YOLOv7#

YOLOv7 áp dụng phương pháp khác khi giới thiệu Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Kiến trúc này cho phép mạng học các đặc trưng đa dạng hơn mà không phá vỡ đường truyền gradient ban đầu, từ đó cải thiện khả năng hội tụ. YOLOv7 cũng tận dụng tối đa kỹ thuật tái tham số hóa model—cụ thể là các convolution được tái tham số hóa theo kế hoạch—để hợp nhất các lớp convolution trong quá trình suy luận, tăng tốc thực thi mà không làm giảm độ chính xác. Nhờ vậy, YOLOv7 đặc biệt mạnh trong các tác vụ như theo dõi nhiều đối tượng và các hệ thống cảnh báo an ninh phức tạp.

Khác biệt về hệ sinh thái

Trong khi PP-YOLOE+ tích hợp chặt chẽ với framework PaddlePaddle của Baidu, YOLOv7 được xây dựng bằng PyTorch, vốn có cộng đồng lớn hơn và khả năng tương thích rộng hơn ngay khi cài đặt với các pipeline triển khai như ONNX và TensorRT.

Phân tích hiệu năng#

Khi cân bằng tốc độ, số lượng tham số và độ chính xác (mAP), các model thể hiện ưu thế khác nhau tùy thuộc vào biến thể cụ thể và phần cứng mục tiêu. Dưới đây là phần so sánh toàn diện các chỉ số của chúng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Mặc dù model PP-YOLOE+x đạt mAP nhỉnh hơn một chút, các biến thể YOLOv7 có tỷ lệ tham số/độ chính xác rất tốt. Kiến trúc YOLOv7 vẫn được ưa chuộng khi xử lý trực tiếp trên GPU, nơi tối ưu hóa TensorRT mang lại độ trễ cực thấp.

Lợi thế của Ultralytics#

Khi huấn luyện và triển khai các model này, framework bạn chọn cũng quan trọng không kém bản thân model. Sử dụng Ultralytics mang lại trải nghiệm người dùng liền mạch nhờ Python API thống nhất cao, giúp đơn giản hóa toàn bộ vòng đời machine learning.

  • Hệ sinh thái được duy trì tốt: Các model Ultralytics YOLO được hưởng lợi từ hệ sinh thái liên tục được cập nhật, tài liệu toàn diện và cộng đồng năng động.
  • Yêu cầu bộ nhớ: Ultralytics tối ưu hóa mạnh mẽ quy trình tải dữ liệu và chế độ huấn luyện. Việc huấn luyện các model Ultralytics YOLO thường cần ít bộ nhớ CUDA hơn nhiều so với các kiến trúc dựa trên Transformer nặng nề, cho phép nhà phát triển sử dụng batch size lớn hơn trên phần cứng phổ thông.
  • Hiệu quả huấn luyện: Nhờ tận dụng các chiến lược tăng cường dữ liệu mạnh mẽ và tính năng tinh chỉnh hyperparameter tích hợp, Ultralytics đảm bảo model hội tụ nhanh với các pretrained weight sẵn có.

Triển khai API đơn giản#

Gói Ultralytics không hỗ trợ huấn luyện YOLOv7 nguyên bản (xem tài liệu YOLOv7 để chạy các bản export YOLOv7 upstream), nhưng chỉ cần vài dòng code để huấn luyện một model Ultralytics YOLO hiện đại, hoàn toàn không cần xử lý các script huấn luyện phức tạp:

from ultralytics import YOLO

# Tải model YOLO26 đã pretrained
model = YOLO("yolo26n.pt")

# Huấn luyện model trên dataset tùy chỉnh của bạn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export sang TensorRT để triển khai
model.export(format="engine", device=0)

Tiêu chuẩn mới: Giới thiệu YOLO26#

Mặc dù PP-YOLOE+ và YOLOv7 là những cột mốc trong lĩnh vực phát hiện đối tượng, AI đang phát triển nhanh chóng. Với mọi dự án thị giác máy tính mới, chúng tôi đặc biệt khuyến nghị Ultralytics YOLO26. Ra mắt vào tháng 1 năm 2026, YOLO26 đánh dấu bước tiến vượt bậc của AI thị giác, ưu tiên edge.

Vì sao YOLO26 vượt trội hơn các kiến trúc cũ:

  • Thiết kế end-to-end không cần NMS: YOLO26 vốn được thiết kế theo hướng end-to-end. Bằng cách bỏ qua bước hậu xử lý Ức chế phi cực đại (NMS) với head one-to-one tùy chọn (nms=False), model đảm bảo độ trễ suy luận có thể dự đoán và xác định—một bước đột phá lần đầu xuất hiện trong YOLOv10.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quá trình export và cải thiện đáng kể khả năng tương thích với các thiết bị edge công suất thấp.
  • Suy luận CPU nhanh hơn đến 43%: Trong các tình huống không có GPU chuyên dụng—chẳng hạn như cảm biến IoT cho thành phố thông minh—YOLO26 được tối ưu mạnh để chạy hiệu quả trực tiếp trên CPU.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến (như Kimi K2 của Moonshot AI), YOLO26 sử dụng phương pháp kết hợp SGD và Muon để huấn luyện ổn định vượt trội và hội tụ nhanh.
  • ProgLoss + STAL: Các hàm loss cải tiến này giúp nâng cao đáng kể khả năng phát hiện đối tượng nhỏ, yếu tố thiết yếu trong các trường hợp sử dụng như ảnh chụp trên không bằng drone và phát hiện lỗi sản xuất.

Trường hợp sử dụng và kịch bản triển khai lý tưởng#

Khi nào nên dùng PP-YOLOE+#

PP-YOLOE+ phát huy thế mạnh khi bạn sử dụng sâu hệ sinh thái Baidu và PaddlePaddle. Nếu mục tiêu triển khai của bạn sử dụng phần cứng chuyên biệt được thiết kế cho model Paddle (ví dụ: trong một số pipeline sản xuất tại châu Á), PP-YOLOE+ mang lại độ chính xác cao và khả năng tích hợp liền mạch. Model đặc biệt hiệu quả cho tự động hóa sản xuất công nghiệp.

Khi nào nên dùng YOLOv7#

YOLOv7 vẫn là lựa chọn tuyệt vời cho suy luận hiệu năng cao nói chung, đặc biệt khi triển khai trên phần cứng NVIDIA sử dụng TensorRT. Khả năng tích hợp vào hệ sinh thái PyTorch giúp model linh hoạt cao trong nghiên cứu học thuật và các pipeline thương mại tùy chỉnh, chẳng hạn như quản lý đám đông thời gian thực hoặc các tác vụ ước tính tư thế phức tạp, nơi tính toàn vẹn cấu trúc của mạng là yếu tố then chốt.

Các model khác cần cân nhắc#

Tùy theo nhu cầu cụ thể, bạn cũng có thể muốn so sánh các kiến trúc này với YOLO11 để có tính linh hoạt rộng và sẵn sàng cho môi trường production, hoặc với RT-DETR nếu dự án cần những ưu điểm đặc thù của vision Transformer so với mạng convolution truyền thống.

Kết luận#

Cả PP-YOLOE+ và YOLOv7 đều mang lại những cải tiến đáng kể cho lĩnh vực phát hiện đối tượng thời gian thực. PP-YOLOE+ nổi bật trong các môi trường tiêu chuẩn hóa quanh PaddlePaddle, còn YOLOv7 mang lại tính linh hoạt và hiệu năng vượt trội thông qua hệ sinh thái PyTorch.

Tuy nhiên, khi các giải pháp thị giác máy tính tiếp tục phát triển, việc sử dụng công cụ hiện đại là điều thiết yếu. Bằng cách áp dụng Ultralytics Platform và các kiến trúc thế hệ mới như YOLO26, nhà phát triển có thể đảm bảo ứng dụng luôn dẫn đầu về tốc độ, độ chính xác và tính dễ sử dụng.

Người đóng góp

Bình luận