Ultralytics YOLO27:
Get Started

PP-YOLOE+ và YOLOv10#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các model mới liên tục mở rộng giới hạn của khả năng phát hiện vật thể thời gian thực. Trong bài so sánh kỹ thuật toàn diện này, chúng ta sẽ xem xét PP-YOLOE+ và YOLOv10, hai kiến trúc mạnh mẽ được thiết kế cho các hệ sinh thái khác nhau. Chúng ta cũng sẽ tìm hiểu cách lĩnh vực rộng lớn hơn đang chuyển dịch sang các nền tảng thống nhất, dễ sử dụng như Ultralytics Platform và model tiên tiến nhất YOLO26.

Giới thiệu các model#

Để chọn nền tảng phù hợp cho các dự án thị giác máy tính, bạn cần hiểu sâu về sự đánh đổi trong kiến trúc của từng model, các ràng buộc triển khai và mức độ hỗ trợ của hệ sinh thái.

Tổng quan về PP-YOLOE+#

Được các tác giả PaddlePaddle tại Baidu phát triển, PP-YOLOE+ là bước tiến tiếp theo so với các phiên bản trước trong hệ sinh thái PaddleDetection.

Ưu điểm: PP-YOLOE+ hoạt động xuất sắc trong các môi trường tích hợp sâu với framework PaddlePaddle. Model giới thiệu backbone CSPRepResNet tiên tiến và sử dụng chiến lược gán nhãn mạnh mẽ (TAL) để đạt độ chính xác trung bình (mAP) ấn tượng. Model được tối ưu cao để triển khai trên GPU cấp máy chủ thường dùng trong các ứng dụng công nghiệp tại châu Á.

Nhược điểm: Hạn chế chính của PP-YOLOE+ là phụ thuộc nhiều vào hệ sinh thái PaddlePaddle, vốn có thể kém trực quan hơn đối với các nhà phát triển quen dùng PyTorch. Ngoài ra, model cần Non-Maximum Suppression (NMS) truyền thống để hậu xử lý, làm tăng độ trễ và độ phức tạp khi triển khai.

Tìm hiểu thêm về PP-YOLOE+

Tổng quan về YOLOv10#

Do các nhà nghiên cứu tại Đại học Thanh Hoa phát hành, YOLOv10 tạo ra bước chuyển đổi đáng kể về mô hình kiến trúc bằng cách loại bỏ NMS khỏi quy trình suy luận.

Ưu điểm: Điểm nổi bật của YOLOv10 là cơ chế gán nhãn kép nhất quán cho quá trình huấn luyện không cần NMS. Nhờ đó, model dự đoán bounding box trực tiếp mà không cần bước lọc thứ hai, giúp triển khai model đơn giản và nhanh hơn nhiều trên thiết bị biên. Model đạt được sự cân bằng tuyệt vời giữa số lượng tham số thấp và độ chính xác cao.

Nhược điểm: Dù rất hiệu quả trong tác vụ phát hiện vật thể 2D tiêu chuẩn, YOLOv10 không hỗ trợ sẵn các tác vụ thị giác máy tính thiết yếu khác như phân đoạn instance và ước tính tư thế, hạn chế tính linh hoạt trong các quy trình phức tạp, đa tác vụ.

Tìm hiểu thêm về YOLOv10

Bạn đang cân nhắc các giải pháp nâng cao?

Nếu bạn đang tìm hiểu những cải tiến mới nhất trong phát hiện thời gian thực, hãy đọc hướng dẫn về YOLO11 hoặc RT-DETR dựa trên Transformer dành cho các ứng dụng thị giác có độ chính xác cao.

So sánh hiệu năng và chỉ số#

Hiểu rõ hiệu năng của các model này trên những bộ benchmark tiêu chuẩn là yếu tố then chốt để chọn kiến trúc phù hợp. Dưới đây là phần so sánh chi tiết về kích thước, độ chính xác và độ trễ của các model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

Phân tích kỹ thuật#

Khi phân tích dữ liệu, có thể nhận thấy một vài xu hướng chính. Các model nano và small của YOLOv10 tập trung mạnh vào hiệu quả trên thiết bị biên, trong đó YOLOv10n chỉ có 2.3 triệu tham số và 6.7B FLOPs. Thiết kế gọn nhẹ này, kết hợp với kiến trúc không cần NMS, giúp giảm đáng kể độ trễ trên các nền tảng sử dụng TensorRT và OpenVINO.

Ngược lại, PP-YOLOE+ thể hiện năng lực vượt trội ở các nhóm model có trọng số lớn hơn; biến thể X-large nhỉnh hơn YOLOv10x một chút về mAP (54.7% so với 54.4%). Tuy nhiên, điều này đánh đổi bằng số lượng tham số cao hơn gấp ba lần (98.42M so với 29.5M), khiến YOLOv10x trở thành model hiệu quả hơn đáng kể trong môi trường hạn chế bộ nhớ.

Lợi thế của hệ sinh thái Ultralytics#

Dù PP-YOLOE+ và YOLOv10 đều có những thành tựu kỹ thuật đáng chú ý, kỹ thuật ML hiện đại đòi hỏi nhiều hơn một kiến trúc đơn thuần; điều cần thiết là một hệ sinh thái được duy trì tốt.

Ultralytics cung cấp Python SDK hàng đầu trong ngành, giúp đơn giản hóa đáng kể việc thu thập và gán nhãn dữ liệu, huấn luyện và triển khai. So với các framework nghiên cứu cồng kềnh hoặc các model Transformer đời cũ, kiến trúc Ultralytics chỉ cần một phần nhỏ bộ nhớ CUDA khi huấn luyện, cho phép sử dụng batch size lớn hơn và rút ngắn thời gian lặp. Ngoài ra, bộ công cụ Ultralytics rất linh hoạt, hỗ trợ phân loại ảnh, OBB (Hộp giới hạn định hướng) và theo dõi đối tượng mạnh mẽ ngay khi cài đặt.

Ra mắt YOLO26: Thế hệ tiếp theo#

Ra mắt vào tháng 1 năm 2026, Ultralytics YOLO26 là đỉnh cao trong quá trình phát triển của thị giác máy tính, kết hợp những ưu điểm của các model như YOLOv10 đồng thời khắc phục các hạn chế của chúng.

Những cải tiến chính của YOLO26:

  • Thiết kế đầu cuối không cần NMS: Phát triển từ ý tưởng tiên phong trong YOLOv10, YOLO26 cung cấp head đầu cuối tùy chọn (nms=False), loại bỏ bước hậu xử lý NMS để triển khai nhanh hơn, đơn giản hơn trên nhiều loại phần cứng.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), kiến trúc model được đơn giản hóa đáng kể để xuất model, đảm bảo tương thích hoàn toàn với thiết bị AI biên công suất thấp.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện model ngôn ngữ lớn (chẳng hạn Kimi K2 của Moonshot AI), YOLO26 sử dụng phương pháp kết hợp SGD và Muon. Phương pháp này mang lại độ ổn định huấn luyện chưa từng có và tốc độ hội tụ nhanh hơn đáng kể.
  • CPU inference nhanh hơn tới 43%: Được tối ưu mạnh cho các tình huống thực tế, YOLO26 tăng tốc đáng kể cho các ứng dụng dựa vào tính toán CPU, rất phù hợp với giám sát thông minh và triển khai trên thiết bị di động.
  • ProgLoss + STAL: Các hàm loss được cải tiến này giúp tăng đáng kể hiệu năng nhận diện đối tượng nhỏ, yếu tố then chốt đối với ảnh chụp từ trên không và robotics.
  • Cải tiến theo tác vụ: Khác với YOLOv10, YOLO26 hỗ trợ sẵn proto đa tỷ lệ cho segmentation và Residual Log-Likelihood Estimation (RLE) cho ước tính tư thế.

Triển khai thực tế#

Quy trình bắt đầu sử dụng model Ultralytics được thiết kế để thuận tiện tối đa. Chỉ với vài dòng code, bạn có thể khởi chạy quá trình huấn luyện bằng các pipeline tăng cường dữ liệu hiện đại.

from ultralytics import YOLO

# Tải model YOLO26 được khuyến nghị cao
model = YOLO("yolo26n.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
# Mức sử dụng bộ nhớ được tối ưu hóa đáng kể so với các kiến trúc Transformer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Chạy inference đầu cuối không cần NMS
inference_results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Xuất trực tiếp sang ONNX hoặc TensorRT để triển khai
model.export(format="onnx", simplify=True)

Trường hợp sử dụng và khuyến nghị#

Việc chọn PP-YOLOE+ hay YOLOv10 phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và lựa chọn hệ sinh thái.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ là lựa chọn phù hợp trong các trường hợp:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
  • Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.

Khi nào nên chọn YOLOv10#

YOLOv10 được khuyến nghị cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
  • Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Kết luận#

PP-YOLOE+ vẫn là lựa chọn vững chắc cho các nhóm gắn bó với hệ sinh thái Baidu và môi trường máy chủ công nghiệp. YOLOv10 là một dấu mốc học thuật nổi bật, chứng minh tính khả thi của phát hiện thời gian thực không cần NMS.

Tuy nhiên, với các nhà phát triển cần sự kết hợp tối ưu giữa độ chính xác, tốc độ inference vượt trội và khả năng đa tác vụ liền mạch, Ultralytics YOLO26 là lựa chọn hàng đầu. Những cải tiến về hiệu quả huấn luyện và kiến trúc ưu tiên triển khai trên thiết bị biên giúp model trở thành giải pháp mạnh mẽ và linh hoạt nhất cho thị giác máy tính cấp production trong năm 2026 và những năm tiếp theo.

Người đóng góp

Bình luận