Ultralytics YOLO27:

PP-YOLOE+ so với YOLOv10#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các model mới liên tục mở rộng giới hạn của những gì có thể thực hiện trong bài toán phát hiện đối tượng theo thời gian thực. Trong bài so sánh kỹ thuật toàn diện này, chúng ta sẽ xem xét PP-YOLOE+YOLOv10, hai kiến trúc mạnh được thiết kế cho các hệ sinh thái khác nhau. Chúng ta cũng sẽ tìm hiểu cách bức tranh tổng thể đang chuyển dịch sang các nền tảng thống nhất, dễ sử dụng hơn như Ultralytics Platform và model YOLO26 tiên tiến nhất.

Giới thiệu về các Model#

Việc lựa chọn nền tảng phù hợp cho các dự án thị giác máy tính đòi hỏi hiểu biết sâu về những đánh đổi trong kiến trúc, các ràng buộc triển khai và mức độ hỗ trợ của hệ sinh thái của từng model.

Tổng quan về PP-YOLOE+#

Được phát triển bởi các tác giả PaddlePaddle tại Baidu, PP-YOLOE+ là một bước tiến hóa so với các phiên bản trước trong hệ sinh thái PaddleDetection.

Ưu điểm: PP-YOLOE+ phát huy hiệu quả trong các môi trường tích hợp sâu với framework PaddlePaddle. Model này giới thiệu backbone CSPRepResNet tiên tiến và sử dụng chiến lược gán nhãn mạnh mẽ (TAL) để đạt độ chính xác trung bình (mAP) ấn tượng. Model được tối ưu hóa cao cho việc triển khai trên GPU cấp máy chủ, vốn phổ biến trong các ứng dụng công nghiệp tại châu Á.

Nhược điểm: Hạn chế chính của PP-YOLOE+ là sự phụ thuộc lớn vào hệ sinh thái PaddlePaddle, vốn có thể kém trực quan hơn đối với các developer quen dùng PyTorch. Ngoài ra, model yêu cầu sử dụng phương pháp loại bỏ hộp chồng lấn tối đa (NMS) truyền thống để hậu xử lý, làm tăng độ trễ và độ phức tạp khi triển khai.

Tìm hiểu thêm về PP-YOLOE+

Tổng quan về YOLOv10#

Được công bố bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 đã tạo ra một chuyển dịch lớn về mô hình kiến trúc bằng cách loại bỏ NMS khỏi pipeline suy luận.

Ưu điểm: Điểm nổi bật của YOLOv10 là cơ chế gán kép nhất quán cho quá trình huấn luyện không cần NMS. Điều này có nghĩa là model dự đoán BBox một cách nguyên bản mà không cần bước lọc thứ cấp, giúp triển khai model đơn giản và nhanh hơn đáng kể trên các thiết bị biên. Model đạt được sự cân bằng xuất sắc giữa số lượng tham số thấp và độ chính xác cao.

Nhược điểm: Dù rất hiệu quả đối với phát hiện đối tượng 2D tiêu chuẩn, YOLOv10 không có hỗ trợ nguyên bản cho các tác vụ thị giác máy tính quan trọng khác như phân đoạn instanceước lượng pose, từ đó hạn chế tính linh hoạt trong các pipeline đa tác vụ phức tạp.

Tìm hiểu thêm về YOLOv10

Đang cân nhắc các lựa chọn nâng cao?

Nếu bạn đang tìm hiểu những cải tiến mới nhất trong phát hiện theo thời gian thực, hãy xem hướng dẫn của chúng tôi về YOLO11 hoặc RT-DETR dựa trên Transformer cho các ứng dụng thị giác có độ chính xác cao.

So sánh hiệu năng và các chỉ số#

Việc hiểu cách các model này hoạt động trên các benchmark tiêu chuẩn hóa là yếu tố quan trọng để lựa chọn kiến trúc phù hợp. Dưới đây là phần so sánh chi tiết về kích thước, độ chính xác và độ trễ của chúng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Phân tích kỹ thuật#

Khi phân tích dữ liệu, một số xu hướng chính bắt đầu xuất hiện. Các model nano và small của YOLOv10 tập trung mạnh vào hiệu quả trên thiết bị biên, trong đó YOLOv10n chỉ có 2,3 triệu tham số và 6.7B FLOPs. Thiết kế nhẹ này, kết hợp với kiến trúc không cần NMS, giúp giảm đáng kể độ trễ trên các nền tảng sử dụng TensorRTOpenVINO.

Ngược lại, PP-YOLOE+ thể hiện năng lực mạnh ở các lớp trọng số lớn hơn, với biến thể X-large nhỉnh hơn YOLOv10x một chút về mAP (54,7% so với 54,4%). Tuy nhiên, điều này đi kèm với số lượng tham số gần gấp đôi (98.42M so với 56.9M), khiến YOLOv10x trở thành model hiệu quả hơn đáng kể trong các môi trường bị giới hạn bộ nhớ.

Lợi thế từ hệ sinh thái Ultralytics#

Mặc dù cả PP-YOLOE+ và YOLOv10 đều đạt được những thành tựu kỹ thuật đáng chú ý, hoạt động ML engineering hiện đại đòi hỏi nhiều hơn một kiến trúc thuần túy; nó cần một hệ sinh thái được duy trì tốt.

Ultralytics cung cấp Python SDK hàng đầu trong ngành, giúp đơn giản hóa đáng kể việc thu thập và gắn nhãn dữ liệu, huấn luyện và triển khai. So với các framework nghiên cứu cồng kềnh hoặc các model Transformer cũ hơn, kiến trúc Ultralytics chỉ cần một phần nhỏ bộ nhớ CUDA trong quá trình huấn luyện, cho phép sử dụng batch size lớn hơn và lặp nhanh hơn. Ngoài ra, bộ công cụ Ultralytics mang lại tính linh hoạt cao—hỗ trợ phân loại ảnh, OBB (Hộp giới hạn định hướng) và tracking đối tượng mạnh mẽ ngay khi cài đặt.

YOLO26 xuất hiện: Thế hệ tiếp theo#

Được phát hành vào tháng 1 năm 2026, Ultralytics YOLO26 đại diện cho đỉnh cao của quá trình phát triển thị giác máy tính, kết hợp những hiểu biết tốt nhất từ các model như YOLOv10 đồng thời khắc phục những hạn chế của chúng.

Các cải tiến chính của YOLO26:

  • Thiết kế đầu-cuối không cần NMS: Dựa trên khái niệm tiên phong trong YOLOv10, YOLO26 có kiến trúc đầu-cuối nguyên bản, loại bỏ hoàn toàn bước hậu xử lý NMS để triển khai nhanh hơn và đơn giản hơn trên nhiều loại phần cứng.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), kiến trúc model được đơn giản hóa đáng kể cho quá trình export, đảm bảo khả năng tương thích ổn định với các thiết bị edge AI công suất thấp.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện mô hình ngôn ngữ lớn (chẳng hạn như Kimi K2 của Moonshot AI), YOLO26 sử dụng sự kết hợp giữa SGD và Muon. Điều này mang lại độ ổn định huấn luyện chưa từng có và tốc độ hội tụ nhanh hơn đáng kể.
  • Suy luận trên CPU nhanh hơn tới 43%: Được tối ưu hóa mạnh cho các tình huống thực tế, YOLO26 mang lại mức tăng tốc lớn cho các ứng dụng dựa trên năng lực tính toán của CPU, rất phù hợp cho giám sát thông minh và triển khai trên thiết bị di động.
  • ProgLoss + STAL: Các hàm loss cải tiến này giúp tăng đáng kể hiệu suất nhận diện đối tượng nhỏ, một yếu tố quan trọng đối với ảnh chụp từ trên khôngrobotics.
  • Cải tiến theo từng tác vụ: Không giống YOLOv10, YOLO26 hỗ trợ nguyên bản proto đa tỷ lệ cho phân đoạn và Residual Log-Likelihood Estimation (RLE) cho ước lượng pose.

Triển khai thực tế#

Việc bắt đầu với các model Ultralytics được thiết kế để diễn ra dễ dàng. Chỉ với vài dòng code, bạn có thể khởi chạy một phiên huấn luyện bằng tính năng tự động tinh chỉnh hyperparameter và các pipeline tăng cường dữ liệu hiện đại.

from ultralytics import YOLO

# Load the highly recommended YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset
# Memory usage is highly optimized compared to transformer architectures
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Run an end-to-end NMS-free inference
inference_results = model("https://ultralytics.com/images/bus.jpg")

# Export directly to ONNX or TensorRT for deployment
model.export(format="onnx", simplify=True)

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa PP-YOLOE+ và YOLOv10 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ là lựa chọn phù hợp cho:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện có được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có các kernel suy luận được tối ưu cao, dành riêng cho engine suy luận Paddle Lite hoặc Paddle.
  • Phát hiện phía server độ chính xác cao: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên các server GPU mạnh, nơi sự phụ thuộc vào framework không phải là vấn đề.

Khi nào nên chọn YOLOv10#

YOLOv10 được khuyến nghị cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện đầu cuối mà không cần triệt tiêu cực đại, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các project yêu cầu sự cân bằng tốt giữa tốc độ suy luận và độ chính xác phát hiện trên nhiều quy mô model khác nhau.
  • Ứng dụng có độ trễ nhất quán: Các kịch bản triển khai mà thời gian suy luận có thể dự đoán là yếu tố quan trọng, chẳng hạn như robotics hoặc các hệ thống tự hành.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Kết luận#

PP-YOLOE+ vẫn là một lựa chọn đáng tin cậy cho các đội ngũ bị ràng buộc trong hệ sinh thái Baidu và các môi trường máy chủ công nghiệp. YOLOv10 là một cột mốc học thuật nổi bật, chứng minh tính khả thi của phát hiện theo thời gian thực không cần NMS.

Tuy nhiên, đối với các developer tìm kiếm sự kết hợp tối ưu giữa độ chính xác, tốc độ suy luận vượt trội và khả năng đa tác vụ liền mạch, Ultralytics YOLO26 là lựa chọn dứt khoát. Những cải tiến về hiệu quả huấn luyện và kiến trúc triển khai ưu tiên thiết bị biên giúp model trở thành giải pháp mạnh mẽ và linh hoạt nhất cho thị giác máy tính cấp production trong năm 2026 và các năm tiếp theo.

Những người đóng góp

Bình luận