Ultralytics YOLO27:
Get Started

PP-YOLOE+ vs YOLOX#

Bức tranh thị giác máy tính đã được định hình đáng kể bởi sự phát triển nhanh chóng của các model phát hiện đối tượng. Trong số những cột mốc đáng chú ý có PP-YOLOE+ và YOLOX, hai kiến trúc mở rộng giới hạn về hiệu năng và độ chính xác thời gian thực. Việc hiểu rõ khác biệt trong kiến trúc, sự đánh đổi về hiệu năng và các tình huống triển khai lý tưởng là rất quan trọng đối với nhà nghiên cứu và nhà phát triển đang xây dựng thế hệ tiếp theo của hệ thống nhận diện hình ảnh.

Nguồn gốc và thông tin chi tiết về model#

Trước khi đi sâu vào kiến trúc kỹ thuật, việc tìm hiểu bối cảnh ra đời của cả hai model sẽ rất hữu ích. Mỗi model được phát triển để giải quyết các nút thắt cụ thể trong phát hiện đối tượng, chịu ảnh hưởng lớn từ tổ chức đứng sau.

Thông tin chi tiết về PP-YOLOE+:

Tìm hiểu thêm về PP-YOLOE+

Thông tin YOLOX:

Tìm hiểu thêm về YOLOX

Các cải tiến kiến trúc#

Khác biệt cốt lõi giữa hai detector này nằm ở cách tiếp cận trích xuất đặc trưng và dự đoán bounding box.

YOLOX tạo tiếng vang vào năm 2021 khi chuyển đổi thành công dòng YOLO sang thiết kế không cần anchor. Bằng cách loại bỏ anchor box, YOLOX giảm đáng kể số lượng tham số thiết kế và mức độ tinh chỉnh heuristic cần thiết cho dataset tùy chỉnh. Model cũng giới thiệu head tách rời, chia tác vụ phân loại và định vị thành các luồng xử lý riêng biệt trong mạng nơ-ron. Sự tách biệt này giải quyết xung đột vốn có giữa phân loại đối tượng và hồi quy tọa độ không gian, giúp hội tụ nhanh hơn trong quá trình huấn luyện.

PP-YOLOE+, do Baidu phát triển, được tối ưu hóa mạnh cho hệ sinh thái PaddlePaddle. Model kế thừa các thế hệ trước, PP-YOLOE và PP-YOLOv2, đồng thời giới thiệu chiến lược gán nhãn động (TAL) và backbone mới có tên CSPRepResNet. Backbone này tận dụng kỹ thuật tái tham số hóa cấu trúc, cho phép model hưởng lợi từ kiến trúc nhiều nhánh phức tạp trong quá trình huấn luyện, sau đó gộp liền mạch thành mạng một nhánh có tốc độ cao để suy luận.

Tái tham số hóa cấu trúc

Tái tham số hóa cấu trúc cho phép model huấn luyện với nhiều nhánh song song (cải thiện luồng gradient), sau đó gộp các nhánh đó về mặt toán học thành một lớp tích chập duy nhất để triển khai, tăng tốc độ suy luận mà không làm giảm độ chính xác.

So sánh hiệu năng và chỉ số#

Khi so sánh trực tiếp các model này, có thể thấy chúng phục vụ những nhu cầu hơi khác nhau trong phổ hiệu năng. PP-YOLOE+ thường đạt độ chính xác tuyệt đối cao hơn, trong khi YOLOX nổi bật với các biến thể cực kỳ gọn nhẹ, phù hợp với phần cứng bị giới hạn nghiêm ngặt.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Lưu ý: Các giá trị tốt nhất trong từng nhóm cột liên quan được tô đậm bằng chữ đậm.

YOLOX có các biến thể nano và tiny, gần như không chiếm dung lượng đĩa hoặc bộ nhớ CUDA, còn PP-YOLOE+ mở rộng rất tốt trên phần cứng cấp máy chủ, trở thành lựa chọn đáng tin cậy cho các ứng dụng công nghiệp nặng trong hệ sinh thái Baidu.

Ứng dụng thực tế#

Việc lựa chọn giữa các framework này thường phụ thuộc vào yêu cầu tích hợp và mục tiêu phần cứng.

Điểm mạnh của YOLOX#

Nhờ đặc tính không cần anchor và có các biến thể edge cực nhỏ, YOLOX phổ biến trong lĩnh vực robotics và triển khai trên vi điều khiển. Pipeline hậu xử lý đơn giản giúp chuyển model sang các định dạng phần cứng NPU tùy chỉnh như TensorRT và NCNN dễ dàng hơn.

Điểm mạnh của PP-YOLOE+#

Đối với các tổ chức tích hợp sâu vào những trung tâm sản xuất châu Á sử dụng stack công nghệ của Baidu, PP-YOLOE+ cung cấp lộ trình triển khai được tối ưu hóa sẵn. Model nổi bật trong các tình huống kiểm tra chất lượng độ chính xác cao, chạy trên các cụm máy chủ mạnh, nơi giới hạn thời gian thực nghiêm ngặt cho phép sử dụng model nặng hơn một chút.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa PP-YOLOE+ và YOLOX phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và ưu tiên hệ sinh thái của bạn.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ là lựa chọn phù hợp trong các trường hợp:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
  • Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.

Khi nào nên chọn YOLOX#

YOLOX được khuyến nghị cho:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các head phát hiện hoặc hàm loss mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động đời cũ, nơi kích thước cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các dự án nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên vận tải tối ưu và ảnh hưởng của chúng đến quá trình hội tụ khi huấn luyện.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Lợi thế Ultralytics: Giới thiệu YOLO26#

Mặc dù PP-YOLOE+ và YOLOX là những cột mốc nghiên cứu xuất sắc, bối cảnh triển khai hiện đại đòi hỏi trải nghiệm nhất quán hơn, thân thiện với developer hơn và hiệu quả vượt trội. Đây là lúc Ultralytics YOLO26 hoàn toàn định nghĩa lại tiêu chuẩn cho AI thị giác hiện đại.

Với các nhóm muốn chuyển từ những repository nghiên cứu riêng lẻ sang hệ thống sẵn sàng đưa vào production, Ultralytics cung cấp một hệ sinh thái mạnh mẽ, được duy trì tốt. Việc train model không còn đòi hỏi cấu hình môi trường phức tạp; chỉ cần truy cập một Python API thống nhất.

Các ưu điểm chính của Ultralytics YOLO26 gồm:

  • Thiết kế end-to-end không cần NMS: Khác với PP-YOLOE+ và YOLOX, vốn cần Ức chế phi cực đại (NMS) để lọc các bounding box trùng lặp, YOLO26 có head end-to-end tích hợp sẵn (nms=False). Thiết kế này loại bỏ các nút thắt về độ trễ và đơn giản hóa đáng kể logic triển khai.
  • Inference trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ Distribution Focal Loss (DFL) một cách có chủ đích, YOLO26 đạt tốc độ inference vượt trội trên phần cứng CPU, khiến model này phù hợp hơn hẳn cho điện toán biên và các thiết bị tiêu thụ ít năng lượng.
  • Optimizer MuSGD: Lấy cảm hứng từ Kimi K2 của Moonshot AI, optimizer lai này đưa độ ổn định khi train LLM vào thị giác máy tính, giúp hội tụ nhanh hơn nhiều và giảm thiểu yêu cầu bộ nhớ trong quá trình train.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, một tính năng quan trọng trong hoạt động của drone và xử lý ảnh chụp từ trên không có độ chi tiết cao.
  • Tính linh hoạt: Trong khi PP-YOLOE+ và YOLOX chỉ tập trung vào detection, YOLO26 xử lý liền mạch phân đoạn instance, ước tính tư thế và Bounding Box có định hướng (OBB) bằng cùng một cú pháp trực quan.

Quy trình train tinh gọn với Ultralytics#

Các model Ultralytics có hiệu quả sử dụng bộ nhớ và tốc độ train vượt trội, hoàn toàn vượt qua những lựa chọn thay thế dựa trên Transformer vốn cần lượng bộ nhớ CUDA khổng lồ. Bạn có thể khai thác sức mạnh của YOLO26 chỉ với vài dòng code:

from ultralytics import YOLO

# Tải model nano YOLO26 end-to-end có hiệu quả cao
model = YOLO("yolo26n.pt")

# Huấn luyện trên dataset mẫu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Đánh giá hiệu năng của model
metrics = model.val()

# Export liền mạch sang ONNX hoặc TensorRT
model.export(format="engine")
Khám phá Ultralytics Platform

Với các nhóm cần giải pháp không cần code, Ultralytics Platform cung cấp tính năng train trên cloud, gán nhãn dataset tích hợp và triển khai chỉ bằng một cú nhấp chuột cho tất cả model YOLO của bạn.

Kết luận#

PP-YOLOE+ và YOLOX đều có vị trí trong lịch sử thị giác máy tính, lần lượt nhờ độ chính xác cao và thiết kế anchor-free gọn nhẹ. Tuy nhiên, với các tổ chức đang xây dựng tương lai của AI trong nông nghiệp, thành phố thông minh và bán lẻ, khả năng bảo trì liên tục, tính dễ sử dụng và kiến trúc không cần NMS tích hợp của Ultralytics YOLO26 khiến model này trở thành lựa chọn không thể bàn cãi.

Nếu bạn đang tìm hiểu các kiến trúc thay thế cho benchmark cụ thể, hãy tham khảo tài liệu Ultralytics toàn diện để so sánh YOLO11 phiên bản cũ hơn hoặc các lựa chọn dựa trên Transformer như RT-DETR. Bằng cách chuyển sang hệ sinh thái Ultralytics thống nhất, developer tiết kiệm thời gian và nguồn lực quý giá, đồng thời đạt được kết quả tiên tiến nhất khi triển khai trên edge hoặc cloud.

Người đóng góp

Bình luận