Ultralytics YOLO27:

So sánh YOLOX và PP-YOLOE+#

Khi thiết kế một pipeline thị giác máy tính mạnh mẽ, việc lựa chọn model phát hiện đối tượng phù hợp là một quyết định then chốt. Bối cảnh các bộ phát hiện đối tượng theo thời gian thực có tính cạnh tranh rất cao, với nhiều kiến trúc nỗ lực mang lại sự cân bằng tối ưu giữa tốc độ inference và độ chính xác phát hiện. Trong bài so sánh kỹ thuật này, chúng ta sẽ đánh giá hai model nổi bật: YOLOX và PP-YOLOE+. Bằng cách xem xét thiết kế kiến trúc, phương pháp huấn luyện và các chỉ số hiệu năng, chúng tôi hướng đến việc cung cấp cho các developer và nhà nghiên cứu những thông tin cần thiết để lựa chọn công cụ phù hợp với môi trường triển khai của mình.

Các đổi mới và thiết kế kiến trúc#

Cả hai model đều được thiết kế để giải quyết những điểm hạn chế cụ thể trong các phiên bản YOLO trước đây, nhưng chúng áp dụng những cách tiếp cận hoàn toàn khác nhau để xử lý sự đánh đổi giữa tốc độ và độ chính xác.

YOLOX: Kết nối Nghiên cứu và Ngành công nghiệp#

Được phát triển bởi Zheng Ge, Songtao Liu, Feng Wang, Zeming Li và Jian Sun tại Megvii, YOLOX được phát hành vào ngày 18 tháng 7 năm 2021. Model này đánh dấu một bước chuyển đáng kể trong dòng YOLO khi hoàn toàn áp dụng thiết kế không dùng anchor. Bạn có thể tìm hiểu nghiên cứu nền tảng trong bài báo Arxiv chính thức của họ và mã nguồn ban đầu trong repository YOLOX trên GitHub.

YOLOX tích hợp một head tách biệt, phân tách các tác vụ phân loại và hồi quy, qua đó cải thiện đáng kể tốc độ hội tụ trong quá trình huấn luyện. Ngoài ra, model này giới thiệu các chiến lược gán label nâng cao như SimOTA để tự động gán các mẫu positive. Điều này giúp model đạt hiệu quả cao, đặc biệt trong các môi trường AI biên, nơi tài nguyên tính toán bị giới hạn nghiêm ngặt.

Tìm hiểu thêm về YOLOX

PP-YOLOE+: Phát hiện công nghiệp hiệu năng cao#

Được giới thiệu bởi các tác giả PaddlePaddle tại Baidu vào ngày 2 tháng 4 năm 2022, PP-YOLOE+ là một phiên bản phát triển được tối ưu hóa cao của dòng PP-YOLO. Được trình bày chi tiết trong công bố Arxiv của họ, PP-YOLOE+ được tích hợp sâu vào hệ sinh thái Baidu và yêu cầu framework PaddlePaddle. Các cấu hình của model có thể được tìm thấy trong repository PaddleDetection trên GitHub.

PP-YOLOE+ sử dụng backbone CSPRepResNet mạnh mẽ và một head Căn chỉnh theo tác vụ hiệu quả (ET-head) cùng với Học căn chỉnh tác vụ (TAL). Kiến trúc này đạt độ chính xác trung bình (mAP) nổi bật trên dataset COCO, trở thành lựa chọn đáng gờm cho việc phát hiện lỗi công nghiệp và xử lý nặng phía server, trong đó độ chính xác được ưu tiên hơn số lượng dependency tối thiểu.

Tìm hiểu thêm về PP-YOLOE+

Benchmark hiệu năng#

Việc hiểu cách các model này hoạt động trên những quy mô khác nhau là yếu tố thiết yếu cho triển khai. Bảng dưới đây trình bày các chỉ số chính, bao gồm mAP và tốc độ inference khi export sang TensorRT.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
Các yếu tố cần cân nhắc khi triển khai

Mặc dù PP-YOLOE+x đạt độ chính xác tuyệt đối cao nhất, YOLOX cung cấp các biến thể cực kỳ nhẹ (Nano và Tiny), rất phù hợp với các vi điều khiển công suất thấp và phần cứng di động đời cũ.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOX và PP-YOLOE+ phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn YOLOX#

YOLOX là lựa chọn phù hợp cho:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các detection head hoặc hàm loss mới.
  • Thiết bị edge siêu nhẹ: Triển khai trên microcontroller hoặc phần cứng mobile legacy, nơi footprint cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các project nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên optimal transport và tác động của chúng đến quá trình hội tụ khi training.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ được khuyến nghị cho:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện có được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
  • Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có các kernel suy luận được tối ưu cao, dành riêng cho engine suy luận Paddle Lite hoặc Paddle.
  • Phát hiện phía server độ chính xác cao: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên các server GPU mạnh, nơi sự phụ thuộc vào framework không phải là vấn đề.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Lợi thế của Ultralytics: Giới thiệu YOLO26#

Mặc dù YOLOX và PP-YOLOE+ đều có những ưu điểm riêng, tốc độ phát triển nhanh chóng của AI đòi hỏi các công cụ kết hợp độ chính xác hiện đại nhất với khả năng sử dụng vượt trội. Đây là điểm mà các model của Ultralytics, cụ thể là Ultralytics YOLO26 vừa được phát hành, vượt trội hơn các repository nghiên cứu cũ.

Được phát hành vào tháng 1 năm 2026, YOLO26 thiết lập một tiêu chuẩn mới cho phát hiện đối tượng hiện đại và nhiều tác vụ khác, mang lại trải nghiệm developer mà các framework cạnh tranh khó có thể sánh bằng.

Vì sao các Developer chọn YOLO26#

  1. Thiết kế end-to-end không cần NMS: Dựa trên các khái niệm tiên phong trong YOLOv10, YOLO26 vốn được thiết kế theo kiến trúc end-to-end. Bằng cách loại bỏ hoàn toàn bước hậu xử lý Non-Maximum Suppression (NMS), model này bảo đảm độ trễ nhất quán cao và đơn giản hóa đáng kể các pipeline export cho môi trường biên.
  2. Tối ưu hóa thế hệ mới: Độ ổn định khi huấn luyện được cải tiến mang tính đột phá nhờ MuSGD Optimizer, một optimizer lai giữa SGD và Muon (lấy cảm hứng từ các phương pháp của LLM như Kimi K2 của Moonshot AI). Điều này bảo đảm tốc độ hội tụ nhanh hơn. Hơn nữa, YOLO26 sử dụng ProgLoss + STAL để cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, một tính năng quan trọng cho các ứng dụng liên quan đến ảnh chụp từ trên không và robot.
  3. Hiệu quả phần cứng vượt trội: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 giảm đáng kể yêu cầu bộ nhớ. Model này cho tốc độ inference trên CPU nhanh hơn tới 43%, trở thành lựa chọn tối ưu cho các thiết bị không có tăng tốc GPU chuyên dụng.
  4. Tính linh hoạt vượt trội: Khác với PP-YOLOE+, vốn chỉ tập trung vào phát hiện, YOLO26 cung cấp khả năng hỗ trợ hợp nhất cho nhiều tác vụ. Model này tích hợp loss phân đoạn ngữ nghĩa chuyên biệt cho phân đoạn instance, Residual Log-Likelihood Estimation (RLE) để ước tính pose chính xác và các cơ chế loss góc nâng cao cho Bounding Box định hướng (OBB).

Tích hợp liền mạch với hệ sinh thái#

Ultralytics loại bỏ sự bất tiện của việc cài đặt các framework phức tạp. Với Python API hợp nhất hoặc Ultralytics Platform trực quan, bạn có thể huấn luyện, xác thực và export model chỉ với vài dòng code.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train on a custom dataset with minimal CUDA memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Effortlessly run inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX natively, fully benefiting from the NMS-free architecture
model.export(format="onnx")

Đối với người dùng đang đánh giá các kiến trúc mạnh mẽ khác trong hệ sinh thái Ultralytics, YOLO11 vẫn là lựa chọn rất đáng tin cậy cho các triển khai legacy, trong khi RT-DETR dựa trên Transformer cung cấp năng lực xuất sắc cho những ai tìm kiếm các giải pháp dựa trên cơ chế attention.

Tóm tắt#

Việc lựa chọn giữa YOLOX và PP-YOLOE+ thường phụ thuộc vào các ràng buộc framework chính của bạn—dù bạn ưu tiên tính linh hoạt dựa trên PyTorch hay khả năng tích hợp sâu với PaddlePaddle của Baidu. Tuy nhiên, đối với các tổ chức muốn bảo đảm hạ tầng AI của mình luôn sẵn sàng cho tương lai, Ultralytics YOLO26 là một lựa chọn thay thế vượt trội hơn nhiều. Với thiết kế không cần NMS mang tính cách mạng, footprint bộ nhớ nhẹ và tính linh hoạt toàn diện trên nhiều tác vụ, YOLO26 giúp các team xây dựng các ứng dụng thị giác máy tính nhanh hơn, thông minh hơn và hiệu quả hơn với mức độ dễ dàng chưa từng có.

Những người đóng góp

Bình luận