YOLO Vision 2026:

YOLOX so với PP-YOLOE+#

Khi thiết kế một pipeline computer vision mạnh mẽ, việc lựa chọn mô hình phát hiện đối tượng phù hợp là một quyết định quan trọng. Bối cảnh của các trình phát hiện đối tượng thời gian thực có tính cạnh tranh cao, với nhiều kiến trúc nỗ lực mang lại sự cân bằng tối ưu giữa tốc độ suy luận và độ chính xác phát hiện. Trong so sánh kỹ thuật này, chúng ta sẽ đánh giá hai mô hình nổi bật: YOLOX và PP-YOLOE+. Bằng cách kiểm tra thiết kế kiến trúc, phương pháp huấn luyện và các số liệu hiệu suất, chúng tôi nhằm cung cấp cho các lập trình viên và nhà nghiên cứu những thông tin chi tiết cần thiết để chọn đúng công cụ cho môi trường triển khai của họ.

Đổi mới Kiến trúc và Thiết kế#

Cả hai model đều được thiết kế để giải quyết những điểm yếu cụ thể trong các phiên bản YOLO trước đó, tuy nhiên chúng áp dụng những phương pháp cơ bản khác nhau để giải quyết sự đánh đổi giữa tốc độ và độ chính xác.

YOLOX: Kết nối Nghiên cứu và Công nghiệp#

Được phát triển bởi Zheng Ge, Songtao Liu, Feng Wang, Zeming Li và Jian Sun tại Megvii, YOLOX được phát hành vào ngày 18 tháng 7 năm 2021. Nó đánh dấu một sự chuyển dịch đáng kể trong dòng họ YOLO bằng cách áp dụng hoàn toàn thiết kế phi mỏ neo (anchor-free). Bạn có thể khám phá nghiên cứu nền tảng trong Arxiv paper chính thức của họ và mã nguồn gốc trong YOLOX GitHub repository.

YOLOX tích hợp phần đầu giải kết hợp (decoupled head), tách biệt các tác vụ phân loại và hồi quy, giúp cải thiện đáng kể tốc độ hội tụ trong quá trình huấn luyện. Ngoài ra, nó giới thiệu các chiến lược gán nhãn tiên tiến như SimOTA để gán động các mẫu dương tính. Điều này làm cho mô hình có hiệu suất cực高, đặc biệt là trong các môi trường edge AI nơi tài nguyên tính toán bị giới hạn nghiêm ngặt.

Tìm hiểu thêm về YOLOX

PP-YOLOE+: Phát hiện công nghiệp hiệu năng cao#

Được giới thiệu bởi các tác giả PaddlePaddle tại Baidu vào ngày 2 tháng 4 năm 2022, PP-YOLOE+ đại diện cho một sự tiến hóa được tối ưu hóa cao của chuỗi PP-YOLO. Được chi tiết trong Arxiv publication của họ, PP-YOLOE+ được tích hợp sâu vào hệ sinh thái Baidu và yêu cầu framework PaddlePaddle. Các cấu hình của mô hình có thể được tìm thấy trong PaddleDetection GitHub repository.

PP-YOLOE+ dựa trên backbone CSPRepResNet mạnh mẽ và sử dụng phần đầu Efficient Task-aligned head (ET-head) bên cạnh Task Alignment Learning (TAL). Kiến trúc này đạt được mean Average Precision (mAP) xuất sắc trên COCO dataset, biến nó thành một lựa chọn đáng gờm cho việc phát hiện lỗi công nghiệp và xử lý nặng trên phía máy chủ nơi độ chính xác được ưu tiên hơn các phần phụ thuộc tối thiểu.

Tìm hiểu thêm về PP-YOLOE+

Điểm chuẩn hiệu năng#

Hiểu cách các mô hình này hoạt động trên các quy mô khác nhau là điều cần thiết cho việc triển khai. Bảng dưới đây phác thảo các số liệu chính, bao gồm mAP và tốc độ suy luận khi được xuất sang TensorRT.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
Các cân nhắc khi triển khai

Trong khi PP-YOLOE+x đạt được độ chính xác tuyệt đối cao nhất, YOLOX cung cấp các biến thể cực kỳ gọn nhẹ (Nano và Tiny), rất phù hợp cho các vi điều khiển công suất thấp và phần cứng di động cũ.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa YOLOX và PP-YOLOE+ phụ thuộc vào yêu cầu dự án cụ thể, các ràng buộc triển khai và sở thích về hệ sinh thái của bạn.

Khi nào nên chọn YOLOX#

YOLOX là lựa chọn mạnh mẽ cho:

  • Nghiên cứu Phát hiện Anchor-Free: Nghiên cứu học thuật sử dụng kiến trúc anchor-free sạch, gọn của YOLOX làm baseline để thử nghiệm với các head phát hiện hoặc hàm mất mát mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động cũ nơi mà footprint cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là rất quan trọng.
  • Nghiên cứu Gán nhãn SimOTA: Các dự án nghiên cứu điều tra các chiến lược gán nhãn dựa trên vận chuyển tối ưu và tác động của chúng đến sự hội tụ trong đào tạo.

Khi nào nên chọn PP-YOLOE+#

PP-YOLOE+ được khuyến nghị cho:

  • Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có cơ sở hạ tầng hiện có được xây dựng trên framework và công cụ PaddlePaddle của Baidu.
  • Triển khai Paddle Lite Edge: Triển khai lên phần cứng với các kernel suy luận được tối ưu hóa cao dành riêng cho Paddle Lite hoặc engine suy luận Paddle.
  • Nhận diện phía máy chủ có độ chính xác cao: Các kịch bản ưu tiên độ chính xác nhận diện tối đa trên các máy chủ GPU mạnh mẽ, nơi sự phụ thuộc vào framework không phải là vấn đề.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế của Ultralytics: Giới thiệu YOLO26#

Mặc dù cả YOLOX và PP-YOLOE+ đều mang lại những ưu điểm riêng biệt, sự tiến hóa nhanh chóng của AI đòi hỏi các công cụ kết hợp độ chính xác tối tân với tính dễ sử dụng chưa từng có. Đây là nơi các mô hình Ultralytics, cụ thể là Ultralytics YOLO26 mới được phát hành gần đây, vượt trội hơn các kho lưu trữ nghiên cứu cũ.

Được phát hành vào tháng 1 năm 2026, YOLO26 thiết lập một tiêu chuẩn mới cho object detection hiện đại và hơn thế nữa, mang lại trải nghiệm cho nhà phát triển đơn giản là không có đối thủ từ các framework cạnh tranh.

Tại sao các nhà phát triển chọn YOLO26#

  1. Thiết kế End-to-End Không NMS: Dựa trên các khái niệm được tiên phong trong YOLOv10, YOLO26 là dạng end-to-end nguyên bản. Bằng cách loại bỏ hoàn toàn quá trình hậu xử lý Non-Maximum Suppression (NMS), nó đảm bảo độ trễ cực kỳ nhất quán và đơn giản hóa đáng kể các pipeline xuất cho môi trường biên.
  2. Tối ưu hóa thế hệ tiếp theo: Độ ổn định huấn luyện được cách mạng hóa bởi MuSGD Optimizer, một sự kết hợp lai giữa SGD và Muon (lấy cảm hứng từ các phương pháp luận LLM như Kimi K2 của Moonshot AI). Điều này đảm bảo hội tụ nhanh hơn. Hơn nữa, YOLO26 sử dụng ProgLoss + STAL để cải thiện đáng kể khả năng nhận dạng vật thể nhỏ, một tính năng quan trọng cho các ứng dụng liên quan đến aerial imagery và robot.
  3. Hiệu suất phần cứng chưa từng có: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 làm giảm đáng kể yêu cầu bộ nhớ. Nó tự hào có tốc độ suy luận CPU nhanh hơn tới 43%, làm cho nó trở thành lựa chọn dứt khoát cho các thiết bị thiếu khả năng tăng tốc GPU chuyên dụng.
  4. Tính đa dạng cực độ: Khác với PP-YOLOE+ tập trung nghiêm ngặt vào việc phát hiện, YOLO26 cung cấp hỗ trợ thống nhất trên nhiều tác vụ. Nó kết hợp tổn thất phân đoạn ngữ nghĩa chuyên dụng cho instance segmentation, Residual Log-Likelihood Estimation (RLE) cho pose estimation chính xác, và các cơ chế tổn thất góc nâng cao cho Oriented Bounding Boxes (OBB).

Tìm hiểu thêm về YOLO26

Tích hợp hệ sinh thái liền mạch#

Ultralytics loại bỏ sự thất vọng khi cài đặt framework phức tạp. Sử dụng Python API thống nhất hoặc Ultralytics Platform trực quan, bạn có thể huấn luyện, xác thực và xuất các mô hình chỉ với một vài dòng mã.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train on a custom dataset with minimal CUDA memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Effortlessly run inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX natively, fully benefiting from the NMS-free architecture
model.export(format="onnx")

Đối với người dùng đang đánh giá các kiến trúc mạnh mẽ khác trong hệ sinh thái Ultralytics, YOLO11 vẫn là một lựa chọn rất đáng tin cậy cho các bản triển khai cũ, trong khi RT-DETR dựa trên transformer cung cấp khả năng tuyệt vời cho những ai tìm kiếm các giải pháp dựa trên cơ chế chú ý (attention-based).

Tóm tắt#

Việc lựa chọn giữa YOLOX và PP-YOLOE+ thường phụ thuộc vào các ràng buộc framework chính của bạn—liệu bạn thích tính linh hoạt dựa trên PyTorch hay tích hợp sâu với PaddlePaddle của Baidu. Tuy nhiên, đối với các tổ chức muốn chuẩn bị cho tương lai cơ sở hạ tầng AI của họ, Ultralytics YOLO26 cung cấp một giải pháp thay thế vượt trội hơn nhiều. Với thiết kế không cần NMS cách mạng, dung lượng bộ nhớ nhẹ và tính đa dạng tác vụ toàn diện, YOLO26 trao quyền cho các nhóm xây dựng các ứng dụng computer vision nhanh hơn, thông minh hơn và hiệu quả hơn với sự dễ dàng chưa từng có.

Người đóng góp

Bình luận