YOLOX và PP-YOLOE+#
Khi thiết kế pipeline thị giác máy tính vững chắc, lựa chọn model phát hiện đối tượng phù hợp là quyết định then chốt. Lĩnh vực phát hiện đối tượng thời gian thực có tính cạnh tranh cao, với nhiều kiến trúc tìm cách cân bằng tối ưu giữa tốc độ suy luận và độ chính xác phát hiện. Trong phần so sánh kỹ thuật này, chúng tôi đánh giá hai model nổi bật: YOLOX và PP-YOLOE+. Bằng cách xem xét thiết kế kiến trúc, phương pháp huấn luyện và các chỉ số hiệu năng, chúng tôi mong muốn cung cấp cho nhà phát triển và nhà nghiên cứu thông tin cần thiết để chọn công cụ phù hợp với môi trường triển khai.
Đổi mới và thiết kế kiến trúc#
Cả hai model đều được thiết kế để giải quyết những vấn đề cụ thể của các phiên bản YOLO trước đó, nhưng áp dụng những phương pháp hoàn toàn khác nhau để cân bằng tốc độ và độ chính xác.
YOLOX: Kết nối nghiên cứu với công nghiệp#
Do Zheng Ge, Songtao Liu, Feng Wang, Zeming Li và Jian Sun tại Megvii phát triển, YOLOX được phát hành vào ngày 18 tháng 7 năm 2021. Model đánh dấu bước chuyển đáng kể của họ YOLO khi hoàn toàn áp dụng thiết kế không dùng anchor. Bạn có thể tìm hiểu nghiên cứu nền tảng trong bài báo Arxiv chính thức và xem mã nguồn gốc trong repository GitHub YOLOX.
YOLOX tích hợp head tách biệt, chia các tác vụ phân loại và hồi quy, qua đó cải thiện đáng kể tốc độ hội tụ trong quá trình huấn luyện. Ngoài ra, model giới thiệu các chiến lược gán nhãn tiên tiến như SimOTA để gán mẫu dương một cách linh động. Nhờ đó, model hoạt động rất hiệu quả, đặc biệt trong môi trường AI biên có tài nguyên tính toán bị giới hạn nghiêm ngặt.
PP-YOLOE+: Phát hiện công nghiệp hiệu năng cao#
Được các tác giả PaddlePaddle tại Baidu giới thiệu vào ngày 2 tháng 4 năm 2022, PP-YOLOE+ là phiên bản phát triển được tối ưu hóa cao của dòng PP-YOLO. Được trình bày chi tiết trong ấn phẩm Arxiv, PP-YOLOE+ tích hợp sâu vào hệ sinh thái Baidu và yêu cầu framework PaddlePaddle. Bạn có thể tìm thấy cấu hình model trong repository GitHub PaddleDetection.
PP-YOLOE+ sử dụng backbone CSPRepResNet mạnh mẽ và head Efficient Task-aligned (ET-head) cùng với Task Alignment Learning (TAL). Kiến trúc này đạt độ chính xác trung bình (mAP) vượt trội trên bộ dữ liệu COCO, trở thành lựa chọn đáng gờm cho phát hiện lỗi công nghiệp và xử lý nặng phía server, nơi độ chính xác được ưu tiên hơn số lượng dependency tối thiểu.
Đánh giá hiệu năng#
Hiểu rõ hiệu năng của các model này ở nhiều quy mô khác nhau là điều thiết yếu cho việc triển khai. Bảng dưới đây nêu các chỉ số chính, bao gồm mAP và tốc độ suy luận khi xuất sang TensorRT.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Dù PP-YOLOE+x đạt độ chính xác tuyệt đối cao nhất, YOLOX có các biến thể cực kỳ gọn nhẹ (Nano và Tiny), rất phù hợp với vi điều khiển công suất thấp và phần cứng di động đời cũ.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOX và PP-YOLOE+ phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và ưu tiên về hệ sinh thái.
Khi nào nên chọn YOLOX#
YOLOX là lựa chọn phù hợp khi:
- Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các head phát hiện hoặc hàm loss mới.
- Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động đời cũ, nơi kích thước cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
- Nghiên cứu gán nhãn SimOTA: Các dự án nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên vận tải tối ưu và ảnh hưởng của chúng đến quá trình hội tụ khi huấn luyện.
Khi nào nên chọn PP-YOLOE+#
PP-YOLOE+ được khuyến nghị trong các trường hợp:
- Tích hợp hệ sinh thái PaddlePaddle: Các tổ chức có hạ tầng hiện hữu được xây dựng trên framework và bộ công cụ PaddlePaddle của Baidu.
- Triển khai biên bằng Paddle Lite: Triển khai lên phần cứng có kernel suy luận được tối ưu hóa cao, dành riêng cho Paddle Lite hoặc inference engine Paddle.
- Phát hiện độ chính xác cao phía máy chủ: Các kịch bản ưu tiên độ chính xác phát hiện tối đa trên máy chủ GPU mạnh, nơi sự phụ thuộc vào framework không phải vấn đề đáng lo ngại.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Ưu thế của Ultralytics: Giới thiệu YOLO26#
Dù YOLOX và PP-YOLOE+ đều có những ưu điểm riêng, tốc độ phát triển nhanh của AI đòi hỏi các công cụ kết hợp độ chính xác tiên tiến nhất với khả năng sử dụng dễ dàng vượt trội. Các model Ultralytics, đặc biệt là Ultralytics YOLO26 mới phát hành, vượt trội hơn các repository nghiên cứu cũ ở điểm này.
Được phát hành vào tháng 1 năm 2026, YOLO26 thiết lập tiêu chuẩn mới cho phát hiện đối tượng hiện đại và nhiều tác vụ khác, đồng thời mang lại trải nghiệm phát triển mà các framework cạnh tranh khó sánh kịp.
Vì sao nhà phát triển chọn YOLO26#
- Thiết kế đầu-cuối không cần NMS: Dựa trên những ý tưởng tiên phong trong YOLOv10, YOLO26 hỗ trợ suy luận đầu-cuối nguyên bản. Bằng cách bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS) nhờ head một-một tùy chọn (
nms=False), model đảm bảo độ trễ nhất quán cao và đơn giản hóa đáng kể pipeline xuất sang môi trường biên. - Tối ưu hóa thế hệ mới: Độ ổn định huấn luyện được cách mạng hóa nhờ Optimizer MuSGD, một phương pháp lai giữa SGD và Muon (lấy cảm hứng từ các phương pháp LLM như Kimi K2 của Moonshot AI). Phương pháp này đảm bảo hội tụ nhanh hơn. Ngoài ra, YOLO26 sử dụng ProgLoss + STAL để cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, một tính năng quan trọng cho các ứng dụng liên quan đến ảnh hàng không và robot.
- Hiệu quả phần cứng vượt trội: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 đơn giản hóa head phát hiện và đồ thị xuất model. Model đạt tốc độ suy luận CPU nhanh hơn tới 43%, trở thành lựa chọn hàng đầu cho các thiết bị không có khả năng tăng tốc GPU chuyên dụng.
- Tính linh hoạt vượt trội: Khác với PP-YOLOE+ chỉ tập trung vào phát hiện, YOLO26 hỗ trợ thống nhất nhiều tác vụ. Model tích hợp loss phân đoạn ngữ nghĩa chuyên biệt cho phân đoạn instance, Residual Log-Likelihood Estimation (RLE) để ước lượng tư thế chính xác và cơ chế loss góc tiên tiến cho bounding box định hướng (OBB).
Tích hợp hệ sinh thái liền mạch#
Ultralytics loại bỏ những phiền toái khi cài đặt framework phức tạp. Sử dụng Python API thống nhất hoặc Nền tảng Ultralytics trực quan, bạn có thể huấn luyện, validation và xuất model chỉ với vài dòng code.
from ultralytics import YOLO
# Tải model YOLO26 small tiên tiến nhất
model = YOLO("yolo26s.pt")
# Huấn luyện trên tập dữ liệu tùy chỉnh với mức sử dụng bộ nhớ CUDA tối thiểu
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Chạy suy luận dễ dàng
predictions = model("https://ultralytics.com/images/bus.jpg")
# Xuất ONNX trực tiếp, tận dụng tối đa kiến trúc không cần NMS
model.export(format="onnx", nms=False)Đối với người dùng đang đánh giá các kiến trúc mạnh mẽ khác trong hệ sinh thái Ultralytics, YOLO11 vẫn là lựa chọn đáng tin cậy cho các hệ thống triển khai cũ, trong khi RT-DETR dựa trên Transformer cung cấp năng lực vượt trội cho những ai tìm kiếm giải pháp dựa trên attention.
Tóm tắt#
Việc lựa chọn giữa YOLOX và PP-YOLOE+ thường phụ thuộc vào các ràng buộc framework chính của bạn—dù bạn ưu tiên tính linh hoạt dựa trên PyTorch hay khả năng tích hợp sâu với PaddlePaddle của Baidu. Tuy nhiên, với các tổ chức muốn đảm bảo hạ tầng AI sẵn sàng cho tương lai, Ultralytics YOLO26 là một giải pháp thay thế vượt trội hơn hẳn. Với suy luận không cần NMS tùy chọn, footprint bộ nhớ nhẹ và khả năng hỗ trợ đa dạng tác vụ, YOLO26 giúp các nhóm xây dựng ứng dụng thị giác máy tính nhanh hơn, thông minh hơn và hiệu quả hơn một cách dễ dàng chưa từng có.