YOLOX và YOLO11#
Sự phát triển của thị giác máy tính được thúc đẩy mạnh mẽ bởi nỗ lực xây dựng các framework phát hiện đối tượng thời gian thực cân bằng giữa độ chính xác cao và tốc độ suy luận. Trong số những cột mốc nổi bật nhất của hành trình này có YOLOX và Ultralytics YOLO11. Dù cả hai model đều đóng góp đáng kể cho lĩnh vực, kiến trúc nền tảng, triết lý thiết kế và hệ sinh thái dành cho nhà phát triển của chúng khác biệt đáng kể.
Bài so sánh kỹ thuật toàn diện này tìm hiểu kiến trúc, chỉ số hiệu năng, phương pháp huấn luyện và kịch bản triển khai lý tưởng của hai model, giúp bạn đưa ra quyết định sáng suốt cho dự án trí tuệ nhân tạo tiếp theo.
Tổng quan về YOLOX#
Được các nhà nghiên cứu Zheng Ge, Songtao Liu, Feng Wang, Zeming Li và Jian Sun tại Megvii giới thiệu vào ngày 18 tháng 7 năm 2021, YOLOX đánh dấu một thay đổi đáng kể trong dòng YOLO. Model kết nối thành công nghiên cứu học thuật với ứng dụng công nghiệp bằng cách giới thiệu thiết kế không anchor.
Để tìm hiểu thêm về phương diện kỹ thuật, bạn có thể tham khảo bài báo YOLOX Arxiv gốc.
Các đặc điểm kiến trúc chính#
YOLOX rời bỏ phương pháp phát hiện dựa trên anchor truyền thống, áp dụng head tách rời và cơ chế không anchor. Thiết kế này giảm số lượng tham số thiết kế và cải thiện hiệu năng của model trên nhiều benchmark. Ngoài ra, model còn giới thiệu các chiến lược gán nhãn tiên tiến như SimOTA để tăng tốc quá trình huấn luyện và cải thiện khả năng hội tụ.
Dù YOLOX có độ chính xác rất tốt so với thời điểm ra mắt, model chủ yếu tập trung vào phát hiện đối tượng bằng box giới hạn và không hỗ trợ nguyên bản các tác vụ thị giác phức tạp khác.
Bằng cách loại bỏ các anchor box được xác định trước, YOLOX giảm đáng kể công sức tinh chỉnh theo kinh nghiệm cho từng dataset, trở thành baseline mạnh để nghiên cứu các phương pháp không anchor.
Tổng quan về Ultralytics YOLO11#
Được Glenn Jocher và Jing Qiu tại Ultralytics phát hành ngày 27 tháng 9 năm 2024, YOLO11 là model tiên tiến, định nghĩa lại tính linh hoạt và dễ sử dụng trong thị giác máy tính. Được xây dựng trên nền tảng nghiên cứu nhiều năm, model cung cấp một giải pháp hoàn thiện cao, sẵn sàng cho môi trường sản xuất và vượt trội trên nhiều tác vụ.
Lợi thế của Ultralytics#
YOLO11 không chỉ là một bộ phát hiện đối tượng; đây là framework hợp nhất hỗ trợ phân đoạn thực thể, phân loại ảnh, ước lượng tư thế và phát hiện box giới hạn có định hướng (OBB). Model sở hữu kiến trúc hiệu quả cao, ưu tiên sự cân bằng liền mạch giữa tốc độ, số lượng tham số và độ chính xác.
Ngoài ra, YOLO11 được tích hợp hoàn toàn vào Nền tảng Ultralytics, cung cấp một hệ sinh thái tinh gọn cho việc gán nhãn dữ liệu, huấn luyện model và triển khai.
So sánh hiệu năng và chỉ số#
Khi so sánh các model này, có thể thấy rõ sự cân bằng về hiệu năng. YOLO11 đạt độ chính xác trung bình (mAP) cao hơn với số lượng tham số và FLOPs ít hơn đáng kể ở hầu hết các kích thước so với các model YOLOX tương ứng.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Như kết quả minh họa, các model YOLO11 luôn vượt YOLOX về độ chính xác trong khi sử dụng ít tham số hơn. Chẳng hạn, YOLO11m đạt 51.5 mAP chỉ với 20.1M tham số, trong khi YOLOXx đạt 51.1 mAP tương đương nhưng cần tới 99.1M tham số. Hiệu quả sử dụng bộ nhớ này trong quá trình huấn luyện và suy luận khiến YOLO11 rất phù hợp để triển khai trên các thiết bị AI biên, tránh yêu cầu bộ nhớ CUDA lớn thường thấy ở các model cũ hơn hoặc dựa trên Transformer như RT-DETR.
Các model Ultralytics cần ít bộ nhớ GPU hơn đáng kể khi huấn luyện so với YOLOX và các kiến trúc dựa trên Transformer, cho phép nhà nghiên cứu huấn luyện model mạnh mẽ trên phần cứng phổ thông.
Hệ sinh thái và tính dễ sử dụng#
Một trong những khác biệt nổi bật nhất giữa hai framework là trải nghiệm dành cho nhà phát triển.
YOLOX thường yêu cầu clone repository, thiết lập môi trường phức tạp và chạy các tham số dòng lệnh dài dòng để huấn luyện, cũng như xuất model sang các định dạng như ONNX hoặc TensorRT.
Trái ngược hoàn toàn, Ultralytics YOLO11 cung cấp API Python và CLI cực kỳ đơn giản. Thư viện Ultralytics tự động xử lý tăng cường dữ liệu, tinh chỉnh siêu tham số và xuất model.
from ultralytics import YOLO
# Tải model YOLO11 đã huấn luyện trước
model = YOLO("yolo11n.pt")
# Dễ dàng huấn luyện model trên dữ liệu tùy chỉnh
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Xuất model đã huấn luyện sang TensorRT để triển khai tối ưu
model.export(format="engine")Hệ sinh thái được duy trì tốt này được hỗ trợ bởi tài liệu phong phú và khả năng tích hợp liền mạch với các công cụ như Weights & Biases để theo dõi thí nghiệm.
Các trường hợp sử dụng phù hợp nhất#
Việc lựa chọn giữa các model này thường phụ thuộc vào đặc điểm cụ thể của môi trường triển khai.
Khi nào nên dùng YOLOX#
- Hệ thống cũ: Khi bạn có quy trình hiện hành được xây dựng cụ thể dựa trên codebase YOLOX gốc hoặc các phương pháp phát hiện đối tượng đầu năm 2021.
- Baseline học thuật: Khi thực hiện nghiên cứu cần benchmark trực tiếp với các kiến trúc không anchor nền tảng từ năm 2021.
Khi nào nên dùng YOLO11#
- Triển khai trong môi trường sản xuất: Dành cho ứng dụng thương mại trong bán lẻ thông minh hoặc hệ thống báo động an ninh, nơi mã nguồn đáng tin cậy, được duy trì tốt và độ chính xác cao là yêu cầu bắt buộc.
- Quy trình đa nhiệm: Khi dự án cần theo dõi đối tượng, ước lượng tư thế người và phân đoạn thực thể bằng một framework hợp nhất duy nhất.
- Thiết bị biên hạn chế tài nguyên: Nhờ số lượng tham số thấp và thông lượng cao, YOLO11 lý tưởng để triển khai trên Raspberry Pi hoặc các node biên di động thông qua CoreML và NCNN.
Nhìn về phía trước: Ưu thế của YOLO26#
Mặc dù YOLO11 là một bước tiến vượt bậc so với YOLOX, lĩnh vực thị giác máy tính đang phát triển nhanh chóng. Với các nhà phát triển bắt đầu dự án mới hiện nay, Ultralytics YOLO26 là lựa chọn được khuyến nghị hàng đầu.
Ra mắt vào tháng 1 năm 2026, YOLO26 kế thừa kiến trúc xuất sắc của YOLO11 và bổ sung một số tính năng đột phá:
- Thiết kế đầu-cuối không cần NMS: Head one-to-one tùy chọn của YOLO26 (
nms=False) loại bỏ bước hậu xử lý ức chế phi cực đại (NMS), giúp quy trình triển khai nhanh hơn và đơn giản hơn (ý tưởng được nghiên cứu lần đầu trong YOLOv10). - Suy luận trên CPU nhanh hơn đến 43%: Nhờ loại bỏ Distribution Focal Loss (DFL), YOLO26 hiệu quả hơn đáng kể trên CPU và các thiết bị biên công suất thấp.
- Bộ tối ưu MuSGD: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM của Moonshot AI, bộ tối ưu MuSGD giúp quá trình huấn luyện ổn định cao và hội tụ nhanh.
- Các hàm loss tiên tiến: Bằng cách sử dụng ProgLoss + STAL, YOLO26 cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố quan trọng đối với ảnh chụp từ drone và robot tự hành.
Với phần lớn tác vụ thị giác máy tính hiện đại, nâng cấp pipeline để tận dụng YOLO26 sẽ mang lại sự cân bằng tối ưu giữa tốc độ, độ chính xác và tính đơn giản khi triển khai.