YOLO Vision 2026:

So sánh YOLOX và YOLO11#

Sự tiến hóa của thị giác máy tính chủ yếu được thúc đẩy bởi việc theo đuổi các framework phát hiện đối tượng thời gian thực, đảm bảo sự cân bằng giữa độ chính xác cao và tốc độ suy luận. Trong số các mốc quan trọng nhất trên hành trình này là YOLOXUltralytics YOLO11. Mặc dù cả hai model đều có đóng góp quan trọng cho lĩnh vực này, nhưng kiến trúc cốt lõi, triết lý thiết kế và hệ sinh thái dành cho nhà phát triển của chúng lại có sự khác biệt đáng kể.

Bài so sánh kỹ thuật toàn diện này khám phá các kiến trúc, số liệu hiệu suất, phương pháp đào tạo và các kịch bản triển khai lý tưởng để giúp bạn đưa ra quyết định sáng suốt cho dự án trí tuệ nhân tạo tiếp theo của mình.

Tổng quan về YOLOX#

Được giới thiệu bởi các nhà nghiên cứu Zheng Ge, Songtao Liu, Feng Wang, Zeming Li và Jian Sun tại Megvii vào ngày 18 tháng 7 năm 2021, YOLOX đánh dấu một bước chuyển dịch lớn trong dòng sản phẩm YOLO. Nó đã thu hẹp thành công khoảng cách giữa nghiên cứu học thuật và ứng dụng công nghiệp thông qua việc giới thiệu thiết kế không neo (anchor-free).

Để tìm hiểu thêm về nền tảng kỹ thuật, bạn có thể xem lại bài báo Arxiv của YOLOX gốc.

Các tính năng kiến trúc chính#

YOLOX đã tách rời khỏi phương pháp phát hiện dựa trên neo truyền thống bằng cách áp dụng một head tách rời và cơ chế không cần neo. Thiết kế này đã giảm số lượng tham số thiết kế và cải thiện hiệu suất của model trên nhiều benchmark khác nhau. Ngoài ra, nó cũng giới thiệu các chiến lược gán nhãn tiên tiến như SimOTA để tăng tốc quy trình đào tạo và cải thiện khả năng hội tụ.

Mặc dù YOLOX mang lại độ chính xác tuyệt vời vào thời điểm ra mắt, nó chủ yếu tập trung vào phát hiện đối tượng theo BBox và thiếu hỗ trợ mặc định cho các tác vụ thị giác phức tạp khác.

Tìm hiểu thêm về YOLOX

Thiết kế không cần neo (Anchor-Free)

Bằng cách loại bỏ các anchor box định sẵn, YOLOX đã giảm đáng kể việc điều chỉnh heuristic cần thiết cho các tập dữ liệu khác nhau, khiến nó trở thành một nền tảng cơ sở mạnh mẽ cho nghiên cứu về các phương pháp luận không cần neo.

Tổng quan về Ultralytics YOLO11#

Được phát hành vào ngày 27 tháng 9 năm 2024 bởi Glenn Jocher và Jing Qiu tại Ultralytics, YOLO11 là một model tiên tiến định nghĩa lại tính linh hoạt và sự dễ sử dụng trong thị giác máy tính. Được xây dựng dựa trên nhiều năm nghiên cứu nền tảng, nó cung cấp một giải pháp được tối ưu hóa cao, sẵn sàng cho môi trường sản xuất và vượt trội trong vô số tác vụ.

Lợi thế từ Ultralytics#

YOLO11 không chỉ là một trình phát hiện đối tượng; nó là một framework hợp nhất hỗ trợ phát hiện phân đoạn thực thể (instance segmentation), phân loại hình ảnh (image classification), ước tính tư thế (pose estimation)hộp giới hạn có định hướng (OBB). Nó tự hào sở hữu kiến trúc hiệu suất cao, ưu tiên sự cân bằng liền mạch giữa tốc độ, số lượng tham số và độ chính xác.

Hơn nữa, YOLO11 được tích hợp hoànfully vào Ultralytics Platform, cung cấp một hệ sinh thái tinh gọn để gán nhãn dữ liệu, huấn luyện model và triển khai.

Tìm hiểu thêm về YOLO11

So sánh Hiệu năng và Chỉ số#

Khi so sánh các model này, sự cân bằng về hiệu suất trở nên rõ ràng. YOLO11 đạt được mAP cao hơn với số lượng tham số và FLOPs ít hơn đáng kể trong hầu hết các hạng mục kích thước so với các model YOLOX tương ứng.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Như đã chứng minh, các model YOLO11 luôn vượt trội hơn YOLOX về độ chính xác trong khi vẫn duy trì lượng tham số gọn hơn. Ví dụ, YOLO11m đạt 51.5 mAP chỉ với 20.1M tham số, trong khi YOLOXx đạt mức mAP tương tự là 51.1 nhưng đòi hỏi lượng tham số khổng lồ lên tới 99.1M. Hiệu quả bộ nhớ này trong quá trình huấn luyện và suy luận giúp YOLO11 rất phù hợp để triển khai trên các thiết bị AI biên, tránh các yêu cầu bộ nhớ CUDA nặng nề thường thấy ở các model cũ hơn hoặc dựa trên Transformer như RT-DETR.

Huấn luyện hiệu quả

Các model của Ultralytics yêu cầu ít bộ nhớ GPU hơn đáng kể trong quá trình đào tạo so với YOLOX và các kiến trúc dựa trên Transformer, cho phép các nhà nghiên cứu đào tạo các model mạnh mẽ trên phần cứng tiêu dùng tiêu chuẩn.

Hệ sinh thái và tính dễ sử dụng#

Một trong những khác biệt rõ rệt nhất giữa hai framework là trải nghiệm dành cho nhà phát triển.

YOLOX thường yêu cầu sao chép kho lưu trữ, thiết lập môi trường phức tạp và chạy các đối số dòng lệnh dài dòng để huấn luyện và xuất model sang các định dạng như ONNX hoặc TensorRT.

Ngược lại, Ultralytics YOLO11 cung cấp một Python API và CLI vô cùng đơn giản. Thư viện Ultralytics xử lý tăng cường dữ liệu (data augmentation), tinh chỉnh siêu tham số (hyperparameter tuning) và xuất file một cách tự động.

from ultralytics import YOLO

# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")

# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")

Hệ sinh thái được bảo trì tốt này được hỗ trợ bởi tài liệu chi tiết và khả năng tích hợp liền mạch với các công cụ như Weights & Biases để theo dõi thử nghiệm (experiment tracking).

Các trường hợp sử dụng lý tưởng#

Việc lựa chọn giữa các model này thường phụ thuộc vào các đặc thù của môi trường triển khai.

Khi nào nên sử dụng YOLOX#

  • Hệ thống kế thừa (Legacy Systems): Nếu bạn có một pipeline đã được thiết lập rõ ràng xoay quanh framework MegEngine hoặc các mô hình phát hiện đối tượng từ đầu năm 2021.
  • Cơ sở học thuật (Academic Baselines): Khi thực hiện nghiên cứu yêu cầu benchmark trực tiếp so với các kiến trúc cơ sở không cần neo từ kỷ nguyên 2021.

Khi nào nên sử dụng YOLO11#

  • Triển khai trong môi trường sản xuất: Dành cho các ứng dụng thương mại trong bán lẻ thông minh (smart retail) hoặc hệ thống báo động an ninh, nơi mã nguồn ổn định, được bảo trì và độ chính xác cao là những yếu tố bắt buộc.
  • Pipeline đa tác vụ (Multi-Task Pipelines): Khi một dự án yêu cầu theo dõi đối tượng, ước tính tư thế người và phân đoạn các instance bằng cách sử dụng một framework hợp nhất duy nhất.
  • Thiết bị biên bị hạn chế tài nguyên: Nhờ số lượng tham số thấp và thông lượng cao, YOLO11 là lựa chọn lý tưởng để triển khai trên Raspberry Pi hoặc các nút biên di động thông qua CoreMLNCNN.

Hướng tới tương lai: Lợi thế của YOLO26#

Mặc dù YOLO11 là một bước nhảy vọt lớn so với YOLOX, lĩnh vực thị giác máy tính đang tiến步 rất nhanh. Đối với các nhà phát triển bắt đầu các dự án mới ngay hôm nay, Ultralytics YOLO26 là khuyến nghị chính thức.

Được ra mắt vào tháng 1 năm 2026, YOLO26 tiếp thu sự xuất sắc về kiến trúc của YOLO11 và giới thiệu một số tính năng đột phá:

  • Thiết kế không cần NMS từ đầu đến cuối: YOLO26 loại bỏ quá trình xử lý hậu kỳ Triệt tiêu Non-Maximum (NMS), phát trực tuyến suy luận nguyên bản để tạo ra các pipeline triển khai đơn giản và nhanh chóng hơn (một khái niệm lần đầu tiên được khám phá trong YOLOv10).
  • Tốc độ CPU Inference nhanh hơn tới 43%: Thông qua việc loại bỏ Distribution Focal Loss (DFL), YOLO26 hiệu quả hơn đáng kể trên CPU và các thiết bị biên tiêu thụ điện năng thấp.
  • Trình tối ưu hóa MuSGD: Lấy cảm hứng từ các cải tiến đào tạo LLM từ Moonshot AI, trình tối ưu hóa MuSGD đảm bảo quá trình đào tạo ổn định cao và hội tụ nhanh chóng.
  • Hàm mất mát tiên tiến: Sử dụng ProgLoss + STAL, YOLO26 đạt được những cải tiến đáng kể trong việc nhận diện đối tượng nhỏ, điều rất quan trọng đối với ảnh chụp từ drone và robot tự hành.

Đối với đại đa số các tác vụ thị giác máy tính hiện đại, việc nâng cấp pipeline của bạn để tận dụng YOLO26 sẽ mang lại sự cân bằng tối ưu nhất về tốc độ, độ chính xác và sự đơn giản trong triển khai.

Người đóng góp

Bình luận