Ultralytics YOLO27:
Get Started

YOLOX so với YOLOv8#

Trong vài năm qua, lĩnh vực thị giác máy tính đã chứng kiến những tiến bộ đáng kể trong phát hiện đối tượng thời gian thực. Khi các nhà nghiên cứu và kỹ sư liên tục nâng cao giới hạn về độ chính xác và tốc độ, việc lựa chọn trong số các model hiện có có thể là một thách thức. Hướng dẫn toàn diện này đưa ra so sánh kỹ thuật chuyên sâu giữa hai kiến trúc có ảnh hưởng lớn: YOLOX và Ultralytics YOLOv8.

Bằng cách phân tích kiến trúc riêng biệt, phương pháp huấn luyện và khả năng triển khai của từng model, nhà phát triển có thể đưa ra quyết định sáng suốt khi chọn framework tối ưu cho dự án trí tuệ nhân tạo.

YOLOX: Kết nối nghiên cứu với công nghiệp#

YOLOX nổi lên như một model mang tính bước ngoặt, giúp thu hẹp thành công khoảng cách giữa nghiên cứu học thuật và ứng dụng công nghiệp. Model đưa thiết kế không anchor trở lại, giảm đáng kể số lượng tham số thiết kế và việc tinh chỉnh heuristic cần thiết cho các bộ phát hiện trước đây dựa trên anchor.

Thông tin model:

Điểm nổi bật về kiến trúc#

YOLOX tích hợp một số sửa đổi quan trọng giúp model khác biệt với các phiên bản tiền nhiệm. Đáng chú ý nhất là head tách rời, chia các tác vụ phân loại và hồi quy bounding box thành những nhánh riêng biệt. Lựa chọn kiến trúc này giải quyết xung đột vốn có giữa sự căn chỉnh không gian cần thiết cho hồi quy và tính bất biến tịnh tiến cần thiết cho phân loại, giúp tăng tốc độ hội tụ trong quá trình huấn luyện.

Ngoài ra, YOLOX sử dụng chiến lược gán nhãn SimOTA. Phương pháp gán động này mô hình hóa việc ghép đối tượng ground truth với các dự đoán thành bài toán vận tải tối ưu, giúp giảm thời gian huấn luyện đồng thời cải thiện độ chính xác trung bình (mAP). Model cũng sử dụng các kỹ thuật tăng cường dữ liệu mạnh như MixUp và Mosaic, nhưng đáng chú ý là tắt các kỹ thuật này trong những epoch cuối để ổn định các đặc trưng đã học.

Tìm hiểu thêm về YOLOX

YOLOv8: Tiêu chuẩn hệ sinh thái linh hoạt#

Được xây dựng trên nền tảng nhiều năm nghiên cứu liên tục, Ultralytics YOLOv8 đánh dấu bước phát triển lớn của các model thị giác máy tính tiên tiến nhất. Model được thiết kế từ đầu không chỉ để phát hiện đối tượng mà còn là một framework đa tác vụ toàn diện, có khả năng xử lý nhiều thách thức nhận diện hình ảnh với API vô cùng dễ tiếp cận.

Thông tin model:

Những cải tiến về kiến trúc#

YOLOv8 giới thiệu kiến trúc tinh gọn, thay thế module C3 bằng module C2f hiệu quả hơn, cải thiện luồng gradient và khả năng trích xuất đặc trưng mà không làm tăng đáng kể số lượng tham số. Tương tự YOLOX, YOLOv8 sử dụng thiết kế không anchor và head tách biệt; tuy nhiên, model cải tiến cách tính loss bằng cách tích hợp Distribution Focal Loss (DFL) và CIoU loss, từ đó tạo ra các dự đoán bounding box chặt chẽ hơn nhiều, đặc biệt với các đối tượng nhỏ hoặc chồng lấp.

Hệ sinh thái Ultralytics

Một trong những thế mạnh lớn nhất của YOLOv8 là khả năng tích hợp sâu vào hệ sinh thái Ultralytics. Dù bạn sử dụng Python API hợp nhất hay giao diện trực quan của Ultralytics Platform, quá trình chuyển đổi từ huấn luyện sang triển khai diễn ra liền mạch, hỗ trợ sẵn các định dạng từ ONNX đến TensorRT.

Ngoài phát hiện đối tượng tiêu chuẩn, YOLOv8 còn hỗ trợ sẵn phân đoạn instance, phân loại ảnh, ước tính tư thế và bounding box định hướng (OBB). Khả năng xử lý đa tác vụ này khiến YOLOv8 trở thành lựa chọn hấp dẫn cho các môi trường production phức tạp, nơi cần duy trì nhiều loại model.

So sánh hiệu năng và chỉ số#

Khi so sánh các model này, nhà phát triển cần cân nhắc sự đánh đổi giữa độ chính xác, độ trễ suy luận và chi phí tính toán. Bảng dưới đây minh họa các benchmark của cả hai dòng model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8

YOLOv8 luôn cho thấy mAP vượt trội ở các kích thước tham số tương đương, đồng thời duy trì tốc độ GPU xuất sắc. Hơn nữa, các model Ultralytics nổi tiếng nhờ yêu cầu bộ nhớ thấp hơn trong quá trình huấn luyện. Đây là lợi thế quan trọng khi tăng batch size trên phần cứng phổ thông, đặc biệt khi so sánh với các kiến trúc Transformer tiêu tốn nhiều tài nguyên như RT-DETR, vốn sử dụng nhiều CUDA memory hơn đáng kể.

Trải nghiệm phát triển và triển khai#

Làm việc với các codebase nghiên cứu cũ thường đòi hỏi cấu hình môi trường phức tạp và viết mã mẫu tùy chỉnh cho suy luận. Ngược lại, Ultralytics API đơn giản hóa quy trình này chỉ còn vài dòng Python.

from ultralytics import YOLO

# Khởi tạo model YOLOv8 small
model = YOLO("yolov8s.pt")

# Huấn luyện model dễ dàng trên tập dữ liệu tùy chỉnh
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Đánh giá độ chính xác của model
metrics = model.val()

# Chạy suy luận trên ảnh kiểm thử
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

Giao diện hợp nhất này là đặc trưng của hệ sinh thái Ultralytics được duy trì tốt, giúp nhà phát triển dành ít thời gian hơn để gỡ lỗi môi trường và nhiều thời gian hơn để cải tiến giải pháp thị giác máy tính.

Trường hợp sử dụng và khuyến nghị#

Việc chọn YOLOX hay YOLOv8 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOX#

YOLOX là lựa chọn phù hợp khi:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các head phát hiện hoặc hàm loss mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động đời cũ, nơi kích thước cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các dự án nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên vận tải tối ưu và ảnh hưởng của chúng đến quá trình hội tụ khi huấn luyện.

Khi nào nên chọn YOLOv8#

YOLOv8 được khuyến nghị cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án cần một model đã được kiểm chứng cho phát hiện, phân đoạn, phân loại và ước lượng tư thế trong hệ sinh thái Ultralytics.
  • Hệ thống sản xuất đã thiết lập: Các môi trường sản xuất hiện có được xây dựng trên kiến trúc YOLOv8 với quy trình triển khai ổn định, đã được kiểm thử kỹ lưỡng.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng rãi: Các ứng dụng hưởng lợi từ kho hướng dẫn phong phú, tích hợp bên thứ ba và tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Hướng tới tương lai: Kiến trúc YOLO26#

Mặc dù YOLOv8 mang lại sự cân bằng và khả năng sử dụng vượt trội, lĩnh vực trí tuệ nhân tạo vẫn tiếp tục phát triển nhanh chóng. Ra mắt vào tháng 1 năm 2026, YOLO26 là tiêu chuẩn hàng đầu cho triển khai edge và cloud hiện đại, kế thừa các khái niệm nền tảng từ những thế hệ trước và liên tục tối ưu hóa chúng.

YOLO26 giới thiệu thiết kế end-to-end không cần NMS: head one-to-one tùy chọn (nms=False) bỏ qua bước hậu xử lý non-maximum suppression theo heuristic. Đột phá này đảm bảo độ trễ ổn định, có tính xác định trên nhiều mục tiêu triển khai khác nhau. Hơn nữa, bằng cách chủ động loại bỏ module Distribution Focal Loss (DFL), YOLO26 đạt tốc độ suy luận CPU nhanh hơn tới 43%, trở thành lựa chọn tối ưu cho hệ thống nhúng và ứng dụng di động.

Độ ổn định huấn luyện cũng được cải thiện đáng kể trong YOLO26 nhờ tích hợp optimizer MuSGD mới—kết hợp SGD và Muon để tăng tốc hội tụ. Cùng với các hàm loss mới ProgLoss + STAL, YOLO26 cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố rất quan trọng trong lập bản đồ bằng drone và hệ thống báo động an ninh.

Kết luận và khuyến nghị#

Khi đánh giá các framework cũ so với giải pháp hiện đại, xu hướng phát triển đã rõ ràng. YOLOX từng là bước đệm quan trọng trong quá trình chuyển đổi sang phương pháp không anchor, nhưng việc thiếu hệ sinh thái đa tác vụ tích hợp làm hạn chế tính hữu dụng của model trong môi trường production có nhịp độ nhanh.

Với nhà phát triển ưu tiên trải nghiệm liền mạch, hỗ trợ tác vụ đa dạng và sự hậu thuẫn mạnh mẽ từ cộng đồng, YOLOv8 vẫn là lựa chọn rất đáng tin cậy. Tuy nhiên, với những ai muốn tối đa hóa hiệu năng điện toán edge, loại bỏ nút thắt NMS và đạt độ chính xác cao nhất nhờ các cải tiến huấn luyện mới nhất, YOLO26 là model được khuyến nghị hàng đầu cho mọi dự án thị giác máy tính mới.

Nếu muốn khám phá các model khác trong bộ sản phẩm Ultralytics, bạn cũng có thể xem xét đặc tính hiệu năng của YOLO11 hoặc tìm hiểu các khái niệm tiên phong không cần NMS từng được thử nghiệm ban đầu trong YOLOv10.

Người đóng góp

Bình luận