Ultralytics YOLO27:
Get Started

YOLOv10 so với YOLOX#

Lĩnh vực thị giác máy tính được thúc đẩy bởi những tiến bộ nhanh chóng trong các kiến trúc phát hiện đối tượng thời gian thực. Bài so sánh kỹ thuật chi tiết này tìm hiểu hai model có ảnh hưởng lớn, góp phần mở rộng giới hạn về hiệu quả và mô hình thiết kế: YOLOv10 và YOLOX. Bằng cách xem xét sự khác biệt về kiến trúc, các chỉ số hiệu năng và phương pháp huấn luyện, nhà phát triển và nhà nghiên cứu có thể đưa ra quyết định sáng suốt khi triển khai các hệ thống thị giác đáng tin cậy.

Bối cảnh và nguồn gốc của các model#

Hiểu rõ nguồn gốc của các model học sâu này giúp cung cấp bối cảnh hữu ích về mục tiêu kiến trúc và các trường hợp sử dụng mà chúng hướng đến.

YOLOv10: Loại bỏ NMS để phát hiện end-to-end thực sự#

Được phát triển nhằm giải quyết các nút thắt độ trễ tồn tại lâu nay, YOLOv10 giới thiệu phương pháp end-to-end gốc cho dòng YOLO.

Tìm hiểu thêm về YOLOv10

YOLOX: Thu hẹp khoảng cách giữa nghiên cứu và công nghiệp#

YOLOX ra đời như một phiên bản không dùng anchor của thiết kế YOLO truyền thống, cung cấp phương pháp đơn giản hơn với hiệu năng cạnh tranh, đặc biệt hướng đến việc giúp cộng đồng công nghiệp triển khai dễ dàng hơn.

Tìm hiểu thêm về YOLOX

Điểm nổi bật và cải tiến về kiến trúc#

Cả hai framework đều khác với các bộ phát hiện truyền thống dựa trên anchor, nhưng giải quyết những vấn đề khác nhau trong pipeline phát hiện đối tượng.

Kiến trúc YOLOX#

YOLOX mang đến một số cập nhật quan trọng cho hệ sinh thái vào năm 2021. Đóng góp chính của model là chuyển sang thiết kế bộ phát hiện không dùng anchor. Bằng cách loại bỏ các anchor box được xác định trước, YOLOX giảm đáng kể số lượng tham số thiết kế và mức tinh chỉnh heuristic cần thiết cho các dataset khác nhau.

Ngoài ra, YOLOX sử dụng head tách biệt, phân tách các tác vụ phân loại và hồi quy. Điều này giải quyết xung đột giữa hai mục tiêu, giúp tăng đáng kể tốc độ hội tụ trong quá trình huấn luyện. Model cũng sử dụng SimOTA để gán nhãn nâng cao, cải thiện khả năng xử lý các cảnh đông đúc và hiện tượng che khuất thường gặp trong dataset COCO.

Ưu thế của thiết kế không dùng anchor

Các thiết kế không dùng anchor, chẳng hạn thiết kế do YOLOX tiên phong, giúp giảm đáng kể độ phức tạp khi tinh chỉnh model. Nhà phát triển không còn cần chạy phân cụm k-means trên dataset tùy chỉnh để xác định kích thước anchor box tối ưu, nhờ đó tiết kiệm thời gian chuẩn bị quý báu.

Kiến trúc YOLOv10#

Dù YOLOX cải tiến head phát hiện, model vẫn phụ thuộc vào Non-Maximum Suppression (NMS) trong quá trình suy luận, gây ra độ biến thiên về độ trễ. YOLOv10 nhắm trực tiếp vào hạn chế này bằng cách giới thiệu chiến lược gán nhãn kép nhất quán để huấn luyện không cần NMS. Trong quá trình huấn luyện, model sử dụng cả phương pháp gán nhãn một-nhiều và một-một; khi suy luận, model loại bỏ hoàn toàn head một-nhiều, tạo ra các dự đoán gọn mà không cần hậu xử lý NMS.

YOLOv10 còn có thiết kế model toàn diện, cân bằng giữa hiệu quả và độ chính xác. Model tích hợp các head phân loại gọn nhẹ và kỹ thuật giảm mẫu tách biệt không gian-kênh, giúp giảm đáng kể số lượng tham số và FLOPs mà không làm giảm độ chính xác.

So sánh hiệu năng#

Đánh giá các model này trên phần cứng như GPU NVIDIA T4 cho thấy những ưu thế riêng tùy theo quy mô. Bảng dưới đây trình bày phần so sánh toàn diện.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Như đã thấy ở trên, YOLOv10 mở rộng quy mô rất hiệu quả. Biến thể YOLOv10x đạt độ chính xác cao nhất (54.4 mAP), trong khi biến thể YOLOv10n có tốc độ suy luận nhanh nhất nhờ tích hợp TensorRT. Ngược lại, model nano YOLOX đời cũ có footprint tổng thể nhỏ nhất, phù hợp với các môi trường bị giới hạn nghiêm ngặt về tài nguyên.

Phương pháp huấn luyện và yêu cầu tài nguyên#

Khi triển khai model vào môi trường production, hệ sinh thái huấn luyện và nhu cầu tài nguyên cũng quan trọng không kém tốc độ suy luận thuần túy.

YOLOX thường phụ thuộc vào các cấu hình môi trường cũ, có thể gây khó khăn trong quản lý. Ngoài ra, codebase cũ của model đòi hỏi nhiều boilerplate code hơn để thực hiện huấn luyện phân tán đa GPU hoặc tối ưu hóa độ chính xác hỗn hợp.

Ngược lại, YOLOv10 tích hợp mượt mà với các workflow PyTorch hiện đại, nhưng chính hệ sinh thái Ultralytics mới thực sự nâng tầm trải nghiệm của nhà phát triển. Các model Ultralytics có mức sử dụng bộ nhớ CUDA khi huấn luyện thấp hơn đáng kể so với các kiến trúc dựa trên Transformer như RT-DETR.

Ví dụ mã: Huấn luyện đơn giản hóa#

Với API Ultralytics thống nhất, bạn có thể dễ dàng huấn luyện các model tiên tiến nhất chỉ bằng vài dòng Python. Cách này tránh phải biên dịch thủ công các toán tử C++ hoặc xử lý các tệp cấu hình phức tạp.

from ultralytics import YOLO

# Khởi tạo model YOLOv10 đã được huấn luyện trước
model = YOLO("yolov10s.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Đánh giá hiệu năng của model
metrics = model.val()

# Xuất model đã tối ưu hóa sang định dạng ONNX
model.export(format="onnx")

Cú pháp đơn giản này cho phép sử dụng ngay độ chính xác hỗn hợp tự động, tăng cường dữ liệu tự động và tích hợp sẵn với các công cụ như Weights & Biases.

Trường hợp sử dụng và khuyến nghị#

Việc chọn YOLOv10 hay YOLOX tùy thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là lựa chọn phù hợp cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
  • Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.

Khi nào nên chọn YOLOX#

YOLOX được khuyến nghị cho:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các head phát hiện hoặc hàm loss mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động đời cũ, nơi kích thước cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các dự án nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên vận tải tối ưu và ảnh hưởng của chúng đến quá trình hội tụ khi huấn luyện.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Tương lai của AI thị giác: YOLO26 ra mắt#

Dù YOLOv10 và YOLOX là những cột mốc quan trọng, lĩnh vực thị giác máy tính vẫn không ngừng tiến lên. Với nhà phát triển bắt đầu dự án mới hiện nay, Ultralytics YOLO26 là lựa chọn được khuyến nghị hàng đầu.

Ra mắt vào tháng 1 năm 2026, Ultralytics YOLO26 kế thừa đột phá nền tảng của thiết kế end-to-end không cần NMS do YOLOv10 tiên phong, đồng thời tiếp tục cải tiến để đạt độ ổn định và tốc độ cao hơn.

YOLO26 nổi bật nhờ mang đến một số bước tiến vượt bậc:

  • Suy luận CPU nhanh hơn đến 43%: Bằng cách loại bỏ có chủ đích Distribution Focal Loss (DFL), YOLO26 đạt hiệu năng vượt trội trên các thiết bị biên không có GPU.
  • Optimizer MuSGD: Lấy cảm hứng từ độ ổn định trong huấn luyện LLM, phương pháp lai mới này kết hợp SGD và Muon để bảo đảm hội tụ nhanh hơn và quá trình huấn luyện ổn định cao.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố then chốt đối với ảnh chụp từ trên không và cảm biến IoT.
  • Tính linh hoạt vượt trội: Khác với YOLOX vốn chỉ là bộ phát hiện đối tượng, YOLO26 hỗ trợ nguyên bản phân đoạn đối tượng, ước lượng tư thế, phân loại ảnh và phát hiện OBB trong cùng một thư viện thống nhất.
Khai thác Ultralytics Platform

Để đưa model vào production một cách đơn giản nhất, nhà phát triển có thể sử dụng Ultralytics Platform để gán nhãn dataset, huấn luyện model YOLO26 trên cloud và triển khai lên mọi thiết bị biên mà không cần thiết lập.

Ứng dụng thực tế#

Việc chọn đúng model quyết định thành công của các lượt triển khai thực tế trong nhiều ngành khác nhau.

Phân tích video tốc độ cao#

Để xử lý các luồng video dày đặc, chẳng hạn như quản lý giao thông trong thành phố thông minh, YOLOv10 mang lại lợi thế đáng kể nhờ hậu xử lý không cần NMS. Loại bỏ nút thắt NMS giúp duy trì độ trễ thấp ổn định, khiến model trở thành lựa chọn lý tưởng để kết hợp với các thuật toán theo dõi như BoT-SORT.

Triển khai trên thiết bị biên đời cũ#

Trong các môi trường học thuật cũ hoặc ứng dụng Android đời cũ được tối ưu mạnh cho mô hình tích chập thuần túy, các model nhỏ hơn như YOLOX-Tiny vẫn có thể phù hợp với những trường hợp sử dụng chuyên biệt, khi việc duy trì môi trường PyTorch cũ là sự đánh đổi có thể chấp nhận.

Thiết bị biên và IoT hiện đại#

Đối với các lượt triển khai trên phần cứng thế hệ mới, chẳng hạn robot, drone và phân tích hàng hóa trên kệ bán lẻ, YOLO26 là giải pháp tối ưu. Độ trễ CPU giảm mạnh và khả năng phát hiện đối tượng nhỏ vượt trội giúp model đặc biệt phù hợp với điều hướng tự hành và quản lý hàng tồn kho chi tiết.

Để mở rộng bộ công cụ học sâu bằng các nội dung so sánh khác, bạn cũng có thể tìm hiểu cách các model này so với những lựa chọn thay thế như YOLO11 linh hoạt hoặc RT-DETR ứng dụng Transformer.

Người đóng góp

Bình luận