Ultralytics YOLO27:
Get Started

YOLOX so với YOLOv9#

Bức tranh toàn cảnh của lĩnh vực thị giác máy tính được định hình bởi những đột phá kiến trúc liên tục nhằm cân bằng hiệu quả tính toán với độ chính xác cao. Khi đánh giá các model phát hiện đối tượng thời gian thực, việc so sánh YOLOX của Megvii với YOLOv9 của Academia Sinica cho thấy hai triết lý phát triển deep learning khác biệt. Một bên tiên phong với mô hình không anchor đơn giản hóa, bên còn lại giới thiệu các kỹ thuật định tuyến gradient tiên tiến để tối đa hóa khả năng lưu giữ thông tin.

Hướng dẫn kỹ thuật này phân tích những khác biệt tinh tế về kiến trúc, benchmark hiệu năng và trường hợp sử dụng lý tưởng, đồng thời minh họa cách các giải pháp hiện đại như Nền tảng Ultralytics và model YOLO26 mới ra mắt mang đến lựa chọn thay thế vượt trội cho triển khai sẵn sàng đưa vào production.

YOLOX: Tiên phong với mô hình không anchor#

Ra mắt vào giữa năm 2021, YOLOX là bước tiến lớn giúp thu hẹp khoảng cách giữa nghiên cứu học thuật và ứng dụng công nghiệp. Bằng cách loại bỏ nhu cầu sử dụng các anchor box xác định trước, model đơn giản hóa đáng kể việc tinh chỉnh heuristic cần thiết cho các dataset tùy chỉnh.

Các cải tiến kiến trúc#

YOLOX giới thiệu một số thay đổi quan trọng cho pipeline phát hiện tiêu chuẩn. Model triển khai head tách rời, phân chia tác vụ phân loại và hồi quy, giúp giảm đáng kể xung đột giữa việc nhận diện đối tượng và xác định vị trí ranh giới của đối tượng. Ngoài ra, YOLOX sử dụng SimOTA, một chiến lược gán nhãn tiên tiến giúp phân bổ động các mẫu dương trong quá trình huấn luyện, từ đó hội tụ nhanh hơn và cải thiện hiệu năng tổng thể trên các dataset benchmark tiêu chuẩn.

Ưu điểm và hạn chế#

Điểm mạnh chính của YOLOX nằm ở thiết kế đơn giản hóa. Cơ chế không anchor giúp nhà phát triển giảm thời gian chạy các thuật toán phân cụm để tìm kích thước anchor tối ưu cho dữ liệu cụ thể. Tuy nhiên, vì là kiến trúc cũ hơn được xây dựng nguyên bản mà không có các tiến bộ gần đây về self-attention hay định tuyến gradient, model khó đạt được hiệu quả tham số của các mạng mới hơn. Model cũng không hỗ trợ nguyên bản các tác vụ nâng cao như phân đoạn đối tượng và ước lượng tư thế trong một API thống nhất.

Tìm hiểu thêm về YOLOX

YOLOv9: Tối đa hóa thông tin gradient#

Đến năm 2024, YOLOv9 giới thiệu một cách tiếp cận giàu tính lý thuyết để giải quyết vấn đề nút thắt thông tin vốn có trong các mạng nơ-ron tích chập sâu.

Các cải tiến kiến trúc#

Đặc điểm nổi bật của YOLOv9 là Thông tin Gradient Lập trình được (PGI), bảo đảm dữ liệu ngữ nghĩa quan trọng không bị mất khi đi qua nhiều lớp của mạng. Kết hợp với Mạng Tổng hợp Lớp Hiệu quả Tổng quát (GELAN), YOLOv9 đạt tỷ lệ tham số trên độ chính xác đặc biệt cao. Nhờ đó, model giữ được gradient chính xác để cập nhật trọng số, mang lại hiệu quả cao ngay cả ở các phiên bản nhẹ.

Ưu điểm và hạn chế#

YOLOv9 thể hiện xuất sắc khi đẩy giới hạn lý thuyết của độ chính xác model. Model đạt điểm mAP rất cao trên COCO, nên được các nhà nghiên cứu ưa chuộng. Tuy nhiên, dù hiệu quả, YOLOv9 vẫn dựa vào ức chế phi cực đại (NMS) truyền thống để hậu xử lý, gây ra các đợt tăng đột biến độ trễ trong quá trình suy luận. Với các kỹ sư tập trung triển khai AI lên thiết bị biên, việc quản lý logic NMS làm tăng độ phức tạp không cần thiết cho pipeline triển khai.

Tìm hiểu thêm về YOLOv9

Nút thắt trong bước hậu xử lý

Các model truyền thống như YOLOX và YOLOv9 cần ức chế phi cực đại (NMS) để lọc các bounding box trùng lặp. Bước này vốn có tính tuần tự và thường tạo nút thắt trên CPU, cho thấy nhu cầu về các kiến trúc đầu-cuối nguyên bản có trong những model Ultralytics mới nhất.

So sánh hiệu năng#

Khi so sánh các chỉ số tính toán thô của những kiến trúc này, có thể thấy YOLOv9 cung cấp baseline hiện đại hơn, trong khi YOLOX vẫn là lựa chọn nhẹ cho các hệ thống cũ. Dưới đây là phân tích chi tiết các model tiêu chuẩn của chúng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Mặc dù YOLOv9 thể hiện độ chính xác vượt trội với số lượng tham số tương đương, các nhà phát triển tìm kiếm sự cân bằng tối ưu giữa tốc độ, độ chính xác và tính dễ sử dụng nên cân nhắc những cải tiến mới nhất từ Ultralytics.

Lợi thế của Ultralytics: Khám phá YOLO26#

Mặc dù việc đánh giá các model lịch sử như YOLOX và YOLOv9 cung cấp bối cảnh hữu ích, tiêu chuẩn tiên tiến hiện nay là Ultralytics YOLO26. Ra mắt vào đầu năm 2026, YOLO26 tái thiết kế căn bản pipeline phát hiện cho môi trường doanh nghiệp hiện đại.

Đổi mới kiến trúc vượt trội#

YOLO26 giải quyết các nút thắt hậu xử lý của những phiên bản trước bằng thiết kế đầu-cuối không cần NMS tùy chọn (nms=False), giúp đơn giản hóa việc triển khai trên mọi phần cứng. Ngoài ra, bằng cách loại bỏ Distribution Focal Loss (DFL) và tích hợp Bộ tối ưu MuSGD mới—kết hợp Stochastic Gradient Descent và Muon—YOLO26 đạt được độ ổn định huấn luyện chưa từng có.

Với các nhà phát triển triển khai trên môi trường giới hạn tài nguyên như Raspberry Pi, YOLO26 mang lại tốc độ suy luận trên CPU nhanh hơn đến 43%. Model cũng giới thiệu ProgLoss + STAL (Progressive Loss và Small-Target-Aware Label Assignment), cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố quan trọng đối với ảnh hàng không và phân tích drone.

Hệ sinh thái phát triển tinh gọn#

Khác với các kho nghiên cứu độc lập, hệ sinh thái Ultralytics mang đến trải nghiệm dành cho nhà phát triển vượt trội. Sử dụng Ultralytics Python API, kỹ sư có thể giảm đáng kể mã boilerplate. Ngoài ra, yêu cầu bộ nhớ được tối ưu cao, cho phép bạn huấn luyện model mạnh mẽ với VRAM GPU ít hơn so với các kiến trúc phụ thuộc nhiều vào attention.

from ultralytics import YOLO

# Tải model YOLO26 small được tối ưu cao, không cần NMS
model = YOLO("yolo26s.pt")

# Huấn luyện trên dataset tùy chỉnh với mức sử dụng bộ nhớ tối thiểu
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Dễ dàng export sang các định dạng triển khai đã tối ưu
model.export(format="engine", quantize=16)  # Xuất sang TensorRT

Ngoài phát hiện, YOLO26 còn hỗ trợ liền mạch nhiều tác vụ trong cùng một framework. Dù cần Bounding Box Định hướng (OBB) chính xác để xử lý ảnh vệ tinh hay mask pixel chi tiết cho ứng dụng chẩn đoán hình ảnh, quy trình làm việc vẫn giống nhau. Với các nhóm đang sử dụng quy trình làm việc của thế hệ trước, Ultralytics YOLO11 cũng sẵn có và được hỗ trợ đầy đủ.

Trường hợp sử dụng lý tưởng và chiến lược triển khai#

Việc chọn kiến trúc phù hợp hoàn toàn phụ thuộc vào môi trường triển khai mục tiêu và yêu cầu dự án của bạn.

Điện toán biên và robot#

Trên thiết bị công suất thấp, sử dụng model cần hậu xử lý nặng có thể làm suy giảm nghiêm trọng hiệu năng. Dù YOLOX-Nano cực kỳ nhỏ, độ chính xác thường không đủ cho các tác vụ trọng yếu về an toàn. YOLO26 là lựa chọn hàng đầu trong trường hợp này; head không DFL và khả năng suy luận tùy chọn không cần NMS cho phép model chạy mượt trên các luồng CPU thuần, rất phù hợp với robot tự hành hoặc quản lý bãi đỗ xe thông minh.

Đánh giá benchmark học thuật#

Nếu mục tiêu duy nhất là phân tích luồng gradient và nghiên cứu các nút thắt trong mạng sâu, YOLOv9 vẫn là một đối tượng nghiên cứu xuất sắc. Framework PGI cung cấp những thông tin thú vị về cách các đặc trưng được bảo toàn qua các lớp của mạng nơ-ron sâu, khiến model trở thành công cụ hữu ích cho các nhà nghiên cứu đại học tìm hiểu lý thuyết tích chập.

Phân tích video doanh nghiệp#

Với các tác vụ xử lý video quy mô lớn như hệ thống cảnh báo an ninh hoặc giám sát giao thông, tốc độ và khả năng export linh hoạt là yếu tố tối quan trọng. Các công cụ export nguyên bản của framework Ultralytics cho phép nhóm biên dịch trực tiếp YOLO26 sang TensorRT hoặc OpenVINO chỉ bằng một lệnh, giúp rút ngắn đáng kể thời gian đưa sản phẩm ra thị trường.

Bằng cách tận dụng các tính năng toàn diện của hệ sinh thái Ultralytics, các nhóm machine learning có thể bỏ qua sự phức tạp của các codebase nghiên cứu thô và tập trung trực tiếp vào việc xây dựng ứng dụng AI thực tế có khả năng mở rộng.

Người đóng góp

Bình luận