Ultralytics YOLO27:
Get Started

YOLOv6-3.0 và YOLOX#

Bức tranh thị giác máy tính chịu ảnh hưởng sâu sắc từ các model hướng đến thu hẹp khoảng cách giữa nghiên cứu học thuật và ứng dụng công nghiệp. Khi đánh giá các framework phát hiện đối tượng được thiết kế cho triển khai hiệu năng cao, YOLOv6-3.0 và YOLOX thường là những ứng viên nổi bật. Cả hai model đều đưa ra triết lý kiến trúc riêng nhằm tối đa hóa thông lượng và độ chính xác, nhưng khác biệt đáng kể về lựa chọn thiết kế và mục tiêu triển khai chính.

So sánh kỹ thuật toàn diện này đi sâu vào kiến trúc, chỉ số hiệu năng và các trường hợp sử dụng lý tưởng của YOLOv6-3.0 và YOLOX, đồng thời tìm hiểu cách model Ultralytics YOLO26 thế hệ mới kế thừa và vượt qua những đổi mới này.

YOLOv6-3.0: Thông lượng công nghiệp#

Được phát triển bởi Bộ phận AI Thị giác của Meituan, YOLOv6-3.0 được định vị rõ ràng là framework phát hiện đối tượng một giai đoạn, tối ưu cho ứng dụng công nghiệp. Model này ưu tiên tối đa thông lượng trên kiến trúc GPU.

Kiến trúc và phương pháp#

YOLOv6-3.0 giới thiệu module nối kết hai chiều (BiC) để cải thiện hợp nhất đặc trưng giữa các quy mô khác nhau. Backbone được xây dựng dựa trên thiết kế EfficientRep, tối ưu mạnh cho inference GPU thân thiện với phần cứng, khiến model đặc biệt hiệu quả trong môi trường xử lý backend tận dụng NVIDIA TensorRT.

Ngoài ra, YOLOv6-3.0 sử dụng chiến lược huấn luyện hỗ trợ anchor (AAT). Phương pháp mới này tận dụng tính ổn định của huấn luyện dựa trên anchor, đồng thời duy trì pipeline inference không anchor, kết hợp hiệu quả ưu điểm của cả hai mô hình mà không phát sinh chi phí độ trễ khi triển khai.

Tối ưu hóa phần cứng chuyên biệt

Dù YOLOv6 hoạt động xuất sắc trên GPU chuyên dụng, kiến trúc chuyên biệt cao đôi khi có thể dẫn đến độ trễ chưa tối ưu khi triển khai trên CPU thông thường hoặc thiết bị edge công suất thấp.

Tìm hiểu thêm về YOLOv6

YOLOX: Kết nối nghiên cứu với công nghiệp#

Được Megvii giới thiệu, YOLOX đánh dấu bước chuyển đáng kể của dòng YOLO khi hoàn toàn áp dụng thiết kế không anchor kết hợp với các chiến lược huấn luyện tiên tiến như SimOTA.

Kiến trúc và phương pháp#

YOLOX tích hợp thành công cơ chế không anchor với cấu trúc head tách rời. Bằng cách tách các tác vụ phân loại và hồi quy thành những luồng riêng biệt, YOLOX cải thiện đáng kể tốc độ hội tụ và giảm thiểu các mục tiêu xung đột thường xuất hiện trong head phát hiện kết hợp.

Ngoài ra, YOLOX tích hợp sẵn các chiến lược tăng cường dữ liệu mạnh mẽ (như MixUp và Mosaic) vào pipeline huấn luyện, cải thiện đáng kể độ bền vững khi huấn luyện từ đầu trên các benchmark tiêu chuẩn như dataset COCO.

Ưu điểm của head tách rời

Head tách rời trong YOLOX là một cột mốc quan trọng, truyền cảm hứng cho các thế hệ model phát hiện tiếp theo bằng cách chứng minh rằng việc tách các đặc trưng theo từng tác vụ giúp nâng cao độ chính xác tổng thể.

Tìm hiểu thêm về YOLOX

So sánh hiệu năng và chỉ số#

Khi so sánh trực tiếp các model này, có thể thấy rõ sự đánh đổi giữa tốc độ, số lượng tham số và độ chính xác. Bảng hiệu năng chi tiết dưới đây nêu bật các model tiêu biểu của cả hai dòng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Dù YOLOX có các biến thể cực kỳ gọn nhẹ như Nano, YOLOv6-3.0 mở rộng quy mô tốt hơn ở phân khúc cao cấp, mang lại mAP vượt trội cho các model lớn hơn cùng khả năng tăng tốc TensorRT tuyệt vời. Tuy nhiên, cả hai model đều dựa vào các repository huấn luyện cũ, có thể khó tích hợp vào ứng dụng hiện đại.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv6 và YOLOX phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và hệ sinh thái bạn ưu tiên.

Khi nào nên chọn YOLOv6#

YOLOv6 là lựa chọn phù hợp cho:

  • Triển khai tương thích với phần cứng công nghiệp: Các tình huống mà thiết kế nhận biết phần cứng và tái tham số hóa hiệu quả của model mang lại hiệu năng tối ưu trên phần cứng mục tiêu cụ thể.
  • Detection một giai đoạn tốc độ cao: Các ứng dụng ưu tiên tốc độ suy luận GPU thô để xử lý video thời gian thực trong môi trường được kiểm soát.
  • Tích hợp hệ sinh thái Meituan: Các nhóm đang làm việc trong ngăn xếp công nghệ và hạ tầng triển khai của Meituan.

Khi nào nên chọn YOLOX#

YOLOX được khuyến nghị cho:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các head phát hiện hoặc hàm loss mới.
  • Thiết bị biên siêu nhẹ: Triển khai trên vi điều khiển hoặc phần cứng di động đời cũ, nơi kích thước cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các dự án nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên vận tải tối ưu và ảnh hưởng của chúng đến quá trình hội tụ khi huấn luyện.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Ưu thế của Ultralytics: Giới thiệu YOLO26#

Dù YOLOv6 và YOLOX đã mở rộng giới hạn của lĩnh vực phát hiện đối tượng trong thời kỳ tương ứng, thị giác máy tính hiện đại đòi hỏi nhiều hơn việc dự đoán bounding box. Developer cần framework thống nhất, pipeline triển khai liền mạch và cơ chế huấn luyện hiệu quả. Đây là thế mạnh của Ultralytics Platform, đặc biệt với sự ra mắt của YOLO26.

Ra mắt vào tháng 1 năm 2026, YOLO26 đánh dấu bước chuyển đổi mô hình. Model mang lại hiệu năng vượt trội đồng thời duy trì hệ sinh thái đặc biệt thân thiện với developer.

Những cải tiến chính của YOLO26#

  • Thiết kế end-to-end không cần NMS: Dựa trên các khái niệm được tiên phong trong YOLOv10, YOLO26 cung cấp head không cần NMS nguyên bản (nms=False), loại bỏ nhu cầu hậu xử lý triệt tiêu cực đại không tối đa (NMS). Điều này giúp giảm đáng kể độ biến thiên độ trễ và đơn giản hóa việc triển khai trên edge.
  • Optimizer MuSGD: YOLO26 kế thừa các cải tiến về độ ổn định trong huấn luyện LLM, sử dụng optimizer MuSGD kết hợp (lấy cảm hứng từ Kimi K2 của Moonshot AI). Nhờ đó, quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh hơn so với các optimizer cũ.
  • Inference CPU nhanh hơn tới 43%: Khác với YOLOv6 vốn gặp khó khăn trên phần cứng không có GPU, YOLO26 được tối ưu mạnh cho thiết bị edge. Việc loại bỏ DFL (Distribution Focal Loss) giúp đơn giản hóa head đầu ra, tăng đáng kể tốc độ trong môi trường di động và CPU.
  • ProgLoss + STAL: Các hàm loss vượt trội cải thiện đáng kể khả năng phát hiện vật thể nhỏ, lĩnh vực mà những kiến trúc cũ như YOLOX thường gặp khó khăn. Điều này khiến YOLO26 trở nên lý tưởng cho ảnh hàng không và cảm biến IoT.
  • Tính linh hoạt vượt trội: Trong khi YOLOv6 và YOLOX chỉ là các model phát hiện, một kiến trúc YOLO26 duy nhất hỗ trợ nguyên bản phân đoạn instance, ước lượng tư thế, phân loại ảnh và bounding box định hướng (OBB).

Dễ sử dụng và hỗ trợ hệ sinh thái#

Lựa chọn Ultralytics giúp bạn tiếp cận hệ sinh thái được bảo trì tốt và phát triển tích cực. Gói Python của Ultralytics mang đến trải nghiệm từ "zero đến thành thạo", với yêu cầu bộ nhớ khi huấn luyện rất thấp so với các model Transformer cồng kềnh, đồng thời hỗ trợ export liền mạch sang các định dạng như ONNX, OpenVINO và CoreML.

from ultralytics import YOLO

# Tải model YOLO26 nano tiên tiến nhất (có thể dùng head không cần NMS qua nms=False)
model = YOLO("yolo26n.pt")

# Huấn luyện trên dataset mẫu COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy inference hiệu quả trên CPU hoặc GPU
results = model("https://ultralytics.com/images/bus.jpg")

# Export sang TensorRT để triển khai công nghiệp
model.export(format="engine")

Kết luận và khuyến nghị#

Khi lựa chọn giữa YOLOv6-3.0 và YOLOX, hãy cân nhắc các giới hạn phần cứng. Nếu bạn đang xây dựng hệ thống phân tích video thông lượng cao được hỗ trợ bởi phần cứng NVIDIA mạnh mẽ, YOLOv6-3.0 mang lại khả năng tăng tốc TensorRT vượt trội. Ngược lại, YOLOX vẫn là lựa chọn được ưa chuộng nhờ tính lịch sử tại những môi trường hưởng lợi từ thiết kế hoàn toàn tách rời và không anchor.

Tuy nhiên, với developer tìm kiếm sự cân bằng tối ưu giữa tốc độ, độ chính xác và tính dễ sử dụng, nâng cấp lên model Ultralytics YOLO26 là hướng đi rõ ràng. Với kiến trúc end-to-end không cần NMS, inference CPU nhanh và hỗ trợ toàn diện thông qua hệ sinh thái Ultralytics, model dễ dàng vượt trội hơn các CNN công nghiệp cũ. Với người dùng quan tâm đến các biến thể production ổn định cao trước đây, YOLO11 vẫn được hỗ trợ đầy đủ và sử dụng rộng rãi trong ứng dụng doanh nghiệp.

Người đóng góp

Bình luận