Ultralytics YOLO27:

YOLOv5 so với YOLOX#

Quá trình phát triển của thị giác máy tính thời gian thực đã trải qua nhiều cột mốc quan trọng, với các kiến trúc khác nhau không ngừng nâng cao giới hạn về tốc độ và độ chính xác. Hai model có ảnh hưởng lớn trong lĩnh vực này là YOLOv5YOLOX. Mặc dù cả hai đều nổi tiếng với hiệu năng cao trong bài toán phát hiện đối tượng, chúng áp dụng những hướng tiếp cận kiến trúc hoàn toàn khác nhau.

Hướng dẫn này cung cấp phân tích kỹ thuật chuyên sâu về hai model, so sánh kiến trúc, các metric hiệu năng, phương pháp training và các kịch bản triển khai lý tưởng để giúp developer và nhà nghiên cứu lựa chọn công cụ phù hợp cho các dự án AI thị giác của mình.

Tổng quan về model và khác biệt kiến trúc#

Ultralytics YOLOv5#

Được Ultralytics giới thiệu, YOLOv5 nhanh chóng trở thành tiêu chuẩn trong ngành nhờ sự cân bằng vượt trội giữa hiệu năng, tính dễ sử dụng và hiệu quả bộ nhớ. Được xây dựng native trên framework PyTorch, YOLOv5 sử dụng kiến trúc dựa trên anchor. Model này dựa vào các hình dạng bounding box được định nghĩa trước để dự đoán vị trí đối tượng, nhờ đó đạt hiệu quả cao trong các tác vụ phát hiện đối tượng tiêu chuẩn.

Một trong những thế mạnh lớn nhất của YOLOv5 là ecosystem được duy trì tốt. Model này có tài liệu toàn diện, Python API cực kỳ đơn giản và khả năng tích hợp native với Ultralytics Platform. Điều này cho phép developer chuyển đổi liền mạch từ gán nhãn dataset sang training và export sang các format như ONNXTensorRT.

Lợi thế hệ sinh thái

Các model YOLO của Ultralytics thường yêu cầu ít GPU memory hơn đáng kể trong quá trình training so với các giải pháp dựa trên Transformer phức tạp. Dấu chân bộ nhớ thấp này giúp YOLOv5 dễ tiếp cận hơn với các nhà nghiên cứu sử dụng phần cứng cấp độ consumer.

Megvii YOLOX#

Được phát triển bởi các nhà nghiên cứu tại Megvii, YOLOX đi theo hướng khác bằng cách giới thiệu thiết kế anchor-free cho dòng YOLO. Bằng cách loại bỏ anchor box, YOLOX đơn giản hóa detection head và giảm đáng kể số lượng tham số heuristic cần tinh chỉnh thủ công trong quá trình training.

YOLOX cũng tích hợp decoupled head—tách các tác vụ classification và regression thành các nhánh network khác nhau—đồng thời sử dụng chiến lược gán nhãn SimOTA. Những cải tiến này thu hẹp khoảng cách giữa nghiên cứu học thuật và ứng dụng công nghiệp, giúp YOLOX đặc biệt hiệu quả trong các môi trường có scale đối tượng biến thiên lớn.

Tìm hiểu thêm về YOLOX

Hiệu năng và các chỉ số#

Khi đánh giá các model thị giác máy tính, sự đánh đổi giữa Độ chính xác trung bình (mAP) và tốc độ inference là yếu tố then chốt. Cả hai model đều cung cấp nhiều kích thước khác nhau (từ Nano đến Extra-Large) để phù hợp với các giới hạn phần cứng khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Mặc dù YOLOXx đạt độ chính xác đỉnh cao nhỉnh hơn một chút (51.1 mAP), YOLOv5 cung cấp pipeline triển khai mạnh mẽ và được kiểm thử kỹ lưỡng hơn nhiều trên phần cứng CPU và GPU. Tốc độ TensorRT của YOLOv5 cho thấy model được tối ưu sâu cho các thiết bị edge computing, khiến đây trở thành lựa chọn có độ tin cậy cao cho phân tích video thời gian thực.

Phương pháp training và khả năng sử dụng#

Trải nghiệm developer khác biệt đáng kể giữa hai kiến trúc này.

Cách tiếp cận của YOLOX#

Training YOLOX thường yêu cầu clone repository gốc, quản lý các dependency cụ thể và thực thi những script command-line phức tạp. Mặc dù hỗ trợ các tính năng nâng cao như training mixed-precision và thiết lập multi-node thông qua MegEngine, đường cong học tập có thể khá dốc đối với developer cần prototyping nhanh.

Lợi thế của Ultralytics#

Ngược lại, Ultralytics ưu tiên trải nghiệm người dùng được tinh gọn ở mức cao. Với package Python ultralytics, developer có thể load, train và validate một model với lượng boilerplate code tối thiểu. Ultralytics tự động xử lý các phép tăng cường dữ liệu phức tạp, quá trình tiến hóa hyperparameter và việc lập lịch learning rate.

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

Hơn nữa, tính linh hoạt của YOLOv5 còn vượt ra ngoài phát hiện đối tượng tiêu chuẩn, cung cấp khả năng hỗ trợ mạnh mẽ cho phân loại ảnhphân đoạn instance trong cùng một API nhất quán.

Triển khai tinh gọn

Khi hoàn tất training, việc export model YOLOv5 sang CoreML, TFLite hoặc OpenVINO đơn giản chỉ bằng cách chạy model.export(format="onnx"). Điều này loại bỏ nhu cầu sử dụng các script chuyển đổi của bên thứ ba vốn thường cần thiết đối với các repository tập trung vào nghiên cứu.

Ứng dụng thực tế#

Việc lựa chọn giữa hai model này phụ thuộc vào môi trường triển khai và yêu cầu kỹ thuật của bạn:

  • Bán lẻ và quản lý hàng tồn kho: Đối với các ứng dụng yêu cầu nhận diện sản phẩm thời gian thực trên các thiết bị edge như NVIDIA Jetson, YOLOv5 đặc biệt phù hợp. Dấu chân bộ nhớ tối thiểu và tốc độ inference TensorRT nhanh cho phép tracking nhiều camera mà không làm rớt frame.
  • Nghiên cứu học thuật và kiến trúc tùy chỉnh: YOLOX được cộng đồng nghiên cứu đánh giá cao. Decoupled head và bản chất anchor-free khiến model này trở thành baseline xuất sắc cho các engineer muốn thử nghiệm những chiến lược gán nhãn mới hoặc làm việc trên các dataset mà anchor box truyền thống không thể generalize tốt.
  • AI nông nghiệp: Đối với các tác vụ nông nghiệp chính xác như phát hiện trái cây hoặc nhận diện cỏ dại bằng drone, khả năng training và triển khai model YOLOv5 dễ dàng thông qua Ultralytics Platform cho phép các chuyên gia trong lĩnh vực triển khai giải pháp AI mà không cần nền tảng chuyên sâu về engineering machine learning.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv5 và YOLOX phụ thuộc vào yêu cầu cụ thể của dự án, các giới hạn triển khai và ưu tiên về ecosystem của bạn.

Khi nào nên chọn YOLOv5#

YOLOv5 là lựa chọn phù hợp cho:

  • Hệ thống production đã được kiểm chứng: Các triển khai hiện có, trong đó bề dày ổn định, tài liệu phong phú và sự hỗ trợ lớn từ cộng đồng của YOLOv5 được đánh giá cao.
  • Huấn luyện trong điều kiện hạn chế tài nguyên: Các môi trường có tài nguyên GPU hạn chế, nơi pipeline huấn luyện hiệu quả và yêu cầu bộ nhớ thấp hơn của YOLOv5 mang lại lợi thế.
  • Hỗ trợ đa dạng định dạng export: Các dự án yêu cầu triển khai trên nhiều định dạng, bao gồm ONNX, TensorRT, CoreMLTFLite.

Khi nào nên chọn YOLOX#

YOLOX được khuyến nghị cho:

  • Nghiên cứu phát hiện không anchor: Nghiên cứu học thuật sử dụng kiến trúc không anchor rõ ràng của YOLOX làm baseline để thử nghiệm các detection head hoặc hàm loss mới.
  • Thiết bị edge siêu nhẹ: Triển khai trên microcontroller hoặc phần cứng mobile legacy, nơi footprint cực nhỏ của biến thể YOLOX-Nano (0.91M tham số) là yếu tố then chốt.
  • Nghiên cứu gán nhãn SimOTA: Các project nghiên cứu tìm hiểu chiến lược gán nhãn dựa trên optimal transport và tác động của chúng đến quá trình hội tụ khi training.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Tương lai của Vision AI: YOLO26 xuất hiện#

Mặc dù cả YOLOv5 và YOLOX đã khẳng định vị trí trong lịch sử thị giác máy tính, lĩnh vực này vẫn đang tiến bộ nhanh chóng. Đối với developer bắt đầu các dự án mới hiện nay, Ultralytics đặc biệt khuyến nghị khám phá model flagship mới nhất của mình, YOLO26.

Được phát hành vào tháng 1 năm 2026, YOLO26 thể hiện bước tiến vượt bậc cả về hiệu năng lẫn khả năng sử dụng. Model này giới thiệu thiết kế end-to-end không cần NMS mang tính đột phá, loại bỏ hoàn toàn bước hậu xử lý Non-Maximum Suppression. Điều này làm giảm đáng kể biến thiên độ trễ và đơn giản hóa logic triển khai trên các thiết bị công suất thấp.

Hơn nữa, YOLO26 sử dụng MuSGD Optimizer mới—một hybrid giữa SGD và Muon lấy cảm hứng từ các cải tiến trong training LLM—để đạt hội tụ cực kỳ ổn định và nhanh chóng. Với DFL Removal (loại bỏ Distribution Focal Loss nhằm đơn giản hóa việc export và cải thiện khả năng tương thích với các thiết bị edge/công suất thấp), YOLO26 đạt tốc độ inference CPU nhanh hơn tới 43%, củng cố vị thế là model tối ưu cho edge computing, robotics và các ứng dụng IoT hiện đại. Ngoài ra, ProgLoss + STAL cung cấp các hàm loss được cải tiến, với những nâng cao đáng kể trong khả năng nhận diện đối tượng nhỏ—yếu tố quan trọng đối với IoT, robotics và ảnh chụp từ trên không. Người dùng quan tâm đến các thế hệ trước cũng có thể xem xét YOLO11, mặc dù YOLO26 là lựa chọn state-of-the-art không thể tranh cãi.

Kết luận#

YOLOv5 và YOLOX đều cung cấp khả năng phát hiện đối tượng đáng kinh ngạc. YOLOX đã mở rộng giới hạn kiến trúc khi chứng minh vào năm 2021 rằng các thiết kế anchor-free có thể cạnh tranh và vượt qua các phương pháp truyền thống. Tuy nhiên, YOLOv5 vẫn là một thế lực dẫn đầu nhờ tính dễ sử dụng vô song, ecosystem toàn diện và yêu cầu bộ nhớ thấp hơn trong quá trình training.

Đối với phần lớn các ứng dụng thương mại, ecosystem Ultralytics cung cấp con đường nhanh nhất từ dataset thô đến model production được triển khai. Dù sử dụng YOLOv5 đã được kiểm chứng hay nâng cấp lên YOLO26 tiên tiến, developer đều được hưởng lợi từ một framework được thiết kế để giúp AI thị giác trở nên dễ tiếp cận, hiệu quả và có hiệu năng cao.

Những người đóng góp

Bình luận