Ultralytics YOLO27:
Get Started

YOLOv9 và YOLOv6-3.0#

Sự phát triển của công nghệ phát hiện vật thể thời gian thực được thúc đẩy bởi những cải tiến liên tục trong kiến trúc mạng nơ-ron, nhằm tối ưu sự cân bằng tinh tế giữa tốc độ suy luận, độ chính xác và hiệu quả tính toán. Khi các developer và nhà nghiên cứu tìm hiểu hệ sinh thái ngày càng đông đúc của các framework thị giác máy tính, việc so sánh những kiến trúc hàng đầu là thiết yếu để chọn đúng công cụ cho từng tác vụ.

Hướng dẫn kỹ thuật này so sánh chuyên sâu hai model có năng lực cao: YOLOv9, nổi tiếng với khả năng giữ lại thông tin trong học sâu, và YOLOv6-3.0, một model được thiết kế riêng cho các ứng dụng công nghiệp.

Tổng quan YOLOv9: Tối đa hóa khả năng giữ lại đặc trưng#

Ra mắt vào đầu năm 2024, YOLOv9 giải quyết một trong những thách thức dai dẳng nhất của mạng nơ-ron sâu: mất thông tin trong quá trình truyền xuôi. Bằng cách đảm bảo gradient đáng tin cậy và feature map giữ lại dữ liệu quan trọng, model này mở rộng giới hạn của độ chính xác lý thuyết.

Kiến trúc và phương pháp#

YOLOv9 giới thiệu khái niệm Thông tin Gradient có thể lập trình (PGI) cùng với Mạng tổng hợp lớp hiệu quả tổng quát (GELAN). PGI giải quyết nút thắt thông tin bằng cách cung cấp cơ chế giám sát phụ trợ, đảm bảo mạng chính học được các đặc trưng mạnh mẽ và đáng tin cậy mà không làm tăng chi phí suy luận. Trong khi đó, GELAN tối ưu việc sử dụng tham số, giúp model đạt độ chính xác trung bình trung bình (mAP) tiên tiến nhất mà vẫn giữ chi phí tính toán ở mức hợp lý. Điều này khiến model trở thành lựa chọn xuất sắc cho phân tích ảnh y tế hoặc phát hiện các vật thể cực nhỏ, nơi độ trung thực của đặc trưng là yếu tố then chốt.

Tìm hiểu thêm về YOLOv9

Tổng quan YOLOv6-3.0: Được xây dựng cho quy mô công nghiệp#

Được Meituan phát triển, YOLOv6-3.0 (còn gọi là v3.0) được thiết kế từ đầu để phục vụ các ứng dụng công nghiệp đòi hỏi cao. Ra mắt vào đầu năm 2023, model này tập trung mạnh vào hiệu quả triển khai, cung cấp một bộ model thân thiện với lượng tử hóa và hoạt động xuất sắc trên phần cứng biên.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu và Xiangxiang Chu
  • Tổ chức: Meituan
  • Ngày: 13 tháng 1, 2023
  • Liên kết: Bài báo trên Arxiv, Kho lưu trữ GitHub

Kiến trúc và phương pháp#

YOLOv6-3.0 tạo nên khác biệt nhờ các chiến lược RepOptimizer và Huấn luyện có hỗ trợ Anchor (AAT). Model sử dụng thiết kế mạng nơ-ron nhận biết phần cứng, lấy cảm hứng từ RepVGG; nhờ hợp nhất các lớp, model có thể chạy cực nhanh trên GPU khi suy luận. Bản cập nhật 3.0 tiếp tục tinh chỉnh kiến trúc bằng cách bổ sung module Kết nối hai chiều (BiC) để cải thiện độ chính xác định vị. Nhờ được tối ưu cao cho các định dạng triển khai như TensorRT và OpenVINO, YOLOv6-3.0 thường được ứng dụng trong logistics, tự động hóa sản xuất và môi trường máy chủ có thông lượng cao.

Tìm hiểu thêm về YOLOv6-3.0

So sánh hiệu năng#

Khi đánh giá các model này trên dataset COCO tiêu chuẩn, ta có thể nhận thấy những đánh đổi khác nhau giữa độ chính xác và tốc độ suy luận thô.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Phân tích kỹ thuật#

Trong khi YOLOv6-3.0n dẫn đầu về tốc độ thô trên phần cứng T4 (1.17ms), YOLOv9t đạt mAP cao hơn một chút (38.3%), đồng thời sử dụng ít hơn một nửa số tham số (2.0M so với 4.7M) và ít FLOPs hơn đáng kể. Với yêu cầu phức tạp, độ chính xác cao, YOLOv9e có quy mô lớn đạt mAP 55.6%, cho thấy sức mạnh của kiến trúc PGI trong các mạng sâu.

Đảm bảo dự án sẵn sàng cho tương lai với YOLO26

Nếu bắt đầu một dự án thị giác máy tính mới, chúng tôi đặc biệt khuyến nghị sử dụng YOLO26. Ra mắt năm 2026, model này có Thiết kế đầu-cuối không cần NMS (nms=False) được tích hợp sẵn, loại bỏ độ trễ hậu xử lý NMS và tăng tốc suy luận trên CPU lên đến 43%.

Lợi thế của hệ sinh thái Ultralytics#

Dù triết lý kiến trúc của model nào phù hợp với bạn, việc triển khai trực tiếp thông qua API Python của Ultralytics vẫn mang lại trải nghiệm developer vượt trội.

Tính dễ sử dụng và hiệu quả huấn luyện#

Theo cách truyền thống, việc huấn luyện các model học sâu phức tạp đòi hỏi lượng lớn mã khung sườn. Nền tảng Ultralytics giúp đơn giản hóa những phức tạp này. Dù bạn tinh chỉnh YOLOv9 để phát hiện lỗi hay xuất YOLOv6 cho ứng dụng di động, quy trình làm việc vẫn nhất quán đáng kể.

Ngoài ra, các kiến trúc Ultralytics thường cần ít bộ nhớ CUDA hơn trong quá trình huấn luyện so với các model cồng kềnh dựa trên Transformer. Nhờ đó, developer có thể dùng batch size lớn hơn trên GPU phổ thông, cải thiện đáng kể hiệu quả huấn luyện.

from ultralytics import YOLO

# Dễ dàng chuyển đổi kiến trúc bằng cách thay đổi chuỗi tên file model
# model = YOLO("yolov6n.yaml")  # YOLOv6 có sẵn dưới dạng cấu hình YAML (không có trọng số pretrained)
model = YOLO("yolov9c.pt")

# Huấn luyện model với tính năng tăng cường dữ liệu và lưu vào cache tích hợp sẵn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Xuất sang ONNX hoặc TensorRT liền mạch
model.export(format="engine", quantize=16)

Tính linh hoạt vượt trội trên nhiều tác vụ thị giác#

Mặc dù YOLOv6-3.0 được tối ưu mạnh để tạo bounding box nhanh, các dự án thị giác máy tính hiện đại thường đòi hỏi phương pháp đa tác vụ. Các model Ultralytics nổi tiếng nhờ tính linh hoạt vượt trội. Với những công cụ như Ultralytics YOLOv8 và YOLO26 mới hơn, một framework duy nhất xử lý liền mạch phát hiện vật thể, phân đoạn đối tượng, phân loại ảnh, ước tính tư thế và bounding box định hướng (OBB).

Giới thiệu YOLO26: Tiêu chuẩn mới#

Với các tổ chức muốn tối đa hóa cả hiệu suất lẫn sự dễ dàng khi triển khai, YOLO26 là sự kết hợp tối ưu giữa tốc độ và độ chính xác.

Phát huy thành công của YOLO11, YOLO26 giới thiệu một số tính năng tạo ra bước ngoặt:

  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện Mô hình ngôn ngữ lớn (LLM), chẳng hạn như Kimi K2 của Moonshot AI, optimizer lai này đảm bảo quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 đơn giản hóa đồ thị xuất model, giúp tăng đáng kể khả năng tương thích với các chip điện toán biên công suất thấp.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố quan trọng đối với hoạt động drone và các ứng dụng IoT.
  • Cải tiến theo tác vụ: YOLO26 tích hợp sẵn tính năng tạo mẫu đa tỷ lệ cho phân đoạn, Ước tính hợp lý logarit phần dư (RLE) cho ước tính tư thế và các thuật toán loss góc chuyên biệt để xử lý những trường hợp biên trong phát hiện OBB.

Các tình huống triển khai phù hợp#

Việc lựa chọn kiến trúc phù hợp cuối cùng phụ thuộc vào các ràng buộc trong môi trường production.

Chọn YOLOv6-3.0 nếu bạn đã có pipeline trong lĩnh vực sản xuất công nghiệp, phụ thuộc nhiều vào lượng tử hóa và sử dụng bộ tăng tốc suy luận chuyên dụng trong trường hợp cần độ trễ phần cứng thấp nhất.

Chọn YOLOv9 nếu bạn xử lý các bài toán chẩn đoán y tế phức tạp hoặc giám sát tầm xa, nơi không thể bỏ sót những đặc trưng tinh tế ở cấp pixel.

Tuy nhiên, nếu cần một giải pháp cân bằng hoàn hảo giữa độ chính xác tiên tiến và triển khai đơn giản, không cần NMS, thì Ultralytics YOLO26 là lựa chọn hàng đầu cho kỹ thuật thị giác máy tính hiện đại. Chu kỳ phát triển tích cực, tài liệu toàn diện và cộng đồng hỗ trợ sôi nổi khiến model này trở thành công cụ không thể thiếu đối với cả nhà nghiên cứu lẫn developer.

Người đóng góp

Bình luận