Ultralytics YOLO27:
Get Started

YOLO11 và YOLOv6-3.0#

Lĩnh vực thị giác máy tính phát triển nhanh chóng, và việc chọn kiến trúc model phù hợp là quyết định quan trọng đối với những người làm machine learning. Hai cột mốc đáng chú ý trong quá trình phát triển phát hiện đối tượng thời gian thực là YOLO11 và YOLOv6-3.0. Cả hai model đều có năng lực ấn tượng trong việc khai thác thông tin từ dữ liệu hình ảnh, nhưng được phát triển với những mục tiêu và triết lý thiết kế khác nhau.

Hướng dẫn này phân tích chuyên sâu về mặt kỹ thuật, so sánh kiến trúc, chỉ số hiệu năng và kịch bản triển khai phù hợp để giúp bạn đưa ra quyết định sáng suốt cho dự án AI tiếp theo.

Tổng quan về model#

Trước khi đi sâu vào benchmark kỹ thuật, cần tìm hiểu nguồn gốc và trọng tâm cốt lõi của từng model.

Ultralytics YOLO11#

Được phát triển hoàn toàn trong hệ sinh thái Ultralytics, YOLO11 được thiết kế để mang lại trải nghiệm phát triển đầu-cuối liền mạch. YOLO11 không chỉ chú trọng tốc độ thuần mà còn tập trung vào khả năng đa nhiệm linh hoạt, tính dễ sử dụng và khả năng tích hợp với pipeline triển khai hiện đại.

YOLOv6-3.0 của Meituan#

YOLOv6-3.0 được thiết kế riêng cho các ứng dụng công nghiệp có sẵn bộ xử lý đồ họa (GPU) chuyên dụng. Model này được tối ưu mạnh cho triển khai TensorRT, tập trung tối đa hóa thông lượng trong môi trường được kiểm soát.

Tìm hiểu thêm về YOLOv6

Khác biệt về kiến trúc#

Kiến trúc nền tảng quyết định cách model học và mở rộng quy mô. Cả hai framework đều đưa ra những cải tiến riêng cho công thức YOLO truyền thống.

YOLO11 kế thừa nhiều năm nghiên cứu để tạo ra kiến trúc có hiệu quả sử dụng tham số vượt trội. YOLO11 có backbone tiên tiến và head tổng quát có thể xử lý nhiều tác vụ thị giác máy tính khác nhau—chẳng hạn như phân đoạn đối tượng và ước tính tư thế—mà không cần thay đổi lớn về cấu trúc. Ngoài ra, YOLO11 có yêu cầu bộ nhớ CUDA đặc biệt thấp trong quá trình huấn luyện, tạo nên khác biệt so với các model Transformer cồng kềnh hơn như RT-DETR.

Ngược lại, YOLOv6-3.0 sử dụng module Bi-directional Concatenation (BiC) và chiến lược Anchor-Aided Training (AAT). Các cơ chế này được thiết kế để cải thiện độ chính xác định vị. Kiến trúc chủ yếu được tách biệt và lượng tử hóa mạnh để ưu tiên suy luận model INT8, khiến YOLOv6-3.0 trở thành lựa chọn đáng cân nhắc cho các dây chuyền sản xuất tốc độ cao sử dụng hệ thống GPU cũ.

Lựa chọn framework phù hợp

Nếu dự án của bạn cần tạo mẫu nhanh, hỗ trợ nhiều tác vụ (như phân đoạn hoặc phân loại) và triển khai trên nhiều loại phần cứng (CPU, Edge TPU, thiết bị di động), framework Ultralytics mang lại trải nghiệm phát triển thuận tiện hơn đáng kể.

Hiệu năng và các chỉ số#

Khi đánh giá model, độ chính xác trung bình trung bình (mAP) và tốc độ suy luận là những yếu tố quan trọng hàng đầu. Bảng sau so sánh hiệu năng của YOLO11 với YOLOv6-3.0 ở nhiều quy mô model. Các chỉ số tốt nhất được tô đậm.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Như kết quả cho thấy, YOLO11 luôn đạt độ chính xác (mAP) cao hơn với số tham số và FLOPs ít hơn đáng kể ở các cấp độ tương đương. Hiệu quả tham số này trực tiếp giúp giảm yêu cầu bộ nhớ trong cả quá trình huấn luyện model lẫn suy luận.

Lợi thế của Ultralytics#

Việc chọn model không chỉ dựa trên các chỉ số thuần túy mà còn phụ thuộc vào toàn bộ vòng đời machine learning. Model Ultralytics mang lại lợi thế rõ rệt cho cả nhà phát triển lẫn nhà nghiên cứu.

  1. Dễ sử dụng: API Python của Ultralytics cho phép bạn huấn luyện, validation và xuất model chỉ với vài dòng mã. Bạn không cần cấu hình thủ công các cây dependency phức tạp.
  2. Hệ sinh thái được duy trì tốt: Ultralytics cung cấp hệ sinh thái thống nhất và thường xuyên được cập nhật. Khi sử dụng Ultralytics Platform, nhà phát triển có quyền truy cập vào các tính năng gán nhãn bộ dữ liệu cộng tác, huấn luyện đám mây và giám sát model liền mạch.
  3. Tính linh hoạt: Khác với YOLOv6-3.0, chủ yếu là bộ phát hiện bounding box, YOLO11 hỗ trợ gốc phân loại ảnh và bounding box định hướng (OBB), cho phép bạn hợp nhất stack công nghệ.
  4. Hiệu quả huấn luyện: Nhờ tận dụng các tối ưu hóa hiện đại và auto-batching, YOLO11 huấn luyện hiệu quả trên phần cứng phổ thông, giúp phổ cập AI thị giác tiên tiến nhất.

Ví dụ mã: Huấn luyện và suy luận#

Làm việc với model Ultralytics rất trực quan. Dưới đây là ví dụ có thể chạy 100%, minh họa cách huấn luyện và chạy suy luận bằng package Ultralytics.

from ultralytics import YOLO

# Tải model YOLO11 small đã được huấn luyện trước
model = YOLO("yolo11s.pt")

# Huấn luyện model hiệu quả trên bộ dữ liệu COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Chạy suy luận trên ảnh từ web
prediction = model("https://ultralytics.com/images/bus.jpg")

# Xuất model sang định dạng ONNX để dễ triển khai
model.export(format="onnx")

Các trường hợp sử dụng phù hợp nhất#

Hiểu rõ điểm mạnh của từng model sẽ giúp bạn chọn đúng công cụ cho công việc.

Khi nào nên chọn YOLOv6-3.0: Nếu bạn duy trì một hệ thống công nghiệp cũ được xây dựng riêng cho các pipeline TensorRT 7.x/8.x cụ thể và phần cứng chỉ gồm GPU NVIDIA T4 hoặc A100 chuyên dụng để tự động hóa sản xuất tốc độ cao, YOLOv6 vẫn là một engine hữu dụng và có năng lực.

Khi nào nên chọn YOLO11: Với gần như mọi ứng dụng hiện đại, YOLO11 là lựa chọn vượt trội. Dù bạn đang xây dựng giải pháp sản xuất thông minh, triển khai AI biên trên thiết bị Raspberry Pi hay thực hiện các tác vụ đa nhiệm như phát hiện và phân đoạn ảnh y tế, YOLO11 mang đến sự cân bằng tối ưu giữa tốc độ, độ chính xác và tính linh hoạt khi triển khai.

Triển vọng tương lai: YOLO26 tiên tiến nhất#

Dù YOLO11 đánh dấu bước tiến vượt bậc, Ultralytics vẫn không ngừng mở rộng giới hạn của thị giác máy tính. Ra mắt vào tháng 1 năm 2026, dòng model YOLO26 mới là công nghệ tiên tiến nhất hiện nay và là model được khuyến nghị cho mọi dự án mới.

YOLO26 giới thiệu một số tính năng đột phá được thiết kế chuyên biệt để giải quyết các thách thức triển khai hiện đại:

  • Thiết kế đầu-cuối không cần NMS: Dựa trên các khái niệm do YOLOv10 tiên phong, YOLO26 cung cấp head đầu-cuối tích hợp sẵn (nms=False), loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS), từ đó giúp pipeline triển khai nhanh hơn và đơn giản hơn đáng kể.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 đơn giản hóa head của mạng, tăng đáng kể khả năng tương thích với Internet vạn vật (IoT) công suất thấp và các thiết bị biên.
  • Optimizer MuSGD: Lấy cảm hứng từ các đổi mới trong huấn luyện mô hình ngôn ngữ lớn (LLM) (chẳng hạn như Kimi K2 của Moonshot AI), YOLO26 sử dụng optimizer Muon-SGD lai, đảm bảo độ ổn định huấn luyện vượt trội và hội tụ nhanh hơn.
  • Suy luận trên CPU nhanh hơn tới 43%: Với các ứng dụng chạy mà không có bộ tăng tốc GPU chuyên dụng, YOLO26 được tối ưu hóa sâu để đạt thông lượng xử lý thuần trên CPU cao.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố rất quan trọng đối với hình ảnh từ drone và hoạt động giám sát trên không.
  • Cải tiến theo từng tác vụ: YOLO26 bao gồm các cải tiến tùy chỉnh cho mọi tác vụ, chẳng hạn như tạo prototype đa tỷ lệ cho phân đoạn và Ước lượng Hợp lý Logarit Phần dư (RLE) cho ước lượng tư thế.

Nếu hôm nay bạn bắt đầu một sáng kiến thị giác máy tính mới, việc tận dụng Ultralytics Platform để huấn luyện model YOLO26 sẽ đảm bảo ứng dụng của bạn được xây dựng trên kiến trúc hiệu quả, chính xác và sẵn sàng cho tương lai nhất hiện có.

Các developer muốn tìm hiểu về phát hiện với bộ từ vựng mở cũng có thể xem tài liệu của chúng tôi về YOLO-World.

Người đóng góp

Bình luận