Ultralytics YOLO27:
Get Started

YOLO11 và YOLOv8#

Lĩnh vực thị giác máy tính đã chứng kiến những tiến bộ đáng kể nhờ sự phát triển liên tục của các kiến trúc phát hiện đối tượng. Khi đánh giá model để triển khai thực tế, nhà phát triển thường so sánh ưu điểm của Ultralytics YOLO11 và phiên bản tiền nhiệm rất thành công là Ultralytics YOLOv8. Cả hai model đều thiết lập tiêu chuẩn ngành về tốc độ, độ chính xác và trải nghiệm dành cho nhà phát triển, nhưng phù hợp với các giai đoạn khác nhau trong vòng đời dự án và các ngưỡng hiệu năng hơi khác nhau.

Hướng dẫn này phân tích chuyên sâu kiến trúc, phương pháp huấn luyện và các trường hợp sử dụng lý tưởng của hai model, giúp bạn chọn giải pháp phù hợp nhất cho các sáng kiến trí tuệ nhân tạo của mình.

Các cải tiến kiến trúc#

Quá trình chuyển đổi từ YOLOv8 sang YOLO11 mang đến một số cải tiến kiến trúc then chốt nhằm tối đa hóa hiệu quả trích xuất đặc trưng đồng thời giảm thiểu chi phí tính toán.

Kiến trúc YOLO11#

YOLO11 đánh dấu bước tiến đáng kể trong việc tối ưu hóa mức sử dụng tham số. Model thay các module C2f truyền thống bằng block C3k2 tiên tiến, giúp tăng cường xử lý đặc trưng không gian mà không làm số lượng tham số tăng vọt. Ngoài ra, YOLO11 đưa module C2PSA (Chú ý không gian từng phần qua các giai đoạn) vào backbone. Cơ chế attention này cho phép model tập trung vào các vùng quan tâm quan trọng, cải thiện đáng kể khả năng phát hiện đối tượng nhỏ và xử lý các tình huống che khuất phức tạp.

Kiến trúc YOLOv8#

Ra mắt sớm hơn một năm, YOLOv8 tiên phong chuyển sang head phát hiện không anchor, loại bỏ nhu cầu tinh chỉnh thủ công anchor box và đơn giản hóa công thức loss. Kiến trúc này chủ yếu dựa vào block C2f, một thiết kế cân bằng hiệu quả độ sâu mạng và luồng gradient, giúp model hoạt động cực kỳ ổn định trên nhiều loại ứng dụng thị giác máy tính.

Triết lý thiết kế

YOLOv8 đặt nền tảng cho phát hiện không anchor trong hệ sinh thái Ultralytics, còn YOLO11 cải tiến phương pháp này bằng các cơ chế attention không gian, đạt độ chính xác cao hơn với ít tài nguyên tính toán hơn.

Hiệu năng và benchmark#

Khi triển khai model lên các thiết bị biên như Raspberry Pi hoặc máy chủ hiệu năng cao chạy NVIDIA TensorRT, việc hiểu rõ sự đánh đổi giữa tốc độ và độ chính xác là tối quan trọng. Bảng bên dưới cho thấy YOLO11 luôn vượt trội hơn YOLOv8 về độ chính xác ở mọi biến thể kích thước.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8

Phân tích các chỉ số#

YOLO11 đạt độ chính xác trung bình (mAP) cao hơn đáng kể, đồng thời giảm cả số lượng tham số lẫn phép toán dấu phẩy động (FLOPs). Chẳng hạn, model YOLO11m cần ít hơn 22% tham số so với YOLOv8m nhưng đạt mAP cao hơn 1.3 điểm trên dataset COCO. Ngoài ra, tốc độ inference CPU khi xuất sang định dạng ONNX cho thấy YOLO11 nhanh hơn đáng kể, trở thành ứng viên xuất sắc cho các triển khai không có tăng tốc GPU chuyên dụng.

Lợi thế của hệ sinh thái Ultralytics#

Dù chọn YOLO11 hay YOLOv8, cả hai model đều hưởng lợi từ hệ sinh thái Ultralytics toàn diện, giúp đơn giản hóa đáng kể vòng đời machine learning.

Dễ sử dụng và API đơn giản#

Gói Python ultralytics cung cấp API tinh gọn, cho phép kỹ sư và nhà nghiên cứu huấn luyện, validation và xuất model chỉ với vài dòng code. Gói này trừu tượng hóa những phức tạp thường gặp khi thiết lập môi trường deep learning trong PyTorch.

Hiệu quả huấn luyện và yêu cầu bộ nhớ#

Khác với các Vision Transformer nặng (như RT-DETR), model Ultralytics YOLO nổi tiếng nhờ mức sử dụng bộ nhớ thấp trong quá trình huấn luyện. Hiệu quả bộ nhớ này giúp nhà phát triển huấn luyện các mạng tiên tiến nhất trên GPU phổ thông hoặc môi trường đám mây như Google Colab mà không gặp lỗi hết bộ nhớ.

Tính linh hoạt trên nhiều tác vụ thị giác#

Cả YOLO11 và YOLOv8 đều là model học đa nhiệm thực thụ. Ngoài phát hiện đối tượng bằng bounding box tiêu chuẩn, hai model còn hỗ trợ gốc phân đoạn đối tượng, phân loại ảnh, ước tính tư thế người và Bounding Box Định hướng (OBB) cho ảnh chụp từ trên không.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLO11 và YOLOv8 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái.

Khi nào nên chọn YOLO11#

YOLO11 là lựa chọn phù hợp cho:

  • Triển khai biên trong môi trường production: Các ứng dụng thương mại trên thiết bị như Raspberry Pi hoặc NVIDIA Jetson, nơi độ tin cậy và hoạt động bảo trì liên tục là ưu tiên hàng đầu.
  • Ứng dụng thị giác đa nhiệm: Các dự án cần phát hiện, phân đoạn, ước tính tư thế và OBB trong một framework thống nhất.
  • Tạo mẫu và triển khai nhanh: Các nhóm cần nhanh chóng chuyển từ thu thập dữ liệu sang production bằng Ultralytics Python API tinh gọn.

Khi nào nên chọn YOLOv8#

YOLOv8 được khuyến nghị cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án cần một model đã được kiểm chứng cho phát hiện, phân đoạn, phân loại và ước lượng tư thế trong hệ sinh thái Ultralytics.
  • Hệ thống sản xuất đã thiết lập: Các môi trường sản xuất hiện có được xây dựng trên kiến trúc YOLOv8 với quy trình triển khai ổn định, đã được kiểm thử kỹ lưỡng.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng rãi: Các ứng dụng hưởng lợi từ kho hướng dẫn phong phú, tích hợp bên thứ ba và tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Ví dụ code: Bắt đầu#

Việc triển khai và huấn luyện model Ultralytics rất trực quan. Ví dụ sau minh họa cách tải model YOLO11 đã được huấn luyện trước, tinh chỉnh model trên bộ dữ liệu tùy chỉnh và xuất model để triển khai trên thiết bị biên bằng Apple CoreML:

from ultralytics import YOLO

# Khởi tạo model YOLO11 cỡ nhỏ
model = YOLO("yolo11s.pt")

# Huấn luyện model hiệu quả với yêu cầu bộ nhớ được tối ưu hóa
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Đánh giá hiệu suất trên tập validation
metrics = model.val()

# Chạy suy luận thời gian thực trên ảnh kiểm thử
predictions = model("https://ultralytics.com/images/bus.jpg")

# Xuất sang CoreML để triển khai nhanh trên thiết bị di động
export_path = model.export(format="coreml")
Nâng cấp liền mạch

Vì API Ultralytics được chuẩn hóa, việc nâng cấp pipeline cũ từ YOLOv8 lên YOLO11 thường chỉ cần thay đổi chuỗi weights từ "yolov8n.pt" thành "yolo11n.pt".

Hướng tới tương lai: Đỉnh cao của AI biên với YOLO26#

Dù YOLO11 là một kiến trúc hoàn thiện và có năng lực cao, tốc độ đổi mới nhanh chóng của AI vẫn tiếp diễn. Với các nhà phát triển bắt đầu dự án mới và cần hiệu năng tiên tiến nhất, Ultralytics YOLO26 (phát hành tháng 1 năm 2026) là lựa chọn được khuyến nghị hàng đầu.

YOLO26 mở rộng giới hạn của thị giác máy tính với một số tính năng đột phá:

  • Thiết kế đầu-cuối không cần NMS: Dựa trên các khái niệm được khai phá trong YOLOv10, YOLO26 cung cấp head one-to-one tùy chọn (nms=False), bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS), nhờ đó giảm độ trễ và giúp độ trễ dễ dự đoán hơn trên mọi phần cứng triển khai.
  • Suy luận CPU nhanh hơn đến 43%: Bằng cách loại bỏ hoàn toàn nhánh Distribution Focal Loss (DFL), YOLO26 được tối ưu chuyên biệt cho thiết bị điện toán biên không có GPU mạnh.
  • Bộ tối ưu MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện model ngôn ngữ lớn (LLM), YOLO26 sử dụng bộ tối ưu MuSGD lai, đảm bảo quá trình hội tụ khi huấn luyện ổn định và nhanh chóng.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ và bị che khuất nhiều, yếu tố thiết yếu đối với robot tự hành và phân tích dữ liệu bằng drone.

Dù bạn tin dùng độ tin cậy đã được kiểm chứng của YOLOv8, kiến trúc tối ưu của YOLO11 hay năng lực thế hệ mới của YOLO26, Ultralytics Platform đều cung cấp các công cụ cần thiết để đưa ứng dụng AI thị giác từ ý tưởng vào môi trường production một cách liền mạch. Hãy khám phá các tích hợp đa dạng để kết nối model với quy trình làm việc doanh nghiệp và dashboard phân tích.

Người đóng góp

Bình luận