Ultralytics YOLO27:
Get Started

YOLOv7 và YOLO11#

Lĩnh vực thị giác máy tính đã phát triển nhanh chóng trong vài năm qua. Đối với nhà phát triển và nhà nghiên cứu đang lựa chọn framework phát hiện đối tượng phù hợp, việc hiểu rõ khác biệt về kiến trúc và ứng dụng thực tế giữa các model định hình từng thế hệ là yếu tố then chốt. Hướng dẫn này đưa ra so sánh kỹ thuật chi tiết giữa bước đột phá học thuật YOLOv7 và Ultralytics YOLO11 được hoàn thiện kỹ lưỡng, sẵn sàng cho production.

Nguồn gốc model và triết lý kiến trúc#

YOLOv7, được các tác giả Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao thuộc Viện Khoa học Thông tin, Academia Sinica phát hành ngày 6 tháng 7 năm 2022, đã giới thiệu một số khái niệm mới cho lĩnh vực này. Được trình bày chi tiết trong bài báo nghiên cứu YOLOv7 đăng trên arXiv, model tập trung mạnh vào phương pháp "bag-of-freebies có thể huấn luyện" và Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Các lựa chọn kiến trúc này được thiết kế chuyên biệt để tối đa hóa hiệu quả của đường truyền gradient, khiến YOLOv7 trở thành công cụ mạnh mẽ cho hoạt động benchmark học thuật trên GPU cao cấp.

Tìm hiểu thêm về YOLOv7

YOLO11, do Glenn Jocher và Jing Qiu phát triển tại Ultralytics, được phát hành ngày 27 tháng 9 năm 2024. YOLO11 chuyển trọng tâm từ độ phức tạp thuần túy của kiến trúc sang một hệ sinh thái toàn diện, ưu tiên nhà phát triển. Được lưu trữ trong repository GitHub của Ultralytics, YOLO11 có thiết kế không anchor được tối ưu hóa, giúp giảm đáng kể mức tiêu thụ bộ nhớ trong cả quá trình huấn luyện lẫn suy luận. YOLO11 được tích hợp nguyên bản vào Nền tảng Ultralytics, mang lại trải nghiệm sử dụng thuận tiện vượt trội, từ gán nhãn dataset đến triển khai trên thiết bị biên.

Ưu thế hệ sinh thái

Trong khi các repository độc lập thường bị bỏ không sau khi bài báo học thuật được công bố, các model Ultralytics được cập nhật liên tục, đảm bảo khả năng tương thích dài hạn với các stack machine learning hiện đại như những bản phát hành PyTorch mới nhất và các bộ tăng tốc phần cứng chuyên dụng.

Chỉ số hiệu năng và hiệu quả#

Khi triển khai model vào ứng dụng thực tế, cần cân bằng độ chính xác thuần với tốc độ suy luận và chi phí tính toán. Dưới đây là so sánh trực tiếp các biến thể YOLOv7 và YOLO11 được đánh giá trên benchmark dataset COCO tiêu chuẩn.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Lưu ý: Việc thiếu số liệu tốc độ CPU của YOLOv7 là do các môi trường kiểm thử cũ không chuẩn hóa benchmark ONNX trên CPU. Các giá trị tốt nhất trong những nhóm có thể so sánh được sẽ được đánh dấu.

Phân tích kết quả#

Dữ liệu cho thấy hiệu quả đã có sự cải thiện rõ rệt qua các thế hệ. Model YOLO11l (Large) đạt mAPval cao hơn, ở mức 53,4% so với 51,4% của YOLOv7l, đồng thời sử dụng ít tham số hơn đáng kể (25,3M so với 36,9M) và ít FLOPs hơn nhiều (87,2B so với 104,7B). Độ phức tạp tính toán giảm giúp YOLO11 chạy nhanh hơn trên các triển khai NVIDIA TensorRT và cần ít VRAM hơn, phù hợp hơn nhiều với các môi trường bị giới hạn phần cứng.

Khả năng sử dụng và quy trình huấn luyện#

Trải nghiệm dành cho nhà phát triển là một điểm khác biệt lớn giữa hai framework.

Huấn luyện YOLOv7#

Sử dụng codebase nguồn mở YOLOv7 gốc thường đòi hỏi phải clone repository, tự giải quyết dependency và dùng các đối số dòng lệnh dài dòng. Việc quản lý các tác vụ khác nhau hoặc xuất sang định dạng di động thường cần sửa script nguồn hoặc sử dụng fork của bên thứ ba.

Huấn luyện YOLO11#

YOLO11 được tích hợp sâu vào package Python ultralytics, giúp đơn giản hóa vòng đời machine learning. Việc huấn luyện model phát hiện đối tượng chỉ cần vài dòng mã, và framework tự xử lý việc tải dữ liệu, tinh chỉnh hyperparameter và caching.

from ultralytics import YOLO

# Tải model YOLO11 Nano đã huấn luyện trước để đạt tốc độ tối đa
model = YOLO("yolo11n.pt")

# Huấn luyện model trên dataset ví dụ COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export model đã huấn luyện sang định dạng ONNX để triển khai
export_path = model.export(format="onnx")

Ngoài ra, YOLO11 có tính linh hoạt vượt trội. Chỉ cần thay đổi hậu tố model, nhà phát triển có thể chuyển ngay từ phát hiện sang ánh xạ phân đoạn instance, theo dõi ước tính tư thế hoặc nhận diện hộp giới hạn định hướng (OBB)—mức hỗ trợ đa tác vụ nguyên bản mà YOLOv7 không có.

Đơn giản hóa việc xuất model

Việc xuất YOLO11 sang các định dạng cho thiết bị biên như Apple CoreML hoặc framework Intel OpenVINO chỉ cần một lệnh .export(), tránh các thao tác chỉnh sửa graph phức tạp thường cần thiết với model thế hệ cũ.

Các tình huống triển khai phù hợp#

Hiểu rõ điểm mạnh của từng model giúp xác định trường hợp sử dụng phù hợp nhất.

  • Tái lập benchmark cũ: YOLOv7 vẫn hữu ích với các nhà nghiên cứu học thuật cần tái lập benchmark cụ thể từ năm 2022 hoặc nghiên cứu ảnh hưởng của các kỹ thuật tái tham số hóa trên mạng dựa trên anchor.
  • Môi trường production thương mại: YOLO11 là lựa chọn rõ ràng cho các hệ thống doanh nghiệp. Tính ổn định, hoạt động bảo trì tích cực và khả năng tích hợp với giao diện Nền tảng Ultralytics trên cloud khiến YOLO11 phù hợp để quản lý phân tích bán lẻ quy mô lớn, giám sát an ninh và kiểm soát chất lượng sản xuất.
  • Điện toán biên với tài nguyên hạn chế: Biến thể YOLO11n cực kỳ nhẹ được thiết kế chuyên biệt cho các thiết bị biên công suất thấp, hoạt động hiệu quả trên hệ thống Raspberry Pi hoặc module NVIDIA Jetson.

Hướng tới tương lai: Bước chuyển đổi mô hình của YOLO26#

Dù YOLO11 là giải pháp tiên tiến được hoàn thiện kỹ lưỡng, lĩnh vực machine learning vẫn không ngừng phát triển. Người dùng bắt đầu dự án thị giác mới từ đầu ở thời điểm hiện tại được khuyến nghị mạnh mẽ khám phá Ultralytics YOLO26 vừa ra mắt.

Được phát hành vào tháng 1 năm 2026, YOLO26 giới thiệu một số tính năng đột phá vượt trội hơn cả YOLOv7 lẫn YOLO11:

  • Kiến trúc không cần NMS nguyên bản: Head one-to-one tùy chọn của YOLO26 (nms=False) loại bỏ nhu cầu hậu xử lý bằng Non-Maximum Suppression. Thiết kế end-to-end này đơn giản hóa pipeline triển khai và giảm đáng kể độ biến thiên độ trễ.
  • Suy luận CPU nhanh hơn đến 43%: Bằng cách loại bỏ module Distribution Focal Loss (DFL) một cách có chủ đích, YOLO26 được tối ưu mạnh cho thiết bị biên và môi trường không có GPU chuyên dụng.
  • Tích hợp optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến của Moonshot AI, optimizer lai này đảm bảo độ ổn định huấn luyện chưa từng có và tốc độ hội tụ nhanh hơn.
  • Phát hiện vật thể nhỏ vượt trội: Việc đưa vào các hàm loss ProgLoss và STAL giúp cải thiện đáng kể độ chính xác khi nhận diện chi tiết nhỏ, rất phù hợp để phân tích ảnh trên không chụp bằng drone và dữ liệu cảm biến IoT phức tạp.

Đối với người dùng quan tâm đến kiến trúc dựa trên Transformer hoặc các mô hình khác, tài liệu Ultralytics cũng đề cập đến những model như model phát hiện Transformer RT-DETR và model từ vựng mở YOLO-World.

Người đóng góp

Bình luận