YOLO Vision 2026:

YOLO11 so với YOLOv7#

Bối cảnh của computer vision tiếp tục phát triển với tốc độ nhanh chóng, trong đó phát hiện đối tượng thời gian thực vẫn nằm ở tiền tuyến của các ứng dụng AI. Việc lựa chọn kiến trúc phù hợp cho dự án đòi hỏi phải cân nhắc kỹ lưỡng sự đánh đổi phức tạp giữa tốc độ, độ chính xác và tính dễ triển khai. Trong hướng dẫn này, chúng tôi cung cấp một so sánh kỹ thuật toàn diện giữa hai kiến trúc nổi bật: Ultralytics YOLO11YOLOv7.

Bối cảnh mô hình và thông tin kỹ thuật#

Cả hai mô hình đều có tác động đáng kể đến cộng đồng deep learning, nhưng chúng xuất phát từ các triết lý và kỷ nguyên phát triển khác nhau.

Chi tiết về YOLO11:
Tác giả: Glenn Jocher và Jing Qiu
Tổ chức: Ultralytics
Ngày: 27-09-2024
GitHub: https://github.com/ultralytics/ultralytics
Tài liệu: https://docs.ultralytics.com/models/yolo11/

Tìm hiểu thêm về YOLO11

Chi tiết về YOLOv7:
Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
Tổ chức: Institute of Information Science, Academia Sinica, Taiwan
Ngày: 06-07-2022
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: https://github.com/WongKinYiu/yolov7
Tài liệu: https://docs.ultralytics.com/models/yolov7/

Tìm hiểu thêm về YOLOv7

Sự khác biệt về kiến trúc#

Khi phân tích các cơ chế bên trong, cả hai trình phát hiện đều sử dụng các khái niệm hiện đại nhất, tuy nhiên nền tảng cấu trúc của chúng lại khác nhau.

YOLOv7 giới thiệu khái niệm Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Kiến trúc này được thiết kế để liên tục nâng cao khả năng học tập của mạng mà không làm phá hủy đường dẫn gradient ban đầu, một bước đột phá quan trọng được báo cáo trong bài báo nghiên cứu của họ. YOLOv7 phụ thuộc nhiều vào việc tái tham số hóa cấu trúc và phương pháp "túi quà tặng" mạnh mẽ trong quá trình huấn luyện, cải thiện độ chính xác tổng thể trên tập dữ liệu COCO mà không làm tăng chi phí suy luận.

Ngược lại, YOLO11 được xây dựng dựa trên kiến trúc Ultralytics đã được tối ưu hóa cao. Nó nhấn mạnh vào đường ống trích xuất đặc trưng tinhrefined hơn với ít tham số hơn, dẫn đến việc sử dụng bộ nhớ thấp hơn trong quá trình huấn luyện. YOLO11 đạt được sự cân bằng hiệu suất rất thuận lợi, sử dụng ít tài nguyên tính toán hơn (FLOPs) trong khi vẫn khớp hoặc vượt quá độ chính xác phát hiện của các mô hình nặng hơn. Hơn nữa, YOLO11 hỗ trợ vốn có nhiều tác vụ đa dạng hơn, biến nó thành một lựa chọn linh hoạt cao cho các ứng dụng computer vision hiện đại.

Hiệu quả Bộ nhớ

Một trong những tính năng nổi bật của các mô hình Ultralytics YOLO là yêu cầu bộ nhớ thấp hơn trong quá trình huấn luyện so với các mô hình tiên tiến khác, cho phép các nhà phát triển huấn luyện các mạng mạnh mẽ trên phần cứng PyTorch cấp tiêu dùng.

So sánh Hiệu năng và Chỉ số#

Để đánh giá chính xác khả năng ứng dụng thực tế, việc đánh giá các số liệu như mean Average Precision (mAP), tốc độ suy luận, tham số mô hình và độ phức tạp tính toán (FLOPs) là rất cần thiết. Bảng sau đây cho thấy cách các biến thể quy mô YOLO11 so sánh với các mô hình YOLOv7 lớn hơn.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Như đã thấy, một mô hình như YOLO11x đạt được 54.7 mAP cao hơn so với 53.1 mAP của YOLOv7x, trong khi sử dụng ít tham số hơn đáng kể (56.9M so với 71.3M). Điều này làm nổi bật hiệu quả kiến trúc vượt trội của YOLO11.

Hiệu quả huấn luyện và khả năng sử dụng hệ sinh thái#

Một trong những đặc điểm xác định nhất tách biệt hai kiến trúc này là trải nghiệm nhà phát triển và hệ sinh thái xung quanh.

YOLOv7 về cơ bản là một kho lưu trữ nghiên cứu học thuật. Việc huấn luyện các mô hình thường đòi hỏi thiết lập môi trường phức tạp, quản lý thủ công các phụ thuộc và sử dụng các đối số dòng lệnh dài. Mặc dù nó hỗ trợ thử nghiệm tiên tiến, việc điều chỉnh mã nguồn kho lưu trữ GitHub YOLOv7 cho các môi trường sản xuất tùy chỉnh có thể mất nhiều thời gian.

YOLO11 định nghĩa lại hoàn toàn tính dễ sử dụng. Nó được tích hợp hoàn toàn vào Nền tảng Ultralytics, một hệ sinh thái toàn diện và được duy trì tốt cung cấp các quy trình đầu cuối liền mạch. Từ việc gán nhãn dữ liệu và huấn luyện cục bộ đến triển khai, API Python thống nhất và giao diện dòng lệnh đơn giản giúp đơn giản hóa toàn bộ quá trình.

So sánh mã nguồn#

Huấn luyện một mô hình nhận diện đối tượng với YOLO11 chỉ yêu cầu một vài dòng mã, làm giảm đáng kể rào cản gia nhập:

from ultralytics import YOLO

# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Quickly export to ONNX format
model.export(format="onnx")

Ngược lại, một lệnh huấn luyện YOLOv7 điển hình trông như thế này, yêu cầu thiết lập cẩn thận các đường dẫn, tệp cấu hình và tập lệnh bash:

python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'

YOLO11 cũng cung cấp tính linh hoạt to lớn. Trong khi YOLOv7 yêu cầu các cơ sở mã hoàn toàn khác nhau hoặc sửa đổi nặng để hỗ trợ các tác vụ vượt ra ngoài phát hiện (như tư thế hoặc phân đoạn), YOLO11 xử lý phát hiện đối tượng, phân đoạn thực thể, phân loại hình ảnh, ước tính tư thế và phát hiện Hộp giới hạn định hướng (OBB) thông qua một khung làm việc duy nhất, mạch lạc.

Việc xuất mô hình trở nên dễ dàng

Xuất YOLO11 sang các định dạng như TensorRT hoặc OpenVINO chỉ yêu cầu một lệnh duy nhất, giảm thiểu các vấn đề hỗ trợ toán tử điển hình gặp phải với các mô hình cũ.

Các ứng dụng thực tế và trường hợp sử dụng lý tưởng#

Việc lựa chọn giữa YOLOv7 và YOLO11 hoàn toàn phụ thuộc vào phạm vi dự án và các ràng buộc triển khai.

Khi nào cân nhắc YOLOv7:

  • Đánh giá chuẩn các mô hình cũ: Các nhà nghiên cứu học thuật khám phá các thiết kế đường dẫn gradient có thể sử dụng YOLOv7 làm cơ sở để đánh giá các mạng nơ-ron tích chập mới hơn.
  • Các đường ống tùy chỉnh hiện có: Các nhóm có các đường ống C++ hoặc CUDA được tùy chỉnh nhiều được xây dựng dành riêng xoay quanh logic giải mã hộp giới hạn độc đáo của YOLOv7.

Khi nào nên chọn YOLO11:

  • Sản xuất thương mại: Các ứng dụng trong bán lẻ thông minh hoặc chẩn đoán chăm sóc sức khỏe được hưởng lợi rất nhiều từ cơ sở mã được duy trì và độ ổn định cao của YOLO11.
  • Môi trường bị hạn chế tài nguyên: Dấu chân nhẹ của YOLO11n làm cho nó cực kỳ phù hợp để triển khai trên các thiết bị di động và biên thông qua ONNX.
  • Dự án đa tác vụ: Nếu một ứng dụng cần xác định một người, lập bản đồ khung xương của họ (pose) và phân đoạn một đối tượng họ đang cầm, YOLO11 cung cấp một giải pháp thống nhất.

Đỉnh cao công nghệ: Tiến về phía trước với YOLO26#

Mặc dù YOLO11 là một lựa chọn cực kỳ mạnh mẽ, sự đổi mới trong trí tuệ nhân tạo không bao giờ ngủ quên. Đối với các kỹ sư bắt đầu các dự án mới ngày nay, việc khám phá Ultralytics YOLO26 được khuyến nghị mạnh mẽ.

Được phát hành vào tháng 1 năm 2026, YOLO26 giới thiệu Thiết kế không NMS đầu cuối, loại bỏ hoàn toàn các điểm nghẽn độ trễ liên quan đến hậu xử lý Non-Maximum Suppression. Hơn nữa, YOLO26 tích hợp Trình tối ưu hóa MuSGD mang tính cách mạng, lấy cảm hứng từ các phương pháp huấn luyện LLM, để đảm bảo hội tụ nhanh hơn. Với những cải tiến về hàm mất mát được nhắm mục tiêu thông qua ProgLoss + STAL và hiệu suất suy luận CPU nhanh hơn tới 43% do loại bỏ DFL, YOLO26 được tối ưu hóa cụ thể cho điện toán biên và đại diện cho đỉnh cao hiện tại của AI thị giác.

Tìm hiểu thêm về YOLO26

Đối với những người dùng quan tâm đến các cấu trúc thay thế chuyên biệt, việc khám phá RT-DETR dựa trên transformer hoặc các mô hình YOLO-World từ vựng mở động cũng có thể mang lại kết quả có lợi cho các triển khai computer vision đa dạng.

Những người đóng góp

Bình luận