Ultralytics YOLO27:

So sánh YOLO11 và YOLOv7#

Lĩnh vực thị giác máy tính tiếp tục phát triển với tốc độ nhanh chóng, trong đó phát hiện đối tượng theo thời gian thực vẫn giữ vị trí hàng đầu trong các ứng dụng AI. Việc lựa chọn architecture phù hợp cho dự án đòi hỏi phải cân nhắc sự đánh đổi phức tạp giữa tốc độ, độ chính xác và tính dễ triển khai. Trong hướng dẫn này, chúng tôi cung cấp bản so sánh kỹ thuật toàn diện giữa hai architecture nổi bật: Ultralytics YOLO11YOLOv7.

Bối cảnh và Chi tiết Kỹ thuật của Model#

Cả hai model đều có tác động đáng kể đến cộng đồng deep learning, nhưng chúng bắt nguồn từ những triết lý và thời kỳ phát triển khác nhau.

Thông tin chi tiết về YOLO11:

Thông tin chi tiết về YOLOv7:

Tìm hiểu thêm về YOLOv7

Sự khác biệt về Architecture#

Khi phân tích các cơ chế bên trong, cả hai detector đều sử dụng những khái niệm tiên tiến nhất, nhưng nền tảng cấu trúc của chúng lại khác nhau.

YOLOv7 giới thiệu khái niệm Mạng Tổng hợp Tầng Hiệu quả Mở rộng (E-ELAN). Architecture này được thiết kế để liên tục nâng cao khả năng học của mạng mà không phá hủy đường gradient ban đầu, một đột phá quan trọng được trình bày trong bài nghiên cứu của họ. YOLOv7 phụ thuộc nhiều vào việc tái tham số hóa cấu trúc và phương pháp "bag-of-freebies" mạnh mẽ trong quá trình training, cải thiện độ chính xác tổng thể trên dataset COCO mà không làm tăng chi phí inference.

Ngược lại, YOLO11 được xây dựng trên architecture Ultralytics được tối ưu hóa cao. Model này nhấn mạnh pipeline trích xuất đặc trưng tinh gọn hơn với ít tham số hơn, dẫn đến mức sử dụng bộ nhớ thấp hơn trong quá trình training. YOLO11 đạt được sự cân bằng hiệu năng rất thuận lợi, sử dụng ít tài nguyên tính toán hơn (FLOPs) trong khi vẫn đạt hoặc vượt độ chính xác phát hiện của các model lớn hơn. Hơn nữa, YOLO11 tích hợp sẵn khả năng hỗ trợ nhiều loại task hơn, trở thành lựa chọn linh hoạt cho các ứng dụng thị giác máy tính hiện đại.

Hiệu quả bộ nhớ

Một trong những tính năng nổi bật của các model Ultralytics YOLO là yêu cầu bộ nhớ thấp hơn trong quá trình training so với các model tiên tiến khác, cho phép developer training các mạng mạnh mẽ trên phần cứng PyTorch phổ thông.

So sánh hiệu năng và các chỉ số#

Để đánh giá chính xác khả năng ứng dụng trong thực tế, việc đánh giá các chỉ số như Độ chính xác trung bình (mAP), tốc độ inference, số lượng tham số của model và độ phức tạp tính toán (FLOPs) là điều cần thiết. Bảng dưới đây cho thấy các biến thể scale của YOLO11 so sánh như thế nào với các model YOLOv7 lớn hơn.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Như quan sát được, một model như YOLO11x đạt 54.7 mAP cao hơn so với 53.1 mAP của YOLOv7x, đồng thời sử dụng ít tham số hơn đáng kể (56.9M so với 71.3M). Điều này làm nổi bật hiệu quả architecture vượt trội của YOLO11.

Hiệu quả Training và Tính dễ sử dụng của Ecosystem#

Một trong những đặc điểm nổi bật nhất phân biệt hai architecture này là trải nghiệm developer và ecosystem xung quanh.

YOLOv7 về bản chất là một repository nghiên cứu học thuật. Việc training model thường yêu cầu thiết lập environment phức tạp, quản lý dependency thủ công và sử dụng các tham số dòng lệnh dài. Mặc dù hỗ trợ thử nghiệm tiên tiến, việc điều chỉnh code từ repository GitHub của YOLOv7 cho các environment production tùy chỉnh có thể tốn nhiều thời gian.

YOLO11 định nghĩa lại hoàn toàn tính dễ sử dụng. Model được tích hợp đầy đủ vào Ultralytics Platform, một ecosystem toàn diện và được duy trì tốt, cung cấp workflow end-to-end liền mạch. Từ gán nhãn dữ liệu và training cục bộ đến deployment, Python API hợp nhất và CLI đơn giản hóa toàn bộ quy trình.

So sánh Code#

Training một model phát hiện đối tượng với YOLO11 chỉ cần vài dòng code, giúp giảm đáng kể rào cản tiếp cận:

from ultralytics import YOLO

# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Quickly export to ONNX format
model.export(format="onnx")

Ngược lại, một lệnh training YOLOv7 điển hình trông như sau, yêu cầu thiết lập cẩn thận các path, file cấu hình và bash script:

python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'

YOLO11 cũng mang đến tính linh hoạt vượt trội. Trong khi YOLOv7 yêu cầu các codebase hoàn toàn khác hoặc chỉnh sửa lớn để hỗ trợ các task ngoài phát hiện (như pose hoặc segmentation), YOLO11 xử lý phát hiện đối tượng, segmentation instance, phân loại ảnh, ước tính pose và phát hiện Hộp giới hạn định hướng (OBB) thông qua một framework thống nhất duy nhất.

Đơn giản hóa việc Export

Export YOLO11 sang các format như TensorRT hoặc OpenVINO chỉ yêu cầu một lệnh duy nhất, giúp giảm thiểu các vấn đề hỗ trợ operator thường gặp với các model legacy.

Ứng dụng Thực tế và Các Trường hợp Sử dụng Lý tưởng#

Việc lựa chọn giữa YOLOv7 và YOLO11 hoàn toàn phụ thuộc vào phạm vi dự án và các ràng buộc deployment.

Khi nào nên cân nhắc YOLOv7:

  • Benchmark các Model Legacy: Các nhà nghiên cứu học thuật nghiên cứu thiết kế đường gradient có thể sử dụng YOLOv7 làm baseline để đánh giá các mạng neural tích chập mới hơn.
  • Pipeline Tùy chỉnh Hiện có: Các team có pipeline C++ hoặc CUDA được tùy chỉnh sâu, xây dựng riêng xoay quanh logic giải mã bounding box độc đáo của YOLOv7.

Khi nào nên chọn YOLO11:

  • Production Thương mại: Các ứng dụng trong bán lẻ thông minh hoặc chẩn đoán y tế hưởng lợi đáng kể từ codebase được duy trì và độ ổn định cao của YOLO11.
  • Environment Hạn chế Tài nguyên: Footprint nhẹ của YOLO11n khiến model đặc biệt phù hợp để deployment trên thiết bị di động và edge thông qua ONNX.
  • Dự án Multi-task: Nếu một ứng dụng duy nhất cần nhận diện một người, lập bản đồ bộ xương của họ (pose) và phân đoạn một đối tượng mà họ đang cầm, YOLO11 cung cấp một giải pháp thống nhất.

Công nghệ Tiên tiến: Tiến về phía trước cùng YOLO26#

Mặc dù YOLO11 là một lựa chọn rất mạnh mẽ, sự đổi mới trong trí tuệ nhân tạo không bao giờ dừng lại. Đối với các engineer bắt đầu dự án mới hiện nay, rất nên khám phá Ultralytics YOLO26.

Được phát hành vào tháng 1 năm 2026, YOLO26 giới thiệu Thiết kế không cần NMS end-to-end, loại bỏ hoàn toàn các điểm nghẽn độ trễ liên quan đến bước hậu xử lý Ức chế cực đại không cực đại. Ngoài ra, YOLO26 tích hợp MuSGD Optimizer mang tính cách mạng, lấy cảm hứng từ các phương pháp training LLM, để đảm bảo hội tụ nhanh hơn. Với các cải tiến loss có mục tiêu thông qua ProgLoss + STAL và inference CPU nhanh hơn tới 43% nhờ loại bỏ DFL, YOLO26 được tối ưu riêng cho edge computing và đại diện cho đỉnh cao hiện tại của vision AI.

Đối với người dùng quan tâm đến các cấu trúc thay thế chuyên biệt, việc khám phá model RT-DETR dựa trên transformer hoặc model YOLO-World với open-vocabulary động cũng có thể mang lại kết quả hữu ích cho nhiều hình thức deployment thị giác máy tính.

Những người đóng góp

Bình luận