Ultralytics YOLO27:

YOLO11 so với YOLOv9#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của những gì có thể thực hiện trong phát hiện đối tượng theo thời gian thực. Hai cột mốc quan trọng trong hành trình này là Ultralytics YOLO11 và YOLOv9. Mặc dù cả hai model đều mang lại hiệu năng vượt trội, chúng đại diện cho những cách tiếp cận khác nhau để giải quyết các thách thức cốt lõi của quá trình suy luận và huấn luyện deep learning.

Hướng dẫn này cung cấp một so sánh kỹ thuật toàn diện giữa YOLO11 và YOLOv9, phân tích kiến trúc, các chỉ số hiệu năng và các kịch bản triển khai phù hợp, nhằm giúp bạn lựa chọn model phù hợp cho dự án artificial intelligence tiếp theo.

Tổng quan về model#

Ultralytics YOLO11#

YOLO11 là một model linh hoạt, được tối ưu hóa cao và thiết kế cho các môi trường cấp production. Model này cân bằng độ chính xác tiên tiến với các yêu cầu thực tiễn của điện toán biên và triển khai quy mô lớn.

YOLOv9#

YOLOv9 là một đóng góp học thuật mạnh mẽ, giới thiệu các khái niệm mới nhằm giảm thiểu mất mát thông tin trong các mạng neural sâu, tập trung đáng kể vào những cải tiến lý thuyết trong việc trích xuất đặc trưng.

Tìm hiểu thêm về YOLOv9

Các cải tiến về kiến trúc#

YOLOv9: Thông tin Gradient có thể lập trình#

YOLOv9 giải quyết vấn đề "nút thắt thông tin"—khi dữ liệu bị mất trong quá trình đi qua các layer liên tiếp của một mạng sâu. Để giải quyết vấn đề này, các tác giả đã giới thiệu Thông tin Gradient Có thể Lập trình (PGI) và Mạng Tổng hợp Layer Hiệu quả Tổng quát (GELAN). PGI đảm bảo các gradient được sử dụng để cập nhật trọng số trong quá trình lan truyền ngược chứa đầy đủ thông tin, từ đó tạo ra các biểu diễn đặc trưng có độ chính xác cao. Kiến trúc GELAN tối đa hóa hiệu quả sử dụng parameter, cho phép YOLOv9 đạt độ chính xác cao với cấu trúc tương đối gọn nhẹ.

YOLO11: Hệ sinh thái và hiệu quả#

Trong khi YOLOv9 tập trung vào luồng gradient, YOLO11 được xây dựng nhằm mang lại độ bền vững và tính linh hoạt trong thế giới thực. Model này tinh chỉnh kiến trúc YOLO nền tảng để giảm đáng kể yêu cầu bộ nhớ CUDA trong quá trình huấn luyện so với các phương án phụ thuộc nhiều vào Transformer. Hơn nữa, YOLO11 không chỉ là một object detector; model còn hỗ trợ gốc phân đoạn instance, phân loại ảnh, ước tính posehộp giới hạn định hướng (OBB).

Phát triển tinh gọn

Một trong những thế mạnh lớn nhất của YOLO11 là khả năng tích hợp vào Ultralytics Platform, nền tảng này trừu tượng hóa các quy trình phức tạp như tải dữ liệu, augmentation và huấn luyện phân tán thành một API thống nhất.

So sánh hiệu năng#

Khi lựa chọn model cho production, việc đánh giá sự đánh đổi giữa Độ chính xác trung bình (mAP), tốc độ suy luận và số lượng parameter là rất quan trọng.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Như thể hiện trong bảng, YOLOv9e đạt độ chính xác tổng thể cao nhất, khiến model này rất phù hợp cho việc benchmark học thuật. Tuy nhiên, YOLO11 mang lại tỷ lệ tốc độ trên độ chính xác vượt trội trên mọi phương diện. Chẳng hạn, YOLO11m đạt 51.5 mAP ở 4.7 ms (TensorRT), nhanh hơn YOLOv9m có kích thước tương tự.

Phương pháp huấn luyện và hệ sinh thái#

Trải nghiệm dành cho developer khác biệt đáng kể giữa hai framework.

Huấn luyện YOLOv9#

Việc huấn luyện YOLOv9 thường đòi hỏi phải làm việc với code nghiên cứu được tùy biến sâu, quản lý các phiên bản dependency cụ thể và sử dụng các đối số dòng lệnh phức tạp. Dù mạnh mẽ, quy trình này có thể gây e ngại trong các môi trường enterprise có nhịp độ nhanh.

Huấn luyện YOLO11#

YOLO11 tận dụng Python API Ultralytics được duy trì tốt, mang lại trải nghiệm liền mạch từ "zero-to-hero". Các quy trình huấn luyện hiệu quả được hỗ trợ bởi các pre-trained weight sẵn có và sự hỗ trợ tuyệt vời từ cộng đồng.

from ultralytics import YOLO

# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train on a custom dataset with built-in augmentations
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to ONNX format for deployment
model.export(format="onnx")

Chỉ với ba dòng Python, developer có thể tải một model, bắt đầu huấn luyện với các giá trị mặc định hyperparameter đã được tối ưu hóa và export kiến trúc đã huấn luyện sang các framework như ONNX hoặc TensorRT để triển khai trên edge.

Ứng dụng thực tế#

Khi nào nên chọn YOLOv9#

YOLOv9 là lựa chọn tuyệt vời cho các nhà nghiên cứu muốn khám phá kiến trúc deep learning. Framework PGI khiến model này trở thành ứng viên lý tưởng cho việc phân tích bán lẻ tốc độ cao, nơi yêu cầu độ chính xác cực cao trên các dataset dày đặc và độ phức tạp triển khai được xem là yếu tố thứ yếu so với hiệu năng thuật toán.

Khi nào nên chọn YOLO11#

YOLO11 là công cụ tối ưu cho production. Các khả năng phát hiện đối tượng tinh gọn khiến model này rất phù hợp cho quản lý giao thông đô thị thông minh và các edge device như Raspberry Pi hoặc NVIDIA Jetson. Hơn nữa, tính linh hoạt trên nhiều task khác nhau cho phép một pipeline phát triển duy nhất xử lý phân đoạn trong sản xuấtước tính pose trong phân tích thể thao.

Công nghệ tiên tiến: Ra mắt YOLO26#

Mặc dù YOLO11 và YOLOv9 rất ấn tượng, lĩnh vực artificial intelligence phát triển nhanh chóng. Đối với các developer bắt đầu dự án mới hiện nay, Ultralytics đặc biệt khuyến nghị YOLO26 (phát hành vào tháng 1 năm 2026), model này tiếp tục mở rộng các giới hạn của thị giác máy tính.

YOLO26 kết hợp những đổi mới nổi bật nhất gần đây thành một giải pháp mạnh mẽ, sẵn sàng cho production:

  • Thiết kế end-to-end không cần NMS: YOLO26 loại bỏ tự nhiên bước hậu xử lý Loại bỏ Phi cực đại (NMS), tạo ra các pipeline triển khai đơn giản và nhanh hơn đáng kể.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss đảm bảo khả năng tương thích tốt hơn với các vi điều khiển công suất thấp và các bộ tăng tốc edge AI.
  • Optimizer MuSGD: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM, optimizer MuSGD (kết hợp giữa SGD và Muon) mang lại quá trình huấn luyện ổn định và khả năng hội tụ nhanh hơn.
  • Suy luận CPU nhanh hơn tới 43%: Được tối ưu hóa riêng cho các thiết bị điện toán biên không có GPU chuyên dụng.
  • ProgLoss + STAL: Các hàm loss được cải tiến này nâng cao đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với giám sát nông nghiệp và ảnh chụp từ trên không.

Những người dùng quan tâm đến việc khám phá các kiến trúc đa dạng cũng có thể tìm hiểu RT-DETR để tracking dựa trên Transformer hoặc YOLO-World để phát hiện open-vocabulary zero-shot.

Kết luận#

Cả YOLO11 và YOLOv9 đều đã khẳng định vị trí của mình trong lịch sử thị giác máy tính. YOLOv9 mang đến những đổi mới kiến trúc nổi bật để tối đa hóa khả năng lưu giữ đặc trưng. Tuy nhiên, đối với phần lớn các triển khai trong thế giới thực—từ các ứng dụng AI enterprise đến thiết bị edge di động—tính dễ sử dụng, hiệu quả bộ nhớ và khả năng hỗ trợ đa dạng task của YOLO11 mang lại lợi thế vượt trội. Khi ngành tiếp tục phát triển, việc áp dụng YOLO26 mới hơn đảm bảo hệ thống của bạn đang chạy quá trình suy luận nhanh và đáng tin cậy nhất hiện nay.

Những người đóng góp

Bình luận