Ultralytics YOLO27:
Get Started

YOLO11 và YOLOv9#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của khả năng phát hiện đối tượng thời gian thực. Hai cột mốc quan trọng trong quá trình này là Ultralytics YOLO11 và YOLOv9. Cả hai model đều có hiệu năng vượt trội, nhưng đại diện cho những cách tiếp cận khác nhau nhằm giải quyết các thách thức cốt lõi trong inference và huấn luyện deep learning.

Hướng dẫn này cung cấp phần so sánh kỹ thuật toàn diện giữa YOLO11 và YOLOv9, phân tích kiến trúc, chỉ số hiệu năng và các kịch bản triển khai phù hợp, giúp bạn chọn model thích hợp cho dự án trí tuệ nhân tạo tiếp theo.

Tổng quan về model#

Ultralytics YOLO11#

YOLO11 là model đa năng, được tối ưu hóa cao và thiết kế cho môi trường production. Model cân bằng độ chính xác tiên tiến với các yêu cầu thực tế của điện toán biên và triển khai quy mô lớn.

YOLOv9#

YOLOv9 là một đóng góp học thuật mạnh mẽ, giới thiệu các khái niệm mới nhằm giảm thiểu mất mát thông tin trong mạng neural sâu, tập trung chủ yếu vào những tiến bộ lý thuyết trong trích xuất đặc trưng.

Tìm hiểu thêm về YOLOv9

Các cải tiến kiến trúc#

YOLOv9: Thông tin gradient có thể lập trình#

YOLOv9 giải quyết vấn đề "nút thắt thông tin" — tình trạng dữ liệu bị mất khi đi qua các lớp liên tiếp của mạng sâu. Để khắc phục, các tác giả giới thiệu Thông tin Gradient Có thể Lập trình (PGI) và Mạng Tổng hợp Lớp Hiệu quả Tổng quát (GELAN). PGI đảm bảo gradient dùng để cập nhật trọng số trong quá trình lan truyền ngược chứa đầy đủ thông tin, từ đó tạo ra biểu diễn đặc trưng có độ chính xác cao. Kiến trúc GELAN tối đa hóa hiệu quả sử dụng tham số, giúp YOLOv9 đạt độ chính xác cao với cấu trúc tương đối gọn nhẹ.

YOLO11: Hệ sinh thái và hiệu quả#

Trong khi YOLOv9 tập trung vào luồng gradient, YOLO11 được thiết kế để có độ bền vững và tính linh hoạt trong ứng dụng thực tế. Model cải tiến kiến trúc YOLO nền tảng để giảm đáng kể yêu cầu bộ nhớ CUDA trong quá trình huấn luyện so với các lựa chọn thay thế thiên về Transformer. Ngoài ra, YOLO11 không chỉ là model phát hiện đối tượng; model hỗ trợ sẵn phân đoạn instance, phân loại ảnh, ước tính tư thế và bounding box có hướng (OBB).

Phát triển tinh gọn

Một trong những ưu điểm lớn nhất của YOLO11 là được tích hợp vào gói Python Ultralytics, giúp trừu tượng hóa những phức tạp của việc tải dữ liệu, augmentation và huấn luyện phân tán trong một API thống nhất.

So sánh hiệu năng#

Khi chọn model để đưa vào production, việc đánh giá sự đánh đổi giữa độ chính xác trung bình (mAP), tốc độ inference và số lượng tham số là yếu tố then chốt.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Như thể hiện trong bảng, YOLOv9e đạt độ chính xác tổng thể cao nhất, rất phù hợp để benchmark học thuật. Tuy nhiên, YOLO11 có tỷ lệ tốc độ/độ chính xác vượt trội trên mọi phương diện. Chẳng hạn, YOLO11m đạt 51.5 mAP trong 4.7 ms (TensorRT), nhanh hơn YOLOv9m có kích thước tương đương.

Phương pháp huấn luyện và hệ sinh thái#

Trải nghiệm dành cho nhà phát triển khác biệt đáng kể giữa hai framework.

Huấn luyện YOLOv9#

Huấn luyện YOLOv9 thường đòi hỏi phải làm việc với code nghiên cứu được tùy chỉnh nhiều, quản lý các phiên bản dependency cụ thể và sử dụng các đối số dòng lệnh phức tạp. Tuy mạnh mẽ, cách này có thể gây khó khăn cho các môi trường doanh nghiệp có nhịp độ nhanh.

Huấn luyện YOLO11#

YOLO11 tận dụng Ultralytics Python API được bảo trì tốt, mang đến trải nghiệm liền mạch từ "bắt đầu từ con số không đến thành thạo". Quy trình huấn luyện hiệu quả được hỗ trợ bởi các trọng số pretrained sẵn có và cộng đồng hỗ trợ tích cực.

from ultralytics import YOLO

# Tải model YOLO11 small đã được huấn luyện trước
model = YOLO("yolo11s.pt")

# Huấn luyện trên dataset tùy chỉnh với các augmentation tích hợp sẵn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Xuất sang định dạng ONNX để triển khai
model.export(format="onnx")

Chỉ với ba dòng Python, nhà phát triển có thể tải model, bắt đầu huấn luyện với các giá trị hyperparameter mặc định đã tối ưu và xuất kiến trúc đã huấn luyện sang các framework như ONNX hoặc TensorRT để triển khai trên thiết bị biên.

Ứng dụng thực tế#

Khi nào nên chọn YOLOv9#

YOLOv9 là lựa chọn tuyệt vời cho các nhà nghiên cứu muốn khám phá kiến trúc deep learning. Framework PGI khiến YOLOv9 trở thành ứng viên lý tưởng cho phân tích bán lẻ tốc độ cao, nơi cần độ chính xác cực cao trên dataset dày đặc và độ phức tạp triển khai không quan trọng bằng hiệu năng thuật toán.

Khi nào nên chọn YOLO11#

YOLO11 là công cụ tối ưu cho production. Khả năng phát hiện đối tượng tinh gọn giúp model phù hợp với quản lý giao thông đô thị thông minh và các thiết bị biên như Raspberry Pi hoặc NVIDIA Jetson. Hơn nữa, tính linh hoạt trên nhiều tác vụ cho phép một pipeline phát triển duy nhất xử lý phân đoạn trong sản xuất và ước tính tư thế trong phân tích thể thao.

Công nghệ tiên tiến nhất: YOLO26 ra mắt#

YOLO11 và YOLOv9 đều rất ấn tượng, nhưng lĩnh vực trí tuệ nhân tạo phát triển nhanh chóng. Với các nhà phát triển bắt đầu dự án mới hiện nay, Ultralytics đặc biệt khuyến nghị YOLO26 (ra mắt tháng 1 năm 2026), tiếp tục mở rộng giới hạn của thị giác máy tính.

YOLO26 kết hợp những đổi mới gần đây xuất sắc nhất trong một model mạnh mẽ, sẵn sàng cho production:

  • Thiết kế end-to-end không cần NMS: Head one-to-one tùy chọn của YOLO26 (nms=False) bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS), giúp pipeline triển khai đơn giản và nhanh hơn đáng kể.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss đảm bảo khả năng tương thích tốt hơn với vi điều khiển công suất thấp và bộ tăng tốc AI biên.
  • MuSGD Optimizer: Lấy cảm hứng từ các đổi mới trong huấn luyện LLM, optimizer MuSGD (kết hợp SGD và Muon) mang lại quá trình huấn luyện ổn định và hội tụ nhanh hơn.
  • Inference CPU nhanh hơn tới 43%: Được tối ưu chuyên biệt cho thiết bị điện toán biên không có GPU chuyên dụng.
  • ProgLoss + STAL: Các hàm loss cải tiến này nâng cao đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với giám sát nông nghiệp và ảnh hàng không.

Người dùng muốn tìm hiểu các kiến trúc đa dạng cũng có thể xem xét RT-DETR để theo dõi dựa trên Transformer hoặc YOLO-World để phát hiện zero-shot với từ vựng mở.

Kết luận#

YOLO11 và YOLOv9 đều đã khẳng định vị thế trong lịch sử thị giác máy tính. YOLOv9 mang đến những đổi mới kiến trúc nổi bật nhằm giữ lại đặc trưng tối đa. Tuy nhiên, với phần lớn hoạt động triển khai thực tế — từ ứng dụng AI doanh nghiệp đến thiết bị biên di động — tính dễ sử dụng, hiệu quả bộ nhớ và khả năng hỗ trợ tác vụ linh hoạt của YOLO11 tạo nên lợi thế vượt trội. Khi ngành tiếp tục phát triển, áp dụng phiên bản mới hơn YOLO26 đảm bảo hệ thống của bạn sử dụng khả năng inference nhanh nhất và đáng tin cậy nhất hiện nay.

Người đóng góp

Bình luận