Ultralytics YOLO27:

So sánh YOLOv9 với YOLOv10#

Lĩnh vực thị giác máy tính thời gian thực đã đạt được những tiến bộ vượt bậc, phần lớn nhờ các nhà nghiên cứu không ngừng đẩy xa ranh giới giữa hiệu năng và hiệu quả. Khi phân tích quá trình phát triển của các model thị giác tiên tiến nhất, YOLOv9YOLOv10 là hai cột mốc quan trọng. Được phát hành vào đầu năm 2024, cả hai model đều giới thiệu các thiết kế kiến trúc mang tính đột phá nhằm giải quyết những thách thức tồn tại lâu nay trong mạng neural sâu, từ nút thắt thông tin đến độ trễ hậu xử lý.

Bài so sánh kỹ thuật toàn diện này phân tích kiến trúc, các chỉ số hiệu năng và những kịch bản triển khai phù hợp của chúng, giúp bạn định hướng trong hệ sinh thái phát hiện đối tượng hiện đại đầy phức tạp.

Nguồn gốc model và những đột phá về kiến trúc#

Việc tìm hiểu dòng phát triển và nền tảng lý thuyết của các model này là yếu tố then chốt để lựa chọn kiến trúc phù hợp cho dự án thị giác máy tính cụ thể của bạn.

YOLOv9: Làm chủ luồng thông tin#

Được giới thiệu vào ngày 21 tháng 2 năm 2024, YOLOv9 giải quyết vấn đề lý thuyết về mất mát thông tin khi dữ liệu truyền qua các mạng neural sâu.

YOLOv9 giới thiệu Mạng tổng hợp lớp hiệu quả tổng quát (GELAN), tối đa hóa mức độ khai thác parameter bằng cách kết hợp thế mạnh của CSPNet và ELAN. Ngoài ra, model sử dụng Thông tin gradient có thể lập trình (PGI), một cơ chế giám sát phụ giúp các lớp sâu duy trì thông tin không gian quan trọng. Điều này khiến YOLOv9 đặc biệt mạnh trong các tác vụ đòi hỏi độ trung thực cao của đặc trưng, chẳng hạn như phân tích ảnh y khoa hoặc giám sát từ xa.

Tìm hiểu thêm về YOLOv9

YOLOv10: Hiệu quả đầu-cuối theo thời gian thực#

Được phát hành ngay sau đó vào ngày 23 tháng 5 năm 2024, YOLOv10 tái định hình pipeline triển khai bằng cách loại bỏ một trong những nút thắt độ trễ khét tiếng nhất trong phát hiện đối tượng: Loại bỏ phi cực đại (NMS).

YOLOv10 sử dụng gán kép nhất quán trong quá trình huấn luyện, cho phép tạo ra thiết kế không cần NMS ngay từ đầu. Điều này loại bỏ chi phí hậu xử lý trong quá trình suy luận, giúp giảm đáng kể độ trễ. Kết hợp với thiết kế model tổng thể hướng đến hiệu quả và độ chính xác, YOLOv10 đạt được sự cân bằng nổi bật, giảm chi phí tính toán (FLOPs) trong khi vẫn duy trì độ chính xác cạnh tranh, khiến model trở nên rất hấp dẫn đối với các ứng dụng điện toán biên.

Tìm hiểu thêm về YOLOv10

So sánh hiệu năng và các chỉ số#

Khi benchmark hai model mạnh mẽ này trên bộ dữ liệu MS COCO tiêu chuẩn, những đánh đổi rõ rệt giữa độ chính xác thuần túy và độ trễ suy luận sẽ xuất hiện.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Phân tích dữ liệu#

  1. Độ trễ so với độ chính xác: Các model YOLOv10 thường cung cấp tốc độ suy luận vượt trội hơn. Chẳng hạn, YOLOv10s đạt mAP 46.7% chỉ trong 2.66ms trên TensorRT, trong khi YOLOv9s cần 3.54ms để đạt mAP gần như tương đương ở mức 46.8%.
  2. Độ chính xác hàng đầu: Đối với các kịch bản nghiên cứu yêu cầu độ chính xác phát hiện tối đa, YOLOv9e vẫn là một lựa chọn đáng gờm, đạt mAP 55.6% ấn tượng. Kiến trúc PGI giúp các đặc trưng tinh tế được trích xuất một cách đáng tin cậy.
  3. Hiệu quả: YOLOv10 vượt trội về hiệu quả FLOPs. Điều này trực tiếp chuyển thành mức tiêu thụ điện năng thấp hơn, một chỉ số quan trọng đối với các thiết bị chạy bằng pin sử dụng model AI thị giác.
Mẹo triển khai

Nếu bạn triển khai trên CPU hoặc phần cứng biên có tài nguyên hạn chế như Raspberry Pi, kiến trúc không cần NMS của YOLOv10 thường cung cấp pipeline mượt mà hơn bằng cách loại bỏ các bước hậu xử lý không tất định.

Lợi thế của Ultralytics: Huấn luyện và hệ sinh thái#

Mặc dù khác biệt về kiến trúc đóng vai trò quan trọng, hệ sinh thái phần mềm xung quanh cũng quyết định đáng kể đến thành công của dự án. Cả YOLOv9 và YOLOv10 đều được tích hợp đầy đủ vào hệ sinh thái Ultralytics, mang lại trải nghiệm developer vượt trội.

Tính dễ sử dụng và hiệu quả bộ nhớ#

Không giống các kiến trúc dựa trên Transformer phức tạp thường gặp phải tình trạng phình to bộ nhớ nghiêm trọng, các model Ultralytics YOLO được thiết kế để sử dụng bộ nhớ GPU tối ưu. Điều này cho phép các nhà nghiên cứu sử dụng batch size lớn hơn trên phần cứng phổ thông, giúp AI tiên tiến nhất trở nên dễ tiếp cận.

Python API hợp nhất sẽ trừu tượng hóa những phức tạp của tăng cường dữ liệutinh chỉnh hyperparameter. Bạn có thể chuyển đổi liền mạch giữa các kiến trúc chỉ bằng cách thay đổi chuỗi tên file weight.

from ultralytics import YOLO

# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Validate the model's performance
metrics = model.val()

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Dù bạn cần ghi log metric vào MLflow hay export sang TensorRT để triển khai trên phần cứng tốc độ cao, nền tảng Ultralytics đều hỗ trợ nguyên bản.

Các trường hợp sử dụng lý tưởng#

Việc lựa chọn giữa các model này phụ thuộc vào các ràng buộc triển khai của bạn:

  • Chọn YOLOv9 nếu: Bạn đang thực hiện các tác vụ phát hiện đối tượng nhỏ, chẳng hạn như ảnh chụp từ drone trên không hoặc phát hiện khối u nhỏ, trong đó kiến trúc GELAN giúp duy trì đặc trưng với độ trung thực cao nhất.
  • Chọn YOLOv10 nếu: Mục tiêu chính của bạn là suy luận thời gian thực trên các thiết bị biên. Thiết kế không cần NMS khiến model trở nên lý tưởng cho robot tự hành, giám sát giao thông thời gian thực và giám sát thông minh.

Đón đầu tương lai: Chuyển sang YOLO26#

Mặc dù YOLOv8, YOLOv9 và YOLOv10 là những model xuất sắc, các developer muốn xây dựng giải pháp AI hiện đại nên cân nhắc Ultralytics YOLO26, được phát hành vào tháng 1 năm 2026.

YOLO26 là sự tổng hợp tối ưu của các thế hệ trước, kết hợp những ưu điểm tốt nhất về độ chính xác của YOLOv9 và hiệu quả của YOLOv10.

Những đổi mới chính của YOLO26#

  • Thiết kế đầu-cuối không cần NMS: Dựa trên nền tảng do YOLOv10 xây dựng, YOLO26 loại bỏ nguyên bản bước hậu xử lý NMS để đơn giản hóa việc triển khai.
  • Optimizer MuSGD: Một optimizer lai giữa SGD và Muon, mang những đổi mới trong huấn luyện LLM tiên tiến vào thị giác máy tính để đạt hội tụ cực kỳ ổn định và nhanh chóng.
  • Suy luận trên CPU nhanh hơn tới 43%: Được tối ưu riêng cho điện toán biên và các thiết bị không có GPU chuyên dụng.
  • Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ để đơn giản hóa việc export model và tăng khả năng tương thích với các thiết bị công suất thấp.
  • ProgLoss + STAL: Các hàm loss được cải tiến này mang lại những cải thiện đáng kể trong việc nhận diện đối tượng nhỏ, đạt hoặc vượt qua năng lực của YOLOv9.

Đối với các nhà nghiên cứu đánh giá những kiến trúc legacy, RT-DETRYOLO11 cũng là những lựa chọn thay thế được tài liệu hóa đầy đủ trong hệ sinh thái Ultralytics. Tuy nhiên, để đạt tính linh hoạt tối đa trên mọi tác vụ thị giác, việc chuyển sang YOLO26 trên Ultralytics Platform sẽ đảm bảo bạn đang tận dụng đỉnh cao của AI thị giác mã nguồn mở.

Những người đóng góp

Bình luận