Ultralytics YOLO27:
Get Started

YOLO26 so với YOLOv9#

Lĩnh vực computer vision phát triển nhanh chóng, với các kiến trúc mới liên tục mở rộng giới hạn về tốc độ và độ chính xác. Trong bài so sánh kỹ thuật này, chúng ta xem xét sự khác biệt giữa YOLO26 và YOLOv9, hai model có ảnh hưởng lớn trong lĩnh vực phát hiện vật thể thời gian thực. Cả hai model đều có những cải tiến kiến trúc riêng, nhưng việc hiểu rõ các đánh đổi về hiệu năng, khả năng triển khai và yêu cầu phần cứng là yếu tố then chốt để chọn đúng công cụ cho dự án thị giác tiếp theo.

YOLO26: Model mạnh mẽ được tối ưu cho thiết bị biên#

Ra mắt vào đầu năm 2026, Ultralytics YOLO26 đánh dấu bước tiến thế hệ mới về hiệu quả triển khai và độ ổn định huấn luyện model. Được thiết kế như một framework end-to-end nguyên bản, model trực tiếp giải quyết các điểm nghẽn triển khai vốn thường cản trở ứng dụng AI biên.

Thông tin model:

Kiến trúc và cải tiến#

YOLO26 thiết kế lại căn bản quy trình hậu xử lý bằng cách đưa vào thiết kế end-to-end không cần NMS. Khi chạy với head one-to-one tùy chọn (nms=False), model bỏ qua Non-Maximum Suppression (NMS) và giảm đáng kể mức biến động độ trễ. Nhờ đó, việc triển khai trên nền tảng di động và thiết bị biên trở nên dễ dàng hơn nhiều, đặc biệt khi xuất sang các framework như ONNX và Apple CoreML.

Ngoài ra, việc loại bỏ Distribution Focal Loss (DFL) giúp tinh gọn quy trình xuất model và tăng khả năng tương thích với vi điều khiển công suất thấp. Để cải thiện độ ổn định huấn luyện, YOLO26 tích hợp Optimizer MuSGD mới, kết hợp Stochastic Gradient Descent (SGD) và Muon (lấy cảm hứng từ các cải tiến trong huấn luyện Large Language Model). Điều này giúp hội tụ nhanh hơn và trích xuất đặc trưng ổn định hơn trên các bộ dữ liệu khó.

Inference trên thiết bị biên

Nhờ đơn giản hóa kiến trúc và loại bỏ DFL, YOLO26 đạt tốc độ CPU inference nhanh hơn đến 43%, trở thành lựa chọn lý tưởng cho các thiết bị biên có tài nguyên hạn chế như Raspberry Pi hoặc NVIDIA Jetson Nano.

Để phát hiện các đối tượng rất khó nhận diện trong những cảnh như ảnh chụp từ drone trên không, YOLO26 sử dụng các hàm loss ProgLoss + STAL đã được cập nhật. Các hàm này cải thiện đáng kể recall khi nhận diện vật thể nhỏ. Model còn có các cải tiến theo từng tác vụ, bao gồm proto đa tỷ lệ cho instance segmentation, Residual Log-Likelihood Estimation (RLE) cho pose estimation và loss góc chuyên biệt để phát hiện Oriented Bounding Boxes (OBB).

YOLOv9: Thông tin gradient có thể lập trình#

Được giới thiệu vào đầu năm 2024, YOLOv9 mang đến những tiến bộ lý thuyết về cách mạng neural xử lý luồng gradient trong giai đoạn huấn luyện, tập trung vào hiệu quả tham số và khả năng lưu giữ đặc trưng sâu.

Thông tin model:

Kiến trúc và ưu điểm#

YOLOv9 được xây dựng dựa trên khái niệm Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN). Các khái niệm này giải quyết vấn đề nút thắt thông tin thường thấy trong mạng neural sâu. Bằng cách bảo toàn thông tin thiết yếu trong quá trình truyền xuôi, GELAN đảm bảo gradient dùng để cập nhật trọng số luôn đáng tin cậy. Kiến trúc này mang lại độ chính xác cao, khiến YOLOv9 trở thành lựa chọn phù hợp cho nghiên cứu học thuật về lý thuyết mạng neural và tối ưu hóa đường đi của gradient bằng framework PyTorch.

Hạn chế#

Dù có hiệu quả tham số xuất sắc, YOLOv9 phụ thuộc nhiều vào NMS truyền thống để hậu xử lý bounding box, điều này có thể tạo ra nút thắt tính toán khi inference trên thiết bị biên. Hơn nữa, kho lưu trữ chính thức chủ yếu tập trung vào phát hiện vật thể, nên cần nhiều công sức kỹ thuật tùy chỉnh để điều chỉnh cho các tác vụ chuyên biệt như tracking hoặc pose estimation.

Tìm hiểu thêm về YOLOv9

So sánh hiệu năng#

Khi đánh giá các model này để triển khai thực tế, việc cân bằng độ chính xác (mAP), tốc độ inference và mức sử dụng bộ nhớ là rất quan trọng. Các model Ultralytics nổi tiếng nhờ yêu cầu bộ nhớ thấp trong cả quá trình huấn luyện lẫn inference, sử dụng ít bộ nhớ CUDA hơn nhiều so với các lựa chọn thay thế dựa trên transformer như RT-DETR.

Dưới đây là so sánh trực tiếp hiệu năng của YOLO26 và YOLOv9 trên bộ dữ liệu COCO. Các giá trị tốt nhất trong mỗi cột được đánh dấu bằng chữ đậm.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Lưu ý: Không đưa tốc độ CPU của YOLOv9 vào đây vì tốc độ này thay đổi đáng kể tùy theo cấu hình NMS và nhìn chung chậm hơn cách triển khai nguyên bản không cần NMS của YOLO26.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLO26 và YOLOv9 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLO26#

YOLO26 là lựa chọn phù hợp cho:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Khi nào nên chọn YOLOv9#

YOLOv9 được khuyến nghị cho:

  • Nghiên cứu về nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
  • Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các lớp mạng sâu khi huấn luyện.
  • Đánh giá hiệu năng phát hiện độ chính xác cao: Các tình huống cần hiệu năng mạnh của YOLOv9 trên benchmark COCO làm mốc tham chiếu để so sánh kiến trúc.

Lợi thế của Ultralytics#

Việc chọn model không chỉ đơn thuần là xem benchmark độ chính xác; hệ sinh thái phần mềm đi kèm quyết định tốc độ chuyển từ thu thập dữ liệu sang production.

Dễ sử dụng và hệ sinh thái#

Ultralytics Python API mang đến trải nghiệm liền mạch từ nhập môn đến thành thạo. Thay vì clone các kho lưu trữ phức tạp hoặc tự cấu hình script huấn luyện phân tán, developer có thể cài package bằng pip và bắt đầu huấn luyện ngay. Hệ sinh thái Ultralytics được duy trì tích cực, đảm bảo cập nhật thường xuyên, tích hợp tự động với các nền tảng ML như Weights & Biases và tài liệu phong phú.

Các model Ultralytics khác

Nếu muốn khám phá các model khác trong hệ sinh thái Ultralytics, bạn cũng có thể cân nhắc so sánh YOLO11 hoặc YOLOv8 cổ điển; cả hai đều mang đến khả năng linh hoạt vượt trội cho các ứng dụng tùy chỉnh.

Tính linh hoạt trên nhiều tác vụ thị giác#

Trong khi YOLOv9 chủ yếu là một engine phát hiện, YOLO26 là công cụ thị giác đa dụng. Với cú pháp thống nhất, bạn có thể dễ dàng chuyển từ phát hiện vật thể sang phân đoạn ảnh chính xác đến từng pixel hoặc phân loại toàn ảnh. Tính linh hoạt này giảm nợ kỹ thuật do phải duy trì nhiều codebase rời rạc cho các tính năng computer vision khác nhau.

Huấn luyện và triển khai hiệu quả#

Hiệu quả huấn luyện là nền tảng trong triết lý của Ultralytics. YOLO26 sử dụng trọng số đã huấn luyện sẵn, dễ tiếp cận và có mức sử dụng bộ nhớ thấp hơn đáng kể so với các vision transformer cồng kềnh. Sau khi huấn luyện, pipeline xuất model tích hợp cho phép chuyển đổi chỉ bằng một cú nhấp sang các định dạng tối ưu như TensorRT hoặc LiteRT, giúp quá trình đưa vào production thuận lợi hơn.

Ví dụ code: Bắt đầu với YOLO26#

Việc triển khai YOLO26 rất đơn giản. Đoạn code Python sau minh họa cách tải model đã huấn luyện sẵn, huấn luyện model trên dữ liệu tùy chỉnh và chạy inference bằng API Ultralytics.

from ultralytics import YOLO

# Tải model nano YOLO26 mới nhất, hiện đại nhất
model = YOLO("yolo26n.pt")

# Huấn luyện model trên bộ dữ liệu COCO8 (optimizer='auto' chọn MuSGD cho các lần huấn luyện dài hơn)
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Sử dụng GPU 0, hoặc dùng 'cpu' để huấn luyện bằng CPU
)

# Chạy inference không cần NMS trên ảnh mẫu
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Hiển thị bounding box và độ tin cậy
predictions[0].show()

Bằng cách tận dụng tốc độ, kiến trúc đơn giản hóa và hệ sinh thái mạnh mẽ của YOLO26, các nhóm có thể đưa ứng dụng AI thị giác tiên tiến ra thị trường nhanh hơn, với ít trở ngại kỹ thuật hơn bao giờ hết.

Người đóng góp

Bình luận