Ultralytics YOLO27:

YOLOv9 so với YOLO26#

Bối cảnh phát hiện đối tượng theo thời gian thực đã phát triển đáng kể trong vài năm qua. Khi các chuyên gia machine learning tìm cách triển khai model trên nhiều loại phần cứng, việc lựa chọn kiến trúc phù hợp là yếu tố then chốt. Trong hướng dẫn kỹ thuật toàn diện này, chúng ta sẽ so sánh hai cột mốc quan trọng trong lĩnh vực thị giác máy tính: YOLOv9, ra mắt vào đầu năm 2024 với trọng tâm là tối ưu hóa đường dẫn gradient, và Ultralytics YOLO26, framework tiên tiến nhất hiện nay được phát hành vào đầu năm 2026, hoàn toàn định nghĩa lại suy luận tại edge và độ ổn định khi training.

Tóm tắt điều hành: Dòng model và tác giả#

Việc hiểu rõ nguồn gốc của các model deep learning này cung cấp bối cảnh hữu ích về những lựa chọn thiết kế kiến trúc và đối tượng người dùng mục tiêu của chúng.

YOLOv9#

Được Chien-Yao Wang và Hong-Yuan Mark Liao tại Viện Khoa học Thông tin thuộc Academia Sinica ở Đài Loan phát triển, YOLOv9 được phát hành vào ngày 21 tháng 2 năm 2024. Model này tập trung mạnh vào các khái niệm deep learning mang tính lý thuyết, đặc biệt giải quyết vấn đề nút thắt thông tin trong các mạng nơ-ron tích chập (CNNs) sâu.

Tìm hiểu thêm về YOLOv9

Ultralytics YOLO26#

Được Glenn Jocher và Jing Qiu tại Ultralytics phát triển, YOLO26 được phát hành vào ngày 14 tháng 1 năm 2026. Kế thừa thành công vang dội của các phiên bản tiền nhiệm như YOLO11YOLOv8, YOLO26 được thiết kế từ đầu nhằm ưu tiên khả năng sẵn sàng cho production, triển khai tại edge và hiệu quả end-to-end nguyên bản.

Dùng thử YOLO26 ngay hôm nay

Bạn đã sẵn sàng nâng cấp pipeline thị giác máy tính của mình chưa? Bạn có thể dễ dàng train và triển khai các model YOLO26 trên cloud mà không cần viết code bằng Ultralytics Platform.

Các cải tiến về kiến trúc#

Cả hai model đều tạo ra những thay đổi đột phá trong cách mạng nơ-ron xử lý dữ liệu hình ảnh, nhưng tiếp cận vấn đề từ những góc độ khác nhau.

Thông tin Gradient Có thể Lập trình trong YOLOv9#

Đóng góp chính của YOLOv9 cho lĩnh vực này là giới thiệu Thông tin Gradient Có thể Lập trình (PGI)Mạng Tổng hợp Tầng Hiệu quả Tổng quát (GELAN). Khi mạng nơ-ron trở nên sâu hơn, chúng thường bị mất thông tin trong quá trình feed-forward. PGI đảm bảo các gradient được sử dụng để cập nhật trọng số trong quá trình backpropagation vẫn chính xác và đáng tin cậy, cho phép kiến trúc GELAN đạt độ chính xác cao với ít tham số hơn.

Tuy nhiên, YOLOv9 phụ thuộc nhiều vào kỹ thuật loại bỏ phi cực đại (NMS) truyền thống cho quá trình hậu xử lý, điều này có thể trở thành nút thắt về độ trễ khi suy luận trong thực tế.

Kiến trúc Edge-First của YOLO26#

YOLO26 áp dụng một phương pháp hoàn toàn khác bằng cách tối ưu toàn bộ pipeline từ training đến triển khai theo thời gian thực. Model này kế thừa Thiết kế End-to-End Không cần NMS, lần đầu được phát triển trong YOLOv10, qua đó loại bỏ hoàn toàn nhu cầu hậu xử lý NMS. Kết quả là độ trễ cực thấp, được tối ưu mạnh cho các thiết bị edge như Raspberry Pi hoặc NVIDIA Jetson.

Ngoài ra, YOLO26 loại bỏ hoàn toàn Distribution Focal Loss (DFL). Thay đổi về cấu trúc này đơn giản hóa việc export model sang ONNX và mang lại khả năng tương thích tốt hơn đáng kể với các vi điều khiển công suất thấp.

Trong giai đoạn training, YOLO26 tích hợp MuSGD Optimizer mới, là sự kết hợp giữa Stochastic Gradient Descent và Muon (lấy cảm hứng từ các phương pháp training LLM của Kimi K2 thuộc Moonshot AI). Điều này thu hẹp khoảng cách giữa những đổi mới trong training Mô hình Ngôn ngữ Lớn (LLM) và thị giác máy tính, mang lại quá trình training ổn định hơn đáng kể và thời gian hội tụ nhanh hơn.

So sánh hiệu năng và các chỉ số#

Khi benchmark trên COCO dataset được sử dụng rộng rãi, cả hai model đều thể hiện năng lực vượt trội, nhưng hệ sinh thái Ultralytics nổi bật về tốc độ suy luận thực tế và hiệu quả sử dụng tham số.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Phân tích kết quả#

  • Tốc độ và hiệu quả: Vì YOLO26 sử dụng kiến trúc không cần NMS và các hàm loss được đơn giản hóa, model này đạt tốc độ suy luận trên CPU nhanh hơn tới 43% so với các kiến trúc cũ. Model YOLO26n chạy chỉ trong 1,7 ms trên GPU NVIDIA T4 bằng TensorRT, trở thành lựa chọn tối ưu cho các luồng video theo thời gian thực.
  • Độ chính xác: Model YOLO26x đạt 57,5 mAP chưa từng có, vượt qua model YOLOv9e lớn nhất trong khi vẫn duy trì độ trễ thấp hơn.
  • Yêu cầu bộ nhớ: Các model Ultralytics nổi tiếng nhờ hiệu quả sử dụng tài nguyên. YOLO26 yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình training model và suy luận so với các model thị giác dựa trên Transformer phức tạp, cho phép developer sử dụng batch size lớn hơn trên phần cứng phổ thông.

Hệ sinh thái, tính dễ sử dụng và tính linh hoạt#

Điểm mạnh thực sự của hệ sinh thái Ultralytics nằm ở trải nghiệm người dùng. Trong khi các nhà nghiên cứu sử dụng codebase GitHub của YOLOv9 phải xử lý việc thiết lập môi trường phức tạp và viết script thủ công, YOLO26 được tích hợp hoàn toàn vào Ultralytics Python API trực quan.

Ví dụ API tinh gọn#

Việc training một model YOLO26 tiên tiến nhất chỉ cần vài dòng code Python:

from ultralytics import YOLO

# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export natively to ONNX format in a single command
model.export(format="onnx")

Tính linh hoạt vượt trội cho nhiều task#

Khác với YOLOv9, vốn chủ yếu được thiết kế cho phát hiện đối tượng tiêu chuẩn, YOLO26 hỗ trợ nguyên bản rất nhiều task thị giác máy tính ngay khi cài đặt. Kiến trúc này bao gồm các cải tiến chuyên biệt cho nhiều ứng dụng:

  • Phân đoạn instance: Cung cấp loss phân đoạn ngữ nghĩa chuyên biệt và proto đa tỷ lệ để tạo mask ở cấp pixel chính xác.
  • Ước lượng pose: Tích hợp Residual Log-Likelihood Estimation (RLE) để theo dõi các keypoint khung xương với độ chính xác cực cao.
  • Bounding Box có hướng (OBB): Bao gồm hàm loss góc chuyên biệt, được thiết kế riêng để giải quyết các vấn đề biên trong phát hiện đối tượng xoay cho ảnh chụp từ trên không.
  • Phân loại hình ảnh: Phân loại toàn bộ hình ảnh một cách mạnh mẽ dựa trên các tiêu chuẩn của ImageNet.
Hệ sinh thái tích hợp

Tất cả model YOLO26 đều được hưởng lợi từ khả năng tích hợp liền mạch với Ultralytics Platform, cung cấp tính năng gắn nhãn dataset, active learning và pipeline triển khai tức thì được tích hợp sẵn.

Ứng dụng thực tế#

Việc lựa chọn giữa các model này thường phụ thuộc vào môi trường nơi chúng sẽ được triển khai.

IoT và robotics tại Edge#

Đối với robotics, drone tự hành và các thiết bị IoT nhà thông minh, YOLO26 là lựa chọn vượt trội không thể tranh cãi. Việc tích hợp ProgLoss + STAL mang lại những cải thiện đáng kể trong nhận diện đối tượng nhỏ, yếu tố then chốt đối với giám sát nông nghiệp bằng drone ở độ cao lớn. Kết hợp với tốc độ suy luận CPU nhanh hơn 43% và thiết kế không cần NMS, YOLO26 có thể vận hành mượt mà trên phần cứng không có GPU chuyên dụng.

Nghiên cứu học thuật và phân tích gradient#

YOLOv9 vẫn là một model được đánh giá rất cao trong giới học thuật. Các nhà nghiên cứu tìm hiểu những giới hạn lý thuyết của dòng gradient, hoặc muốn xây dựng các layer PyTorch tùy chỉnh dựa trên khái niệm PGI, sẽ nhận thấy codebase của YOLOv9 là nền tảng tuyệt vời để khám phá lý thuyết deep learning.

Pipeline sản xuất tốc độ cao#

Trong các môi trường công nghiệp như phát hiện lỗi tự động trên băng chuyền tốc độ cao, tốc độ TensorRT vượt trội của các model YOLO26 đảm bảo không có frame nào bị bỏ qua, tối đa hóa throughput của các hệ thống đảm bảo chất lượng.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv9 và YOLO26 phụ thuộc vào yêu cầu cụ thể của dự án, các hạn chế triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOv9#

YOLOv9 là lựa chọn phù hợp cho:

  • Nghiên cứu nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
  • Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các layer sâu của network trong quá trình huấn luyện.
  • Benchmark phát hiện độ chính xác cao: Các tình huống cần hiệu năng benchmark COCO mạnh của YOLOv9 làm mốc tham chiếu cho việc so sánh kiến trúc.

Khi nào nên chọn YOLO26#

YOLO26 được khuyến nghị cho:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Kết luận#

Cả hai model đều đại diện cho những bước tiến vượt bậc của cộng đồng mã nguồn mở. YOLOv9 đã giới thiệu những cải tiến lý thuyết quan trọng cho dòng gradient, có khả năng truyền cảm hứng cho các kiến trúc trong nhiều năm tới. Tuy nhiên, đối với các developer, startup và đội ngũ doanh nghiệp hiện đại đang tìm kiếm sự cân bằng hoàn hảo giữa tốc độ, độ chính xác và tính dễ triển khai, Ultralytics YOLO26 là lựa chọn được khuyến nghị rõ ràng.

Bằng cách loại bỏ NMS, giới thiệu optimizer MuSGD mạnh mẽ và cung cấp bộ công cụ vượt trội cho các task phát hiện, phân đoạn và pose, YOLO26 đảm bảo các dự án thị giác máy tính của bạn được xây dựng trên framework đáng tin cậy và có khả năng thích ứng lâu dài nhất hiện nay.

Những người đóng góp

Bình luận