YOLOv9 và YOLO26#
Lĩnh vực phát hiện đối tượng thời gian thực đã phát triển đáng kể trong vài năm qua. Khi các chuyên gia học máy tìm cách triển khai model trên nhiều loại phần cứng, việc chọn đúng kiến trúc là yếu tố then chốt. Trong hướng dẫn kỹ thuật toàn diện này, chúng tôi so sánh hai cột mốc lớn trong lĩnh vực thị giác máy tính: YOLOv9, ra mắt đầu năm 2024 với trọng tâm là tối ưu hóa đường truyền gradient, và Ultralytics YOLO26, framework tiên tiến nhất hiện nay, phát hành đầu năm 2026, định nghĩa lại hoàn toàn inference trên thiết bị biên và độ ổn định huấn luyện.
Tóm tắt điều hành: Nguồn gốc và tác giả của model#
Hiểu rõ nguồn gốc của các model deep learning này giúp cung cấp bối cảnh hữu ích về các lựa chọn thiết kế kiến trúc và đối tượng sử dụng mục tiêu.
YOLOv9#
Do Chien-Yao Wang và Hong-Yuan Mark Liao thuộc Viện Khoa học Thông tin tại Academia Sinica ở Đài Loan phát triển, YOLOv9 được phát hành vào ngày 21 tháng 2 năm 2024. Model tập trung sâu vào các khái niệm lý thuyết về deep learning, cụ thể là giải quyết vấn đề nút thắt thông tin trong mạng neural tích chập sâu (CNN).
Ultralytics YOLO26#
Do Glenn Jocher và Jing Qiu phát triển tại Ultralytics, YOLO26 được phát hành vào ngày 14 tháng 1 năm 2026. Kế thừa thành công vang dội của các phiên bản tiền nhiệm như YOLO11 và YOLOv8, YOLO26 được thiết kế từ đầu để ưu tiên khả năng sẵn sàng cho môi trường production, triển khai trên thiết bị biên và hiệu quả end-to-end nguyên bản.
Bạn đã sẵn sàng nâng cấp pipeline thị giác máy tính chưa? Bạn có thể dễ dàng huấn luyện và triển khai model YOLO26 trên cloud mà không cần viết mã bằng Nền tảng Ultralytics.
Các cải tiến kiến trúc#
Cả hai model đều mang đến những thay đổi đột phá trong cách mạng neural xử lý dữ liệu hình ảnh, nhưng tiếp cận vấn đề theo những hướng khác nhau.
Thông tin gradient có thể lập trình trong YOLOv9#
Đóng góp chính của YOLOv9 cho lĩnh vực này là giới thiệu Thông tin Gradient Có thể Lập trình (PGI) và Mạng Tổng hợp Lớp Hiệu quả Tổng quát (GELAN). Khi mạng neural ngày càng sâu, chúng thường gặp tình trạng mất thông tin trong quá trình truyền xuôi. PGI đảm bảo gradient dùng để cập nhật trọng số trong quá trình lan truyền ngược luôn chính xác và đáng tin cậy, cho phép kiến trúc GELAN đạt độ chính xác cao với ít tham số hơn.
Tuy nhiên, YOLOv9 phụ thuộc nhiều vào Non-Maximum Suppression (NMS) truyền thống để hậu xử lý, điều này có thể trở thành nút thắt độ trễ khi inference trong môi trường thực tế.
Kiến trúc ưu tiên thiết bị biên của YOLO26#
YOLO26 áp dụng phương pháp hoàn toàn khác bằng cách tối ưu toàn bộ pipeline, từ huấn luyện đến triển khai thời gian thực. Model kế thừa Thiết kế end-to-end không cần NMS được tiên phong lần đầu trong YOLOv10, loại bỏ hoàn toàn nhu cầu hậu xử lý bằng NMS. Nhờ đó, độ trễ cực thấp, giúp model được tối ưu mạnh mẽ cho các thiết bị biên như Raspberry Pi hoặc NVIDIA Jetson.
Ngoài ra, YOLO26 loại bỏ hoàn toàn Distribution Focal Loss (DFL). Thay đổi cấu trúc này đơn giản hóa quá trình export sang ONNX và cải thiện đáng kể khả năng tương thích với các thiết bị biên công suất thấp.
Trong giai đoạn huấn luyện, YOLO26 tích hợp Optimizer MuSGD mới, là sự kết hợp giữa Stochastic Gradient Descent và Muon (lấy cảm hứng từ các phương pháp huấn luyện LLM của Kimi K2 thuộc Moonshot AI). Cách tiếp cận này kết nối các cải tiến trong huấn luyện Mô hình Ngôn ngữ Lớn (LLM) với thị giác máy tính, giúp quá trình huấn luyện ổn định hơn đáng kể và hội tụ nhanh hơn.
So sánh hiệu năng và chỉ số#
Khi đánh giá trên bộ dữ liệu COCO được sử dụng rộng rãi, cả hai model đều thể hiện năng lực vượt trội, nhưng hệ sinh thái Ultralytics nổi bật về tốc độ inference thực tế và hiệu quả sử dụng tham số.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Phân tích kết quả#
- Tốc độ và hiệu quả: Nhờ kiến trúc không cần NMS và các hàm loss được đơn giản hóa, YOLO26 có tốc độ inference trên CPU nhanh hơn tới 43% so với các kiến trúc cũ. Model YOLO26n chạy chỉ trong 1,7 ms trên GPU NVIDIA T4 bằng TensorRT, trở thành lựa chọn tối ưu cho các luồng video thời gian thực.
- Độ chính xác: Model YOLO26x đạt 57,5 mAP vượt trội, tốt hơn model YOLOv9e lớn nhất trong khi vẫn duy trì độ trễ thấp hơn.
- Yêu cầu bộ nhớ: Các model Ultralytics nổi tiếng về hiệu quả. So với các model thị giác dựa trên Transformer phức tạp, YOLO26 cần ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện model và inference, cho phép developer sử dụng batch size lớn hơn trên phần cứng phổ thông.
Hệ sinh thái, tính dễ sử dụng và tính linh hoạt#
Điểm mạnh thực sự của hệ sinh thái Ultralytics nằm ở trải nghiệm người dùng. Trong khi các nhà nghiên cứu sử dụng codebase GitHub của YOLOv9 phải xử lý các bước thiết lập môi trường phức tạp và viết script thủ công, YOLO26 được tích hợp hoàn toàn vào Ultralytics Python API trực quan.
Ví dụ API đơn giản hóa#
Chỉ cần vài dòng mã Python để huấn luyện một model YOLO26 tiên tiến nhất:
from ultralytics import YOLO
# Tải model YOLO26 end-to-end nguyên bản mới nhất
model = YOLO("yolo26s.pt")
# Huấn luyện model; optimizer="auto" sẽ chọn MuSGD cho các lần chạy dài hơn (>10k iterations)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export nguyên bản sang định dạng ONNX chỉ bằng một lệnh
model.export(format="onnx")Tính linh hoạt đa tác vụ vượt trội#
Không giống YOLOv9, vốn chủ yếu được thiết kế cho bài toán phát hiện đối tượng tiêu chuẩn, YOLO26 hỗ trợ nguyên bản nhiều loại tác vụ thị giác máy tính ngay khi cài đặt. Kiến trúc này có những cải tiến chuyên biệt cho nhiều ứng dụng khác nhau:
- Phân đoạn đối tượng: Có hàm loss phân đoạn ngữ nghĩa chuyên biệt và proto đa tỷ lệ để tạo mask ở cấp độ pixel chính xác.
- Ước tính tư thế: Tích hợp Residual Log-Likelihood Estimation (RLE) để theo dõi keypoint khung xương với độ chính xác cực cao.
- BBox định hướng (OBB): Có hàm loss góc chuyên biệt, được thiết kế riêng để giải quyết vấn đề biên trong phát hiện đối tượng xoay trên ảnh chụp từ trên không.
- Phân loại hình ảnh: Phân loại toàn bộ hình ảnh một cách đáng tin cậy theo tiêu chuẩn ImageNet.
Tất cả model YOLO26 đều được tích hợp liền mạch với Nền tảng Ultralytics, cung cấp sẵn các pipeline gán nhãn dataset, học chủ động và triển khai tức thì.
Ứng dụng thực tế#
Việc lựa chọn giữa các model này thường phụ thuộc vào môi trường triển khai.
IoT và robot thiết bị biên#
Với robot, drone tự hành và thiết bị IoT nhà thông minh, YOLO26 là lựa chọn vượt trội rõ rệt. Việc tích hợp ProgLoss + STAL cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố then chốt cho giám sát nông nghiệp bằng drone bay ở độ cao lớn. Kết hợp với tốc độ inference trên CPU nhanh hơn 43% và thiết kế không cần NMS, YOLO26 có thể chạy mượt mà trên phần cứng không có GPU chuyên dụng.
Nghiên cứu học thuật và phân tích gradient#
YOLOv9 vẫn là một model được đánh giá cao trong giới học thuật. Các nhà nghiên cứu tìm hiểu giới hạn lý thuyết của dòng gradient hoặc muốn xây dựng các layer PyTorch tùy chỉnh dựa trên khái niệm PGI sẽ thấy codebase YOLOv9 là nền tảng tuyệt vời để khám phá lý thuyết deep learning.
Pipeline sản xuất tốc độ cao#
Trong môi trường công nghiệp, chẳng hạn như phát hiện lỗi tự động trên băng chuyền tốc độ cao, tốc độ TensorRT vượt trội của các model YOLO26 đảm bảo không bỏ lỡ khung hình, qua đó tối đa hóa thông lượng của hệ thống đảm bảo chất lượng.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOv9 và YOLO26 phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và hệ sinh thái bạn ưu tiên.
Khi nào nên chọn YOLOv9#
YOLOv9 là lựa chọn phù hợp cho:
- Nghiên cứu về nút thắt thông tin: Các dự án học thuật nghiên cứu kiến trúc Programmable Gradient Information (PGI) và Generalized Efficient Layer Aggregation Network (GELAN).
- Nghiên cứu tối ưu hóa luồng gradient: Các nghiên cứu tập trung vào việc tìm hiểu và giảm thiểu mất mát thông tin trong các lớp mạng sâu khi huấn luyện.
- Đánh giá hiệu năng phát hiện độ chính xác cao: Các tình huống cần hiệu năng mạnh của YOLOv9 trên benchmark COCO làm mốc tham chiếu để so sánh kiến trúc.
Khi nào nên chọn YOLO26#
YOLO26 được khuyến nghị cho:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Kết luận#
Cả hai model đều đánh dấu bước tiến vượt bậc cho cộng đồng mã nguồn mở. YOLOv9 mang đến những cải tiến lý thuyết quan trọng về dòng gradient, tạo cảm hứng cho các kiến trúc trong nhiều năm tới. Tuy nhiên, với các developer, startup và đội ngũ doanh nghiệp hiện đại cần sự cân bằng hoàn hảo giữa tốc độ, độ chính xác và khả năng triển khai dễ dàng, Ultralytics YOLO26 là lựa chọn được khuyến nghị rõ ràng.
Với khả năng inference không cần NMS, optimizer MuSGD mạnh mẽ và bộ công cụ vượt trội cho các tác vụ phát hiện, phân đoạn và ước tính tư thế, YOLO26 đảm bảo các dự án thị giác máy tính của bạn được xây dựng trên framework đáng tin cậy và sẵn sàng cho tương lai nhất hiện nay.