YOLO26 so với YOLOv5#
Thị giác máy tính phát triển không ngừng nhờ nỗ lực bền bỉ nhằm cải thiện tốc độ, độ chính xác và khả năng tiếp cận. Việc chọn đúng kiến trúc có ý nghĩa then chốt đối với thành công của mọi dự án AI. Trong hướng dẫn toàn diện này, chúng ta so sánh hai phiên bản mang tính cột mốc của Ultralytics: YOLOv5 tiên phong và YOLO26 đột phá. Dù cả hai đều ảnh hưởng sâu sắc đến lĩnh vực phát hiện vật thể thời gian thực, công nghệ nền tảng của chúng phản ánh sự thay đổi mô hình căn bản trong cách mạng neural xử lý dữ liệu hình ảnh.
Tổng quan về model#
Trước khi đi sâu vào các điểm tinh tế trong kiến trúc, hãy cùng xác lập những thông tin nền tảng về cả hai model.
Thông tin YOLO26:
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: Tài liệu YOLO26
Thông tin về YOLOv5:
- Tác giả: Glenn Jocher
- Tổ chức: Ultralytics
- Ngày: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Tài liệu: Tài liệu YOLOv5
Các cải tiến kiến trúc#
Khoảng cách sáu năm giữa YOLOv5 và YOLO26 thể hiện bước tiến vượt bậc trong nghiên cứu deep learning. YOLOv5 phổ biến hóa việc sử dụng rộng rãi PyTorch cho các model thị giác, với cơ chế phát hiện dựa trên anchor được tối ưu hóa cao và trở thành tiêu chuẩn ngành. Tuy nhiên, YOLOv5 phụ thuộc nhiều vào Non-Maximum Suppression (NMS) trong quá trình hậu xử lý, điều này có thể gây ra nút thắt độ trễ trên các thiết bị hạn chế tài nguyên.
YOLO26 tái thiết kế hoàn toàn pipeline suy luận với Thiết kế đầu cuối không cần NMS. Head one-to-one tùy chọn (nms=False) loại bỏ nhu cầu hậu xử lý NMS, giúp logic triển khai nhanh hơn và đơn giản hơn nhiều; ý tưởng này lần đầu được tiên phong trong YOLOv10 và được hoàn thiện ở đây. Ngoài ra, YOLO26 có Loại bỏ DFL (Distribution Focal Loss), giúp đơn giản hóa đáng kể head đầu ra. Nhờ vậy, việc export model sang các định dạng như ONNX và TensorRT diễn ra cực kỳ thuận lợi, đảm bảo khả năng tương thích tuyệt vời với các thiết bị biên và công suất thấp.
Trong quá trình huấn luyện, YOLO26 sử dụng MuSGD Optimizer tiên tiến, một phương pháp lai giữa SGD và Muon lấy cảm hứng từ Kimi K2 của Moonshot AI. Phương pháp này đưa những đổi mới trong huấn luyện LLM vào lĩnh vực thị giác máy tính, đảm bảo quá trình huấn luyện ổn định cao và hội tụ nhanh hơn đáng kể so với các optimizer SGD hoặc AdamW truyền thống được dùng trong YOLOv5.
Hiệu năng và các chỉ số#
Khi đánh giá model, sự cân bằng giữa mean Average Precision (mAP) và tốc độ suy luận quyết định tính khả thi trong thực tế. YOLO26 được tối ưu hóa sẵn cho cả GPU cao cấp và CPU biên.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Các kết quả benchmark cho thấy mức cải thiện vượt trội. Ví dụ, YOLO26n đạt mAP 40.9, so với mức 28.0 của YOLOv5n, và YOLO26 có tốc độ suy luận trên CPU nhanh hơn tới 43% so với YOLO11n. Điều này khiến YOLO26 vượt trội hơn hẳn cho các triển khai nhúng như Raspberry Pi hoặc thiết bị di động. Mặc dù YOLOv5 nhỉnh hơn đôi chút về tốc độ GPU TensorRT ở quy mô Nano, sự đánh đổi về độ chính xác nghiêng hẳn về YOLO26.
Hệ sinh thái huấn luyện và tính dễ sử dụng#
Cả hai model đều hưởng lợi đáng kể từ hệ sinh thái Ultralytics được duy trì tốt. Chúng mang đến trải nghiệm từ "zero-to-hero" với Python API tinh gọn, tài liệu toàn diện và sự hỗ trợ tích cực từ cộng đồng. Tuy nhiên, YOLO26 nâng hiệu quả huấn luyện lên một tầm cao mới.
Các model Ultralytics luôn cần ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với các giải pháp thay thế sử dụng nhiều Transformer. YOLO26 còn cải thiện điều này bằng các hàm loss ProgLoss + STAL. Những cải tiến này giúp nâng cao đáng kể khả năng nhận diện vật thể nhỏ mà không làm tăng mức sử dụng bộ nhớ.
from ultralytics import YOLO
# Khởi tạo model YOLO26 Nano tiên tiến nhất
model = YOLO("yolo26n.pt")
# Huấn luyện model (optimizer='auto' chọn MuSGD cho các lượt huấn luyện dài hơn)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Chạy suy luận nhanh, không cần NMS trên ảnh kiểm thử
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
predictions[0].show()Script đơn giản này cho phép developer lặp thử nhanh chóng trên dataset tùy chỉnh, chuyển liền mạch từ nạp dữ liệu đến model sẵn sàng đưa vào production.
Với Ultralytics Platform, bạn có thể tự động export các model YOLO26 đã huấn luyện sang những định dạng như CoreML hoặc LiteRT mà không cần viết bất kỳ dòng code chuyển đổi nào.
Tính linh hoạt và các trường hợp sử dụng lý tưởng#
Khi nào nên dùng YOLOv5#
YOLOv5 vẫn là một lựa chọn đáng tin cậy cho các hệ thống cũ. Nếu bạn có pipeline công nghiệp hiện tại phụ thuộc nhiều vào đầu ra dựa trên anchor, hoặc đang chạy suy luận trên các thiết bị NVIDIA Jetson đời cũ với stack TensorRT ổn định, ít thay đổi, YOLOv5 cung cấp giải pháp ổn định và có tài liệu đầy đủ.
Khi nào nên dùng YOLO26#
YOLO26 là lựa chọn hàng đầu cho các dự án thị giác máy tính hiện đại. Tính linh hoạt của model vượt xa thế hệ trước. Trong khi YOLOv5 chủ yếu tập trung vào phát hiện (sau này mới bổ sung phân đoạn), YOLO26 hỗ trợ sâu và nguyên bản cho phân đoạn đối tượng, ước lượng tư thế, phân loại ảnh và hộp giới hạn định hướng (OBB).
YOLO26 giới thiệu Các cải tiến chuyên biệt theo tác vụ, chẳng hạn như hàm loss phân đoạn ngữ nghĩa chuyên dụng, Residual Log-Likelihood Estimation (RLE) cho các keypoint tư thế có độ chính xác cực cao và hàm loss góc nâng cao cho OBB nhằm xử lý các vấn đề ranh giới phức tạp.
- IoT biên và robot: Suy luận không cần NMS tùy chọn cùng tốc độ suy luận CPU nhanh hơn YOLO11n tới 43% khiến YOLO26 trở thành lựa chọn lý tưởng cho điều hướng robot thời gian thực và camera nhà thông minh.
- Ảnh chụp từ trên không: Các cải tiến ProgLoss + STAL giúp tăng đáng kể độ tin cậy khi phát hiện vật thể rất nhỏ từ drone—chẳng hạn như phương tiện trong bãi đỗ xe hoặc cây trồng trên đồng ruộng.
- Phân tích video thời gian thực: Dù theo dõi vận động viên trong chương trình phát sóng thể thao hay giám sát luồng giao thông, hiệu năng cân bằng của YOLO26 đảm bảo tỷ lệ thu hồi cao mà không bỏ khung hình.
Cuối cùng, cam kết của Ultralytics về một hệ sinh thái dễ tiếp cận, hiệu năng cao giúp quá trình chuyển đổi từ YOLOv5 sang YOLO26 diễn ra suôn sẻ, mở ra các năng lực tiên tiến nhất cho cả nhà nghiên cứu lẫn developer.