YOLOv5 và YOLO26#
Sự phát triển của thị giác máy tính được định hình bởi nỗ lực liên tục nhằm tạo ra các model nhanh hơn, chính xác hơn và dễ tiếp cận hơn. Khi so sánh Ultralytics YOLOv5 với Ultralytics YOLO26 tiên tiến nhất, chúng ta đang chứng kiến một bước chuyển đổi mô hình, thu hẹp khoảng cách giữa các hệ thống cũ vững chắc và công nghệ AI hiện đại tiên tiến nhất.
Hướng dẫn này cung cấp phân tích kỹ thuật toàn diện về cả hai kiến trúc, nêu bật các chỉ số hiệu năng, khác biệt về cấu trúc và kịch bản triển khai lý tưởng.
Tổng quan về model#
YOLOv5: Model chủ lực của ngành#
Ra mắt năm 2020, YOLOv5 đã cách mạng hóa khả năng tiếp cận công nghệ phát hiện đối tượng. Bằng cách chuyển kiến trúc sang sử dụng nguyên bản framework PyTorch, model mang đến cho nhà phát triển trải nghiệm "từ con số không đến thành thạo" chưa từng có.
- Tác giả: Glenn Jocher
- Tổ chức: Ultralytics
- Ngày: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Tài liệu: Tài liệu YOLOv5
YOLOv5 đặt nền móng cho hệ sinh thái Ultralytics được duy trì và phát triển tích cực. Model giới thiệu các kỹ thuật tăng cường dữ liệu mạnh mẽ, vòng lặp huấn luyện hiệu quả và các quy trình xuất được tối ưu hóa cao sang những định dạng dành cho thiết bị biên như CoreML và ONNX. Tính dễ sử dụng và yêu cầu bộ nhớ thấp khi huấn luyện đã khiến model trở thành lựa chọn phổ biến của các startup và nhà nghiên cứu trên toàn thế giới.
YOLO26: Chuẩn AI thị giác thế hệ mới#
Đến tháng 1 năm 2026, Ultralytics YOLO26 đại diện cho đỉnh cao của AI thị giác thời gian thực. Model tích hợp nguyên bản những bài học rút ra từ các thế hệ trước như YOLOv8 và YOLO11, đồng thời giới thiệu những đột phá lớn lấy cảm hứng từ quá trình huấn luyện Mô hình ngôn ngữ lớn (LLM).
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: Tài liệu YOLO26
YOLO26 thiết lập chuẩn hiệu năng cân bằng mới, mang lại độ chính xác tiên tiến nhất và được thiết kế chuyên biệt để vượt trội trong các kịch bản điện toán biên.
Nếu đang chuyển đổi một codebase cũ, bạn cũng có thể muốn so sánh YOLOv5 với YOLO11, model thế hệ trước hỗ trợ nhiều tác vụ như ước tính tư thế và hộp giới hạn định hướng (OBB).
Các đột phá kiến trúc trong YOLO26#
Trong khi YOLOv5 dựa vào các head phát hiện dùng anchor và hàm loss tiêu chuẩn, YOLO26 cải tổ toàn diện cơ chế bên trong để loại bỏ các nút thắt khi triển khai.
- Thiết kế đầu cuối không cần NMS: Khác biệt đáng kể nhất là tùy chọn suy luận đầu cuối nguyên bản của YOLO26. Không giống YOLOv5, vốn cần Ức chế phi cực đại (NMS) để lọc các bounding box dư thừa, head một-một tùy chọn của YOLO26 (
nms=False) bỏ qua hoàn toàn bước hậu xử lý này. Nhờ đó, độ trễ suy luận có tính xác định và việc tích hợp vào C++ hoặc phần cứng nhúng được đơn giản hóa đáng kể. - Loại bỏ DFL: YOLO26 loại bỏ Hàm mất mát tiêu điểm phân phối (DFL). Lựa chọn kiến trúc này đơn giản hóa đáng kể quá trình xuất model và tăng khả năng tương thích với các thiết bị biên công suất thấp cùng vi điều khiển, vốn thường gặp khó khăn với các toán tử phức tạp.
- Optimizer MuSGD: Lấy cảm hứng từ Kimi K2 của Moonshot AI, YOLO26 sử dụng Optimizer MuSGD, một phương pháp kết hợp SGD và Muon. Phương pháp này mang lại sự ổn định và khả năng hội tụ nhanh thường thấy trong huấn luyện LLM cho thị giác máy tính, đồng thời giảm mức sử dụng bộ nhớ và rút ngắn chu kỳ huấn luyện so với các model sử dụng nhiều Transformer.
- ProgLoss + STAL: YOLO26 sử dụng các hàm ProgLoss và STAL tinh vi, cải thiện đáng kể khả năng phát hiện đối tượng nhỏ và dày đặc—một thách thức lâu nay của YOLOv5.
So sánh hiệu năng#
Khi so sánh các model trên tập dữ liệu COCO, YOLO26 cho thấy mức cải thiện lớn về độ chính xác (mAP) ở mọi kích thước, đồng thời sử dụng ít tham số hơn từ biến thể medium trở lên.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Lưu ý: YOLO26 Nano (YOLO26n) đạt 40.9 mAP ấn tượng, so với 28.0 mAP của YOLOv5n, tăng 12.9 điểm chỉ với thêm 0.5M tham số; việc loại bỏ DFL và sử dụng head không cần NMS cũng đơn giản hóa quá trình triển khai trên CPU và thiết bị biên.
Tính linh hoạt và hỗ trợ tác vụ#
YOLOv5 chủ yếu nổi tiếng về phát hiện đối tượng. Dù các bản cập nhật sau này bổ sung phân đoạn cơ bản, YOLO26 được xây dựng từ đầu để trở thành engine đa tác vụ thống nhất.
YOLO26 hỗ trợ sẵn:
- Phân đoạn thực thể: Sử dụng proto đa tỷ lệ dành riêng cho tác vụ và hàm loss phân đoạn ngữ nghĩa.
- Phân đoạn ngữ nghĩa: Gán nhãn lớp dày đặc cho từng pixel.
- Ước tính độ sâu: Dự đoán độ sâu cho từng pixel từ một ảnh đơn.
- Phân loại ảnh: Phân loại toàn ảnh tiêu chuẩn.
- Ước tính tư thế: Sử dụng Ước tính hợp lý cực đại phần dư (RLE) để phát hiện keypoint với độ chính xác cao.
- Hộp giới hạn định hướng (OBB): Bao gồm hàm loss góc chuyên biệt để xử lý vấn đề gián đoạn biên, yếu tố quan trọng trong phân tích ảnh vệ tinh.
Cả hai model đều được hưởng lợi từ Ultralytics Platform, cung cấp quy trình gán nhãn dữ liệu, huấn luyện đám mây và triển khai chỉ bằng một cú nhấp chuột liền mạch. Tuy nhiên, YOLO26 tận dụng tối đa các cấu trúc API hiện đại.
Ví dụ sử dụng và mã nguồn#
Python API của Ultralytics giúp chuyển đổi giữa các model vô cùng đơn giản. Vì cả hai model đều dùng chung hệ sinh thái được duy trì tốt, để nâng cấp pipeline YOLOv5 cũ lên YOLO26, bạn chỉ cần thay đổi tệp weights.
Ví dụ Python#
from ultralytics import YOLO
# Để sử dụng YOLOv5, hãy tải tệp weights v5
# model = YOLO("yolov5su.pt")
# Chuyển sang model YOLO26 được khuyến nghị
model = YOLO("yolo26n.pt")
# Huấn luyện trên tập dữ liệu COCO8; optimizer="auto" sẽ chọn MuSGD cho các phiên chạy dài hơn (>10k iterations)
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
batch=32, # Mức sử dụng bộ nhớ thấp của YOLO26 cho phép dùng batch size lớn hơn
)
# Chạy suy luận không cần NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
predictions[0].show()Ví dụ CLI#
Bạn có thể triển khai YOLO26 trực tiếp qua dòng lệnh bằng tích hợp TensorRT để đạt thông lượng GPU tối đa:
# Export the model to TensorRT format
yolo export model=yolo26n.pt format=engine
# Run inference with the compiled engine
yolo predict model=yolo26n.engine source=path/to/video.mp4Các trường hợp sử dụng phù hợp nhất#
Khi nào nên chọn YOLO26#
Với mọi dự án thị giác máy tính hiện đại, YOLO26 là lựa chọn được khuyến nghị rõ ràng.
- AI biên và IoT: Tốc độ suy luận CPU nhanh hơn YOLO11n tới 43% cùng việc loại bỏ DFL khiến model trở nên lý tưởng để triển khai trên Raspberry Pi hoặc thiết bị di động.
- Pipeline tốc độ cao: Kiến trúc không cần NMS đảm bảo độ trễ ổn định, có thể dự đoán—điều thiết yếu đối với robot tự hành và hệ thống báo động an ninh thời gian thực.
- Kịch bản phức tạp: Nếu ứng dụng cần theo dõi đối tượng nhỏ (ví dụ: giám sát bằng drone) hoặc đối tượng xoay (OBB), các hàm loss tiên tiến của YOLO26 (ProgLoss + STAL) mang lại lợi thế lớn về độ chính xác.
Khi nào nên chọn YOLOv5#
- Hệ thống cũ: Nếu môi trường production có các phụ thuộc được mã hóa cứng vào logic tạo anchor hoặc phân tích NMS riêng của YOLOv5, việc chuyển đổi có thể cần một giai đoạn tái cấu trúc ngắn.
- Mốc chuẩn học thuật cụ thể: Các nhà nghiên cứu thường dùng YOLOv5 làm mốc chuẩn cổ điển để minh họa quá trình phát triển lịch sử của kiến trúc phát hiện đối tượng.
Tóm tắt#
Quá trình chuyển đổi từ YOLOv5 sang YOLO26 không chỉ là một bản cập nhật từng bước; đây là bước tiến căn bản trong cách huấn luyện và triển khai model phát hiện đối tượng. Bằng cách tận dụng optimizer MuSGD, loại bỏ hậu xử lý phức tạp nhờ thiết kế không cần NMS và tăng đáng kể tốc độ CPU, Ultralytics YOLO26 mang lại sự cân bằng vượt trội giữa tốc độ và độ chính xác.
YOLOv5 sẽ luôn được nhớ đến như model giúp phổ cập AI thị giác, nhưng các nhà phát triển muốn xây dựng ứng dụng vững chắc, sẵn sàng cho production và bền vững trong tương lai nên tự tin phát triển dựa trên YOLO26.