YOLOv10 và YOLO26#
Lĩnh vực thị giác máy tính đã chứng kiến những tiến bộ đáng kể trong những năm gần đây, chuyển dịch từ các kiến trúc phức tạp, phụ thuộc nhiều vào hậu xử lý sang các model end-to-end tinh gọn. Phần so sánh kỹ thuật này đi sâu vào hai cột mốc quan trọng của hành trình đó: bước đột phá học thuật YOLOv10 và YOLO26 tiên tiến, sẵn sàng cho doanh nghiệp. Bằng cách xem xét kiến trúc, phương pháp huấn luyện và khả năng triển khai thực tế, developer có thể đưa ra quyết định sáng suốt khi xây dựng ứng dụng AI thị giác tiếp theo.
YOLOv10: Tiên phong trong phát hiện đối tượng end-to-end#
- Tác giả: Ao Wang, Hui Chen, Lihao Liu và cộng sự
- Tổ chức: Đại học Thanh Hoa
- Ngày: 2024-05-23
- Liên kết: Bài báo arXiv | Repository GitHub
Ra mắt vào giữa năm 2024, YOLOv10 đánh dấu bước tiến lớn trong nghiên cứu thị giác máy tính học thuật khi giải quyết một trong những nút thắt kéo dài nhất của phát hiện đối tượng thời gian thực: triệt tiêu cực đại (NMS). Các detector đối tượng truyền thống phụ thuộc nhiều vào NMS để loại bỏ các hộp giới hạn dư thừa, làm tăng độ trễ biến thiên trong quá trình suy luận và khiến việc triển khai biên phức tạp hơn.
Nhóm Đại học Thanh Hoa đã giới thiệu chiến lược gán kép nhất quán để huấn luyện không cần NMS. Nhờ đó, model có thể dự đoán hộp giới hạn chính xác mà không cần bước lọc hậu xử lý, trực tiếp cải thiện độ trễ suy luận và hạ thấp rào cản triển khai trên bộ tăng tốc phần cứng. Dù rất hiệu quả với các tác vụ phát hiện tiêu chuẩn, model chủ yếu tập trung vào dự đoán hộp giới hạn và thiếu hỗ trợ nguyên bản cho các tác vụ phức tạp hơn như phân đoạn instance hoặc ước lượng tư thế.
YOLO26: Tiêu chuẩn mới cho AI thị giác trên thiết bị biên và đám mây#
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- Liên kết: Repository GitHub | Nền tảng Ultralytics
Kế thừa các khái niệm không cần NMS tiên phong trước đó, YOLO26 mới ra mắt đại diện cho đỉnh cao về hiệu năng và tính linh hoạt. Được thiết kế cho cả nghiên cứu học thuật lẫn triển khai cấp doanh nghiệp, model cung cấp thiết kế end-to-end không cần NMS thông qua head một-một tùy chọn (nms=False), bỏ qua bước hậu xử lý NMS để triển khai nhanh và đơn giản hơn trên mọi phần cứng được hỗ trợ.
YOLO26 giới thiệu một số cải tiến kiến trúc mang tính đột phá. Việc loại bỏ Distribution Focal Loss (DFL) giúp đơn giản hóa đáng kể quy trình xuất model và tăng khả năng tương thích với các thiết bị biên công suất thấp. Kết hợp với những thay đổi cấu trúc này, YOLO26 đạt tốc độ suy luận trên CPU nhanh hơn tới 43%, trở thành lựa chọn xuất sắc cho các ứng dụng IoT và robot học, nơi có thể không hỗ trợ tăng tốc GPU.
Độ ổn định khi huấn luyện và tốc độ hội tụ cũng được cải thiện đột phá nhờ bộ tối ưu hóa MuSGD, một phương pháp kết hợp SGD và Muon lấy cảm hứng từ kỹ thuật huấn luyện LLM. Kết hợp với các hàm loss tiên tiến như ProgLoss + STAL, YOLO26 cải thiện đáng kể khả năng nhận diện vật thể nhỏ. Model còn giới thiệu các cải tiến chuyên biệt theo tác vụ, bao gồm tạo mẫu đa tỉ lệ cho phân đoạn, Ước lượng Hợp lý Logarit Phần dư (RLE) cho ước lượng tư thế và hàm loss góc chuyên biệt để xử lý vấn đề ranh giới trong phát hiện Hộp giới hạn có hướng (OBB).
Đối với các nhóm muốn mở rộng quy mô quy trình thị giác máy tính, Nền tảng Ultralytics tích hợp liền mạch với YOLO26, cung cấp khả năng gán nhãn dữ liệu trực quan, huấn luyện đám mây tự động và tùy chọn triển khai chỉ với một cú nhấp chuột mà không cần hạ tầng MLOps phức tạp.
So sánh hiệu năng kỹ thuật#
Khi đánh giá các model này, sự cân bằng giữa độ chính xác, kích thước model và tốc độ suy luận là yếu tố then chốt. Bảng dưới đây nêu bật hiệu năng của cả hai dòng model ở nhiều quy mô khác nhau, được đánh giá trên bộ dữ liệu COCO tiêu chuẩn.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Dữ liệu cho thấy rõ ưu thế phát triển của kiến trúc mới hơn. YOLO26 đạt mAP (độ chính xác trung bình) cao hơn ở mọi cấp kích thước, đồng thời duy trì tốc độ suy luận rất cạnh tranh. Việc loại bỏ DFL trong YOLO26 đặc biệt góp phần nâng cao hiệu năng ONNX trên CPU, vốn là chỉ số mà các thế hệ trước thường gặp khó khăn.
Phương pháp huấn luyện và hệ sinh thái#
Model chỉ hữu ích khi có hệ sinh thái hỗ trợ phù hợp. YOLOv10 cung cấp một bản triển khai học thuật xuất sắc dựa trên PyTorch, nhưng thường cần cấu hình thủ công cho các tác vụ ngoài phát hiện cơ bản.
Ngược lại, YOLO26 được tích hợp hoàn toàn vào hệ sinh thái Ultralytics được duy trì tốt. Điều này giúp giảm đáng kể nhu cầu bộ nhớ khi huấn luyện so với các model dựa trên Transformer như RT-DETR, cho phép nhà nghiên cứu huấn luyện các mạng hiện đại nhất trên phần cứng phổ thông. Model có khả năng sử dụng dễ dàng vượt trội, với API thống nhất tự động xử lý tăng cường dữ liệu, tinh chỉnh siêu tham số và ghi log.
Ví dụ code: Huấn luyện YOLO26#
Chỉ cần vài dòng code Python để huấn luyện một model linh hoạt và có độ chính xác cao:
from ultralytics import YOLO
# Tải model YOLO26 small được tối ưu hóa cao
model = YOLO("yolo26s.pt")
# Huấn luyện model hiệu quả với tính năng quản lý bộ nhớ tự động
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# Xuất head một-một không cần NMS sang TensorRT
model.export(format="engine", nms=False)Ứng dụng thực tế và trường hợp sử dụng#
Việc lựa chọn kiến trúc phù hợp hoàn toàn phụ thuộc vào các ràng buộc triển khai.
Điện toán biên tốc độ cao#
Đối với các ứng dụng cần triển khai nhanh trên vi điều khiển, robot hoặc thiết bị di động đời cũ, khả năng suy luận CPU nhanh hơn tới 43% của YOLO26 khiến model này trở thành lựa chọn tối ưu. Kiến trúc không cần NMS và không cần DFL của YOLO26 có thể chuyển đổi liền mạch sang các định dạng như OpenVINO và TensorRT, rất phù hợp cho phân tích video thời gian thực trong hạ tầng thành phố thông minh.
Thị giác đa nhiệm nâng cao#
Trong khi YOLOv10 vượt trội ở tác vụ phát hiện bounding box đơn thuần, các dự án cần khả năng hiểu hình ảnh phong phú phải dựa vào YOLO26. Từ phân đoạn đối tượng trong ảnh y tế đến ước tính tư thế chính xác cho phân tích thể thao, YOLO26 cung cấp các hàm loss chuyên biệt theo tác vụ, đảm bảo độ chính xác vượt trội trên nhiều lĩnh vực.
Nếu dự án cần khả năng phát hiện với từ vựng mở mạnh mẽ, hãy cân nhắc tìm hiểu YOLO-World. Với người dùng đang duy trì các pipeline cũ, YOLO11 vẫn là một lựa chọn thay thế mạnh mẽ, được hỗ trợ đầy đủ trong hệ sinh thái Ultralytics.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOv10 và YOLO26 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái.
Khi nào nên chọn YOLOv10#
YOLOv10 là lựa chọn phù hợp cho:
- Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
- Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
- Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.
Khi nào nên chọn YOLO26#
YOLO26 được khuyến nghị cho:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Kết luận#
Quá trình chuyển đổi từ YOLOv10 sang YOLO26 cho thấy sự thay đổi cốt yếu từ một bằng chứng khái niệm mang tính học thuật sang các giải pháp doanh nghiệp sẵn sàng đưa vào sản xuất. Bằng cách áp dụng thiết kế tiên phong không cần NMS và cải tiến thiết kế này bằng optimizer MuSGD, ProgLoss cùng khả năng tương thích biên được tinh giản, YOLO26 thiết lập chuẩn mực mới về những gì có thể đạt được trong thị giác máy tính thời gian thực. Với các developer hướng đến sự cân bằng tối ưu giữa tốc độ, độ chính xác và tính dễ sử dụng, YOLO26 là lựa chọn hàng đầu.