YOLO26 so với YOLOv7#
Sự phát triển của phát hiện đối tượng thời gian thực đã ghi nhận nhiều dấu mốc, trong đó Ultralytics YOLO26 và YOLOv7 là hai bước tiến quan trọng về năng lực thị giác máy tính. YOLOv7 đã giới thiệu phương pháp bag-of-freebies mạnh mẽ, định nghĩa lại các chuẩn độ chính xác vào năm 2022; trong khi đó, kiến trúc YOLO26 mới ra mắt tiên phong trong các tối ưu hóa ưu tiên thiết bị biên, xử lý đầu-cuối tích hợp sẵn và động lực huấn luyện ổn định lấy cảm hứng từ các cải tiến của model ngôn ngữ lớn (LLM).
Bài phân tích chuyên sâu này so sánh hai kiến trúc, phân tích các chỉ số hiệu năng, khác biệt cấu trúc và kịch bản triển khai lý tưởng để giúp các kỹ sư học máy đưa ra quyết định phù hợp cho dự án AI thị giác tiếp theo.
Thông tin nền và chi tiết về model#
Trước khi xem xét dữ liệu hiệu năng, cần hiểu rõ nguồn gốc và mục tiêu chính của từng model.
Ultralytics YOLO26#
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: Kho lưu trữ Ultralytics
- Tài liệu: Tài liệu YOLO26
YOLOv7#
- Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
- Ngày: 2022-07-06
- Arxiv: Bài báo YOLOv7
- GitHub: Kho lưu trữ YOLOv7
Nếu đang tìm hiểu hệ sinh thái rộng hơn, bạn cũng có thể quan tâm đến YOLO11 cho các triển khai đa tác vụ cân bằng tốt, hoặc RT-DETR dựa trên Transformer cho phát hiện theo chuỗi. Lưu ý rằng các model cũ hơn như YOLOv8 và YOLOv5 vẫn được hỗ trợ đầy đủ trên Nền tảng Ultralytics để tích hợp với hệ thống cũ.
Phân tích chuyên sâu về kiến trúc#
Triết lý kiến trúc đằng sau YOLO26 và YOLOv7 khác biệt đáng kể, phản ánh sự chuyển dịch từ tối đa hóa hiệu năng GPU cao cấp sang tối ưu hóa việc triển khai đầu-cuối liền mạch trên thiết bị biên.
YOLO26: Mô hình ưu tiên thiết bị biên#
Được phát hành vào năm 2026, YOLO26 xem xét lại căn bản quy trình triển khai. Đột phá quan trọng nhất là Thiết kế đầu-cuối không cần NMS. Bằng cách loại bỏ bước hậu xử lý loại bỏ phi cực đại (NMS), YOLO26 giảm đáng kể biến động độ trễ, một ý tưởng lần đầu được thử nghiệm thành công trong YOLOv10. Điều này bảo đảm tốc độ khung hình ổn định ngay cả trong các cảnh đông đúc, yếu tố then chốt đối với robot tự hành và giám sát giao thông.
Ngoài ra, YOLO26 loại bỏ hoàn toàn hàm mất mát tiêu điểm phân phối (DFL). Việc loại bỏ DFL giúp đơn giản hóa quy trình xuất sang các định dạng như ONNX và Apple CoreML, đạt tốc độ suy luận CPU nhanh hơn đến 43%.
Độ ổn định khi huấn luyện cũng là trọng tâm lớn. Việc đưa vào Optimizer MuSGD — một dạng kết hợp giữa Stochastic Gradient Descent tiêu chuẩn và Muon, lấy cảm hứng từ động lực huấn luyện của Kimi K2 — mang độ ổn định huấn luyện LLM tiên tiến vào thị giác máy tính. Kết hợp với các hàm mất mát ProgLoss + STAL, YOLO26 vượt trội trong nhận diện đối tượng nhỏ, một thách thức lâu nay đối với các model phát hiện thời gian thực.
YOLOv7: Bậc thầy về Bag-of-Freebies#
YOLOv7 được phát triển dựa trên nghiên cứu toàn diện về tối ưu hóa đường dẫn gradient. Đổi mới cốt lõi của mô hình là Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN), cho phép model học được nhiều đặc trưng đa dạng hơn mà không làm gián đoạn các đường dẫn gradient ban đầu.
Kiến trúc YOLOv7 cũng phụ thuộc nhiều vào các kỹ thuật tái tham số hóa trong quá trình suy luận, về cơ bản là hợp nhất các lớp để tăng tốc mà không làm giảm các biểu diễn đặc trưng phong phú đã học trong quá trình huấn luyện. Dù hoạt động mạnh mẽ trên GPU máy chủ tiêu chuẩn với NVIDIA TensorRT, phương pháp này vẫn phụ thuộc vào các head phát hiện dựa trên anchor và NMS truyền thống, có thể gây khó khăn khi triển khai trên thiết bị công suất thấp.
So sánh hiệu năng#
Bảng dưới đây so sánh trực tiếp các model được huấn luyện trên bộ dữ liệu COCO tiêu chuẩn. YOLO26 cải thiện đáng kể độ chính xác (mAP) đồng thời duy trì sự cân bằng vượt trội giữa số lượng tham số và FLOPs.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Lưu ý: YOLO26x vượt YOLOv7x về mAP với khoảng cách đáng kể (57.5 so với 53.1) trong khi cần ít hơn khoảng 22% tham số.
Lợi thế của hệ sinh thái Ultralytics#
Một lý do chính khiến các nhà phát triển luôn chọn YOLO26 là khả năng tích hợp sâu với Nền tảng Ultralytics. Khác với các script độc lập cần dùng cho những kiến trúc cũ, Ultralytics cung cấp quy trình làm việc thống nhất và liền mạch.
- Dễ sử dụng: Python API cho phép người dùng tải, huấn luyện và triển khai model chỉ với vài dòng code. Để xuất sang các định dạng di động như LiteRT, chỉ cần thay đổi một đối số.
- Yêu cầu bộ nhớ: Các model Ultralytics được thiết kế tỉ mỉ để tối ưu hiệu quả huấn luyện. So với các model Transformer thị giác nặng, các model này cần ít bộ nhớ CUDA hơn đáng kể, cho phép nhà nghiên cứu chạy batch size lớn hơn trên phần cứng phổ thông.
- Tính linh hoạt: Trong khi YOLOv7 yêu cầu các repository hoàn toàn khác nhau cho từng tác vụ, YOLO26 hỗ trợ nguyên bản Phân loại ảnh, Phân đoạn đối tượng, Ước lượng tư thế và phát hiện Hộp giới hạn định hướng (OBB) chỉ từ một thư viện thống nhất. Model còn có các hàm loss chuyên biệt cho từng tác vụ, chẳng hạn như Ước lượng hợp lý log dư (RLE) cho quy trình xử lý tư thế người.
- Phát triển tích cực: Cộng đồng mã nguồn mở Ultralytics thường xuyên cung cấp các bản cập nhật, đảm bảo xử lý nhanh các trường hợp đặc biệt và duy trì khả năng tương thích liên tục với các bản phát hành PyTorch mới nhất.
Vì YOLO26 không cần NMS theo thiết kế, việc xuất model bằng nms=False và triển khai lên các thiết bị nhúng với Intel OpenVINO hoặc ONNX Runtime loại bỏ hoàn toàn các script hậu xử lý phức tạp.
Các trường hợp sử dụng thực tế#
Sự khác biệt về kiến trúc giữa các model này quyết định kịch bản triển khai phù hợp nhất cho từng model.
Khi nào nên chọn YOLO26#
YOLO26 là lựa chọn được khuyến nghị hàng đầu cho các hệ thống thị giác máy tính hiện đại, hướng đến tương lai.
- AI biên và IoT: Với tốc độ suy luận CPU nhanh hơn 43% và số lượng tham số gọn nhẹ, YOLO26n rất phù hợp với các thiết bị hạn chế tài nguyên như Raspberry Pi hoặc camera đô thị thông minh.
- Drone và ảnh hàng không: Tích hợp ProgLoss + STAL cải thiện đáng kể khả năng phát hiện vật thể nhỏ, khiến model trở thành lựa chọn hàng đầu cho việc kiểm tra đường ống và nông nghiệp chính xác.
- Robot đa tác vụ: Khả năng xử lý đồng thời hộp giới hạn, mask phân đoạn và keypoint tư thế với mức tiêu thụ bộ nhớ tối thiểu khiến model rất phù hợp cho điều hướng và tương tác robot trong môi trường năng động.
Khi nào nên cân nhắc YOLOv7#
Dù phần lớn đã được các kiến trúc mới hơn thay thế, YOLOv7 vẫn hữu ích trong một số lĩnh vực chuyên biệt.
- Đánh giá chuẩn học thuật: Các nhà nghiên cứu phát triển head phát hiện dựa trên anchor mới hoặc nghiên cứu chiến lược đường dẫn gradient thường sử dụng YOLOv7 làm model cơ sở tiêu chuẩn để so sánh.
- Quy trình GPU cũ: Các hệ thống doanh nghiệp được tùy chỉnh riêng cho đầu ra tensor cụ thể và cấu hình NMS riêng của YOLOv7 trên các instance AWS EC2 P4d mạnh mẽ có thể trì hoãn việc chuyển sang model mới cho đến khi cần tái cấu trúc toàn bộ hệ thống.
Ví dụ code: Bắt đầu#
Trải nghiệm dành cho nhà phát triển cho thấy sự khác biệt rõ rệt giữa các repository nghiên cứu tiêu chuẩn và hệ sinh thái Ultralytics. Việc huấn luyện một model YOLO26 tùy chỉnh rất đơn giản:
from ultralytics import YOLO
# Tải model YOLO26 cỡ nhỏ tiên tiến nhất
model = YOLO("yolo26s.pt")
# Huấn luyện model trên bộ dữ liệu tùy chỉnh với chức năng caching và ghi log tự động
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Thực hiện suy luận đầu cuối không cần NMS trên ảnh bên ngoài
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Xuất model đã tối ưu để triển khai trên thiết bị biên
model.export(format="onnx")Lời kết#
Dù YOLOv7 vẫn là một cột mốc đáng trân trọng trong lịch sử phát hiện vật thể thời gian thực, ngành công nghiệp đã nhanh chóng chuyển sang các model ưu tiên sự đơn giản khi triển khai, tính linh hoạt đa tác vụ và hiệu quả trên thiết bị biên.
Với khả năng suy luận không cần NMS, optimizer MuSGD mới và tốc độ suy luận CPU được cải thiện đáng kể, Ultralytics YOLO26 hiện là lựa chọn hàng đầu cho các nhà phát triển và kỹ sư doanh nghiệp. Kết hợp với hệ sinh thái Ultralytics mạnh mẽ, thân thiện với người dùng, model mang đến sự cân bằng vượt trội giữa tốc độ, độ chính xác và trải nghiệm phát triển.