YOLO26 so với YOLOv8#
Sự phát triển của thị giác máy tính được định hình bởi mục tiêu đạt hiệu suất thời gian thực mà không làm giảm độ chính xác. Khi các nhà phát triển và nhà nghiên cứu tìm hiểu bối cảnh học máy hiện đại, việc lựa chọn kiến trúc model phù hợp là yếu tố then chốt. Bài so sánh kỹ thuật toàn diện này khám phá bước tiến thế hệ từ Ultralytics YOLOv8, kiến trúc rất phổ biến đã định nghĩa lại tiêu chuẩn vào năm 2023, đến Ultralytics YOLO26 tiên tiến nhất, được phát hành vào tháng 1 năm 2026.
Bằng cách tìm hiểu sâu kiến trúc, các chỉ số hiệu năng và phương pháp huấn luyện, chúng tôi nêu bật lý do việc nâng cấp lên những cải tiến mới nhất mang lại lợi thế rõ rệt cho phát hiện đối tượng, phân đoạn và nhiều ứng dụng khác.
Thông tin nền và siêu dữ liệu của model#
Hiểu nguồn gốc của các kiến trúc này giúp làm rõ bối cảnh cho những đột phá tương ứng. Cả hai model đều được phát triển bởi Ultralytics, công ty nổi tiếng với việc giúp AI tiên tiến nhất trở nên dễ tiếp cận và dễ triển khai.
Thông tin YOLO26:
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: https://docs.ultralytics.com/models/yolo26
Thông tin về YOLOv8:
- Tác giả: Glenn Jocher, Ayush Chaurasia và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2023-01-10
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: https://docs.ultralytics.com/models/yolov8
Các cải tiến kiến trúc#
Quá trình chuyển đổi từ YOLOv8 sang YOLO26 tạo ra những thay đổi lớn về mô hình tư duy trong cách mạng nơ-ron xử lý dữ liệu hình ảnh và tính toán hàm mất mát.
YOLO26: Tối ưu hiệu quả cho thiết bị biên#
YOLO26 được thiết kế từ đầu nhằm loại bỏ các nút thắt cổ chai khi triển khai và tối đa hóa tốc độ suy luận trên phần cứng hạn chế.
- Thiết kế đầu-cuối không cần NMS: Dựa trên các khái niệm được tiên phong trong YOLOv10, YOLO26 tích hợp sẵn kiến trúc đầu-cuối. Việc loại bỏ hoàn toàn bước hậu xử lý loại bỏ phi cực đại (NMS) gần như triệt tiêu biến động độ trễ. Điều này đơn giản hóa logic triển khai cho các ứng dụng đòi hỏi bảo đảm nghiêm ngặt về thời gian thực.
- Loại bỏ DFL: Việc loại bỏ hàm mất mát tiêu điểm phân phối (DFL) giúp đơn giản hóa đáng kể đầu ra. Lựa chọn kiến trúc này cải thiện đáng kể khả năng tương thích với các thiết bị biên công suất thấp và đơn giản hóa việc xuất sang các định dạng như ONNX và CoreML.
- Optimizer MuSGD: Lấy cảm hứng từ độ ổn định khi huấn luyện được ghi nhận ở các model ngôn ngữ lớn (LLMs) như Kimi K2 của Moonshot AI, YOLO26 sử dụng optimizer MuSGD — một dạng kết hợp giữa Stochastic Gradient Descent và Muon. Cách tiếp cận này đưa các cải tiến huấn luyện ở quy mô LLM vào thị giác máy tính, giúp hội tụ nhanh hơn và các lần chạy huấn luyện ổn định hơn.
- ProgLoss + STAL: Để giải quyết bài toán vốn nổi tiếng là khó khăn khi nhận diện các đối tượng rất nhỏ, YOLO26 triển khai hàm mất mát lũy tiến (ProgLoss) kết hợp với gán nhãn có nhận biết mục tiêu nhỏ (STAL). Phương pháp này cải thiện đáng kể khả năng phát hiện đối tượng nhỏ, khiến YOLO26 trở nên lý tưởng cho các ứng dụng drone.
YOLO26 cũng mang đến các nâng cấp có mục tiêu cho nhiều lĩnh vực thị giác máy tính. Model sử dụng hàm mất mát phân đoạn ngữ nghĩa và proto đa tỷ lệ để cải thiện phân đoạn đối tượng, ước lượng hợp lý log phần dư (RLE) để ước lượng tư thế có độ chính xác cao, cùng các thuật toán hàm mất mát góc chuyên biệt nhằm xử lý vấn đề ở ranh giới của hộp giới hạn định hướng (OBB).
YOLOv8: Model đa năng, bền bỉ#
Khi được phát hành vào năm 2023, YOLOv8 thiết lập một chuẩn mới bằng cách chuyển hoàn toàn sang thiết kế không anchor, giúp khái quát hóa tốt hơn trên các tỷ lệ khung hình khác nhau của tập dữ liệu.
- Module C2f: Model thay module C3 cũ bằng block C2f, cho phép gradient truyền tốt hơn qua backbone của mạng.
- Đầu tách rời: YOLOv8 có đầu tách rời, trong đó việc phân loại và hồi quy hộp giới hạn được tính toán độc lập, giúp tăng đáng kể độ chính xác trung bình (mAP).
- Tính linh hoạt theo tác vụ: Đây là một trong những model đầu tiên cung cấp API thống nhất thực sự cho phân loại hình ảnh, phát hiện, phân đoạn và tác vụ ước lượng tư thế ngay khi cài đặt.
Chỉ số hiệu năng và yêu cầu tài nguyên#
Khi đánh giá model để đưa vào sản xuất, sự cân bằng giữa độ chính xác, tốc độ suy luận và kích thước model là yếu tố tối quan trọng. YOLO26 thể hiện lợi thế thế hệ rõ rệt trên mọi biến thể kích thước.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
Lưu ý: Các giá trị được tô sáng cho thấy sự cân bằng hiệu năng và mức cải thiện hiệu quả của kiến trúc YOLO26 so với phiên bản tiền nhiệm.
Phân tích#
YOLO26 có tốc độ suy luận CPU nhanh hơn đáng kể so với các model YOLOv8 tương đương ở hầu hết quy mô. Ví dụ, YOLO26n đạt 38.9 ms trên CPU khi sử dụng ONNX, so với 80.4 ms của YOLOv8n, đồng thời mAP tăng từ 37.3 lên 40.9. Mức tăng hiệu quả CPU vượt trội này là kết quả trực tiếp của việc loại bỏ DFL và thiết kế không cần NMS, giúp YOLO26 trở thành lựa chọn mạnh mẽ cho các môi trường không có GPU chuyên dụng.
Ngoài ra, các model YOLO26 có số lượng tham số và FLOPs thấp hơn trong từng phân khúc kích thước, nhờ đó giảm đáng kể mức sử dụng bộ nhớ GPU khi suy luận và huấn luyện so với các kiến trúc cũ dựa trên Transformer.
Lợi thế của hệ sinh thái Ultralytics#
Cơ sở hạ tầng xung quanh là yếu tố quan trọng cần cân nhắc khi chọn model AI. YOLO26 và YOLOv8 đều hưởng lợi đáng kể từ Nền tảng Ultralytics thống nhất, mang lại trải nghiệm phát triển vượt trội.
- Dễ sử dụng: Triết lý từ con số không đến thành thạo giúp nhà phát triển tải, huấn luyện và xuất model chỉ với lượng code tối thiểu. API Python vẫn nhất quán giữa các thế hệ model.
- Hiệu quả huấn luyện: Các model Ultralytics YOLO cần ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với các model Transformer (như RT-DETR). Điều này cho phép sử dụng batch size lớn hơn trên phần cứng phổ thông, giúp nghiên cứu AI dễ tiếp cận hơn.
- Hệ sinh thái được duy trì tốt: Nhờ các bản cập nhật liên tục, quy trình CI/CD nghiêm ngặt và tích hợp sâu với các công cụ như Weights & Biases và TensorRT, kho lưu trữ Ultralytics vững chắc và sẵn sàng cho môi trường sản xuất.
- Tính linh hoạt vượt trội: Các model Ultralytics không chỉ làm tốt một việc; chỉ với một lệnh import, bạn có thể xử lý nhiều tập dữ liệu và tăng cường quy trình cho các hệ thống phức tạp cần đồng thời theo dõi, phân loại và phân đoạn.
Vì API Ultralytics được chuẩn hóa cao, việc nâng cấp hệ thống sản xuất từ YOLOv8 lên YOLO26 thực sự đơn giản như thay chuỗi "yolov8n.pt" bằng "yolo26n.pt" trong script.
Ứng dụng thực tế#
Việc chọn giữa các model này thường phụ thuộc vào những ràng buộc triển khai, mặc dù YOLO26 luôn được khuyến nghị cho các dự án mới.
Điện toán biên và mạng IoT#
Trong môi trường biên — chẳng hạn như các trường hợp triển khai Raspberry Pi hoặc cảm biến tại chỗ trong nhà máy — YOLO26 là lựa chọn vượt trội. Tốc độ CPU được tối ưu sẵn và cấu trúc không cần NMS cho phép camera thông minh xử lý video tốc độ khung hình cao để quản lý bãi đỗ xe mà không bị mất khung hình do các nút thắt cổ chai ở bước hậu xử lý.
Ảnh hàng không và ảnh chụp từ độ cao lớn#
Trong giám sát nông nghiệp hoặc kiểm tra cơ sở hạ tầng bằng drone, khả năng phát hiện đối tượng nhỏ là tối quan trọng. Cách triển khai ProgLoss + STAL trong YOLO26 giúp model phát hiện nhất quán các loài gây hại nhỏ hoặc vết nứt vi mô trên đường ống mà các kiến trúc cũ như YOLOv8 có thể bỏ sót, đồng thời cải thiện recall và precision trên các tập dữ liệu như VisDrone.
Hệ thống GPU đời cũ#
YOLOv8 vẫn phù hợp với các hệ thống phụ thuộc nhiều vào đầu ra hồi quy hộp giới hạn cụ thể của model này hoặc các môi trường triển khai doanh nghiệp đã bị ràng buộc vào chu kỳ kiểm định kéo dài và không thể dễ dàng chuyển đổi kiến trúc.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLO26 và YOLOv8 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.
Khi nào nên chọn YOLO26#
YOLO26 là lựa chọn phù hợp cho:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Khi nào nên chọn YOLOv8#
YOLOv8 được khuyến nghị cho:
- Triển khai đa tác vụ linh hoạt: Các dự án cần một model đã được kiểm chứng cho phát hiện, phân đoạn, phân loại và ước lượng tư thế trong hệ sinh thái Ultralytics.
- Hệ thống sản xuất đã thiết lập: Các môi trường sản xuất hiện có được xây dựng trên kiến trúc YOLOv8 với quy trình triển khai ổn định, đã được kiểm thử kỹ lưỡng.
- Hỗ trợ cộng đồng và hệ sinh thái rộng rãi: Các ứng dụng hưởng lợi từ kho hướng dẫn phong phú, tích hợp bên thứ ba và tài nguyên cộng đồng tích cực của YOLOv8.
Ví dụ code: Bắt đầu#
Khai thác sức mạnh của các model Ultralytics mới nhất vô cùng đơn giản. Đoạn code Python sau minh họa cách huấn luyện model YOLO26 trên tập dữ liệu COCO8 và chạy suy luận không cần NMS.
from ultralytics import YOLO
# Tải model YOLO26 Nano có hiệu suất cao
model = YOLO("yolo26n.pt")
# Huấn luyện trên tập dữ liệu COCO8 tiêu chuẩn
# Các siêu tham số và phép tăng cường mặc định được áp dụng tự động
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device="0", # GPU CUDA đầu tiên; dùng device="cpu" để huấn luyện trên CPU
)
# Chạy suy luận đầu-cuối, không cần NMS, trên ảnh nguồn
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Trực quan hóa các kết quả phát hiện
predictions[0].show()Các model khác cần cân nhắc#
Mặc dù YOLO26 đại diện cho công nghệ tiên tiến nhất hiện nay, các nhà phát triển xây dựng nhiều ứng dụng khác nhau cũng có thể tìm hiểu:
- YOLO11: Phiên bản tiền nhiệm trực tiếp của YOLO26, được cải tiến vượt trội so với YOLOv8 và vẫn được sử dụng rộng rãi trong các hệ thống sản xuất tiên tiến.
- RT-DETR: Transformer phát hiện thời gian thực của Baidu. Đây là lựa chọn xuất sắc cho các nhà nghiên cứu tìm hiểu cơ chế attention trong các tác vụ thị giác, dù cần nhiều bộ nhớ CUDA hơn đáng kể để huấn luyện so với các model Ultralytics YOLO thông thường.
Để sử dụng trọn bộ giải pháp huấn luyện trên cloud, gán nhãn tập dữ liệu và triển khai tức thì, hãy khám phá Nền tảng Ultralytics ngay hôm nay.