YOLO Vision 2026:

YOLOv7 so với YOLOv8#

Sự phát triển nhanh chóng của thị trường computer vision đã mang lại hàng loạt công cụ mạnh mẽ cho các lập trình viên và nhà nghiên cứu. Khi quyết định chọn kiến trúc phù hợp cho một pipeline object detection, việc so sánh các mô hình lâu đời là rất cần thiết. Hướng dẫn kỹ thuật này cung cấp cái nhìn sâu sắc về kiến trúc, các metric hiệu năng và các trường hợp sử dụng lý tưởng của hai mô hình có sức ảnh hưởng lớn: YOLOv7 và Ultralytics YOLOv8.

Giới thiệu về các kiến trúc#

Cả hai model đều thể hiện bước tiến đáng kể về hiệu suất, nhưng chúng tiếp cận thách thức tối ưu hóa mạng thần kinh sâu từ các triết lý cấu trúc khác nhau.

YOLOv7: Người tiên phong Bag-of-Freebies#

Được giới thiệu vào giữa năm 2022, YOLOv7 tập trung mạnh vào tối ưu hóa đường dẫn gradient kiến trúc và khái niệm "trainable bag-of-freebies" để đẩy giới hạn nhận diện thời gian thực trên các phần cứng cao cấp.

Điểm nổi bật về kiến trúc: YOLOv7 chủ yếu sử dụng phần đầu dò dựa trên anchor (dù có thử nghiệm các nhánh không dùng anchor) và giới thiệu Extended Efficient Layer Aggregation Networks (E-ELAN). Thiết kế này cải thiện khả năng học của mạng mà không làm hỏng đường dẫn gradient ban đầu. Nó hoạt động cực kỳ tốt trên các GPUs cấp máy chủ, rất phù hợp cho các tác vụ phân tích video nặng.

Điểm mạnh và điểm yếu: Mặc dù YOLOv7 đạt độ trễ tuyệt vời trên phần cứng chuyên dụng, hệ sinh thái của nó lại bị phân mảnh nặng nề. Quá trình huấn luyện đòi hỏi các đối số dòng lệnh phức tạp, thủ công sao chép repository và quản lý chặt chẽ các phụ thuộc trong PyTorch. Hơn nữa, yêu cầu về bộ nhớ trong quá trình huấn luyện có thể quá cao đối với phần cứng phổ thông.

Tìm hiểu thêm về YOLOv7

Ultralytics YOLOv8: Tiêu chuẩn linh hoạt#

Được phát hành vào đầu năm 2023, YOLOv8 đã hoàn toàn định nghĩa lại trải nghiệm nhà phát triển, tập trung không chỉ vào độ chính xác tiên tiến nhất mà còn vào việc cung cấp một framework thống nhất, sẵn sàng cho sản xuất.

Điểm nổi bật về kiến trúc: YOLOv8 giới thiệu phần đầu dò nguyên bản hoàn toàn không dùng anchor (anchor-free), loại bỏ nhu cầu cấu hình thủ công các hộp neo dựa trên MS COCO dataset hoặc phân phối dữ liệu tùy chỉnh. Nó tích hợp module C2f để cải thiện dòng chảy gradient và sử dụng cấu trúc đầu phân tách tách biệt các tác vụ đối tượng, phân loại và hồi quy. Điều này giúp đẩy nhanh tốc độ hội tụ và nâng cao độ chính xác.

Điểm mạnh và điểm yếu: YOLOv8 tự hào có hiệu quả Yêu cầu bộ nhớ xuất sắc. Nó đòi hỏi ít bộ nhớ CUDA hơn đáng kể trong quá trình huấn luyện so với YOLOv7 và các mô hình transformer nặng hơn, cho phép các lập trình viên sử dụng kích thước batch lớn hơn. Điểm mạnh chính của nó nằm ở Tính linh hoạt, hỗ trợ nguyên bản instance segmentation, image classification, pose estimationOriented Bounding Boxes (OBB). Nhược điểm duy nhất là các pipeline cũ cực kỳ chuyên biệt được xây dựng dành riêng cho các tensor của YOLOv7 có thể cần một khoảng thời gian tái cấu trúc ngắn.

Tìm hiểu thêm về YOLOv8

Lợi thế về hệ sinh thái

Ultralytics YOLOv8 hưởng lợi từ một Hệ sinh thái được duy trì tốt. Với API Python trực quan, quá trình phát triển tích cực và sự hỗ trợ mạnh mẽ từ cộng đồng, việc đưa một model từ thử nghiệm cục bộ lên triển khai toàn cầu chỉ mất một phần thời gian so với các repository độc lập.

So sánh hiệu năng chi tiết#

Bảng dưới đây chia nhỏ các số liệu hiệu suất trên các kích thước model chính. Hãy chú ý đến Sự cân bằng hiệu suất đặc biệt mà YOLOv8 đạt được, tối ưu hóa mạnh mẽ cho suy luận nhanh trên các thiết bị biên trong khi vẫn duy trì độ chính xác đẳng cấp thế giới.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

Lưu ý: YOLOv8x đạt mAP cao nhất trong nhóm này, trong khi YOLOv8n chiếm ưu thế về hiệu quả tham số và tốc độ suy luận, biến nó thành nhà vô địch không thể tranh cãi cho việc deploying computer vision on edge AI devices.

Dễ sử dụng và hiệu quả huấn luyện#

Khi nói đến Tính dễ sử dụng, Ultralytics YOLOv8 đứng ở một đẳng cấp riêng. Các kiến trúc cũ hơn như YOLOv7 yêu cầu clone các repository cụ thể và chạy các script dòng lệnh dài dòng để cấu hình tập dữ liệu và đường dẫn.

Ngược lại, gói ultralytics của YOLOv8 mang lại trải nghiệm lập trình viên cực kỳ tinh gọn. Hiệu quả huấn luyện được tối đa hóa thông qua việc tự động tải xuống dữ liệu, trọng số được huấn luyện sẵn sàng sử dụng và khả năng exporting capabilities liền mạch sang các định dạng như ONNXTensorRT.

Đây là cách bạn có thể dễ dàng load, huấn luyện và chạy suy luận bằng cách sử dụng API Python của Ultralytics:

from ultralytics import YOLO

# Load a pretrained YOLOv8 nano model
model = YOLO("yolov8n.pt")

# Train the model efficiently on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Display the predictions
predictions[0].show()
Theo dõi thử nghiệm

YOLOv8 tích hợp nguyên bản với các công cụ MLOps phổ biến như Weights & BiasesClearML, cho phép bạn theo dõi việc hyperparameter tuning và các metric huấn luyện theo thời gian thực.

Các trường hợp sử dụng lý tưởng#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào các ràng buộc cụ thể của môi trường triển khai của bạn.

Khi nào nên chọn YOLOv7#

  • Benchmarking kế thừa (Legacy): Phù hợp cho các nhà nghiên cứu cần một baseline cố định để so sánh với các tiêu chuẩn kiến trúc năm 2022.
  • Cơ sở hạ tầng nặng đã có sẵn: Các môi trường đầu tư mạnh vào GPU NVIDIA V100 hoặc A100, nơi các cấu hình tensor cụ thể của YOLOv7 được nhúng sâu vào quy trình C++ cũ.

Khi nào nên chọn YOLOv8#

  • Sản xuất đa nền tảng: Lý tưởng cho các nhóm cần triển khai liền mạch trên các cloud GPU, thiết bị di động và trình duyệt.
  • Yêu cầu đa tác vụ: Nếu dự án của bạn cần vượt ra ngoài các hộp bao và tận dụng các instance segmentation masks phong phú hoặc pose keypoints.
  • Edge bị hạn chế tài nguyên: YOLOv8 Nano (yolov8n) cung cấp tỷ lệ độ chính xác trên tốc độ đáng kinh ngạc cho lĩnh vực robot, drone và cảm biến IoT.

Hướng tới tương lai: Bước nhảy vọt thế hệ tới YOLO26#

Mặc dù YOLOv8 vẫn là một lựa chọn cực kỳ vững chắc, lĩnh vực computer vision tiến triển rất nhanh. Đối với các lập trình viên bắt đầu các dự án hoàn toàn mới, hiệu năng cao, Ultralytics gần đây đã giới thiệu bước tiến hóa tiếp theo của các mô hình AI. Bạn được khuyên nên khám phá cả YOLO11 được tinh chỉnh sâu sắc và YOLO26 mới được phát hành.

Được phát hành vào tháng 1 năm 2026, YOLO26 đẩy lùi ranh giới của những gì có thể làm được trên các thiết bị edge:

  • Thiết kế End-to-End NMS-Free: YOLO26 là thiết kế end-to-end nguyên bản, loại bỏ hoàn toàn quá trình hậu xử lý Non-Maximum Suppression (NMS). Điều này đảm bảo các quy trình triển khai đơn giản, nhanh hơn đáng kể mà không gặp các nút thắt độ trễ của các model dự đoán mật độ truyền thống.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 đạt được model deployment options đơn giản hơn nhiều và khả năng tương thích với edge vượt trội.
  • Suy luận CPU nhanh hơn tới 43%: Được tối ưu hóa mạnh mẽ cho các môi trường bị hạn chế như Raspberry Pi và các hệ thống nhúng, vượt qua tất cả các thế hệ trước về thông lượng CPU.
  • MuSGD Optimizer: Lấy cảm hứng từ các mô hình huấn luyện Large Language Model (LLM), YOLO26 kết hợp lai giữa SGD và Muon. Điều này mang lại sự ổn định huấn luyện chưa từng có và khả năng hội tụ nhanh chóng.
  • ProgLoss + STAL: Các hàm loss tiên tiến này mang lại những cải tiến đáng kể trong việc nhận diện đối tượng nhỏ, vốn rất quan trọng đối với hình ảnh hàng không, nông nghiệp tự động và robot.

Cho dù bạn đang mở rộng quy mô lên các cụm phân tích video lớn với YOLOv8 hay đẩy việc suy luận xuống các thiết bị edge nhỏ gọn với YOLO26 tiên tiến, Ultralytics Platform cung cấp các công cụ để quản lý toàn bộ vòng đời AI của bạn một cách liền mạch.

Người đóng góp

Bình luận