Ultralytics YOLO27:

YOLOv10 so với YOLOv7#

Sự phát triển nhanh chóng của thị giác máy tính trong vài năm qua đã tạo ra các kiến trúc ngày càng hiệu quả cho những ứng dụng thời gian thực. Việc so sánh YOLOv10YOLOv7 làm nổi bật một giai đoạn chuyển tiếp quan trọng trong quá trình tiến hóa này. Trong khi YOLOv7 giới thiệu các chiến lược training và mở rộng kiến trúc có hiệu quả cao, YOLOv10 đã cách mạng hóa việc deployment bằng cách loại bỏ sự phụ thuộc lâu nay vào phép triệt tiêu cực đại (NMS).

Cả hai model đều mở rộng các giới hạn của phát hiện đối tượng khi ra mắt, nhưng hệ sinh thái Ultralytics hiện đại cùng sự ra đời của các model thế hệ mới như YOLO26 mang đến workflow vượt trội hơn nhiều cho các chuyên gia AI ngày nay.

Hồ sơ và nguồn gốc model#

Việc tìm hiểu nguồn gốc của các model này cung cấp bối cảnh giá trị về những lựa chọn thiết kế kiến trúc cũng như các nghiên cứu học thuật thúc đẩy chúng.

Chi tiết YOLOv10#

Tìm hiểu thêm về YOLOv10

Chi tiết YOLOv7#

Tìm hiểu thêm về YOLOv7

Các cải tiến về kiến trúc#

Phương pháp YOLOv7#

Được phát hành vào năm 2022, YOLOv7 tập trung mạnh vào việc tối ưu hóa các đường dẫn gradient. Model này giới thiệu Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN), cho phép model học các đặc trưng đa dạng hơn mà không phá hủy đường dẫn gradient ban đầu. Ngoài ra, các tác giả đã triển khai phương pháp "bag-of-freebies có thể training", sử dụng các kỹ thuật tái tham số hóa trong quá trình training, sau đó có thể hợp nhất và loại bỏ trong quá trình inference để duy trì tốc độ thực thi nhanh. Mặc dù có những tối ưu hóa ấn tượng này, YOLOv7 vẫn phụ thuộc nhiều vào NMS cho bước hậu xử lý, gây ra độ trễ biến thiên khi phân tích các cảnh dày đặc.

Bước đột phá của YOLOv10#

YOLOv10 xử lý trực tiếp nút thắt NMS. Bằng cách giới thiệu cơ chế gán kép nhất quán trong quá trình training, nhóm Đại học Thanh Hoa đã cho phép phát hiện end-to-end không cần NMS. Phương pháp hai head này sử dụng một nhánh với cơ chế gán một-nhiều để cung cấp tín hiệu giám sát phong phú trong quá trình training, và một nhánh khác với cơ chế gán một-một cho inference không cần NMS. Sự thay đổi kiến trúc này bảo đảm độ trễ inference cực thấp và nhất quán, phù hợp với phân tích video tốc độ cao. Ngoài ra, YOLOv10 sử dụng thiết kế model tổng thể được dẫn dắt bởi hiệu quả và độ chính xác, loại bỏ phần dư thừa tính toán có trong các thế hệ trước.

Tác động của hậu xử lý

Việc loại bỏ NMS khỏi bước hậu xử lý không chỉ tăng tốc inference mà còn đơn giản hóa đáng kể việc deployment trên phần cứng AI biên, chẳng hạn như các bộ tăng tốc AI và NPU, nơi việc biên dịch các thao tác NMS tùy chỉnh vốn nổi tiếng là khó khăn.

So sánh hiệu năng#

Khi so sánh các metric thô trên dataset MS COCO, khoảng cách giữa các thế hệ trở nên rõ ràng. YOLOv10 đạt được sự đánh đổi thuận lợi hơn nhiều giữa số lượng parameter, yêu cầu tính toán và độ chính xác.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Như đã thấy ở trên, YOLOv10x đạt mAP cao hơn là 54.4% so với 53.1% của YOLOv7x, trong khi sử dụng ít hơn khoảng 20% parameter. Ngoài ra, các model YOLOv10 nhẹ (Nano và Small) cung cấp tốc độ deployment TensorRT vượt trội, khiến chúng rất hấp dẫn cho deployment trên thiết bị di động.

Lợi thế từ hệ sinh thái Ultralytics#

Mặc dù việc nghiên cứu các bài báo về kiến trúc mang lại nhiều hiểu biết, hoạt động phát triển thị giác máy tính hiện đại phụ thuộc vào các framework mạnh mẽ và được duy trì tốt. Việc lựa chọn một model được Ultralytics hỗ trợ mang lại lợi thế rất lớn cho các developer muốn nhanh chóng chuyển từ prototype sang production.

Phát triển tinh gọn#

Cả YOLOv10 và YOLOv7 đều có thể được truy cập thông qua package Python tiêu chuẩn của Ultralytics. Điều này mang lại Tính dễ sử dụng vượt trội, thay thế hàng nghìn dòng boilerplate code bằng một API đơn giản, trực quan. Ngoài ra, các model Ultralytics YOLO yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình training so với các kiến trúc Transformer lớn, cho phép sử dụng batch size lớn hơn trên phần cứng phổ thông.

Tính linh hoạt vượt trội#

Trong khi các repository cũ thường chỉ tập trung vào phát hiện bounding box, framework Ultralytics tích hợp hỗ trợ liền mạch rất nhiều loại task. Dù bạn thực hiện phân đoạn instance, ước tính pose hay phát hiện bounding box định hướng (OBB), workflow vẫn hoàn toàn giống nhau.

Ví dụ code: Workflow training nhất quán#

Đoạn code sau minh họa quy trình training liền mạch, tự động xử lý tăng cường dữ liệu và lập lịch learning rate:

from ultralytics import YOLO

# Load the desired model (YOLOv10, YOLOv7, or the recommended YOLO26)
model = YOLO("yolo26n.pt")

# Train the model effortlessly on your dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Export to ONNX format for rapid deployment
model.export(format="onnx")

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv10 và YOLOv7 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc deployment và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là lựa chọn phù hợp cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện đầu cuối mà không cần triệt tiêu cực đại, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các project yêu cầu sự cân bằng tốt giữa tốc độ suy luận và độ chính xác phát hiện trên nhiều quy mô model khác nhau.
  • Ứng dụng có độ trễ nhất quán: Các kịch bản triển khai mà thời gian suy luận có thể dự đoán là yếu tố quan trọng, chẳng hạn như robotics hoặc các hệ thống tự hành.

Khi nào nên chọn YOLOv7#

YOLOv7 được khuyến nghị cho:

  • Benchmarking học thuật: Tái tạo các kết quả state-of-the-art thời kỳ năm 2022 hoặc nghiên cứu ảnh hưởng của E-ELAN và các kỹ thuật bag-of-freebies có thể training.
  • Nghiên cứu tái tham số hóa: Nghiên cứu các convolution được tái tham số hóa theo kế hoạch và các chiến lược mở rộng model kết hợp.
  • Pipeline tùy chỉnh hiện có: Các dự án có pipeline được tùy chỉnh sâu, xây dựng xoay quanh kiến trúc cụ thể của YOLOv7 và không thể dễ dàng refactor.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Tiêu chuẩn mới: Giới thiệu YOLO26#

Mặc dù YOLOv10 là một bước tiến lớn vào năm 2024, bối cảnh thị giác máy tính thay đổi cực kỳ nhanh. Đối với mọi hoạt động phát triển mới, chúng tôi đặc biệt khuyến nghị model thế hệ mới nhất: Ultralytics YOLO26. Được phát hành vào tháng 1 năm 2026, model này đại diện cho đỉnh cao tuyệt đối của AI thị giác thời gian thực, vượt xa cả YOLOv7 và YOLOv10.

YOLO26 mang đến những cải tiến chưa từng có, được thiết kế riêng cho các môi trường deployment hiện đại:

  • Thiết kế end-to-end không cần NMS: Kế thừa nền tảng do YOLOv10 xây dựng, YOLO26 loại bỏ NMS khỏi bước hậu xử lý ngay trong kiến trúc, giúp đơn giản hóa pipeline deployment và duy trì inference tốc độ cao nhất quán.
  • Inference trên CPU nhanh hơn tới 43%: Được tối ưu mạnh cho điện toán biên và các thiết bị không có GPU chuyên dụng, giúp tiết kiệm đáng kể chi phí phần cứng.
  • Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ hoàn toàn, giúp đơn giản hóa đáng kể logic export và cải thiện vượt trội khả năng tương thích với các thiết bị biên công suất thấp và vi điều khiển.
  • Optimizer MuSGD: Lấy cảm hứng từ Kimi K2 của Moonshot AI, hybrid này kết hợp SGD và Muon, đưa các cải tiến trong training Mô hình ngôn ngữ lớn (LLM) trực tiếp vào thị giác máy tính, tạo ra động lực training cực kỳ ổn định và hội tụ nhanh hơn.
  • ProgLoss + STAL: Các hàm loss nâng cao này mang lại những cải thiện đáng kể trong nhận dạng đối tượng nhỏ, một lĩnh vực vốn khó khăn trong lịch sử nhưng có ý nghĩa quan trọng đối với drone, robotics và giám sát thành phố thông minh.
  • Cải tiến theo từng task: YOLO26 không chỉ là một detector. Model này bao gồm loss phân đoạn ngữ nghĩa chuyên biệt, Ước tính Log-Likelihood Dư (RLE) cho tracking pose siêu chính xác và các thuật toán loss góc chuyên biệt để loại bỏ các vấn đề ranh giới OBB.
Quản lý dataset và training

Để có trải nghiệm tốt nhất trong việc quản lý dataset, training YOLO26 và deployment model lên cloud, hãy khám phá Ultralytics Platform. Nền tảng này cung cấp giao diện no-code bổ trợ hoàn hảo cho Python SDK.

Các trường hợp sử dụng trong thực tế#

Việc lựa chọn kiến trúc phù hợp phụ thuộc phần lớn vào phần cứng và các ràng buộc của ứng dụng.

Khi nào nên sử dụng YOLOv7#

YOLOv7 vẫn là lựa chọn đáng tin cậy để duy trì các pipeline legacy đã tích hợp sâu với những cấu trúc tensor riêng của nó, hoặc khi tái tạo các benchmark học thuật từ năm 2022 và 2023. Model này hoạt động ấn tượng trên GPU server cao cấp.

Khi nào nên sử dụng YOLOv10#

YOLOv10 nổi bật trong các tình huống yêu cầu độ trễ nghiêm ngặt và không đổi. Vì không cần NMS, model này đặc biệt phù hợp với việc đếm đám đông mật độ cao hoặc phát hiện lỗi sản xuất, nơi số lượng đối tượng biến động mạnh nhưng thời gian xử lý mỗi frame phải duy trì ổn định.

Khi nào nên sử dụng YOLO26#

YOLO26 là lựa chọn dứt khoát cho mọi dự án greenfield. Từ việc triển khai hệ thống cảnh báo an ninh tinh vi trên một Raspberry Pi cơ bản đến chạy phân tích video quy mô lớn trên cloud, tốc độ CPU vượt trội và khả năng phát hiện đối tượng nhỏ nâng cao của model này khiến nó vượt xa các thế hệ cũ.

Đối với các developer quan tâm đến việc khám phá những kiến trúc hiện đại khác, chúng tôi cũng cung cấp hỗ trợ toàn diện cho các detector dựa trên Transformer như RT-DETR và các model chủ lực thế hệ trước như Ultralytics YOLO11.

Những người đóng góp

Bình luận