YOLO Vision 2026:

EfficientDet so với YOLOv7#

Việc lựa chọn kiến trúc mạng neural hiệu quả nhất đóng vai trò quan trọng đối với sự thành công của bất kỳ sáng kiến computer vision nào. Khi nhu cầu về các giải pháp AI hiệu năng cao tăng nhanh, việc so sánh các mô hình lâu đời như EfficientDet và YOLOv7 trở nên thiết yếu đối với các lập trình viên nhằm tối ưu hóa cả độ chính xác lẫn hiệu quả tính toán.

Phân tích kỹ thuật toàn diện này khám phá các sắc thái kiến trúc, performance metrics và các kịch bản triển khai lý tưởng cho cả hai mô hình. Ngoài ra, chúng tôi sẽ minh họa lý do tại sao hệ sinh thái tích hợp do Ultralytics cung cấp—đỉnh cao là Ultralytics YOLO26 tiên tiến—lại mang lại giải pháp thay thế vượt trội cho các tác vụ computer vision hiện đại.

Tìm hiểu về EfficientDet#

EfficientDet được thiết kế để tối đa hóa độ chính xác trong khi quản lý một cách có hệ thống chi phí tính toán trên nhiều ràng buộc tài nguyên khác nhau. Nó đạt được điều này thông qua một phương pháp mới để mở rộng (scaling) và hợp nhất đặc trưng (feature fusion).

Chi tiết về EfficientDet:
Tác giả: Mingxing Tan, Ruoming Pang và Quoc V. Le
Tổ chức: Google
Ngày: 2019-11-20
Arxiv: EfficientDet: Scalable and Efficient Object Detection
GitHub: Google AutoML Repository

Kiến trúc và các cải tiến#

Về cốt lõi, EfficientDet sử dụng Bi-directional Feature Pyramid Network (BiFPN). Không giống như các FPN truyền thống, BiFPN cho phép hợp nhất đặc trưng đa quy mô dễ dàng và nhanh chóng bằng cách giới thiệu các trọng số có thể học được để tìm hiểu tầm quan trọng của các đặc trưng đầu vào khác nhau. Điều này được kết hợp với một phương pháp compound scaling giúp đồng nhất hóa độ phân giải, độ sâu và chiều rộng của backbone, mạng đặc trưng và các mạng dự đoán box/class cùng một lúc.

Điểm mạnh và điểm yếu#

EfficientDet có khả năng mở rộng cao. Các biến thể nhỏ hơn của nó (d0-d2) cực kỳ tối ưu về tham số, giúp chúng phù hợp với các môi trường bị giới hạn nghiêm ngặt về dung lượng lưu trữ. Các biến thể lớn hơn (như d7) đẩy giới hạn của mean Average Precision (mAP) lên mức cao nhất cho việc xử lý ngoại tuyến cao cấp.

Tuy nhiên, EfficientDet phụ thuộc nhiều vào các triển khai TensorFlow cũ và các pipeline AutoML phức tạp. Cơ sở hạ tầng kế thừa này khiến nó nổi tiếng là khó tích hợp vào các quy trình làm việc tập trung vào PyTorch hiện đại. Hơn nữa, nó gặp phải độ trễ suy luận đáng kể trên các thiết bị biên khi mở rộng quy mô lên các biến thể có độ chính xác cao hơn.

Tìm hiểu thêm về EfficientDet

Tìm hiểu về YOLOv7#

YOLOv7, được giới thiệu vào năm 2022, đã mang lại một bước nhảy vọt lớn về tốc độ và độ chính xác cho các ứng dụng thời gian thực, thiết lập một nền tảng mới cho dòng YOLO vốn rất phổ biến vào thời điểm đó.

Chi tiết về YOLOv7:
Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
Tổ chức: Institute of Information Science, Academia Sinica, Taiwan
Ngày: 2022-07-06
Arxiv: YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors
GitHub: Official YOLOv7 Repository

Kiến trúc và các cải tiến#

YOLOv7 đã giới thiệu Extended Efficient Layer Aggregation Network (E-ELAN). Cải tiến kiến trúc này giúp cải thiện khả năng học tập của mạng mà không phá hủy đường dẫn gradient ban đầu, cho phép model học các đặc trưng đa dạng hơn một cách hiệu quả. Ngoài ra, nó thực hiện một "trainable bag-of-freebies", tận dụng các kỹ thuật như planned re-parameterization và dynamic label assignment để tăng độ chính xác mà không làm tăng chi phí inference.

Điểm mạnh và điểm yếu#

YOLOv7 xuất sắc trong các kịch bản thời gian thực, chẳng hạn như video analytics và điều hướng robot tốc độ cao. Nó mở rộng quy mô cực kỳ tốt trên các GPUs cấp máy chủ và cung cấp bản cài đặt PyTorch nguyên bản, giúp các nhà nghiên cứu học thuật dễ dàng tiếp cận.

Mặc dù có tốc độ ấn tượng, YOLOv7 vẫn dựa vào Non-Maximum Suppression (NMS) để hậu xử lý, điều này có thể gây ra độ trễ thay đổi trong các cảnh đông đúc. Hơn nữa, dung lượng bộ nhớ của nó trong quá trình đào tạo lớn hơn đáng kể so với các thế hệ mới hơn, đòi hỏi phần cứng mạnh mẽ hơn để xử lý các kích thước batch lớn.

Tìm hiểu thêm về YOLOv7

So sánh Hiệu năng và Chỉ số#

Khi so sánh các model này, việc kiểm tra sự đánh đổi giữa độ chính xác, tốc độ inference và kích thước tham số là rất quan trọng. Dưới đây là đánh giá chi tiết về các cấu hình EfficientDet và YOLOv7 khác nhau.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Kết luận về hiệu suất

Trong khi EfficientDet-d7 đạt được mAP cao nhất, nó cần gần 128ms trên một GPU T4. Ngược lại, YOLOv7x đạt mAP 53.1 tương đương ở mức 11.57ms cực nhanh, chứng minh một bước nhảy vọt lớn về thế hệ trong hiệu quả tính toán cho các triển khai thời gian thực.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa EfficientDet và YOLOv7 phụ thuộc vào các yêu cầu dự án cụ thể, ràng buộc triển khai và sở thích hệ sinh thái của bạn.

Khi nào nên chọn EfficientDet#

EfficientDet là một lựa chọn mạnh mẽ cho:

  • Google Cloud và các đường ống TPU: Các hệ thống được tích hợp sâu với API Google Cloud Vision hoặc hạ tầng TPU, nơi EfficientDet có sự tối ưu hóa gốc.
  • Nghiên cứu về Compound Scaling: Các nghiên cứu học thuật tập trung vào việc đánh giá tác động của độ sâu mạng, chiều rộng và khả năng mở rộng độ phân giải cân bằng.
  • Triển khai trên thiết bị di động qua TFLite: Các dự án đặc biệt yêu cầu xuất TensorFlow Lite cho Android hoặc các thiết bị Linux nhúng.

Khi nào nên chọn YOLOv7#

YOLOv7 được khuyến nghị cho:

  • Academic Benchmarking: Tái tạo các kết quả state-of-the-art của kỷ nguyên 2022 hoặc nghiên cứu các hiệu ứng của kỹ thuật E-ELAN và trainable bag-of-freebies.
  • Nghiên cứu về Reparameterization: Khám phá các convolution được lập kế hoạch tái tham số hóa và các chiến lược compound model scaling.
  • Các pipeline tùy chỉnh hiện có: Các dự án với các pipeline tùy chỉnh nặng nề được xây dựng dựa trên kiến trúc cụ thể của YOLOv7 mà không thể dễ dàng tái cấu trúc.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế từ Ultralytics#

Việc lựa chọn đúng kiến trúc vượt ra ngoài các số liệu thô đơn thuần; nó liên quan đến việc đánh giá toàn bộ vòng đời học máy. Ultralytics ecosystem mang lại trải nghiệm lập trình viên vô song, làm giảm đáng kể rào cản gia nhập cho các đợt triển khai AI mạnh mẽ.

  • Dễ sử dụng: Ultralytics cung cấp một Python API được thống nhất cao. Các nhà phát triển có thể train, validate và export model chỉ trong vài dòng code, loại bỏ nhu cầu quản lý các codebase phức tạp, phân mảnh vốn điển hình của EfficientDet.
  • Hệ sinh thái được duy trì tốt: Hưởng lợi từ các bản cập nhật nhanh chóng, tài liệu phong phú và cộng đồng tích cực, Ultralytics đảm bảo khả năng tương thích với các deployment frameworks mới nhất như TensorRT và OpenVINO.
  • Yêu cầu về bộ nhớ: Bằng cách sử dụng các data loader PyTorch được tối ưu hóa cao và cấu trúc mạng hợp lý, các model Ultralytics YOLO yêu cầu ít bộ nhớ CUDA hơn đáng kể trong quá trình đào tạo so với các mạng đa nhánh và các model nặng về Transformer.
  • Tính linh hoạt: Không giống như các kiến trúc cũ gắn liền chặt chẽ với việc phát hiện khung giới hạn, các mô hình Ultralytics là các cỗ máy đa nhiệm mạnh mẽ hỗ trợ Instance Segmentation, Pose EstimationOriented Bounding Boxes (OBB).

Hiệu quả đào tạo với Ultralytics#

Đoạn code sau đây minh họa sự đơn giản của việc train một model state-of-the-art bằng cách sử dụng gói Ultralytics Python, một sự tương phản rõ rệt với việc cấu hình các pipeline TensorFlow cũ.

from ultralytics import YOLO

# Load the highly recommended YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model automatically handling hyperparameter tuning and augmentations
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the model to TensorRT for deployment
model.export(format="engine")

Tiêu chuẩn mới: YOLO26#

Trong khi YOLOv7 và EfficientDet đặt nền móng cho computer vision hiện đại, bối cảnh đã thay đổi đáng kể với sự ra mắt của Ultralytics YOLO26 vào tháng 1 năm 2026. Được thiết kế cho cả độ chính xác cực cao và hiệu năng biên vô song, YOLO26 là đề xuất tối ưu cho tất cả các dự án thị giác mới.

Những đổi mới chính của YOLO26#

  • Thiết kế End-to-End không cần NMS: Dựa trên các nền tảng do YOLOv10 thiết lập, YOLO26 có tính năng end-to-end nguyên bản. Bằng cách loại bỏ hoàn toàn quá trình hậu xử lý Non-Maximum Suppression (NMS), nó mang lại độ trễ thấp hơn và ổn định hơn, điều này rất quan trọng đối với các hệ thống an toàn trọng yếu như lái xe tự động.
  • Tốc độ inference CPU nhanh hơn tới 43%: Nhờ việc loại bỏ Distribution Focal Loss (DFL), YOLO26 có quy trình export đơn giản hóa đáng kể và tốc độ vô song trên các thiết bị biên như Raspberry Pi, khiến nó trở thành nhà vô địch không thể tranh cãi của điện toán biên (edge computing).
  • MuSGD Optimizer: YOLO26 tích hợp MuSGD Optimizer mang tính cách mạng—một sự kết hợp giữa SGD và Muon lấy cảm hứng từ các cải tiến trong đào tạo LLM từ Moonshot AI. Điều này dẫn đến động lực đào tạo ổn định đáng kinh ngạc và tỷ lệ hội tụ nhanh hơn nhiều.
  • ProgLoss + STAL: Việc tích hợp Progressive Loss và Scale-Targeted Alignment Loss cải thiện đáng kể khả năng phát hiện các đối tượng nhỏ của mô hình, giải quyết một điểm nhức nhối lớn đối với hình ảnh từ drone và security alarm systems.
  • Cải tiến theo tác vụ cụ thể: YOLO26 không chỉ là một bộ dò tìm. Nó có tính năng Semantic segmentation loss và multi-scale proto để segmentation hoàn hảo, Residual Log-Likelihood Estimation (RLE) để pose tracking siêu chính xác, và tổn thất góc chuyên biệt để giải quyết các trường hợp mơ hồ về ranh giới OBB.

Tìm hiểu thêm về YOLO26

Khám phá các model thay thế#

Trong khi YOLO26 đại diện cho đỉnh cao của công nghệ hiện tại, hệ sinh thái Ultralytics hỗ trợ nhiều model phù hợp cho các trường hợp sử dụng khác nhau.

Đối với các lập trình viên quản lý các hệ thống cũ vẫn yêu cầu mở rộng quy mô không mỏ neo truyền thống, YOLO11 vẫn là một tùy chọn mạnh mẽ, được hỗ trợ cao trong nền tảng Ultralytics. Ngoài ra, đối với các kịch bản đòi hỏi rõ ràng các kiến trúc dựa trên transformer, RT-DETR cung cấp khả năng phát hiện thời gian thực tận dụng vision transformers, thu hẹp khoảng cách giữa các cơ chế chú ý cao cấp và tốc độ thực thi thời gian thực.

Tóm lại, trong khi EfficientDet cung cấp thông tin chi tiết mang tính học thuật về mở rộng hợp chất và YOLOv7 cung cấp hiệu năng thời gian thực cơ bản vững chắc, các doanh nghiệp hiện đại sẽ phục vụ tốt nhất bằng cách áp dụng Ultralytics Platform. Bằng cách tận dụng YOLO26, các nhóm có thể đảm bảo hiệu năng tối đa, giảm thiểu ma sát đào tạo và bảo vệ tương lai cho các triển khai AI của họ.

Những người đóng góp

Bình luận