YOLO Vision 2026:

Vergleichende Analyse der YOLO26-Bereitstellungsoptionen#

YOLO26 unterstützt mehr als 20 Bereitstellungsoptionen, die jeweils auf eine andere Laufzeit, ein anderes Hardwareziel oder eine andere Plattform abgestimmt sind – von PyTorch und ONNX bis hin zu TensorRT, OpenVINO, CoreML und dedizierten Edge-NPU-Formaten. Die Wahl der richtigen Option gleicht Inferenzgeschwindigkeit, Hardwarebeschränkungen und Integrationsaufwand aus. Dieser Leitfaden vergleicht alle Optionen, damit du die beste Passform für deine Anwendung auswählen kannst, und führt dich anschließend zu den Best Practices für die Modellbereitstellung, um sie zuverlässig zu deployen.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Die Bereitstellung ist die Phase im Computer-Vision-Projekt-Workflow, in der ein trainiertes Modell echte Arbeit verrichtet. Daher hat das Format, in das du exportierst, direkte Auswirkungen auf Geschwindigkeit, Kosten und Portabilität.

So wählst du die richtige Bereitstellungsoption für dein YOLO26-Modell aus#

Wenn es an der Zeit ist, dein YOLO26-Modell bereitzustellen, ist die Auswahl eines geeigneten Exportformats sehr wichtig. Wie in der Exportdokumentation für Ultralytics YOLO26 dargelegt, konvertiert die Funktion model.export() dein trainiertes Modell in eine Vielzahl von Formaten, die auf unterschiedliche Umgebungen und Leistungsanforderungen zugeschnitten sind.

Das ideale Format hängt vom beabsichtigten Einsatzkontext deines Modells und der Hardware ab.

Überspringe den manuellen Export

Für eine verwaltete Bereitstellung ohne manuellen Export bietet die Ultralytics Platform nutzungsfertige Inferenz-Endpunkte mit automatischer Skalierung über 42 globale Regionen hinweg.

Die Bereitstellungsoptionen von YOLO26#

Hier ist eine kurze Beschreibung der einzelnen Formate und wann sie verwendet werden sollten. Eine vollständige Anleitung zum Export findest du in der Exportdokumentation; die direkten Vergleichskriterien findest du in der Vergleichstabelle.

  • PyTorch (.pt): Das native Trainings- und Inferenzformat, das maximale Flexibilität und GPU-Beschleunigung über NVIDIA CUDA oder AMD ROCm bietet – ideal für Forschung und Prototyping ohne erforderlichen Exportschritt.
  • TorchScript (torchscript): Serialisiert das Modell für eine Python-freie C++-Laufzeitumgebung, geeignet für Produktionssysteme, in denen Python nicht verfügbar ist.
  • ONNX (onnx): Ein Framework-unabhängiges Austauschformat mit breiter plattformübergreifender und Hardware-Unterstützung durch ONNX Runtime.
  • OpenVINO (openvino): Intels Toolkit für optimierte Inferenz auf Intel-CPUs, integrierten GPUs und NPUs, das häufig in IoT und Edge-Computing verwendet wird.
  • TensorRT (engine): NVIDIAs Hochleistungs-Laufzeitumgebung für erstklassige GPU-Inferenz mit FP16- und INT8-Optimierung.
  • CoreML (coreml): Apples On-Device-Format für iOS, macOS, watchOS und tvOS unter Verwendung der Apple Neural Engine.
  • TF SavedModel (saved_model): TensorFlows Standardformat für skalierbares serverseitiges Serving mit TensorFlow Serving.
  • TF GraphDef (pb): Ein eingefrorenes, statisches TensorFlow-Graphenformat für Umgebungen, die einen festen Berechnungsraphen erfordern.
  • TF Edge TPU (edgetpu): Kompiliert .tflite-Modelle für Google Coral Edge TPU-Beschleuniger.
  • LiteRT (litert): Googles On-Device-Laufzeitumgebung (vormals TensorFlow Lite) für mobile, eingebettete und browserbasierte Inferenz aus einem einzigen .tflite-Modell, mit FP32- und INT8-Unterstützung sowie Browser-Ausführung über LiteRT.js.
  • PaddlePaddle (paddle): Baidus Deep-Learning-Framework, das in China populär ist und eine breite Hardware-Unterstützung bietet.
  • MNN (mnn): Eine leichtgewichtige, leistungsstarke Inferenz-Engine, die für mobile und eingebettete ARM- und x86-64-Systeme optimiert ist.
  • NCNN (ncnn): Ein leistungsstarkes, leichtgewichtiges Inferenz-Framework, das für mobile ARM-Geräte optimiert ist.
  • Sony IMX500 (imx): Exportiert für Sonys intelligenten Vision-Sensor IMX500 mit On-Chip-Verarbeitung, wie etwa die Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Zielt auf Rockchip-NPUs auf eingebetteten Platinen mit FP16- und INT8-Quantisierung ab.
  • ExecuTorch (executorch): PyTorchs native On-Device-Laufzeitumgebung für Mobilgeräte (iOS und Android) und eingebettete Systeme über XNNPACK.
  • Axelera AI (axelera): Kompiliert für Axeleras Metis AIPU (bis zu 856 TOPS) über PCIe oder M.2 für Edge-Inferenz mit hohem Durchsatz.
  • DEEPX (deepx): Zielt auf DEEPX-NPU-Hardware mit INT8-Quantisierung für eingebettete Edge-Inferenz ab.
  • Qualcomm QNN (qnn): On-Device-Inferenz auf Snapdragon Hexagon NPU, Adreno GPU und CPU durch den Qualcomm AI-Stack.

Die Hailo-Integration exportiert YOLO-Erkennungs-, Segmentierungs-, semantische Segmentierungs-, Tiefenschätzungs-, Klassifizierungs-, Pose- und OBB-Modelle direkt nach Hailo HEF; in der Kompatibilitätstabelle findest du validierte Modelle und Ziele. Die Ambarella-Integration folgt einem ONNX-First-Workflow und kompiliert ONNX-Exporte mit der CVflow-Toolchain von Ambarella für CVflow®-SoCs wie den CV72 in das AmbaPB-Format, wobei optional das komprimierungsbewusste Training mit SpongeTorch verwendet wird. Die Huawei-Ascend-Integration kompiliert ONNX-Exporte mit dem CANN-ATC-Compiler in das Offline-Format .om für die FP16-Inferenz auf Ascend AI-Prozessoren.

Vergleich der Bereitstellungsoptionen#

Die folgende Tabelle fasst die Bereitstellungsoptionen für YOLO26-Modelle anhand der Kriterien zusammen, die die Auswahl normalerweise bestimmen. Einen detaillierten Einblick in die einzelnen Formate findest du in der Dokumentation zu den Exportformaten.

BereitstellungsoptionPerformance-BenchmarksKompatibilität und IntegrationCommunity-Support und ÖkosystemFallstudienWartung und UpdatesSicherheitsaspekteHardwarebeschleunigung
PyTorchGute Flexibilität; kann auf Kosten der reinen Leistung gehenExzellent mit Python-BibliothekenUmfangreiche Ressourcen und CommunityForschung und PrototypenRegelmäßige, aktive EntwicklungAbhängig von der BereitstellungsumgebungCUDA-Unterstützung für GPU-Beschleunigung
TorchScriptBesser für die Produktion geeignet als PyTorchReibungsloser Übergang von PyTorch zu C++Spezialisiert, aber begrenzter als PyTorchIndustrie, in der Python ein Flaschenhals istKonsistente Updates mit PyTorchVerbesserte Sicherheit ohne vollständiges PythonErbt CUDA-Unterstützung von PyTorch
ONNXVariabel je nach RuntimeHoch über verschiedene Frameworks hinwegBreites Ökosystem, von vielen Organisationen unterstütztFlexibilität über ML-Frameworks hinwegRegelmäßige Updates für neue OperationenStelle sichere Konvertierungs- und Bereitstellungspraktiken sicherVerschiedene Hardware-Optimierungen
OpenVINOOptimiert für Intel-HardwareAm besten innerhalb des Intel-ÖkosystemsSolide im Bereich Computer VisionIoT und Edge mit Intel-HardwareRegelmäßige Updates für Intel-HardwareRobuste Funktionen für sensible AnwendungenMaßgeschneidert für Intel-Hardware
TensorRTSpitzenklasse auf NVIDIA-GPUsAm besten für NVIDIA-HardwareStarkes Netzwerk durch NVIDIAEchtzeit-Video- und BildinferenzHäufige Updates für neue GPUsBetonung auf SicherheitEntwickelt für NVIDIA-GPUs
CoreMLOptimiert für Apple-Hardware auf dem GerätExklusiv für das Apple-ÖkosystemStarker Apple- und Entwickler-SupportML auf Apple-Produkten direkt auf dem GerätRegelmäßige Apple-UpdatesFokus auf Datenschutz und SicherheitApple Neural Engine und GPU
TF SavedModelSkalierbar in ServerumgebungenBreite Kompatibilität im TensorFlow-ÖkosystemGroße Unterstützung aufgrund der Popularität von TensorFlowModellbereitstellung in großem MaßstabRegelmäßige Updates durch Google und die CommunityRobuste Funktionen für UnternehmenVerschiedene Hardwarebeschleunigungen
TF GraphDefStabil für statische BerechnungsgraphenIntegriert sich gut in die TensorFlow-InfrastrukturRessourcen zur Optimierung statischer GraphenSzenarien, die statische Graphen erfordernUpdates zusammen mit TensorFlow CoreEtablierte TensorFlow-SicherheitspraktikenTensorFlow-Beschleunigungsoptionen
TF Edge TPUOptimiert für Googles Edge TPU-HardwareExklusiv für Edge TPU-GeräteWächst mit Google und Ressourcen von DrittanbieternIoT-Geräte, die Echtzeitverarbeitung erfordernVerbesserungen für neue Edge TPU-HardwareGoogles robuste IoT-SicherheitSpeziell entwickelt für Google Coral
LiteRTGeschwindigkeit und Effizienz auf Mobilgeräten, eingebetteten Systemen und im WebUnterstützung für Mobilgeräte, eingebettete Systeme, Edge und BrowserRobuste Community, unterstützt durch GoogleOn-Device-Apps für Android, iOS und WebNeueste On-Device-Runtime-FunktionenSichere Inferenz auf dem Gerät und im BrowserGPU-, DSP- und WebGPU-Beschleunigung
PaddlePaddleWettbewerbsfähig, einfach zu bedienen und skalierbarBaidu-Ökosystem, breite AnwendungsunterstützungSchnell wachsend, besonders in ChinaChinesischer Markt und SprachverarbeitungFokus auf chinesische KI-AnwendungenBetont Datenschutz und SicherheitEinschließlich der Kunlun-Chips von Baidu
MNNHohe Leistung für mobile GeräteMobile und eingebettete ARM-Systeme sowie X86-64 CPUMobile/Embedded ML-CommunityEffizienz mobiler SystemeWartung hoher Leistung auf mobilen GerätenVorteile der Sicherheit auf dem GerätOptimierungen für ARM-CPUs und GPUs
NCNNOptimiert für mobile ARM-basierte GeräteMobile und eingebettete ARM-SystemeNischenorientierte, aber aktive Mobile/Embedded ML-CommunityEffizienz von Android- und ARM-SystemenHochleistungswartung auf ARMVorteile der Sicherheit auf dem GerätOptimierungen für ARM-CPUs und GPUs
Sony IMX500On-Sensor-Inferenz bei sehr niedrigem StromverbrauchSony IMX500 Sensor, Raspberry Pi AI CameraSony AITRIOS ÖkosystemOn-Camera Edge AIUpdates für Sony SDK und MCT ToolchainDaten verbleiben auf dem SensorSony IMX500 On-Chip-Beschleuniger
Rockchip RKNNOptimiert für Rockchip NPUsRockchip SoC Boards (z.B. RK3588)Rockchip Entwickler-CommunityEingebettete SBC- und Edge-GeräteUpdates für Rockchip RKNN-ToolkitLokale On-Device-InferenzRockchip NPU
ExecuTorchEffiziente On-Device PyTorch LaufzeitumgebungiOS, Android, eingebettet via XNNPACKUnterstützt durch das PyTorch ProjektMobile und eingebettete AppsWird zusammen mit PyTorch gewartetInferenz auf dem Gerät hält Daten lokalXNNPACK und mobile CPU/GPU Backends
Axelera AISehr hoher Durchsatz (bis zu 856 TOPS)Metis AIPU über PCIe oder M.2Axelera Voyager SDKEdge-Inferenz mit hohem DurchsatzUpdates für Axelera SDKOn-Premises Edge-InferenzAxelera Metis AIPU
DEEPXINT8-optimierte NPU-InferenzDEEPX NPU-HardwareDEEPX Entwicklertools (dx_com, dx_engine)Eingebettete Edge-InferenzUpdates für DEEPX SDK und LaufzeitumgebungLokale On-Device-InferenzDEEPX NPU
Qualcomm QNNSchnelle On-Device Snapdragon InferenzSnapdragon Hexagon NPU, Adreno GPU, CPUQualcomm AI Hub ÖkosystemMobile und Edge Snapdragon GeräteUpdates für Qualcomm AI Stack (QAIRT)Inferenz auf dem Gerät hält Daten lokalSnapdragon Hexagon NPU

Dieser Vergleich gibt dir einen Überblick auf hoher Ebene. Wäge bei der Bereitstellung die spezifischen Anforderungen und Einschränkungen deines Projekts gegen jede Option ab und ziehe den verlinkten Integrationsleitfaden für das von dir gewählte Format zu Rate.

Fazit#

Die breite Palette an Exportformaten von YOLO26 ermöglicht es dir, ein Modell an nahezu jede Umgebung anzupassen – von einem Cloud-GPU-Server bis hin zu einer Edge-Kamera direkt am Sensor. Sobald du dich für ein Format entschieden hast, befolge die Best Practices für die Modellbereitstellung zur Optimierung, Fehlerbehebung und Sicherheit, und wende dich bei Problemen an die Ultralytics-Community.

FAQ#

  • Ultralytics YOLO26 unterstützt verschiedene Bereitstellungsformate, die jeweils für spezifische Umgebungen und Hardwareplattformen konzipiert sind. Zu den wichtigsten Formaten gehören:

    • PyTorch für Forschung und Prototyping, mit hervorragender Python-Integration.
    • TorchScript für Produktionsumgebungen, in denen Python nicht verfügbar ist.
    • ONNX für plattformübergreifende Kompatibilität und Hardwarebeschleunigung.
    • OpenVINO für optimierte Leistung auf Intel-Hardware.
    • TensorRT für Hochgeschwindigkeits-Inferenz auf NVIDIA-GPUs.

    Jedes Format hat einzigartige Vorteile. Eine detaillierte Schritt-für-Schritt-Anleitung findest du in unserer Dokumentation zum Exportprozess.

  • Um die Inferenzgeschwindigkeit auf Intel-CPUs zu verbessern, kannst du dein YOLO26-Modell mit dem Intel OpenVINO-Toolkit bereitstellen. OpenVINO bietet signifikante Leistungssteigerungen durch die Optimierung von Modellen zur effizienten Nutzung von Intel-Hardware.

    1. Konvertiere dein YOLO26-Modell mit der Funktion model.export() in das OpenVINO-Format.
    2. Befolge die detaillierte Installationsanleitung in der Dokumentation zum Intel OpenVINO Export.

    Weitere Einblicke findest du in unserem Blogbeitrag.

  • Ja, YOLO26-Modelle können auf Mobilgeräten bereitgestellt werden – unter Verwendung von LiteRT (vormals TensorFlow Lite) und NCNN für Android sowie CoreML oder LiteRT für iOS. LiteRT ist Googles On-Device-Laufzeitumgebung für Mobil- und Embedded-Geräte und führt dasselbe Modell auf Android, iOS und im Browser aus, wodurch eine effiziente Inferenz auf dem Gerät ermöglicht wird.

    Beispiel
    # Export command for NCNN format
    model.export(format="ncnn")

    Weitere Details zur Bereitstellung von Modellen auf Mobilgeräten findest du in unserem LiteRT-Integrationsleitfaden.

  • Bei der Wahl eines Bereitstellungsformats für YOLO26 solltest du folgende Faktoren berücksichtigen:

    • Leistung: Einige Formate wie TensorRT bieten außergewöhnliche Geschwindigkeiten auf NVIDIA-GPUs, während OpenVINO für Intel-Hardware optimiert ist.
    • Kompatibilität: ONNX bietet eine breite Kompatibilität über verschiedene Plattformen hinweg.
    • Einfache Integration: Formate wie CoreML oder LiteRT sind speziell auf die jeweiligen Ökosysteme wie iOS bzw. Android zugeschnitten.
    • Community-Support: Formate wie PyTorch und TensorFlow verfügen über umfangreiche Community-Ressourcen und -Support.

    Eine vergleichende Analyse findest du in unserer Dokumentation zu den Exportformaten.

  • Um YOLO26-Modelle in einer Webanwendung bereitzustellen, kannst du LiteRT.js verwenden – die Web-Laufzeitumgebung von LiteRT, die es ermöglicht, Machine-Learning-Modelle direkt im Browser und in Node.js auszuführen. Dieser Ansatz macht Backend-Infrastruktur überflüssig und sorgt für Echtzeitleistung.

    1. Exportiere das YOLO26 Modell in das LiteRT Format.
    2. Integriere das exportierte Modell mit LiteRT.js in deine Webanwendung.

    Schritt-für-Schritt-Anleitungen findest du in unserem LiteRT-Integrationsleitfaden.

Kommentare