Ultralytics YOLO27:
Get Started

Vergleich der Bereitstellungsoptionen für YOLO26#

YOLO26 unterstützt mehr als 20 Bereitstellungsoptionen, die jeweils auf eine andere Laufzeitumgebung, Hardware oder Plattform abgestimmt sind – von PyTorch und ONNX über TensorRT, OpenVINO und CoreML bis hin zu speziellen Formaten für Edge-NPUs. Bei der Wahl der passenden Option gilt es, Inferenzgeschwindigkeit, Hardwareeinschränkungen und einfache Integration gegeneinander abzuwägen. Dieser Leitfaden vergleicht alle Optionen, damit du die richtige für deine Anwendung auswählen und anschließend die Best Practices für die Modellbereitstellung nutzen kannst, um das Modell zuverlässig bereitzustellen.



Ansehen: So wählst du das beste Bereitstellungsformat für Ultralytics YOLO26 für dein Projekt aus | TensorRT | OpenVINO 🚀

Die Bereitstellung ist die Phase im Ablauf eines Computer-Vision-Projekts, in der ein trainiertes Modell seine praktische Arbeit aufnimmt. Das Exportformat wirkt sich daher direkt auf Geschwindigkeit, Kosten und Portabilität aus.

So wählst du die passende Bereitstellungsoption für dein YOLO26-Modell aus#

Wenn du dein YOLO26-Modell bereitstellen möchtest, ist die Wahl eines geeigneten Exportformats sehr wichtig. Wie in der Exportdokumentation für Ultralytics YOLO26 beschrieben, wandelt die Funktion model.export() dein trainiertes Modell in verschiedene Formate um, die auf unterschiedliche Umgebungen und Leistungsanforderungen zugeschnitten sind.

Das ideale Format hängt vom vorgesehenen Einsatzbereich und der Hardware deines Modells ab.

Manuellen Export überspringen

Für eine verwaltete Bereitstellung ohne manuellen Export bietet die Ultralytics Platform einsatzbereite Inferenzendpunkte mit automatischer Skalierung in 42 Regionen weltweit.

Die Bereitstellungsoptionen von YOLO26#

Hier findest du eine kurze Beschreibung der einzelnen Formate und ihrer Anwendungsbereiche. Eine vollständige Anleitung zum Export findest du in der Exportdokumentation; einen direkten Vergleich der Kriterien bietet die Vergleichstabelle.

  • PyTorch (.pt): Das native Format für Training und Inferenz bietet maximale Flexibilität und GPU-Beschleunigung mit NVIDIA CUDA oder AMD ROCm – ideal für Forschung und Prototypen, da kein Export erforderlich ist.
  • TorchScript (torchscript): Serialisiert das Modell für eine C++-Laufzeitumgebung ohne Python und eignet sich für Produktionssysteme, in denen Python nicht verfügbar ist.
  • ONNX (onnx): Ein frameworkunabhängiges Austauschformat mit breiter Plattform- und Hardwareunterstützung durch ONNX Runtime, auch für NVIDIA-GPUs über CUDA und AMD-GPUs über MIGraphX.
  • OpenVINO (openvino): Intels Toolkit für optimierte Inferenz auf Intel-CPUs, integrierten GPUs und NPUs, das häufig im IoT und bei der Edge-Verarbeitung eingesetzt wird.
  • TensorRT (engine): Die Hochleistungs-Laufzeitumgebung von NVIDIA ermöglicht erstklassige GPU-Inferenz mit FP16- und INT8-Optimierung.
  • CoreML (coreml): Apples Format für die Ausführung auf Geräten mit iOS, macOS, watchOS und tvOS nutzt die Apple Neural Engine.
  • Core AI (coreai): Apples neues Format .aimodel für iOS 27 und macOS 27 verteilt die Ausführung auf CPU, GPU und Apple Neural Engine. Für den Export ist macOS 26 oder neuer auf Apple-Chips oder x86_64 Linux mit glibc 2.34 oder neuer sowie Python 3.11 bis 3.14 erforderlich.
  • TF SavedModel (saved_model): Das Standardformat von TensorFlow für skalierbares serverseitiges Bereitstellen mit TensorFlow Serving.
  • TF GraphDef (pb): Ein eingefrorenes TensorFlow-Format mit statischem Graphen für Umgebungen, die einen festen Berechnungsgraphen benötigen.
  • TF Edge TPU (edgetpu): Kompiliert .tflite-Modelle für Google Coral Edge TPU-Beschleuniger.
  • LiteRT (litert): Googles Laufzeitumgebung für die Ausführung auf Geräten (früher TensorFlow Lite) ermöglicht Inferenz auf Mobilgeräten, eingebetteten Systemen und im Browser mit einem einzigen .tflite-Modell. Sie unterstützt FP32 und INT8 sowie die Ausführung im Browser über LiteRT.js.
  • PaddlePaddle (paddle): Das in China beliebte Deep-Learning-Framework von Baidu bietet breite Hardwareunterstützung.
  • MNN (mnn): Eine schlanke, leistungsstarke Inferenz-Engine, optimiert für mobile und eingebettete ARM- und x86-64-Systeme.
  • NCNN (ncnn): Ein leistungsstarkes, schlankes Inferenz-Framework, das für mobile ARM-Geräte optimiert ist.
  • Sony IMX500 (imx): Exportiert Modelle für Sonys intelligenten Bildsensor IMX500 mit Verarbeitung auf dem Chip, etwa für die Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Unterstützt NPUs von Rockchip auf eingebetteten Platinen mit FP16- und INT8-Quantisierung.
  • ExecuTorch (executorch): PyTorchs native Laufzeitumgebung für die Ausführung auf Mobilgeräten (iOS und Android) und eingebetteten Systemen über XNNPACK.
  • Axelera AI (axelera): Kompiliert Modelle für Axelera Metis AIPU (bis zu 856 TOPS) über PCIe oder M.2 und ermöglicht so eine leistungsstarke Inferenz am Netzwerkrand.
  • DEEPX (deepx): Unterstützt DEEPX-NPU-Hardware mit INT8-Quantisierung für eingebettete Inferenz am Netzwerkrand.
  • Qualcomm QNN (qnn): Inferenz direkt auf Geräten mit Snapdragon Hexagon NPU, Adreno GPU und CPU über den Qualcomm-AI-Stack.

Die Hailo-Integration exportiert YOLO-Modelle für Erkennung, Segmentierung, semantische Segmentierung, Tiefenschätzung, Klassifizierung, Pose und OBB direkt in das Hailo-HEF-Format. In der Kompatibilitätstabelle findest du validierte Modelle und Ziele. Die Ambarella-Integration basiert auf einem ONNX-zuerst-Workflow und kompiliert ONNX-Exporte mit der CVflow-Toolchain von Ambarella in das AmbaPB-Format für CVflow®-SoCs wie den CV72; optional kommt dabei das SpongeTorch-kompressionsbewusste Training zum Einsatz. Die Huawei-Ascend-Integration kompiliert ONNX-Exporte mit dem CANN-ATC-Compiler für FP16-Inferenz auf Ascend AI Processors in das Offlineformat .om. Die AMD-Xilinx-Integration quantisiert ONNX-Exporte mit AMD Quark für NPUs der Versal AI Edge Series Gen 2, die der Vitis AI Execution Provider zu einem .rai-Modell kompiliert.

Vergleich der Bereitstellungsoptionen#

Die folgende Tabelle fasst die Bereitstellungsoptionen für YOLO26-Modelle anhand der Kriterien zusammen, die bei der Auswahl üblicherweise ausschlaggebend sind. Einen ausführlichen Überblick über die einzelnen Formate findest du in der Dokumentation zu Exportformaten.

BereitstellungsoptionLeistungsbenchmarksKompatibilität und IntegrationCommunity-Unterstützung und ÖkosystemFallstudienWartung und AktualisierungenSicherheitsaspekteHardwarebeschleunigung
PyTorchGute Flexibilität; möglicherweise geringere SpitzenleistungHervorragend mit Python-BibliothekenUmfangreiche Ressourcen und aktive CommunityForschung und PrototypenRegelmäßige, aktive WeiterentwicklungAbhängig von der BereitstellungsumgebungCUDA-Unterstützung für GPU-Beschleunigung
TorchScriptFür den Produktionseinsatz besser geeignet als PyTorchReibungsloser Übergang von PyTorch zu C++Spezialisiert, aber weniger breit aufgestellt als PyTorchBranchen, in denen Python zum Engpass wirdRegelmäßige Aktualisierungen zusammen mit PyTorchVerbesserte Sicherheit ohne vollständige Python-UmgebungÜbernimmt die CUDA-Unterstützung von PyTorch
ONNXJe nach Laufzeitumgebung unterschiedlichHohe Kompatibilität mit verschiedenen FrameworksBreites Ökosystem, unterstützt von vielen OrganisationenFlexibilität über verschiedene ML-Frameworks hinwegRegelmäßige Aktualisierungen zur Unterstützung neuer OperationenAchte auf sichere Konvertierungs- und BereitstellungsverfahrenVerschiedene Hardwareoptimierungen
OpenVINOFür Intel-Hardware optimiertAm besten innerhalb des Intel-ÖkosystemsEtabliert im Bereich Computer VisionIoT und Edge Computing mit Intel-HardwareRegelmäßige Updates für Intel-HardwareLeistungsstarke Funktionen für sensible AnwendungenAuf Intel-Hardware zugeschnitten
TensorRTSpitzenleistung auf NVIDIA-GPUsOptimal für NVIDIA-HardwareStarkes Netzwerk über NVIDIAEchtzeit-Inferenz für Videos und BilderHäufige Updates für neue GPUsSicherheitsorientiertFür NVIDIA-GPUs entwickelt
CoreMLFür Apple-Hardware direkt auf dem Gerät optimiertExklusiv im Apple-ÖkosystemStarke Unterstützung durch Apple und EntwicklerMaschinelles Lernen direkt auf Apple-GerätenRegelmäßige Apple-UpdatesFokus auf Datenschutz und SicherheitApple Neural Engine und GPU
Core AIFür Apple Silicon optimiertiOS 27 und macOS 27; Export auf Apple Silicon mit macOS 26+ oder auf x86_64 Linux (glibc 2.34+), Python 3.11-3.14Apple-Framework; optional in iOS-/Flutter-SDKsMaschinelles Lernen direkt auf Apple-Plattformen der nächsten GenerationAn Apple-Betriebssystemversionen gebunden; derzeit BetaBei der Inferenz direkt auf dem Gerät bleiben die Daten lokalApple Neural Engine, GPU und CPU
TF SavedModelFür den Einsatz in Serverumgebungen skalierbarBreite Kompatibilität im TensorFlow-ÖkosystemUmfangreiche Unterstützung dank der Beliebtheit von TensorFlowModelle in großem Maßstab bereitstellenRegelmäßige Updates von Google und der CommunityLeistungsstarke Funktionen für UnternehmenVerschiedene Hardwarebeschleunigungen
TF GraphDefStabil bei statischen BerechnungsgraphenLässt sich gut in die TensorFlow-Infrastruktur integrierenRessourcen zur Optimierung statischer GraphenSzenarien, in denen statische Graphen erforderlich sindUpdates parallel zum TensorFlow-KernEtablierte Sicherheitspraktiken von TensorFlowTensorFlow-Beschleunigungsoptionen
TF Edge TPUFür Googles Edge-TPU-Hardware optimiertExklusiv für Edge-TPU-GeräteWachsende Ressourcen von Google und DrittanbieternIoT-Geräte, die Echtzeitverarbeitung erfordernVerbesserungen für neue Edge-TPU-HardwareRobuste IoT-Sicherheit von GoogleSpeziell für Google Coral entwickelt
LiteRTGeschwindigkeit und Effizienz auf Mobilgeräten, eingebetteten Systemen und im WebUnterstützung für Mobilgeräte, eingebettete Systeme, Edge-Geräte und BrowserStarke Community, unterstützt von GoogleApps direkt auf dem Gerät für Android, iOS und das WebNeueste Funktionen für die Laufzeitumgebung auf dem GerätSichere Inferenz direkt auf dem Gerät und im BrowserBeschleunigung durch GPU, DSP und WebGPU
PaddlePaddleLeistungsfähig, einfach zu bedienen und skalierbarBaidu-Ökosystem und breite AnwendungsunterstützungRasantes Wachstum, insbesondere in ChinaChinesischer Markt und SprachverarbeitungFokus auf chinesische KI-AnwendungenFokus auf Datenschutz und SicherheitEinschließlich Baidus Kunlun-Chips
MNNHohe Leistung auf MobilgerätenARM-Systeme für Mobilgeräte und eingebettete Systeme sowie X86-64-CPUCommunity für maschinelles Lernen auf Mobilgeräten und eingebetteten SystemenEffizienz auf MobilgerätenHohe Leistung und zuverlässige Wartung auf MobilgerätenSicherheitsvorteile direkt auf dem GerätOptimierungen für ARM-CPUs und GPUs
NCNNFür mobile Geräte mit ARM-Prozessoren optimiertARM-Systeme für Mobilgeräte und eingebettete SystemeKleine, aber aktive Community für maschinelles Lernen auf Mobilgeräten und eingebetteten SystemenEffizienz auf Android- und ARM-SystemenHohe Leistung und zuverlässige Wartung auf ARM-SystemenSicherheitsvorteile direkt auf dem GerätOptimierungen für ARM-CPUs und GPUs
Sony IMX500Inferenz direkt auf dem Sensor bei sehr geringem StromverbrauchSony IMX500-Sensor, Raspberry Pi AI CameraSony-AITRIOS-ÖkosystemEdge-KI direkt in der KameraUpdates für Sony SDK und MCT-ToolchainDie Daten bleiben auf dem SensorSony-IMX500-Beschleuniger auf dem Chip
Rockchip RKNNFür Rockchip-NPUs optimiertRockchip-SoC-Boards (z. B. RK3588)Rockchip-EntwicklercommunityEingebettete Einplatinencomputer und Edge-GeräteUpdates für das Rockchip RKNN-ToolkitLokale Inferenz direkt auf dem GerätRockchip NPU
ExecuTorchEffiziente PyTorch-Laufzeitumgebung direkt auf dem GerätiOS, Android und eingebettete Systeme über XNNPACKUnterstützt vom PyTorch-ProjektApps für Mobilgeräte und eingebettete SystemeParallel zu PyTorch gepflegtBei der Inferenz direkt auf dem Gerät bleiben die Daten lokalXNNPACK und CPU-/GPU-Backends für Mobilgeräte
Axelera AISehr hoher Durchsatz (bis zu 856 TOPS)Metis AIPU über PCIe oder M.2Axelera Voyager SDKEdge-Inferenz mit hohem DurchsatzAxelera-SDK-UpdatesEdge-Inferenz vor OrtAxelera Metis AIPU
DEEPXINT8-optimierte NPU-InferenzDEEPX-NPU-HardwareDEEPX-Entwicklerwerkzeuge (dx_com, dx_engine)Eingebettete Edge-InferenzUpdates für DEEPX SDK und LaufzeitumgebungLokale Inferenz direkt auf dem GerätDEEPX NPU
Qualcomm QNNSchnelle Snapdragon-Inferenz auf dem GerätSnapdragon Hexagon NPU, Adreno GPU, CPUQualcomm-AI-Hub-ÖkosystemMobile Snapdragon-Geräte und Edge-GeräteUpdates für den Qualcomm-AI-Stack (QAIRT)Bei der Inferenz direkt auf dem Gerät bleiben die Daten lokalSnapdragon Hexagon NPU
HailoINT8-HEF-Inferenz auf Hailo-NPUsHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler und HailoRTKameras, Roboter, industrielle Edge-SystemeHailo-DFC- und HailoRT-VersionenLokale Inferenz direkt auf dem GerätHailo NPU
Huawei AscendHöherer Durchsatz auf dem Ascend AI CoreAtlas-Boards und OrangePi AIProHuawei-CANN-ÖkosystemEdge-Inferenz auf Ascend-NPUsCANN- und ATC-VersionenLokale Inferenz direkt auf dem GerätAscend AI Core
AMD XilinxINT8-Inferenz auf NPUs der Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI und QuarkEingebettete Bildverarbeitung auf adaptiven SoCsVitis-AI- und Quark-VersionenLokale Inferenz direkt auf dem GerätVersal-AI-Engine-NPU

Dieser Vergleich bietet dir einen allgemeinen Überblick. Wäge für die Bereitstellung die spezifischen Anforderungen und Einschränkungen deines Projekts gegenüber den einzelnen Optionen ab und ziehe den verlinkten Integrationsleitfaden für das von dir gewählte Format heran.

Fazit#

Die große Auswahl an Exportformaten für YOLO26 ermöglicht es dir, ein Modell an nahezu jede Umgebung anzupassen – vom Cloud-GPU-Server bis zur Edge-Kamera am Sensor. Sobald du ein Format ausgewählt hast, befolge die bewährten Vorgehensweisen für die Modellbereitstellung zur Optimierung, Fehlerbehebung und Sicherheit und wende dich bei Problemen an die Ultralytics-Community.

Häufig gestellte Fragen#

  • Ultralytics YOLO26 unterstützt verschiedene Bereitstellungsformate, die jeweils für bestimmte Umgebungen und Hardwareplattformen ausgelegt sind. Zu den wichtigsten Formaten gehören:

    • PyTorch für Forschung und Prototyping mit hervorragender Python-Integration.
    • TorchScript für Produktionsumgebungen, in denen Python nicht verfügbar ist.
    • ONNX für plattformübergreifende Kompatibilität und Hardwarebeschleunigung.
    • OpenVINO für optimierte Leistung auf Intel-Hardware.
    • TensorRT für schnelle Inferenz auf NVIDIA-GPUs.

    Jedes Format bietet eigene Vorteile. Eine ausführliche Anleitung findest du in unserer Dokumentation zum Exportprozess.

  • Um die Inferenzgeschwindigkeit auf Intel-CPUs zu erhöhen, kannst du dein YOLO26-Modell mit dem OpenVINO-Toolkit von Intel bereitstellen. OpenVINO ermöglicht erhebliche Leistungssteigerungen, indem es Modelle so optimiert, dass sie Intel-Hardware effizient nutzen.

    1. Wandle dein YOLO26-Modell mit der Funktion model.export() in das OpenVINO-Format um.
    2. Folge der ausführlichen Einrichtungsanleitung in der Dokumentation zum Intel-OpenVINO-Export.

    Weitere Informationen findest du in unserem Blogbeitrag.

  • Ja, YOLO26-Modelle lassen sich mit LiteRT (früher TensorFlow Lite) und NCNN für Android sowie mit CoreML oder LiteRT für iOS auf Mobilgeräten bereitstellen. LiteRT ist Googles Laufzeitumgebung für die Ausführung auf Mobilgeräten und eingebetteten Geräten. Sie führt dasselbe Modell auf Android, iOS und im Browser aus und ermöglicht eine effiziente Inferenz direkt auf dem Gerät.

    Beispiel
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Exportbefehl für das NCNN-Format
    model.export(format="ncnn")

    Weitere Informationen zur Bereitstellung von Modellen auf Mobilgeräten findest du in unserem LiteRT-Integrationsleitfaden.

  • Berücksichtige bei der Auswahl eines Bereitstellungsformats für YOLO26 die folgenden Faktoren:

    • Leistung: Einige Formate wie TensorRT bieten außergewöhnlich hohe Geschwindigkeit auf NVIDIA-GPUs, während OpenVINO für Intel-Hardware optimiert ist.
    • Kompatibilität: ONNX bietet breite Kompatibilität mit verschiedenen Plattformen.
    • Einfache Integration: Formate wie CoreML oder LiteRT sind auf bestimmte Ökosysteme wie iOS beziehungsweise Android zugeschnitten.
    • Unterstützung durch die Community: Für Formate wie PyTorch und TensorFlow gibt es umfangreiche Ressourcen und Unterstützung aus der Community.

    Eine vergleichende Analyse findest du in unserer Dokumentation zu Exportformaten.

  • Um YOLO26-Modelle in einer Webanwendung bereitzustellen, kannst du LiteRT.js, die Web-Laufzeitumgebung von LiteRT, verwenden. Damit lassen sich Modelle für maschinelles Lernen direkt im Browser und in Node.js ausführen. Dadurch wird keine Backend-Infrastruktur benötigt und eine Leistung in Echtzeit ermöglicht.

    1. Exportiere das YOLO26-Modell in das LiteRT-Format.
    2. Integriere das exportierte Modell mit LiteRT.js in deine Webanwendung.

    Eine Schritt-für-Schritt-Anleitung findest du in unserem LiteRT-Integrationsleitfaden.

Kommentare