Ultralytics YOLO27:

Vergleichende Analyse der Bereitstellungsoptionen für YOLO26#

YOLO26 unterstützt mehr als 20 Bereitstellungsoptionen, die jeweils auf eine andere Laufzeitumgebung, ein anderes Hardwareziel oder eine andere Plattform abgestimmt sind – von PyTorch und ONNX bis zu TensorRT, OpenVINO, CoreML und speziellen Formaten für Edge-NPUs. Die Wahl der richtigen Option erfordert eine Abwägung zwischen Inferenzgeschwindigkeit, Hardwareeinschränkungen und einfacher Integration. Dieser Leitfaden vergleicht alle Optionen, damit du die beste Lösung für deine Anwendung auswählen und anschließend mit den Best Practices für die Modellbereitstellung fortfahren kannst, um das Modell zuverlässig bereitzustellen.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Die Bereitstellung ist die Phase im Workflow eines Computer-Vision-Projekts, in der ein trainiertes Modell mit der eigentlichen Arbeit beginnt. Daher wirkt sich das Exportformat direkt auf Geschwindigkeit, Kosten und Portierbarkeit aus.

So wählst du die richtige Bereitstellungsoption für dein YOLO26-Modell aus#

Wenn es Zeit ist, dein YOLO26-Modell bereitzustellen, ist die Auswahl eines geeigneten Exportformats besonders wichtig. Wie in der Exportdokumentation zu Ultralytics YOLO26 beschrieben, wandelt die Funktion model.export() dein trainiertes Modell in verschiedene Formate um, die auf unterschiedliche Umgebungen und Leistungsanforderungen zugeschnitten sind.

Das ideale Format hängt vom vorgesehenen Einsatzkontext deines Modells und von der Hardware ab.

Manuellen Export überspringen

Für eine verwaltete Bereitstellung ohne manuellen Export bietet die Ultralytics Platform sofort einsatzbereite Inferenzendpunkte mit automatischer Skalierung in 42 Regionen weltweit.

Bereitstellungsoptionen für YOLO26#

Hier findest du eine kurze Beschreibung jedes Formats und Hinweise dazu, wann du es einsetzen solltest. Eine vollständige Anleitung zum Export findest du in der Exportdokumentation; die Kriterien im direkten Vergleich enthält die Vergleichstabelle.

  • PyTorch (.pt): Das native Format für Training und Inferenz bietet maximale Flexibilität und GPU-Beschleunigung durch NVIDIA CUDA oder AMD ROCm – ideal für Forschung und Prototyping, da kein Exportschritt erforderlich ist.
  • TorchScript (torchscript): Serialisiert das Modell für eine C++-Laufzeitumgebung ohne Python und eignet sich für Produktionssysteme, in denen Python nicht verfügbar ist.
  • ONNX (onnx): Ein frameworkunabhängiges Austauschformat mit umfassender plattform- und hardwareübergreifender Unterstützung durch ONNX Runtime.
  • OpenVINO (openvino): Intels Toolkit für optimierte Inferenz auf Intel-CPUs, integrierten GPUs und NPUs, das häufig im IoT- und Edge-Computing eingesetzt wird.
  • TensorRT (engine): Die Hochleistungs-Laufzeitumgebung von NVIDIA liefert erstklassige GPU-Inferenz mit FP16- und INT8-Optimierung.
  • CoreML (coreml): Apples On-Device-Format für iOS, macOS, watchOS und tvOS, das die Apple Neural Engine verwendet.
  • TF SavedModel (saved_model): Das Standardformat von TensorFlow für skalierbares serverseitiges Bereitstellen mit TensorFlow Serving.
  • TF GraphDef (pb): Ein eingefrorenes statisches TensorFlow-Graphformat für Umgebungen, die einen unveränderlichen Berechnungsgraphen benötigen.
  • TF Edge TPU (edgetpu): Kompiliert .tflite-Modelle für Google Coral Edge-TPU-Beschleuniger.
  • LiteRT (litert): Googles On-Device-Laufzeitumgebung (früher TensorFlow Lite) für Inferenz auf Mobilgeräten, eingebetteten Systemen und im Browser aus einem einzigen .tflite-Modell, mit FP32- und INT8-Unterstützung sowie Ausführung im Browser über LiteRT.js.
  • PaddlePaddle (paddle): Das in China beliebte Deep-Learning-Framework von Baidu mit umfassender Hardwareunterstützung.
  • MNN (mnn): Eine schlanke, leistungsstarke Inferenz-Engine, optimiert für mobile und eingebettete ARM- und x86-64-Systeme.
  • NCNN (ncnn): Ein leistungsstarkes, schlankes Inferenz-Framework, das auf mobile ARM-Geräte abgestimmt ist.
  • Sony IMX500 (imx): Exportiert Modelle für Sonys intelligenten Bildsensor IMX500 mit Verarbeitung auf dem Chip, etwa für die Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Richtet sich an Rockchip-NPUs auf eingebetteten Boards mit FP16- und INT8-Quantisierung.
  • ExecuTorch (executorch): PyTorches native On-Device-Laufzeitumgebung für mobile Geräte (iOS und Android) und eingebettete Systeme über XNNPACK.
  • Axelera AI (axelera): Kompiliert für Axelera Metis AIPU (bis zu 856 TOPS) über PCIe oder M.2 und ermöglicht eine hochdurchsatzfähige Edge-Inferenz.
  • DEEPX (deepx): Richtet sich an DEEPX-NPU-Hardware mit INT8-Quantisierung für eingebettete Edge-Inferenz.
  • Qualcomm QNN (qnn): On-Device-Inferenz auf Snapdragon Hexagon NPU, Adreno GPU und CPU über den Qualcomm-AI-Stack.
  • Core AI (coreai): Apples neues .aimodel-Format für iOS 27 und macOS 27, geplant für CPU, GPU und Apple Neural Engine; der Export erfordert macOS 26 oder neuer auf Apple Silicon.

Die Hailo-Integration exportiert YOLO-Modelle für Objekterkennung, Segmentierung, semantische Segmentierung, Tiefenschätzung, Klassifizierung, Pose und OBB direkt in Hailo HEF. In der Kompatibilitätstabelle findest du validierte Modelle und Zielplattformen. Die Ambarella-Integration folgt einem ONNX-zentrierten Workflow und kompiliert ONNX-Exporte mit Ambarellas CVflow-Toolchain für CVflow®-SoCs wie den CV72 in das AmbaPB-Format; optional kann dabei SpongeTorch für komprimierungsbewusstes Training verwendet werden. Die Huawei-Ascend-Integration kompiliert ONNX-Exporte mit dem CANN-ATC-Compiler in das Offline-Format .om für FP16-Inferenz auf Ascend AI Processors.

Bereitstellungsoptionen im Vergleich#

Die folgende Tabelle fasst die Bereitstellungsoptionen für YOLO26-Modelle anhand der Kriterien zusammen, die üblicherweise die Auswahl bestimmen. Eine ausführliche Betrachtung jedes Formats findest du in der Dokumentation zu Exportformaten.

BereitstellungsoptionLeistungsbenchmarksKompatibilität und IntegrationCommunity-Unterstützung und ÖkosystemFallstudienWartung und AktualisierungenSicherheitsaspekteHardwarebeschleunigung
PyTorchGute Flexibilität, möglicherweise auf Kosten der RohleistungHervorragend mit Python-BibliothekenUmfangreiche Ressourcen und CommunityForschung und PrototypenRegelmäßige, aktive WeiterentwicklungAbhängig von der BereitstellungsumgebungCUDA-Unterstützung für GPU-Beschleunigung
TorchScriptBesser für die Produktion geeignet als PyTorchReibungsloser Übergang von PyTorch zu C++Spezialisierter, aber enger gefasst als PyTorchBranchen, in denen Python ein Engpass istKonsistente Aktualisierungen zusammen mit PyTorchVerbesserte Sicherheit ohne vollständiges PythonÜbernimmt die CUDA-Unterstützung von PyTorch
ONNXJe nach Laufzeitumgebung unterschiedlichHoch über verschiedene Frameworks hinwegBreites Ökosystem, von vielen Organisationen unterstütztFlexibilität über verschiedene ML-Frameworks hinwegRegelmäßige Aktualisierungen für neue OperationenAchte auf sichere Verfahren für Konvertierung und BereitstellungVerschiedene Hardwareoptimierungen
OpenVINOFür Intel-Hardware optimiertAm besten innerhalb des Intel-ÖkosystemsStark im Bereich Computer VisionIoT und Edge mit Intel-HardwareRegelmäßige Aktualisierungen für Intel-HardwareRobuste Funktionen für sensible AnwendungenAuf Intel-Hardware zugeschnitten
TensorRTErstklassige Leistung auf NVIDIA-GPUsAm besten für NVIDIA-Hardware geeignetStarkes Netzwerk durch NVIDIAEchtzeitinferenz für Videos und BilderHäufige Aktualisierungen für neue GPUsSicherheitsfokusFür NVIDIA-GPUs entwickelt
CoreMLFür On-Device-Hardware von Apple optimiertExklusiv für das Apple-ÖkosystemStarke Unterstützung durch Apple und die Entwickler-CommunityOn-Device-ML auf Apple-ProduktenRegelmäßige Aktualisierungen von AppleFokus auf Datenschutz und SicherheitApple Neural Engine und GPU
TF SavedModelSkalierbar in ServerumgebungenBreite Kompatibilität im TensorFlow-ÖkosystemUmfangreiche Unterstützung aufgrund der Beliebtheit von TensorFlowModelle in großem Maßstab bereitstellenRegelmäßige Aktualisierungen durch Google und die CommunityRobuste Funktionen für UnternehmenVerschiedene Hardwarebeschleunigungen
TF GraphDefStabil für statische BerechnungsgraphenGute Integration in die TensorFlow-InfrastrukturRessourcen zur Optimierung statischer GraphenSzenarien, die statische Graphen erfordernAktualisierungen parallel zum TensorFlow-KernBewährte TensorFlow-SicherheitsverfahrenOptionen zur TensorFlow-Beschleunigung
TF Edge TPUFür die Edge-TPU-Hardware von Google optimiertExklusiv für Edge-TPU-GeräteWachsende Unterstützung durch Ressourcen von Google und DrittanbieternIoT-Geräte, die Echtzeitverarbeitung benötigenVerbesserungen für neue Edge-TPU-HardwareRobuste IoT-Sicherheit von GoogleSpeziell für Google Coral entwickelt
LiteRTGeschwindigkeit und Effizienz auf Mobilgeräten, eingebetteten Geräten und im WebUnterstützung für Mobilgeräte, eingebettete Systeme, Edge-Geräte und BrowserStarke Community, unterstützt von GoogleOn-Device-Apps für Android, iOS und das WebAktuelle Funktionen der On-Device-LaufzeitumgebungSichere Inferenz auf dem Gerät und im BrowserBeschleunigung durch GPU, DSP und WebGPU
PaddlePaddleLeistungsfähig, einfach zu verwenden und skalierbarBaidu-Ökosystem und breite Unterstützung für AnwendungenSchnell wachsend, insbesondere in ChinaChinesischer Markt und SprachverarbeitungFokus auf chinesische KI-AnwendungenLegt Wert auf Datenschutz und SicherheitEinschließlich der Kunlun-Chips von Baidu
MNNHohe Leistung auf MobilgerätenMobile und eingebettete ARM-Systeme sowie X86-64-CPUCommunity für ML auf Mobilgeräten und in eingebetteten SystemenEffizienz auf mobilen SystemenHohe Leistung und gute Wartbarkeit auf MobilgerätenSicherheitsvorteile durch die Verarbeitung auf dem GerätOptimierungen für ARM-CPUs und GPUs
NCNNFür mobile Geräte mit ARM-Architektur optimiertMobile und eingebettete ARM-SystemeKleine, aber aktive ML-Community für mobile und eingebettete SystemeEffizienz auf Android- und ARM-SystemenHohe Leistung und gute Wartbarkeit auf ARMSicherheitsvorteile durch die Verarbeitung auf dem GerätOptimierungen für ARM-CPUs und GPUs
Sony IMX500Inferenz auf dem Sensor bei sehr geringem EnergieverbrauchSony IMX500-Sensor, Raspberry Pi AI CameraSony-AITRIOS-ÖkosystemEdge-KI direkt auf der KameraAktualisierungen für Sony SDK und MCT-ToolchainDie Daten bleiben auf dem SensorOn-Chip-Beschleuniger des Sony IMX500
Rockchip RKNNFür Rockchip-NPUs optimiertRockchip-SoC-Boards (z. B. RK3588)Rockchip-Entwickler-CommunityEingebettete SBCs und Edge-GeräteAktualisierungen für das Rockchip RKNN-ToolkitLokale Inferenz auf dem GerätRockchip-NPU
ExecuTorchEffiziente PyTorch-Laufzeitumgebung für die Ausführung auf dem GerätiOS, Android und eingebettete Systeme über XNNPACKUnterstützt durch das PyTorch-ProjektMobile und eingebettete AnwendungenParallel zu PyTorch gepflegtDie Inferenz auf dem Gerät hält die Daten lokalXNNPACK sowie CPU- und GPU-Backends für Mobilgeräte
Axelera AISehr hoher Durchsatz (bis zu 856 TOPS)Metis AIPU über PCIe oder M.2Axelera Voyager SDKEdge-Inferenz mit hohem DurchsatzAktualisierungen für das Axelera SDKLokale Edge-InferenzAxelera Metis AIPU
DEEPXFür INT8 optimierte NPU-InferenzDEEPX-NPU-HardwareDEEPX-Entwicklerwerkzeuge (dx_com, dx_engine)Eingebettete Edge-InferenzAktualisierungen für DEEPX SDK und LaufzeitumgebungLokale Inferenz auf dem GerätDEEPX-NPU
Qualcomm QNNSchnelle Snapdragon-Inferenz auf dem GerätSnapdragon Hexagon NPU, Adreno GPU, CPUQualcomm-AI-Hub-ÖkosystemMobile Snapdragon-Geräte und Snapdragon-Edge-GeräteAktualisierungen für den Qualcomm-AI-Stack (QAIRT)Die Inferenz auf dem Gerät hält die Daten lokalSnapdragon Hexagon NPU
HailoINT8-HEF-Inferenz auf Hailo-NPUsHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler und HailoRTKameras, Roboter, industrielle Edge-SystemeHailo-DFC- und HailoRT-ReleasesLokale Inferenz auf dem GerätHailo NPU
Huawei AscendHöherer Durchsatz auf dem Ascend AI CoreAtlas-Boards und OrangePi AIProHuawei-CANN-ÖkosystemEdge-Inferenz auf Ascend-NPUsCANN- und ATC-ReleasesLokale Inferenz auf dem GerätAscend AI Core
Core AIOptimiert für Apple SiliconiOS 27 und macOS 27; Export erfordert macOS 26+Apple-Framework; noch nicht in iOS-/Flutter-SDKs enthaltenOn-Device-ML auf Apple-Plattformen der nächsten GenerationAn Apple-Betriebssystem-Releases gekoppelt; derzeit in der BetaDie Inferenz auf dem Gerät hält die Daten lokalApple Neural Engine, GPU und CPU

Dieser Vergleich gibt dir einen Überblick auf hoher Ebene. Berücksichtige bei der Bereitstellung die spezifischen Anforderungen und Einschränkungen deines Projekts für jede Option und ziehe den verlinkten Integrationsleitfaden für das von dir gewählte Format zurate.

Fazit#

Die große Auswahl an Exportformaten von YOLO26 ermöglicht es dir, ein Modell für nahezu jede Umgebung anzupassen – von einem Cloud-GPU-Server bis zu einer Edge-Kamera mit Inferenz auf dem Sensor. Nachdem du ein Format ausgewählt hast, befolge die Best Practices für die Modellbereitstellung zur Optimierung, Fehlerbehebung und Sicherheit und wende dich an die Ultralytics-Community, wenn du nicht weiterkommst.

FAQ#

  • Ultralytics YOLO26 unterstützt verschiedene Bereitstellungsformate, die jeweils für bestimmte Umgebungen und Hardwareplattformen entwickelt wurden. Zu den wichtigsten Formaten gehören:

    • PyTorch für Forschung und Prototyping mit hervorragender Python-Integration.
    • TorchScript für Produktionsumgebungen, in denen Python nicht verfügbar ist.
    • ONNX für plattformübergreifende Kompatibilität und Hardwarebeschleunigung.
    • OpenVINO für optimierte Leistung auf Intel-Hardware.
    • TensorRT für schnelle Inferenz auf NVIDIA-GPUs.

    Jedes Format bietet eigene Vorteile. Eine ausführliche Anleitung findest du in unserer Dokumentation zum Exportprozess.

  • Um die Inferenzgeschwindigkeit auf Intel-CPUs zu erhöhen, kannst du dein YOLO26-Modell mit Intels OpenVINO-Toolkit bereitstellen. OpenVINO ermöglicht deutliche Leistungssteigerungen, indem es Modelle für eine effiziente Nutzung der Intel-Hardware optimiert.

    1. Konvertiere dein YOLO26-Modell mithilfe der Funktion model.export() in das OpenVINO-Format.
    2. Befolge die ausführliche Einrichtungsanleitung in der Dokumentation zum Intel-OpenVINO-Export.

    Weitere Informationen findest du in unserem Blogbeitrag.

  • Ja, YOLO26-Modelle können auf mobilen Geräten mit LiteRT (früher TensorFlow Lite) und NCNN für Android sowie CoreML oder LiteRT für iOS bereitgestellt werden. LiteRT ist Googles Laufzeitumgebung für Geräte für mobile und eingebettete Geräte und führt dasselbe Modell unter Android, iOS und im Browser aus, wodurch eine effiziente Inferenz direkt auf dem Gerät ermöglicht wird.

    Beispiel
    # Export command for NCNN format
    model.export(format="ncnn")

    Weitere Informationen zur Bereitstellung von Modellen auf mobilen Geräten findest du in unserem LiteRT-Integrationsleitfaden.

  • Berücksichtige bei der Auswahl eines Bereitstellungsformats für YOLO26 die folgenden Faktoren:

    • Leistung: Einige Formate wie TensorRT bieten außergewöhnliche Geschwindigkeiten auf NVIDIA-GPUs, während OpenVINO für Intel-Hardware optimiert ist.
    • Kompatibilität: ONNX bietet umfassende Kompatibilität über verschiedene Plattformen hinweg.
    • Einfache Integration: Formate wie CoreML oder LiteRT sind auf bestimmte Ökosysteme wie iOS beziehungsweise Android zugeschnitten.
    • Unterstützung durch die Community: Formate wie PyTorch und TensorFlow verfügen über umfangreiche Ressourcen und Unterstützung durch die Community.

    Eine vergleichende Analyse findest du in unserer Dokumentation zu Exportformaten.

  • Für die Bereitstellung von YOLO26-Modellen in einer Webanwendung kannst du LiteRT.js, die Web-Laufzeitumgebung von LiteRT, verwenden. Damit lassen sich Modelle für maschinelles Lernen direkt im Browser und in Node.js ausführen. Dieser Ansatz macht eine Backend-Infrastruktur überflüssig und ermöglicht eine Leistung in Echtzeit.

    1. Exportiere das YOLO26-Modell in das LiteRT-Format.
    2. Integriere das exportierte Modell mit LiteRT.js in deine Webanwendung.

    Eine Schritt-für-Schritt-Anleitung findest du in unserem LiteRT-Integrationsleitfaden.

Kommentare