Beobachtetes Signal · 12. Aug. 2026 · Technical Guide · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
ONNX Runtime als Portabilitätsschicht: Export, Verifizierung und Deployment
Dieser technische Leitfaden erläutert, wie ONNX als Portabilitätsschicht genutzt wird: Modelle werden exportiert (beispielsweise aus PyTorch), die numerische Äquivalenz zwischen Original und Export wird verifiziert und das Deployment erfolgt über die ONNX Runtime, wobei sichergestellt wird, dass das Modell auf der vorgesehenen Hardware läuft. Der Artikel behandelt typische Exportfallen, die Priorisierung und Erkennung von Execution Providern, Profiling zur Identifizierung von Graph-Partitionierungsgrenzen, Quantisierungsmodi (dynamisch vs. statisch) sowie SessionOptions zur Optimierung von Performance und Numerik. Zudem enthält er ausführbare Python-Snippets für Export, Strukturprüfungen, numerische Verifizierung, Provider-Inspektion, Profiling und Tuning-Optionen.
Praktischer technischer Leitfaden für Modell-Export, Verifizierung, Profiling und Quantisierung für Ingenieure im ML-Inferenz-Deployment; relevant für die Infrastruktur, stellt jedoch keine fundamentale Plattformänderung oder branchenweite Richtlinienänderung dar.
Marktsignale zu multigrid.ai in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- ONNX bietet ein einheitliches Modell-Artefakt, das über eine einzige API auf CPU, GPU und verschiedenen Beschleunigern ausgeführt werden kann, garantiert jedoch keine identischen Berechnungen wie das Originalmodell oder die tatsächliche Ausführung auf dem angeforderten Provider.
- Der Export nach ONNX kann verlustbehaftet sein: Tracing kann Kontrollflüsse einfrieren, nicht unterstützte Operatoren werden möglicherweise in Approximationen zerlegt und numerische Abweichungen können ohne Fehlermeldungen auftreten.
- Die ONNX Runtime nutzt eine geordnete Liste von Execution Providern (z. B. CUDAExecutionProvider, CPUExecutionProvider); bei Nichtverfügbarkeit erfolgt ein stillschweigender Rückfall, weshalb get_providers() aufgerufen und die Registrierung protokolliert werden sollte.
- ONNX Runtime enthält Quantisierungswerkzeuge mit zwei Modi: dynamisch (Gewichte quantisiert; Aktivierungen zur Laufzeit berechnet) und statisch (Gewichte und Aktivierungen mittels Kalibrierungsdaten quantisiert), wobei letzterer meist für rein ganzzahlige NPUs erforderlich ist.
- SessionOptions (graph_optimization_level, intra_op_num_threads, inter_op_num_threads, enable_mem_pattern) beeinflussen Inferenz-Performance und numerische Ergebnisse erheblich; das Speichern eines optimierten Graphen vermeidet wiederholte Optimierungen beim Laden.
Verknüpfte Unternehmen
6 verknüpfte Unternehmen“* [Core ML and the Apple Neural Engine: Convert, Quantise, Profile](https://multigrid.ai/learn/coreml-guide)...”
“Exporting from PyTorch...”
“ONNX Runtime ships quantisation tooling that operates on the exported graph, which means you can compress without returning to the training ...”
“* [Core ML and the Apple Neural Engine: Convert, Quantise, Profile](https://multigrid.ai/learn/coreml-guide)...”
“one artefact for a Windows desktop, a Linux server and an Android phone is a real saving....”
“sess = ort.InferenceSession( "model.onnx", providers=["CUDAExecutionProvider", "CPUExecutionProvider"], )...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Mac-Port ermöglicht lokale Ausführung von NVIDIA Nemotron Omni
NVIDIA hat mit Nemotron-3-Nano-Omni-30B-A3B ein trimodales Modell mit 30 Milliarden Parametern (Bild, Audio, Text) und öffentlich zugänglichen Gewichten veröffentlicht. Da die Audio- und Bild-Module jedoch eine multimodale Laufzeitumgebung erfordern, die auf Apple Silicon standardmäßig nicht verfügbar ist, entwickelte ein Entwickler den fehlenden Port. Dieser ermöglicht die Ausführung mittels MLX-4-Bit-Quantisierung direkt auf dem Mac. Der unter einer MIT-Lizenz auf GitHub veröffentlichte Quellcode wurde erfolgreich gegen NVIDIAs PyTorch-Referenz validiert, wobei nahezu identische Embeddings und exakte CPU-Berechnungen erzielt wurden. Die lokale Ausführung benötigt rund 22 GB und läuft stabil. Zudem deckte der Autor Schwachstellen in der NVIDIA-Referenz auf, etwa NaN-Werte bei gebatchtem Audio. Dies senkt die Hürde für datenschutzsensible On-Device-KI-Anwendungen erheblich.
Transformer-Inferenz auf CPU in drei Schritten beschleunigen
Ein Entwickler beschreibt einen dreistufigen Ansatz, um die CPU-Inferenzlatenz eines DistilBERT-Support-Ticket-Klassifizie-rers von rund 750 ms auf 280 ms zu senken, ohne die Hardware oder das Modell zu verändern. Die Optimierung umfasste: Erstens das Batching von Eingaben anstelle der Einzelverarbeitung im Forward Pass (Reduktion auf 480 ms), zweitens den Export des Modells nach ONNX mit Ausführung über ONNX Runtime (350 ms) und drittens die Anwendung einer dynamischen INT8-Quantisierung auf das ONNX-Modell (280 ms). Der Beitrag enthält Code-Beispiele für PyTorch-ONNX-Exporte, ONNX Runtime-Inferenz sowie quantize_dynamic, ergänzt durch einen FastAPI-Wrapper für batched Requests. Zudem gibt der Autor praxisnahe operative Tipps zur Wahl von Batch-Größen, der Analyse von Input-Längen und der Validierung der Vorhersagegenauigkeit nach der Quantisierung.
Android-Leitfaden für hochleistungsfähige quantisierte Modelle
Dieser technische Leitfaden erläutert, wie Android-Entwickler benutzerdefinierte, quantisierte Machine-Learning-Modelle für eine effiziente On-Device-Inferenz integrieren können. Er behandelt die Mathematik der linearen Quantisierung (Scale und Zero-Point), Abwägungen zwischen symmetrischen und asymmetrischen Schemata sowie die Vorteile der Per-Channel-Quantisierung. Der Artikel beschreibt Android-Hardwarebeschleunigungspfade (NPU, GPU, DSP), empfiehlt INT8/FP16 für NPUs/GPUs sowie DSPs für Streaming-Workloads und warnt vor Performance-Fallen wie nicht unterstützten Custom Operators, die ein CPU-Fallback verursachen. Zudem wird Googles AICore-Systemdienst (Gemeinsame Systemmodelle wie Gemini Nano, Speicher-Deduplizierung, Play System Updates, Hardware-Abstraktion) beleuchtet. Es wird eine Kotlin-basierte Architektur unter Verwendung von Hilt, Kotlin Coroutines, Kotlin Flow und TensorFlow Lite mit NNAPI/GPU-Delegates bereitgestellt. Eine Kalibrierung mit repräsentativen Datensätzen und Operator-Fusion wird empfohlen, um die Genauigkeit zu wahren.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
