Beobachtetes Signal · 9. Sept. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 3/5 · Sentiment: Positiv
Roboter-KI-Inferenz: Die Abwägung zwischen On-Device- und Rechenzentrum-Compute
Diese Analyse untersucht die Rechenarchitektur für embodied AI und vergleicht On-Device-Inferenz wie NVIDIA Jetson Thor mit roboterexterner Rechenzentrumsinferenz für Generalist Robot Models. Zu den wichtigsten Kompromissen zählen Echtzeit-Latenz, Kosten und Siliziumeffizienz. Während On-Device-Compute Determinismus garantiert, limitiert es die Modellgröße; das Auslagern ermöglicht größere Modelle, erzeugt jedoch Netzwerk-Latenz und Sicherheitsprobleme. Der Artikel argumentiert, dass eine hybride Kaskade unvermeidlich ist, bei der hierarchische Modelle schwere Planungsaufgaben in die Cloud verlagern und schnelle Aktionsebenen lokal ausführen. Beispiele umfassen Figure mit Helix on-robot, Physical Intelligence mit π0.7 off-robot auf H100 sowie Boston Dynamics mit Onboard-Jetson-Thor und Google TPUs off-robot. Benchmarks zeigen, dass die Auslagerung auf eine B300 etwa 46 % der On-Device-TCO pro PFLOP bei 40 % Auslastung liefert und eine B300 sieben Roboter mit einer p99-Latenz von 1,16 Sekunden bedienen kann. Dennoch bleibt die Netzwerk-Hürde die zentrale Herausforderung.
Der Artikel liefert eine detaillierte technische Analyse von KI-Inferenzarchitekturen für Robotik, einem sich rasant entwickelnden Sektor mit erheblichen Auswirkungen auf Edge- versus Cloud-Compute und die NVIDIA-Strategie. Er beeinflusst direkt Infrastrukturentscheidungen im KI-Bereich und das breitere Tech-Ökosystem.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Frontier-Robotermodelle umfassen 5 bis 14 Milliarden Parameter (π0.7, DreamZero); Jetson Thor bietet rund 1/10 der Rechenleistung einer B200 und ca. 1/14 einer B300.
- Das Auslagern auf eine geteilte B300-GPU bedient bis zu 7 Roboter zu 0,17 USD/Std./PFLOP gegenüber On-Device Jetson Thor mit 0,37 USD/Std./PFLOP (40 % Auslastung) und erreicht ~46 % der On-Device-TCO.
- Boston Dynamics teilt seinen Stack auf: System 1 läuft Onboard auf Jetson Thor, System 2 läuft roboterextern auf Google TPUs über eine DeepMind-Partnerschaft.
- On-Device-Compute kreuzt die Siliziumeffizienz bei ca. 7 Robotern pro GPU und ca. 5 Robotern pro GPU bei der DRAM-Effizienz; für größere Flotten wird die Auslagorung bevorzugt.
- Netzwerk-Jitter und Funklöcher sind kritische Probleme: Sunday Robotics verlagerte die Inferenz nach WLAN-Tests im Heimbeobachtungsbereich wieder Onboard.
Verknüpfte Unternehmen
6 verknüpfte Unternehmen“NVIDIA’s DreamZero, a 14-billion-parameter “world action model” built on a video-diffusion backbone, needs two GB200 GPUs off-robot just to ...”
“The biggest robot model builders today, like NVIDIA and Google DeepMind, will lean toward this cloud approach....”
“The biggest robot model builders today, like NVIDIA and Google DeepMind, will lean toward this cloud approach....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Modellierung verteilter KI-Inferenz über Millionen von Haushalten
Der Autor stellt HEARTH vor, eine Machbarkeitsstudie zur Modellierung einer verteilten KI-Inferenz-Flotte aus handelsüblichen Rechengeräten in privaten Haushalten. Nach fünf Modellierungsdurchläufen ist das Kernfazit klar umrissen: Residential Hosting kann nur für kleine Single-Node-Inferenz-Workloads (z. B. quantisierte 8B-Modelle) unter bestimmten Annahmen zu Beschleunigerpreisen, Batching, Auslastung, Stromkosten und Hosting-Vereinbarungen wettbewerbsfähig sein. Das Whitepaper hebt fünf Bedingungen hervor, die erfüllt sein müssen (Hardware-Lizenzierung, gebenchmarkte Serving-Performance, anhaltende Nachfrage, Energiewirtschaft und Netzbetreiber-Genehmigung), und empfiehlt Labortests sowie die Klärung von Lizenzfragen vor jedem Praxistest. Die Studie verweist auf ihren vollständigen Bericht, das Quellmodell und externe Datenquellen wie Berkeley Lab, ERCOT und NVIDIA.
KI: Vom Inferenz-Zeitalter zur Orchestrierungs-Ära
Der Artikel argumentiert, dass sich mit der Reifung agentischer KI-Systeme der Leistungsengpass von der Modellinferenz zur Orchestrierung verlagert hat – also der Rechenarbeit zwischen den Modellschritten wie Tool-Aufrufen, Zustandsverwaltung, Retrieval und Ergebnisverarbeitung. Hervorgehoben werden NVIDIAs Vera CPU, die speziell zur Beschleunigung des agentischen Durchsatzes entwickelt wurde, sowie ein latent-diffusionsbasiertes Multiplayer-Interaktives-Weltmodell mit 5 Milliarden Parametern. Zudem werden diverse Open-Source- und Plattform-Entwicklungen beleuchtet, darunter Rowboat (ein lokal ausgerichteter Desktop-KI-Kollege), Amazons Reverse DPO für selektives Unlearning, SenseNova-Vision sowie die Integration von MiniMax-Modellen in Amazon Bedrock. Diese Entwicklungen signalisieren, dass Infrastruktur, Anwendungen und Forschung zunehmend auf die Optimierung der Orchestrierungsschicht in mehrstufigen KI-Workflows konvergieren.
Nvidia über Physische KI, Jetson, Simulation und Agenten
Deepu Talla, VP und GM bei Nvidia, erläutert die Plattform des Unternehmens für physische KI und Robotik und beschreibt ein Modell aus drei Computern: Rechenzentrum-Training (GB300, Vera Rubin), Simulation (RTX Pro 6000, Omniverse) und Edge-Runtime (Jetson Thor, Orin). Laut Talla entwickeln derzeit rund 2,5 Millionen Entwickler und über 10.000 Unternehmen auf Basis von Jetson, während die Industrie jährlich etwa eine bis zwei Millionen Roboter ausliefert – bei einem von Nvidia auf Dutzende Milliarden geschätzten Marktpotenzial. Zu den Kern Themen gehören Vision-Language-Action-Modelle, die Überbrückung der Sim-to-Real-Lücke mittels Omniverse und der Open-Source-Physik-Engine Newton, hybride Edge-Cloud-Architekturen, agentische Orchestrierung für Roboterflotten sowie der aktuelle Branchenfokus auf Training und Simulation.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
