Beobachtetes Signal · 23. Juli 2026 · Technical Analysis · Quelle: SemiAnalysis · Relevanz: 4/5 · Sentiment: Positiv

NVIDIA Vera Rubin NVL72: Inference-TCO und Architektur-Analyse

Zusammenfassung des Signals

SemiAnalysis analysiert frühe Engineering-Sample-Metriken und architektonische Änderungen für NVIDIAs Vera Rubin NVL72 (Oberon SM_107) und vergleicht die Inference-Leistung sowie die Total Cost of Ownership (TCO) mit GB200- und GB300-NVL72-Baselines. Von CoreWeave unter Verwendung von DeepSeek R1 gemeldete Ergebnisse zeigen massive Gewinne pro MW und US-Dollar im Vergleich zu einer GB200-Baseline, jedoch verweist SemiAnalysis auf Benchmarking-Nuancen wie unterschiedliche Baselines, Single-Turn-Workloads und prä-produktionsreife Rack-Hardware. Rubins Architekturänderungen umfassen größere SMEM/TMEM-Konfigurationen, verdoppelten FP8/FP4-Tensor-Durchsatz, 2:4-Aktivierungssparsamkeit, einen 3-Bit-LUT-B-Tensor-Core-Dekomprimierungsmodus und 3D-gestapeltes HBM4 für eine rund 2,8-fache globale Speicherbandbreite gegenüber Blackwell. SemiAnalysis beziffert die Rubin-TCO pro GPU auf 3,57 US-Dollar im Betreibermodell gegenüber 1,84 US-Dollar für GB200 und 2,36 US-Dollar für GB300, während NVIDIA plant, bis zum dritten Quartal 2026 verifizierbare InferenceX-Zahlen vorzulegen.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Frühe Rubin-Architektur- und Benchmark-Angaben von NVIDIA beeinflussen die Inference-Leistung, Energieeffizienz und TCO für Large-Model-Deployments erheblich. Diese Entwicklungen prägen die Rechenzentrumsbeschaffung, die Wirtschaftlichkeit von Model-Deployments und das wettbewerbliche Benchmarking.

SIGNAL RADAR

Marktsignale zu NVIDIA in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Vera Rubin NVL72 ist NVIDIAs Rack-Scale-Oberon-Architektur (SM_107) der zweiten Generation.
  • CoreWeave berichtete, dass Rubin bei der Verwendung von DeepSeek R1 im Vergleich zu einer 2025er GB200-NVL72-Baseline die 5,4-fache Leistung pro MW und etwa die 5-fache Leistung pro US-Dollar liefert.
  • SemiAnalysis weist in seinem Modell eine Rubin-TCO pro GPU von 3,57 US-Dollar (Betreibereigentum) gegenüber 1,84 US-Dollar für GB200 und 2,36 US-Dollar für GB300 aus.
  • Rubin erhöht die globale Speicherbandbreite durch 3D-gestapeltes HBM4 um das ca. 2,8-fache gegenüber Blackwell Ultra und ergänzt Features wie 2:4-Aktivierungssparsamkeit und einen 3-Bit-LUT-B-Tensor-Core-Dekomprimierungsmodus.
  • NVIDIA hat Rubin-PRs in PyTorch, vLLM und den OpenAI Triton Compiler upstreaming-integriert und eine Vorschau des Rubin (SM_107) Software-Stacks mit CUDA 13.4 veröffentlicht.

Verknüpfte Unternehmen

7 verknüpfte Unternehmen

“Vera Rubin NVL72 is the second generation of Nvidia’s rack-scale Oberon architecture, and its gains on inference come from extreme co-design...”

“In this article we break down Nvidia's Rubin claims against several baselines, showing where Rubin clearly leads Blackwell and where the lea...”

“Google should submit TPUv7 results in the next couple of months, and AMD has committed to MI455X UALoE72....”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: SemiAnalysis•Veröffentlicht: 23. Juli 2026
Ursprünglicher Berichttitel: “Vera Rubin NVL72 vs GB200 NVL72? Inference TCO & Architecture Analysis”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Infrastructure14. Sept. 2026

Nvidia Rubin NVL72: Bis zu 67-fache Leistung pro Dollar bei Agentic Inference

SemiAnalysis hat erste verifizierte Benchmarks für agentenbasierte Inferenz auf Nvidias kommender Plattform Rubin NVL72 veröffentlicht. Basierend auf dem AgentX-Benchmark erzielt Rubin selbst mit früher Pre-Release-Software eine bis zu 67-mal höhere Leistung pro TCO-Dollar im Vergleich zu GB300-Systemen sowie einen massiv gesteigerten Durchsatz pro Megawatt. Unter festen Strombudget-Bedingungen prognostiziert die Analyse für Rubin gegenüber der Blackwell-Architektur ein Umsatzplus von 39 % und eine Gewinnsteigerung von 42 %; pro Gigawatt verdoppelt sich die Rentabilität nahezu. Durch dynamisches Power-Shifting (DSX MaxLPS) lässt sich zudem die GPU-Dichte pro Rechenzentrumsfläche signifikant erhöhen. Die Ergebnisse verdeutlichen Rubins Effizienzvorsprung gegenüber Modellen wie H200 und MI355X und positionieren die Plattform als künftigen Standard für kosteneffiziente Token-Generierung bei Inferenz-Providern.

Signal analysieren
Layer 1: Core IT, Operations & Foundation25. Feb. 2026

Nvidias KI-System Vera Rubin verspricht zehnfache Energieeffizienz

Nvidia hat Details zu seinem neuen Rack-Scale-KI-System Vera Rubin vorgestellt, das die Performance-pro-Watt-Effizienz im Vergleich zur Vorgängergeneration Grace Blackwell etwa verzehnfachen soll. Die Auslieferung der modularen, vollständig flüssigkeitsgekühlten Racks ist für das zweite Halbjahr 2026 geplant. Jedes Rack integriert 72 Rubin-GPUs sowie 36 Vera-CPUs und besteht aus rund 1,3 Millionen Komponenten von über 80 Zulieferern aus mehr als 20 Ländern. Das Design setzt auf Hot-Swap-fähige Superchips, um die Wartung zu vereinfachen und trotz höherer absoluter Leistungsaufnahme die Energieeffizienz drastisch zu steigern. Zu den erwarteten Kunden zählen Hyperscaler und KI-Entwickler wie OpenAI, Anthropic, Amazon, Google und Microsoft; Meta plant den Einsatz ab 2027. Während Lieferkettenrisiken bei Speicherbausteinen und Wettbewerbsdruck durch AMDs Helios-Plattform bestehen, plant Nvidia bis 2029 massive US-Fertigungskapazitäten.

Signal analysieren
Infrastructure14. Aug. 2026

NVIDIA GPU-Roadmap: Von A100 bis Vera Rubin (2026)

Dieser Artikel beleuchtet NVIDIAs aktuelle Rechenzentrum-GPU-Roadmap über vier Hauptarchitekturen hinweg – Ampere (A100), Hopper (H100/H200), Blackwell (B200/B300) und Vera Rubin (R100) – und zeigt deren Relevanz für die KI-Infrastrukturplanung auf. Zusammengefasst werden Speicher- und Interconnect-Verbesserungen (HBM2e zu HBM3/HBM3e und HBM4), neue Präzisionsformate wie FP8 und das 4-bit-Format NVFP4 sowie der Trend zu Rack-Scale-Designs (etwa NVL72 und NVL144). Der Beitrag verdeutlicht praxisnahe Beschaffungsimplikationen: Hardware gezielt an Engpässe wie Speicher oder Rechenleistung anpassen, Rechenzentren auf Strom und Kühlung auslegen, Miet- versus Kaufmodelle abwägen und Kostenberechnungen für jede Generation neu durchführen. Vera Rubin (R100) wird für das zweite Halbjahr 2026 erwartet, gefolgt von Rubin Ultra im Jahr 2027 und der neuen Architektur mit dem Codinamen Feynman für 2028.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.