Beobachtetes Signal · 31. März 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 2/5 · Sentiment: Neutral

SemiAnalysis analysiert Nvidia Blackwell Tensor Cores auf Mikrobenchmarking-Ebene

Zusammenfassung des Signals

SemiAnalysis hat eine tiefgehende Mikrobenchmarking-Studie zum Nvidia-Datencenter-Grafikprozessor Blackwell (SM100) veröffentlicht, die die Leistung von PTX- und SASS-Instruktionen für KI-Workloads untersucht. Der Bericht misst Low-Level-Verhalten und praktische Obergrenzen für tensorbezogene Primitiva wie UMMA, TMA, cp.async, LDGSTS, TMEM, DSMEM, Multicast, Cluster-Scheduling und neue 2SM-MMA-Instruktionen. Zu den empirischen Kernbefunden zählen Durchsatz- und Latenzkurven für asynchrone Kopiervorgänge und TMA, eine gemessene Die-to-Die-L2-Strafe von rund 300 Zyklen sowie form- und layoutabhängige MMA-Durchsätze. Die Autoren haben ihr Benchmarking-Repository als Open Source bereitgestellt und planen weitere Kernel-Benchmarks für Blackwell-Varianten und andere KI-Beschleuniger wie TPU Pallas, Trainium und AMD CDNA4.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Liefert umsetzbare Low-Level-Leistungsmessungen für Nvidia Blackwell GPUs, die für ML-System- und Kernel-Entwickler von Bedeutung sind, jedoch für die breitere AdTech-Branche nur indirekte Relevanz besitzen.

SIGNAL RADAR

Marktsignale zu NVIDIA in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • SemiAnalysis hat ein Open-Source-Repository für Blackwell-Mikroarchitektur-Benchmarks veröffentlicht, das PTX- und SASS-Instruktionen wie UMMA, TMA und cp.async abdeckt.
  • Der Durchsatz asynchroner Kopiervorgänge saturiert bei ca. 6,6 TB/s und hat eine Basislatenz von rund 600 ns, die sich nach 8 KiB in-flight etwa verdoppelt.
  • TMA skaliert auf deutlich größere Datenmengen in-flight (bis mindestens 128 KiB) und erreicht oder übertrifft den Durchsatz asynchroner Kopiervorgänge jenseits von 32 Bytes.
  • Die gemessene Die-to-Die-L2-Latenzstrafe auf der getesteten B200-Hardware liegt bei etwa 300 Zyklen, wobei logische GPC- und Cluster-Mappings variieren können.
  • Blackwell 2SM MMA zeigt eine nahezu perfekte schwache Skalierung (bis zu ca. 2x) gegenüber 1SM MMA, wobei M=64 etwa 50 % des theoretischen Peaks erreicht.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: SemiAnalysis•Veröffentlicht: 31. März 2026
Ursprünglicher Berichttitel: “Dissecting Nvidia Blackwell - Tensor Cores, PTX Instructions, SASS, Floorsweep, Yield”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI16. Feb. 2026

InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper

SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.

Signal analysieren
Large Language Models (LLM) & AI14. Juli 2026

GPU-Vergleich 2026: NVIDIA, AMD und Intel für KI-Workloads im Test

Eine aktuelle Analyse vergleicht Workstation- und Prosumer-GPUs für lokale LLM-Inferenz und KI-Workloads im Jahr 2026: NVIDIAs Blackwell-Architektur (RTX 50-Serie), AMDs Radeon AI Pro R9700 sowie Intels Arc Pro B70. Für reale Transformer-Inferenz erweisen sich VRAM-Kapazität, Speicherbandbreite und die Reife des Software-Ökosystems als weitaus kritischer als theoretische Spitzenwerte (AI TOPS). Die Analyse liefert konkrete VRAM-Richtwerte für gängige Modellgrößen sowie Spezifikations- und Preisvergleiche inklusive Faktoren wie Leistungsaufnahme, Thermik, Formfaktor und Multi-GPU-Setups. Im Ergebnis bleibt NVIDIA dank enormer Bandbreite und ausgereiftem CUDA/TensorRT-Stack die Benchmark für High-End-Inferenz. AMDs R9700 positioniert sich dank ROCm-Support als starkes Preis-Leistungs-Angebot für Workstations, während Intel mit der B70 eine budgetfreundliche 32-GB-Option im wachsenden oneAPI-Ökosystem bietet.

Signal analysieren
Large Language Models (LLM) & AI23. Juli 2026

NVIDIA Vera Rubin NVL72: Inference-TCO und Architektur-Analyse

SemiAnalysis analysiert frühe Engineering-Sample-Metriken und architektonische Änderungen für NVIDIAs Vera Rubin NVL72 (Oberon SM_107) und vergleicht die Inference-Leistung sowie die Total Cost of Ownership (TCO) mit GB200- und GB300-NVL72-Baselines. Von CoreWeave unter Verwendung von DeepSeek R1 gemeldete Ergebnisse zeigen massive Gewinne pro MW und US-Dollar im Vergleich zu einer GB200-Baseline, jedoch verweist SemiAnalysis auf Benchmarking-Nuancen wie unterschiedliche Baselines, Single-Turn-Workloads und prä-produktionsreife Rack-Hardware. Rubins Architekturänderungen umfassen größere SMEM/TMEM-Konfigurationen, verdoppelten FP8/FP4-Tensor-Durchsatz, 2:4-Aktivierungssparsamkeit, einen 3-Bit-LUT-B-Tensor-Core-Dekomprimierungsmodus und 3D-gestapeltes HBM4 für eine rund 2,8-fache globale Speicherbandbreite gegenüber Blackwell. SemiAnalysis beziffert die Rubin-TCO pro GPU auf 3,57 US-Dollar im Betreibermodell gegenüber 1,84 US-Dollar für GB200 und 2,36 US-Dollar für GB300, während NVIDIA plant, bis zum dritten Quartal 2026 verifizierbare InferenceX-Zahlen vorzulegen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.