Beobachtetes Signal · 31. März 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 2/5 · Sentiment: Neutral
SemiAnalysis analysiert Nvidia Blackwell Tensor Cores auf Mikrobenchmarking-Ebene
SemiAnalysis hat eine tiefgehende Mikrobenchmarking-Studie zum Nvidia-Datencenter-Grafikprozessor Blackwell (SM100) veröffentlicht, die die Leistung von PTX- und SASS-Instruktionen für KI-Workloads untersucht. Der Bericht misst Low-Level-Verhalten und praktische Obergrenzen für tensorbezogene Primitiva wie UMMA, TMA, cp.async, LDGSTS, TMEM, DSMEM, Multicast, Cluster-Scheduling und neue 2SM-MMA-Instruktionen. Zu den empirischen Kernbefunden zählen Durchsatz- und Latenzkurven für asynchrone Kopiervorgänge und TMA, eine gemessene Die-to-Die-L2-Strafe von rund 300 Zyklen sowie form- und layoutabhängige MMA-Durchsätze. Die Autoren haben ihr Benchmarking-Repository als Open Source bereitgestellt und planen weitere Kernel-Benchmarks für Blackwell-Varianten und andere KI-Beschleuniger wie TPU Pallas, Trainium und AMD CDNA4.
Liefert umsetzbare Low-Level-Leistungsmessungen für Nvidia Blackwell GPUs, die für ML-System- und Kernel-Entwickler von Bedeutung sind, jedoch für die breitere AdTech-Branche nur indirekte Relevanz besitzen.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- SemiAnalysis hat ein Open-Source-Repository für Blackwell-Mikroarchitektur-Benchmarks veröffentlicht, das PTX- und SASS-Instruktionen wie UMMA, TMA und cp.async abdeckt.
- Der Durchsatz asynchroner Kopiervorgänge saturiert bei ca. 6,6 TB/s und hat eine Basislatenz von rund 600 ns, die sich nach 8 KiB in-flight etwa verdoppelt.
- TMA skaliert auf deutlich größere Datenmengen in-flight (bis mindestens 128 KiB) und erreicht oder übertrifft den Durchsatz asynchroner Kopiervorgänge jenseits von 32 Bytes.
- Die gemessene Die-to-Die-L2-Latenzstrafe auf der getesteten B200-Hardware liegt bei etwa 300 Zyklen, wobei logische GPC- und Cluster-Mappings variieren können.
- Blackwell 2SM MMA zeigt eine nahezu perfekte schwache Skalierung (bis zu ca. 2x) gegenüber 1SM MMA, wobei M=64 etwa 50 % des theoretischen Peaks erreicht.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper
SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
GPU-Vergleich 2026: NVIDIA, AMD und Intel für KI-Workloads im Test
Eine aktuelle Analyse vergleicht Workstation- und Prosumer-GPUs für lokale LLM-Inferenz und KI-Workloads im Jahr 2026: NVIDIAs Blackwell-Architektur (RTX 50-Serie), AMDs Radeon AI Pro R9700 sowie Intels Arc Pro B70. Für reale Transformer-Inferenz erweisen sich VRAM-Kapazität, Speicherbandbreite und die Reife des Software-Ökosystems als weitaus kritischer als theoretische Spitzenwerte (AI TOPS). Die Analyse liefert konkrete VRAM-Richtwerte für gängige Modellgrößen sowie Spezifikations- und Preisvergleiche inklusive Faktoren wie Leistungsaufnahme, Thermik, Formfaktor und Multi-GPU-Setups. Im Ergebnis bleibt NVIDIA dank enormer Bandbreite und ausgereiftem CUDA/TensorRT-Stack die Benchmark für High-End-Inferenz. AMDs R9700 positioniert sich dank ROCm-Support als starkes Preis-Leistungs-Angebot für Workstations, während Intel mit der B70 eine budgetfreundliche 32-GB-Option im wachsenden oneAPI-Ökosystem bietet.
NVIDIA Vera Rubin NVL72: Inference-TCO und Architektur-Analyse
SemiAnalysis analysiert frühe Engineering-Sample-Metriken und architektonische Änderungen für NVIDIAs Vera Rubin NVL72 (Oberon SM_107) und vergleicht die Inference-Leistung sowie die Total Cost of Ownership (TCO) mit GB200- und GB300-NVL72-Baselines. Von CoreWeave unter Verwendung von DeepSeek R1 gemeldete Ergebnisse zeigen massive Gewinne pro MW und US-Dollar im Vergleich zu einer GB200-Baseline, jedoch verweist SemiAnalysis auf Benchmarking-Nuancen wie unterschiedliche Baselines, Single-Turn-Workloads und prä-produktionsreife Rack-Hardware. Rubins Architekturänderungen umfassen größere SMEM/TMEM-Konfigurationen, verdoppelten FP8/FP4-Tensor-Durchsatz, 2:4-Aktivierungssparsamkeit, einen 3-Bit-LUT-B-Tensor-Core-Dekomprimierungsmodus und 3D-gestapeltes HBM4 für eine rund 2,8-fache globale Speicherbandbreite gegenüber Blackwell. SemiAnalysis beziffert die Rubin-TCO pro GPU auf 3,57 US-Dollar im Betreibermodell gegenüber 1,84 US-Dollar für GB200 und 2,36 US-Dollar für GB300, während NVIDIA plant, bis zum dritten Quartal 2026 verifizierbare InferenceX-Zahlen vorzulegen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
