Beobachtetes Signal · 16. Feb. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 3/5 · Sentiment: Positiv

InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper

Zusammenfassung des Signals

SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Dieser herstellerübergreifende Multi-Node-Inference-Benchmark liefert essenzielle Erkenntnisse für die TCO von LLM-Infrastrukturen, Software-Prioritäten bei der Komposabilität und die Validierung von High-End-GPU-Deployments.

SIGNAL RADAR

Marktsignale zu NVIDIA in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • SemiAnalysis hat InferenceX v2 als Open-Source-Benchmark (Apache 2.0) für kontinuierliche Inference veröffentlicht.
  • InferenceX v2 benchmarkt knapp 1.000 GPUs über NVIDIA-SKUs (u. a. GB200/GB300 NVL72, B200, B300, Blackwell Ultra) und aktuelle AMD-SKUs (u. a. MI355X).
  • Es ist die erste Suite eines Drittanbieters, die Blackwell Ultra GB300 NVL72 über die Pareto-Frontier sowie MI355X disagg+wideEP Multi-Node FP4- und FP8-Performance testet.
  • Ergebnisse: NVIDIA Blackwell-Systeme dominieren bei großskaliger MoE disaggregated Inference und Energieeffizienz; AMD MI355X ist bei FP8-Single-Node stark, leidet aber unter Software-Limitierungen bei Komposabilität und FP4-Multi-Node.
  • Speculative Decoding bzw. MTP senkt die Kosten pro Token deutlich; dokumentiert werden Produktions-Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: SemiAnalysis•Veröffentlicht: 16. Feb. 2026
Ursprünglicher Berichttitel: “InferenceX v2: NVIDIA Blackwell Vs AMD vs Hopper - Formerly InferenceMAX”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Infrastructure31. März 2026

SemiAnalysis analysiert Nvidia Blackwell Tensor Cores auf Mikrobenchmarking-Ebene

SemiAnalysis hat eine tiefgehende Mikrobenchmarking-Studie zum Nvidia-Datencenter-Grafikprozessor Blackwell (SM100) veröffentlicht, die die Leistung von PTX- und SASS-Instruktionen für KI-Workloads untersucht. Der Bericht misst Low-Level-Verhalten und praktische Obergrenzen für tensorbezogene Primitiva wie UMMA, TMA, cp.async, LDGSTS, TMEM, DSMEM, Multicast, Cluster-Scheduling und neue 2SM-MMA-Instruktionen. Zu den empirischen Kernbefunden zählen Durchsatz- und Latenzkurven für asynchrone Kopiervorgänge und TMA, eine gemessene Die-to-Die-L2-Strafe von rund 300 Zyklen sowie form- und layoutabhängige MMA-Durchsätze. Die Autoren haben ihr Benchmarking-Repository als Open Source bereitgestellt und planen weitere Kernel-Benchmarks für Blackwell-Varianten und andere KI-Beschleuniger wie TPU Pallas, Trainium und AMD CDNA4.

Signal analysieren
Large Language Models (LLM) & AI25. Aug. 2026

Qwen3-8B-Inferenz-Benchmark und FP8-Performance auf Nvidia Blackwell

Unabhängige Benchmarks vergleichen die Inferenz-Performance von Qwen3-8B auf einer Nvidia RTX PRO 6000 Blackwell (96 GB) über drei Serving-Stacks hinweg: vLLM 0.27.1, SGLang 0.5.9 und llama.cpp CUDA. Bei einer Concurrency von 32 unter BF16 erreichte vLLM einen aggregierten Durchsatz von 1.725 Tokens/s (TTFT p50: 39 ms), SGLang 1.327 Tok/s (TTFT p50: 42 ms) und llama.cpp 428 Tok/s (TTFT p50: 316 ms). Der Einsatz eines FP8-Checkpoints unter vLLM steigerte den Durchsatz um das rund 1,5-Fache auf 2.597 Tok/s (Single-Stream: Anstieg von 86 auf 130 Tok/s) bei reduzierter Latenz und ohne messbare Qualitätseinbußen im standardisierten Faktencheck. Die Analyse dokumentiert detailliert die Methodik, Reproduktionsschritte sowie einen notwendigen sm_120-spezifischen Kernel-Workaround für FP8 auf Workstation-Blackwell-Hardware.

Signal analysieren
Infrastructure24. Aug. 2026

AgentX 1.0: Open-Source-Benchmark für agentische Inferenz

SemiAnalysis hat AgentX 1.0 und InferenceXv3 vorgestellt – einen Open-Source-Benchmark für agentische Inferenz und dessen Implementierung, ausgelegt für langkettige, mehrstufige Coding-Workloads mit bis zu 1M Kontext (Apache 2.0). Das Projekt umfasst offene Datensätze, Tools und Dashboards, nachdem über 3 Millionen US-Dollar in Traces und Testläufe auf rund 2MW über 1.000 Chips investiert wurden. AgentX initiierte bereits über 50 Upstream-Pull-Requests und plattformübergreifende Optimierungen für vLLM, SGLang, TensorRT-LLM, ATOM, LMCache, Mooncake und Dynamo. Die Ergebnisse zeigen differenzierte Anbieter-Leistungsdaten: NVIDIA dominiert bei vielen Frontier-Modellen, während AMD mit ATOM in Teilbereichen wettbewerbsfähig ist. Aktuelle Optimierungen haben zudem Preis-Leistungs-Vergleiche verschoben. Der Datensatz ist auf HuggingFace verfügbar, die Ergebnisse sind auf InferenceX einsehbar.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.