Beobachtetes Signal · 16. Feb. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 3/5 · Sentiment: Positiv
InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper
SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
Dieser herstellerübergreifende Multi-Node-Inference-Benchmark liefert essenzielle Erkenntnisse für die TCO von LLM-Infrastrukturen, Software-Prioritäten bei der Komposabilität und die Validierung von High-End-GPU-Deployments.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- SemiAnalysis hat InferenceX v2 als Open-Source-Benchmark (Apache 2.0) für kontinuierliche Inference veröffentlicht.
- InferenceX v2 benchmarkt knapp 1.000 GPUs über NVIDIA-SKUs (u. a. GB200/GB300 NVL72, B200, B300, Blackwell Ultra) und aktuelle AMD-SKUs (u. a. MI355X).
- Es ist die erste Suite eines Drittanbieters, die Blackwell Ultra GB300 NVL72 über die Pareto-Frontier sowie MI355X disagg+wideEP Multi-Node FP4- und FP8-Performance testet.
- Ergebnisse: NVIDIA Blackwell-Systeme dominieren bei großskaliger MoE disaggregated Inference und Energieeffizienz; AMD MI355X ist bei FP8-Single-Node stark, leidet aber unter Software-Limitierungen bei Komposabilität und FP4-Multi-Node.
- Speculative Decoding bzw. MTP senkt die Kosten pro Token deutlich; dokumentiert werden Produktions-Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
Verknüpfte Unternehmen
7 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
SemiAnalysis analysiert Nvidia Blackwell Tensor Cores auf Mikrobenchmarking-Ebene
SemiAnalysis hat eine tiefgehende Mikrobenchmarking-Studie zum Nvidia-Datencenter-Grafikprozessor Blackwell (SM100) veröffentlicht, die die Leistung von PTX- und SASS-Instruktionen für KI-Workloads untersucht. Der Bericht misst Low-Level-Verhalten und praktische Obergrenzen für tensorbezogene Primitiva wie UMMA, TMA, cp.async, LDGSTS, TMEM, DSMEM, Multicast, Cluster-Scheduling und neue 2SM-MMA-Instruktionen. Zu den empirischen Kernbefunden zählen Durchsatz- und Latenzkurven für asynchrone Kopiervorgänge und TMA, eine gemessene Die-to-Die-L2-Strafe von rund 300 Zyklen sowie form- und layoutabhängige MMA-Durchsätze. Die Autoren haben ihr Benchmarking-Repository als Open Source bereitgestellt und planen weitere Kernel-Benchmarks für Blackwell-Varianten und andere KI-Beschleuniger wie TPU Pallas, Trainium und AMD CDNA4.
Qwen3-8B-Inferenz-Benchmark und FP8-Performance auf Nvidia Blackwell
Unabhängige Benchmarks vergleichen die Inferenz-Performance von Qwen3-8B auf einer Nvidia RTX PRO 6000 Blackwell (96 GB) über drei Serving-Stacks hinweg: vLLM 0.27.1, SGLang 0.5.9 und llama.cpp CUDA. Bei einer Concurrency von 32 unter BF16 erreichte vLLM einen aggregierten Durchsatz von 1.725 Tokens/s (TTFT p50: 39 ms), SGLang 1.327 Tok/s (TTFT p50: 42 ms) und llama.cpp 428 Tok/s (TTFT p50: 316 ms). Der Einsatz eines FP8-Checkpoints unter vLLM steigerte den Durchsatz um das rund 1,5-Fache auf 2.597 Tok/s (Single-Stream: Anstieg von 86 auf 130 Tok/s) bei reduzierter Latenz und ohne messbare Qualitätseinbußen im standardisierten Faktencheck. Die Analyse dokumentiert detailliert die Methodik, Reproduktionsschritte sowie einen notwendigen sm_120-spezifischen Kernel-Workaround für FP8 auf Workstation-Blackwell-Hardware.
AgentX 1.0: Open-Source-Benchmark für agentische Inferenz
SemiAnalysis hat AgentX 1.0 und InferenceXv3 vorgestellt – einen Open-Source-Benchmark für agentische Inferenz und dessen Implementierung, ausgelegt für langkettige, mehrstufige Coding-Workloads mit bis zu 1M Kontext (Apache 2.0). Das Projekt umfasst offene Datensätze, Tools und Dashboards, nachdem über 3 Millionen US-Dollar in Traces und Testläufe auf rund 2MW über 1.000 Chips investiert wurden. AgentX initiierte bereits über 50 Upstream-Pull-Requests und plattformübergreifende Optimierungen für vLLM, SGLang, TensorRT-LLM, ATOM, LMCache, Mooncake und Dynamo. Die Ergebnisse zeigen differenzierte Anbieter-Leistungsdaten: NVIDIA dominiert bei vielen Frontier-Modellen, während AMD mit ATOM in Teilbereichen wettbewerbsfähig ist. Aktuelle Optimierungen haben zudem Preis-Leistungs-Vergleiche verschoben. Der Datensatz ist auf HuggingFace verfügbar, die Ergebnisse sind auf InferenceX einsehbar.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
