Beobachtetes Signal · 31. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
Tensor-Parallel-Inferenz stoppt an NVLink-Bandbreitengrenze
Ein technischer Benchmark analysierte die NCCL-Kollektivleistung auf einem Single-Node-System mit vier NVIDIA H100, um die Engpässe der Tensor-Parallel-Inferenz (TP) im NVLink/NVSwitch-Fabric zu ermitteln. Dabei wurden Nachrichtengrößen von 8 Byte bis 8 GB für All-Reduce, All-Gather und Reduce-Scatter getestet. Die Ergebnisse zeigen eine All-Reduce-Bus-Bandbreite von rund 366 GB/s, was etwa 77 % des unidirektionalen NVLink-Budgets pro GPU entspricht. Bei großen Nachrichten erwies sich NVLink SHARP (NVLS) als überlegen gegenüber Ring- und Tree-Algorithmen, da NVLS die Reduktionslast auf den Switch verlagert. Zudem verdeutlichte ein Protokollvergleich (Simple, LL, LL128), dass die Latenzuntergrenze bei kleinen Nachrichten den Durchsatz beim autoregressiven Decoding stark dominiert. Das entsprechende Repository und die Rohdaten sind auf GitHub veröffentlicht.
Liefert praxisnahe, reproduzierbare Messungen der NVLink/NVSwitch-Kollektivlimits auf H100-Hardware für Skalierungsentscheidungen bei LLM-Inferenz, ist jedoch keine branchenverändernde Plattformankündigung.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Benchmark durchgeführt auf einem Einzelknoten mit 4× NVIDIA H100 GPUs.
- Gemessene All-Reduce-Bus-Bandbreite von ca. 366 GB/s (entspricht rund 77 % des unidirektionalen NVLink-Budgets pro GPU).
- Getestete Kollektive: All-Reduce, All-Gather und Reduce-Scatter bei Nachrichtengrößen von 8 Byte bis 8 GB.
- Algorithmen-Ranking bei großen Nachrichten: NVLink SHARP (NVLS) > Ring > Tree; NVLS verlagert Reduktion auf den Switch.
- Protokollstudie (Simple / LL / LL128) offenbarte eine Latenzuntergrenze bei kleinen Nachrichten, die die Dekodierungsleistung bei Tensor-Parallel-Inferenz limitiert.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
NCCL: Der Motor hinter dem Multi-GPU-LLM-Training
Dieser technische Beitrag vom 17. Juni 2026 beleuchtet, wie die NVIDIA Collective Communications Library (NCCL) durch hochoptimierte GPU-Kommunikationsprimitive das effiziente, großflächige Training von LLMs ermöglicht. Der Artikel erläutert gängige Kollektivoperationen wie Broadcast, Reduce, AllReduce, AllGather und ReduceScatter, hebt den ringbasierten AllReduce-Algorithmus von NCCL sowie dessen Topologie-Erkennung (NVLink, PCIe, NUMA, InfiniBand) hervor und zeigt, wie Frameworks wie PyTorch und JAX NCCL (z. B. backend='nccl') nutzen, um Gradienten und Aktivierungen über zahlreiche GPUs hinweg zu orchestrieren. Der Autor argumentiert, dass mit wachsenden Modellgrößen die Kommunikation – und nicht nur die Rechenleistung – zum entscheidenden Flaschenhals wird, und nennt Forschungsansätze wie Gradientenkompression, Kommunikationsüberlappung, Sequenz-/Expertenparallelität und hierarchisches AllReduce zur Minderung dieses Engpasses.
InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper
SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
SemiAnalysis analysiert Nvidia Blackwell Tensor Cores auf Mikrobenchmarking-Ebene
SemiAnalysis hat eine tiefgehende Mikrobenchmarking-Studie zum Nvidia-Datencenter-Grafikprozessor Blackwell (SM100) veröffentlicht, die die Leistung von PTX- und SASS-Instruktionen für KI-Workloads untersucht. Der Bericht misst Low-Level-Verhalten und praktische Obergrenzen für tensorbezogene Primitiva wie UMMA, TMA, cp.async, LDGSTS, TMEM, DSMEM, Multicast, Cluster-Scheduling und neue 2SM-MMA-Instruktionen. Zu den empirischen Kernbefunden zählen Durchsatz- und Latenzkurven für asynchrone Kopiervorgänge und TMA, eine gemessene Die-to-Die-L2-Strafe von rund 300 Zyklen sowie form- und layoutabhängige MMA-Durchsätze. Die Autoren haben ihr Benchmarking-Repository als Open Source bereitgestellt und planen weitere Kernel-Benchmarks für Blackwell-Varianten und andere KI-Beschleuniger wie TPU Pallas, Trainium und AMD CDNA4.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
