Beobachtetes Signal · 9. Juni 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 3/5 · Sentiment: Positiv
DeepSeek v4: Inference-Performance und Software-Optimierungen von Tag 0 bis 43
SemiAnalysis hat mit InferenceX eine detaillierte technische Analyse der Inferenz-Performance von DeepSeek v4 Pro vom ersten Tag bis zum Tag 43 über verschiedene Beschleuniger-SKUs (darunter GB300 NVL72, Huawei Ascend 950DT, MI355X, B200/B300 und H200) veröffentlicht. Der Bericht dokumentiert den Day-0-Support für CUDA und Huawei CANN, frühe ROCm-Regressionen bei AMD sowie eine massive Durchsatzsteigerung um über das Hundertfache bis zum Tag 26. Zudem werden Kernel- und Laufzeitprobleme – wie ein TensorRT-LLM fused HC hidden-size guard –, eingereichte Pull Requests sowie zahlreiche inkrementelle Software-Optimierungen wie MTP, MegaMoE, FP4-Pfade, AITER-Kernels und die Integration von Triton, TileLang und FlyDSL beleuchtet. Die Untersuchung hebt Rack-Scale-Resultate auf GB300 NVL72 hervor, die durch Bereitstellungen von CoreWeave ermöglicht wurden, und analysiert architektonische Features sowie Effizienzgewinne bei Tokens pro Megawatt.
Der Bericht dokumentiert stackübergreifende Optimierungen für ein führendes offenes LLM und zeigt signifikante Durchsatz- sowie Effizienzsteigerungen, die die Total Cost of Ownership (TCO) und die Skalierbarkeit der Inferenz über wichtige Beschleuniger-Ökosysteme hinweg direkt beeinflussen.
Marktsignale zu Huawei in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- InferenceX (SemiAnalysis) hat die Inferenz-Performance von DeepSeek v4 Pro von Tag 0 bis Tag 43 über GPUs wie GB300 NVL72, Huawei Ascend 950DT, MI355X, B200, B300 und H200 gemessen.
- vLLM und SGLang boten native Tag-0-Unterstützung für DeepSeek v4 auf CUDA; auch Huawei CANN dokumentierte den Ascend-Support zum Start.
- Die AMD-ROCm-Performance für MI355X war anfangs schwach, verbesserte sich jedoch bis Tag 26 unter technischer Leitung um mehr als das Hundertfache.
- SemiAnalysis reichte einen PR zur Behebung eines TensorRT-LLM-Kernel-Problems ein und verwies auf nachfolgende Upstream-Patches für ein hidden-size-Guard-Problem.
- CoreWeave stellte zwei GB300 NVL72 Racks zur Verfügung, wodurch die gemessenen GB300-SGLang-Ergebnisse realisiert werden konnten.
Verknüpfte Unternehmen
8 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
DeepSeek V4: Architektonische Revolution mit Fokus auf Long-Context-Codierung erwartet
DeepSeek, ein chinesisches Open-Source-KI-Startup, plant die Veröffentlichung von DeepSeek V4 (Gerüchte-Codenamen MODEL1) zum chinesischen Neujahrsfest im Februar 2026. Code-Commits deuten auf eine grundlegende architektonische Überholung hin, die auf extreme Long-Context-Codierung und Software-Engineering-Aufgaben ausgerichtet ist. Zu den wichtigsten Innovationen gehört Engram, ein konditionales Memory-Lookup, das faktisches Abrufen von Reasoning trennt und millionenfache Token-Wissensspeicher ermöglicht. Zudem stabilisieren Manifold-Constrained Hyper-Connections (mHC) die schichtübergreifende Konnektivität, während DeepSeek Sparse Attention (DSA) Kontextfenster von über einer Million Token unterstützt. Berichten zufolge verzögerte sich das Training des R2-Modells zuvor aufgrund von Hardware-Instabilitäten bei Huawei Ascend Chips, weshalb für das finale Training wieder auf Nvidia GPUs gewechselt wurde. Diese Entwicklung unterstreicht die rasante Innovationsdynamik chinesischer Open-Weight-Modelle und wirft ein Schlaglicht auf geopolitische Lieferkettenabhängigkeiten im KI-Training.
InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper
SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.
DeepSeek-Gründer Liang Wenfeng: Rechenleistung ist der primäre Engpass
Hello China Tech veröffentlichte Auszüge aus einem fast vierstündigen Investoren-Transkript von DeepSeek-Gründer Liang Wenfeng. Darin argumentierte er, dass die Verfügbarkeit von Rechenleistung die Hauptlücke zwischen DeepSeek und führenden US-KI-Laboren darstelle. Unterschiede bei Talenten, Modellfähigkeiten und Anwendungen seien demnach nachgelagerte Konsequenzen kleinerer Compute-Budgets und limitierter Chip-Lieferketten. Liang bezifferte die erste externe Finanzierungsrunde von DeepSeek auf über 50 Milliarden RMB (ca. 7,4 Milliarden USD), was offiziell noch nicht bestätigt wurde. Zudem beschrieb er die Entwicklung des High-Level-Compilers TileLang zur Verringerung der Nvidia-Abhängigkeit und prognostizierte, dass chinesische Chips innerhalb eines Jahres für das Training verifiziert sein könnten. Weitere Themen waren Preisgestaltung, Open-Weight-Modelle, Mitarbeiterbindung durch Aktienoptionen sowie Verpflichtungen zur V4-Multimodalität.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
