Observed Signal · Sep 28, 2026 · Technical Release · Source: SemiAnalysis · Impact: 4/5 · Sentiment: Positive

GLM-5.3 Sparse Attention Impact on DRAM Memory TAM

Zusammenfassung des Signals

Dieser Artikel analysiert die Auswirkungen von Sparse-Attention-Mechanismen, insbesondere DeepSeek Sparse Attention (DSA), die im GLM-5.3-Modell von Z.ai verwendet werden, auf den adressierbaren Gesamtmarkt (TAM) für DRAM-Speicher, einschließlich HBM und NAND. Es wird erklärt, dass Sparse Attention zwar KV-Cache-Speicher und Bandbreite während der Attention-Operation reduziert, jedoch nicht den Gesamtspeicherbedarf, da die Top-k-Auswahl den vollständigen Kontext im HBM erfordert. Der Artikel diskutiert Systemoptimierungen wie HiSparse, das KV-Cache auf Host-DRAM auslagert, um Kapazitätsengpässe zu überwinden. Er enthält auch detaillierte Leistungs- und Kostenvergleiche für das Serving von GLM-5.3 auf verschiedenen Hardware-Plattformen (GB200, GB300, MI355X) mit Inferenz-Engines wie Dynamo-SGLang, Dynamo-TRT-LLM und ATOM, wobei Kosteneffizienz und Interaktivitäts-Kompromisse hervorgehoben werden. Die Analyse umfasst einen tiefen Einblick in die Architektur von GLM-5, einschließlich Lightning Indexer, MLA-Konfiguration und Post-Training-Pipeline.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Nachrichten über die Architektur großer Sprachmodelle und Inferenzoptimierung wirken sich direkt auf die KI-Infrastruktur und den Speichermarkt aus, mit detaillierter Kosten-Leistungs-Analyse, die für KI-/AdTech-Anbieter relevant ist.

SIGNAL RADAR

Marktsignale zu NVIDIA in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • GLM-5.3 verwendet DeepSeek Sparse Attention (DSA) mit einem Lightning Indexer für die Top-k-Token-Auswahl.
  • Sparse Attention reduziert den Gesamtspeicherbedarf nicht, da der vollständige Kontext im HBM benötigt wird.
  • HiSparse, ein hierarchisches Speichersystem, lagert KV-Cache auf Host-DRAM aus, um den Durchsatz bei hoher Nebenläufigkeit zu verbessern.
  • GB200 mit Dynamo-SGLang kostet 0,044 $ pro Million Gesamt-Tokens bei 150 Tokens pro Sekunde, 12 % weniger als MI355X mit ATOM.
  • GLM-5.3 auf TileRT mit MI355X erreicht die 2-fache P90-Interaktivität im Vergleich zu FP4 MI335X-Konfiguration.
Primary Source Grounding & Direct Attribution
Direct Origin Attribution
Primary Reporting: SemiAnalysis•Published: Sep 28, 2026
Original Coverage Title: “Inside GLM-5.3: How Sparse Attention Affects DRAM Memory TAM”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Infrastructure29. Sept. 2026

Samsung investiert 1 Mrd. Dollar in KI-Infrastruktur-Firma Helix

Samsung Electronics und fünf Tochtergesellschaften investieren gemeinsam 1 Milliarde US-Dollar in Helix Digital Infrastructure, ein von KKR gegründetes und von Nvidia unterstütztes KI-Infrastrukturunternehmen. Samsung Electronics steuert 500 Millionen US-Dollar bei, den Rest übernehmen Samsung C&T, Samsung SDS, Samsung SDI, Samsung Life Insurance und Samsung Fire & Marine Insurance. Helix, geführt vom ehemaligen AWS-CEO Adam Selipsky, konzentriert sich auf Hyperscale-Rechenzentren, Stromerzeugung, Übertragung und Glasfasernetze. Die Investition ergänzt die bereits zugesagten über 10 Milliarden US-Dollar anderer Investoren wie KKR, Kuwait Investment Authority, Nvidia und Vistra. Der Schritt ermöglicht es Samsung, seine Halbleiter-, Kühlungs-, Rechenzentrumsbau- und Batteriekompetenzen zu nutzen, um im KI-Infrastrukturmarkt zu expandieren.

Signal analysieren
AI Infrastructure28. Sept. 2026

Alibabas T-Head-Chips: Cloud-Kunden oder Qwen-Training?

Alibaba kündigte auf seiner Apsara-Konferenz an, dass sein neuer KI-Chip Zhenwu V900 im ersten Quartal 2027 in Massenproduktion gehen und verkauft wird, zwei Quartale früher als geplant. Dies folgt auf Huaweis Ankündigung, dass sein Ascend-960DT-Chip im ersten Quartal 2027 fertig sein wird. Beide Unternehmen sehen sich einer hohen Nachfrage und begrenzten Angebot für ihre Chips gegenüber. IDC-Daten zeigen, dass Nvidia 55 % der chinesischen Server-KI-Beschleuniger-Lieferungen hält, Huawei 20 % und T-Head 7 %. Alibaba plant, Qwen-Modelle mit 5-10 Billionen Parametern zu trainieren, hat aber nicht offengelegt, welche Chips verwendet werden, was Bedenken über Konkurrenz zwischen internem Modelltraining und zahlenden Cloud-Kunden um knappe Chip-Kapazitäten aufwirft.

Signal analysieren
AI Infrastructure21. Sept. 2026

Nscale Files for US IPO Targeting $30B Valuation

British AI infrastructure company Nscale has filed its IPO prospectus with the US SEC, aiming to list on the New York Stock Exchange under the ticker 'NSCL'. The company seeks a valuation of around $30 billion, as reported by CNBC via Reuters, a significant jump from its last private round valuation of $14.6 billion. Nscale, which transitioned from Bitcoin mining to AI compute, reported first-half 2026 revenue of $140.6 million, a 1,252% increase, but also a net loss of $1.02 billion. Its order book stands at $103.4 billion, with Microsoft and Anthropic contracts totaling $88.4 billion. The company recently secured $3.1 billion in convertible notes, with Nvidia as a key investor. Nscale faces high customer concentration, a going-concern note, and dependence on a few suppliers. Goldman Sachs, J.P. Morgan, and Morgan Stanley are lead underwriters.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.