Sparse Attention in GLM-5.3 und ihre Auswirkungen auf DRAM-Speicher
Dieser Artikel analysiert die Auswirkungen von Sparse-Attention-Mechanismen, insbesondere DeepSeek Sparse Attention (DSA), die im GLM-5.3-Modell von Z.ai verwendet werden, auf den adressierbaren Gesamtmarkt (TAM) für DRAM-Speicher, einschließlich HBM und NAND. Es wird erklärt, dass Sparse Attention zwar KV-Cache-Speicher und Bandbreite während der Attention-Operation reduziert, jedoch nicht den Gesamtspeicherbedarf, da die Top-k-Auswahl den vollständigen Kontext im HBM erfordert. Der Artikel diskutiert Systemoptimierungen wie HiSparse, das KV-Cache auf Host-DRAM auslagert, um Kapazitätsengpässe zu überwinden. Er enthält auch detaillierte Leistungs- und Kostenvergleiche für das Serving von GLM-5.3 auf verschiedenen Hardware-Plattformen (GB200, GB300, MI355X) mit Inferenz-Engines wie Dynamo-SGLang, Dynamo-TRT-LLM und ATOM, wobei Kosteneffizienz und Interaktivitäts-Kompromisse hervorgehoben werden. Die Analyse umfasst einen tiefen Einblick in die Architektur von GLM-5, einschließlich Lightning Indexer, MLA-Konfiguration und Post-Training-Pipeline.
- •GLM-5.3 verwendet DeepSeek Sparse Attention (DSA) mit einem Lightning Indexer für die Top-k-Token-Auswahl.
- •Sparse Attention reduziert den Gesamtspeicherbedarf nicht, da der vollständige Kontext im HBM benötigt wird.
- •HiSparse, ein hierarchisches Speichersystem, lagert KV-Cache auf Host-DRAM aus, um den Durchsatz bei hoher Nebenläufigkeit zu verbessern.
