Beobachtetes Signal · 10. Aug. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 3/5 · Sentiment: Positiv
TileRT ermöglicht ultrahohe Interaktivität auf NVIDIA GPUs
SemiAnalysis berichtet über TileRT, einen persistenten Engine-Ansatz, der einen vollständigen Decode-Graphen auf NVIDIA GPUs in einen einzigen residenten Kernel kompiliert, um die Latenz pro Token drastisch zu senken. In InferenceX-Benchmarks erreichte TileRT auf einem einzelnen B200 Decode-Server bis zu 500 Tokens/s/user (GLM5 FP8 744B) und lieferte massive Leistungssteigerungen gegenüber traditionellen GPU-Inference-Engines. TileRT wurde für latenzsensitives Decoding entwickelt und bleibt gleichzeitig mit durchsatzoptimierten Prefill-Engines wie vLLM interoperabel. Die Technologie ist bei Xiaomi und Z.ai bereits im Produktiveinsatz, unterstützt aktuell jedoch nur einen kleinen Modellkatalog und ist primär auf Batch-Size-1-Workloads ausgelegt, was den Zielkonflikt zwischen maximaler Interaktivität pro Nutzer und aggregiertem Durchsatz verdeutlicht.
Ansätze zur signifikanten Reduzierung der GPU-Latenz pro Nutzer beeinflussen die Wirtschaftlichkeit von LLM-Infrastrukturen und die Kapazitätsplanung für KI-Dienste maßgeblich.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- TileRT kompiliert den gesamten Decode-Graphen statisch in einen einzigen persistenten Kernel auf NVIDIA GPUs, um die Überlappung von Compute, Memory und Kommunikation zu maximieren.
- Im InferenceX-Benchmark erreichte TileRT bis zu 500 Tokens/s/user auf einem einzelnen B200 Decode-Server (GLM5 FP8 744B) – etwa dreimal schneller als herkömmliche Engines.
- Auf einem Acht-GPU-B200-Node erzielte TileRT 340 Tokens/s/user (8k/1k-Szenario) und im 1k/1k-Szenario bis zu 494,2 Tokens/s/user.
- TileRT ist bei Xiaomi (MiMo V2.5 Pro UltraSpeed) und Z.ai (GLM-5.1 HighSpeed) produktiv im Einsatz.
- TileRT unterstützt derzeit nur ausgewählte Modelle (GLM-5/5.1 und DeepSeek-V3.2) und verarbeitet pro Decode-Node jeweils eine Anfrage (Batch-Size 1) zugunsten geringerer Latenzen.
Verknüpfte Unternehmen
18 verknüpfte Unternehmen“Frontier AI labs such as OpenAI are therefore evaluating purpose-built inference systems, including Cerebras and NVIDIA Groq LPUs that prior...”
“We thank the TileRT maintainers for collaborating on TileRT InferenceX benchmarks and also in general thankful to the vLLM community for the...”
“Frontier AI labs such as OpenAI are therefore evaluating purpose-built inference systems, including Cerebras and NVIDIA Groq LPUs that prior...”
“Frontier AI labs such as OpenAI are therefore evaluating purpose-built inference systems, including Cerebras and NVIDIA Groq LPUs that prior...”
“Frontier AI labs such as OpenAI are therefore evaluating purpose-built inference systems, including Cerebras and NVIDIA Groq LPUs that prior...”
“TileRT does not replace vLLM, vLLM remains the high-throughput prefill engine and the surrounding serving layer......”
“The TileRT decode engine is already being deployed in production at Xiaomi for MiMo V2.5 Pro UltraSpeed......”
“The TileRT decode engine is already being deployed in production at Xiaomi for MiMo V2.5 Pro UltraSpeed and ZAI with GLM 5.1 HighSpeed....”
“The TileRT decode engine is already being deployed in production at Xiaomi for MiMo V2.5 Pro UltraSpeed and ZAI with GLM 5.1 HighSpeed....”
“Our benchmark has been widely reproduced, validated and/or supported by almost every major buyer of compute from Google Cloud to Microsoft A...”
“Furthermore, it has the support of the ML community ... and the support of major labs like OpenAI, MiniMax, ZAI, Qwen, Moonshot Kimi, etc....”
“Our benchmark has been widely reproduced, validated and/or supported by almost every major buyer of compute from Google Cloud to Microsoft A...”
“Our benchmark has been widely reproduced, validated and/or supported by almost every major buyer of compute from Google Cloud to Microsoft A...”
“We will have Google TPUv7 results soon, and AMD has committed to MI455X UALoE72 this year too....”
“Our benchmark has been widely reproduced, validated and/or supported by almost every major buyer of compute from Google Cloud to Microsoft A...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
TileLang for High-Performance GPU Kernels
This technical tutorial introduces TileLang, a Python-first DSL for writing high-performance GPU kernels that balances the high-level convenience of Triton with the low-level control of CUTLASS/CuTe. TileLang exposes tiles as first-class objects, requires explicit buffer placement (shared memory, registers), and relies on a layout-inference pass to derive thread mappings and memory layouts. The article walks through a GEMM example, an MLA (Multi‑Head Latent Attention) decode kernel (DeepSeek) where TileLang's layout inference enables a compact ~80-line implementation matching FlashMLA H100 fp16 performance, and a production RMSNorm+SiLU drop-in used at AtlasCloud that expands supported channel widths and improved latency. The post details primitives (T.alloc_shared, T.gemm, T.Pipelined, etc.), backend targets, and one-line optimization knobs like swizzling and warp policies.
cuTile Rust: Sichere Rust-GPU-Kernel nahe cuBLAS-Performance
cuTile Rust, eine von NVIDIA-Forschern im Paper „Fearless Concurrency on the GPU“ (arXiv:2606.15991) vorgestellte tile-basierte DSL als Crate, wendet das Ownership- und Borrow-Checker-Modell von Rust auf die Host-zu-GPU-Launch-Grenze an. Mutable Outputs werden dabei in nachweislich disjunkte Tiles partitioniert und als exklusive &mut Views übergeben. Der Ansatz kompiliert zu CUDA Tile IR und GPU Cubins, wobei sm_80+-GPUs, CUDA 13.3, Rust 1.89+ und Linux erforderlich sind. Die Autoren verzeichnen Durchsätze von rund 96% der cuBLAS-Leistung bei GEMM auf einer B200 sowie End-to-End-Inferenzergebnisse mit Grout von 171 Token/s für Qwen3-4B auf einer RTX 5090, wenngleich unabhängige Replizierungen je nach Hardware und Workload variieren. Toolchain und Crate befinden sich in einem frühen Stadium und beschränken sich vorerst auf CUDA und Linux.
Google TPUv7 Ironwood erzielt bis zu 50 % besseres Preis-Leistungs-Verhältnis
Unabhängige Inferenz-Benchmarks des Analysehauses SemiAnalysis zeigen, dass Googles TPUv7 Ironwood im direkten Vergleich mit NVIDIAs B200- und B300-GPUs ein bis zu 50 % besseres Preis-Leistungs-Verhältnis erzielt. Bei typischen Interaktivitätsanforderungen sinken die Kosten pro Token um 19 bis 34 %. Ausschlaggebend für diesen Effizienzsprung sind das abgestimmte Hardware- und Software-Design, der neue TorchTPU-Stack mit nativem PyTorch-Support sowie Kernel- und Serving-Optimierungen für vLLM und SGLang. Google forciert die Externalisierung seiner TPU-Infrastruktur – sowohl durch Hardware-Direktverkäufe als auch über die Google Cloud Platform, wobei Anthropic bereits als Großkunde fungiert. Der TorchTPU-Stack befindet sich in der Private Beta und soll Mitte Oktober als Open Source bereitgestellt werden. Zusätzliche Funktionen wie Speculative Decoding und disaggregiertes Serving etablieren Googles TPUs als ernsthafte Herausforderer im KI-Inferenzmarkt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
