Beobachtetes Signal · 1. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Positiv
llm-d als CNCF Sandbox-Projekt für Kubernetes LLM Inference übergeben
Auf der KubeCon Europe 2026 haben IBM Research, Red Hat und Google Cloud das Framework llm-d als Sandbox-Projekt an die Cloud Native Computing Foundation (CNCF) übergeben. Unterstützt von Gründungspartnern wie NVIDIA, CoreWeave, AMD und Mistral AI, fungiert llm-d als Kubernetes-natives Framework für verteilte LLM Inference im Produktionsmaßstab. Es integriert Middleware zwischen vLLM und Orchestrierungsschichten wie KServe und bietet Funktionen wie Disaggregated Serving, Hierarchical KV Cache Offloading sowie präfix-cache-bewusstes Routing über einen Endpoint Picker. Benchmarks der Version v0.5 mit Qwen3-32B verzeichnen eine GPU-Auslastung von über 80 Prozent, nahezu eliminiere P99-Latenzen beim Time-to-First-Token sowie gesteigerte Durchsätze und Cache-Trefferquoten. Das hardware-agnostische Projekt nutzt LeaderWorkerSet-Primitive für Multi-Node Expert Parallelism, befindet sich als CNCF Sandbox-Projekt jedoch in einem frühen Stadium und erfordert vor dem Produktiveinsatz entsprechende Tests in Staging-Umgebungen.
Führende Cloud- und Infrastrukturanbieter haben ein Kubernetes-natives Framework für LLM Inference in die CNCF eingebracht. Die Technologie verspricht signifikant höhere GPU-Auslastungen, cache-optimiertes Routing und Multi-Node-Parallelität, was die Skalierung von produktiven LLM-Workloads nachhaltig verändern könnte.
Marktsignale zu vLLM in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- IBM Research, Red Hat und Google Cloud haben llm-d auf der KubeCon Europe 2026 als CNCF Sandbox-Projekt übergeben.
- Zu den Gründungspartnern gehören unter anderem NVIDIA, CoreWeave, AMD, Cisco, Hugging Face, Intel, Lambda und Mistral AI.
- llm-d ist ein Kubernetes-natives Framework für verteilte Inference mit Disaggregated Serving, Hierarchical KV Cache Offloading und präfix-cache-bewusstem Routing.
- v0.5-Benchmarks auf Qwen3-32B zeigten eine auf über 80 % gesteigerte GPU-Auslastung, nahezu Null P99 Time-to-First-Token und optimierte KV-Cache-Treffer.
- Das Projekt ist hardware-agnostisch (Unterstützung für NVIDIA, AMD, Intel, Google TPU) und nutzt LeaderWorkerSet (LWS) für parallele Multi-Node-Topologien.
Verknüpfte Unternehmen
5 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Fintech reduziert LLM-Latenz durch Self-Hosting von vLLM um 60 Prozent
Ein Fintech-Unternehmen der Serie B hat seine produktive LLM-Inferenz innerhalb von sechs Wochen von der Hugging Face Inference API (HFIA) auf einen selbst gehosteten vLLM-Cluster migriert. Dadurch sank die p99-Latenz von 2,8 Sekunden auf 1,12 Sekunden (eine Reduktion von rund 60 Prozent), während die monatlichen Inferenzkosten von 22.000 US-Dollar auf 4.800 US-Dollar (78 Prozent Einsparung) sanken. Das zwölfköpfige Engineering-Team setzte vLLM 0.4.3 auf acht NVIDIA A100 80GB GPUs ein, implementierte AWQ 4-Bit-Quantisierung, Continuous Batching, Prefix Caching sowie Resilienz-Patterns wie Circuit Breakers und Retries. Validiert wurden die Änderungen durch 14-tägige parallele Benchmarks mit Llama 3 8B und Mistral 7B. Der Bericht liefert konkrete Deployment-Konfigurationen, Benchmarking-Skripte, Produktivcode und wertvolle operative Einblicke in Quantisierungs-Trade-offs, Batching-Strategien und die Zuverlässigkeit selbst gehosteter LLMs.
Lokale LLM-Inferenz für datenschutzkonforme Browser-Intelligence neu entwickelt
Ein Entwicklerpapier beschreibt die Kathon Local AI Engine, eine offene On-Device-Architektur zur Ausführung von Large Language Models und Vision-Language-Modellen direkt im Browser ohne Cloud-Inferenz. Das System nutzt llama.cpp mit einem quantisierten Qwen 2.5 VL 2B Q4 GGUF-Modell, einen Rust-basierten Inferenz-Server (llama-server), der über eine lokale WebSocket-API mit einem React/TypeScript-Frontend kommuniziert, sowie zahlreiche Optimierungen wie Speculative Decoding, KV-Cache-Quantisierung, Prompt Caching und GPU-beschleunigte Tensor-Operationen. Das Design setzt auf vollständig isolierten Betrieb (Airgapping) und kryptografische Auditierbarkeit über ein unveränderliches SHA3-256-.aioss-Ledger. Der Autor Lois-Kleinner Alpasan veröffentlichte ein formales Papier im The Anticloud Research Corpus und positioniert das Projekt als datenschutzorientierte Alternative zur Cloud-Inferenz, die Nutzerdaten lokal belässt und durch Endanwender auditierbar macht.
Französisches KI-Startup ZML veröffentlicht kostenlosen LLMD-Inferenzserver für diverse Chips
Das von Yann LeCun unterstützte Pariser KI-Startup ZML hat LLMD vorgestellt, einen Inferenz-Performance-Server zur effizienten Ausführung von Open-Source Large Language Models über verschiedenste Chip-Architekturen hinweg (darunter Nvidia, AMD, Google TPU, Apple Metal und Intel Arc). Das proprietäre Produkt wird zunächst kostenlos bereitgestellt, um Nutzungsdaten zu sammeln; Ziel ist es laut ZML, Vendor Lock-in zu vermeiden, gemischte Chip-Bereitstellungen zu ermöglichen sowie Inferenzkosten und Energieverbrauch für Unternehmen und Clouds zu senken. Gründer Steeve Morin betonte die Co-Design-Arbeit mit Chipherstellern. Das 20-köpfige Startup, das eine Seed-Runde über 20 Millionen US-Dollar von Investoren wie 20VC und LocalGlobe eingeworben hat, plant weitere Veröffentlichungen. Damit positioniert sich ZML im Inferenzmarkt als Konkurrent zu Unternehmen wie Baseten, Inferact und RadixArk und könnte die Adaption von KI-Chips jenseits von Nvidia beschleunigen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
