Beobachtetes Signal · 8. Juli 2026 · Product Launch · Quelle: techcrunch · Relevanz: 3/5 · Sentiment: Positiv
Französisches KI-Startup ZML veröffentlicht kostenlosen LLMD-Inferenzserver für diverse Chips
Das von Yann LeCun unterstützte Pariser KI-Startup ZML hat LLMD vorgestellt, einen Inferenz-Performance-Server zur effizienten Ausführung von Open-Source Large Language Models über verschiedenste Chip-Architekturen hinweg (darunter Nvidia, AMD, Google TPU, Apple Metal und Intel Arc). Das proprietäre Produkt wird zunächst kostenlos bereitgestellt, um Nutzungsdaten zu sammeln; Ziel ist es laut ZML, Vendor Lock-in zu vermeiden, gemischte Chip-Bereitstellungen zu ermöglichen sowie Inferenzkosten und Energieverbrauch für Unternehmen und Clouds zu senken. Gründer Steeve Morin betonte die Co-Design-Arbeit mit Chipherstellern. Das 20-köpfige Startup, das eine Seed-Runde über 20 Millionen US-Dollar von Investoren wie 20VC und LocalGlobe eingeworben hat, plant weitere Veröffentlichungen. Damit positioniert sich ZML im Inferenzmarkt als Konkurrent zu Unternehmen wie Baseten, Inferact und RadixArk und könnte die Adaption von KI-Chips jenseits von Nvidia beschleunigen.
Ein Startup-Produkt für chipübergreifende Inferenz kann Vendor Lock-in und Betriebskosten reduzieren, was die KI-Infrastrukturentscheidungen von Unternehmen und Cloud-Anbietern beeinflusst; dies stellt eine relevante Marktentwicklung dar, jedoch ohne plattformweiten regulatorischen oder technischen Systemwechsel.
Marktsignale zu AMD in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- ZML hat LLMD veröffentlicht, einen LLM-Inferenzserver für den Betrieb von Modellen auf verschiedenen Chiptypen.
- LLMD unterstützt diverse Chips wie Nvidia, AMD, Google TPU, Apple Metal und Intel Arc.
- ZML ist ein in Paris ansässiges Startup mit rund 20 Mitarbeitern, gegründet von Steeve Morin.
- ZML hat 20 Millionen US-Dollar von Investoren wie 20VC, Kima Ventures und LocalGlobe eingesammelt.
- LLMD ist nicht Open-Source, wird aber als kostenloses Produkt zur Analyse des Nutzerverhaltens eingeführt.
Verknüpfte Unternehmen
9 verknüpfte Unternehmen“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”
“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”
“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”
“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”
“So ZML has competition such as Baseten, recently valued at $13 billion;...”
“the startup’s cap table confirms that other founders are paying attention, including Dagger and Docker founder Solomon Hykes...”
“the startup’s cap table confirms that other founders are paying attention, including ... Clément Delangue and Julien Chaumond from Hugging F...”
“Morin raised $20 million from venture firms including Harry Stebbings’ 20VC, >commit, AALVC, Drysdale Ventures, Xavier Niel’s Kima Ventures,...”
“Zenly, which Snapchat acquired for nine figures in 2017...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI und Broadcom präsentieren Jalapeño-Inferenzchip für LLMs
OpenAI und Broadcom haben Jalapeño vorgestellt, einen auf LLM-Inferenz optimierten Beschleuniger, der als erster „Intelligence Processor“ von OpenAI bezeichnet wird. Die gemeinsam mit Broadcom und Celestica entwickelte Hardware wurde von Grund auf für moderne sowie zukünftige LLM-Inferenz konzipiert und mithilfe von OpenAI-Modellen in nur neun Monaten vom Design zum Tape-out geführt. Erste Engineering-Samples laufen im Labor mit ML-Workloads wie GPT‑5.3‑Codex‑Spark. Laut internen Tests übertrifft die Performance pro Watt den aktuellen Branchenstandard deutlich; ein detaillierter technischer Bericht soll folgen. Ab 2026 planen die Partner gigawattgroße Deployments mit Rechenzentrumspartnern wie Microsoft, um die Inferenzkosten sowie Latenzen zu senken und die Zuverlässigkeit für interaktive LLM-Produkte im großen Maßstab zu verbessern.
Gimlet Labs sammelt 80 Millionen US-Dollar für Multi-Silicon Inference Cloud ein
Das KI-Startup Gimlet Labs hat in einer von Menlo Ventures angeführten Series-A-Finanzierungsrunde 80 Millionen US-Dollar eingesucht, um eine sogenannte Multi-Silicon Inference Cloud zu kommerzialisieren. Die Software orchestriert KI-Workloads über verschiedene Hardware-Architekturen hinweg und verspricht eine dreifache bis zehnfache Beschleunigung der KI-Inference bei gleichen Kosten und Energieverbrauch. Gimlet arbeitet mit Chipherstellern wie NVIDIA, AMD, Intel, ARM, Cerebras und d-Matrix zusammen und bietet seine Lösung wahlweise als Software, API oder über die Gimlet Cloud für große Modelllabore und Rechenzentren an. Zum Marktstart verzeichnete das Unternehmen bereits Umsätze im zweistelligen Millionenenbereich, beschäftigt rund 30 Mitarbeiter und kommt inklusive vorheriger Seed- und Angel-Investments auf ein Gesamtkapital von 92 Millionen US-Dollar. Die Technologie setzt an einem zentralen Infrastruktur-Engpass im Bereich Künstliche Intelligenz an.
Z.ai meldet: KI-Modell baut eigene Inferenz-Infrastruktur autonom auf
Das chinesische KI-Unternehmen Z.ai (ehemals Zhipu AI) hat ein Research Paper veröffentlicht, das beschreibt, wie das firmeneigene GLM-5.3-Modell über einen spezialisierten Infra Agent die produktive Inferenz-Infrastruktur auf einem Cluster von über 100.000 chinesischen KI-Beschleunigern eigenständig aufgebaut und optimiert hat. Der Prozess von der Modellanpassung bis zur Produktivreife dauerte weniger als zwei Wochen und verdreifachte den End-to-End-Durchsatz, wobei die Leistung laut Z.ai mit Nvidia-GPUs vergleichbar sei. Über ein neuartiges 'Dense Feedback'-Verfahren identifiziert und behebt der KI-Agent System-Engpässe autonom – so wurde etwa ein Parallelisierungs-Bottleneck von 20 % auf unter 1 % reduziert. Z.ai wertet dies als Vorstufe einer Recursive Self-Improvement (RSI), wenn auch noch keine vollständige RSI erreicht ist. Gerüchte über ähnliche Durchbrüche bei Google DeepMind bleiben unbestätigt. Die Veröffentlichung erfolgte im September 2026.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
