Beobachtetes Signal · 8. Juli 2026 · Product Launch · Quelle: techcrunch · Relevanz: 3/5 · Sentiment: Positiv

Französisches KI-Startup ZML veröffentlicht kostenlosen LLMD-Inferenzserver für diverse Chips

Zusammenfassung des Signals

Das von Yann LeCun unterstützte Pariser KI-Startup ZML hat LLMD vorgestellt, einen Inferenz-Performance-Server zur effizienten Ausführung von Open-Source Large Language Models über verschiedenste Chip-Architekturen hinweg (darunter Nvidia, AMD, Google TPU, Apple Metal und Intel Arc). Das proprietäre Produkt wird zunächst kostenlos bereitgestellt, um Nutzungsdaten zu sammeln; Ziel ist es laut ZML, Vendor Lock-in zu vermeiden, gemischte Chip-Bereitstellungen zu ermöglichen sowie Inferenzkosten und Energieverbrauch für Unternehmen und Clouds zu senken. Gründer Steeve Morin betonte die Co-Design-Arbeit mit Chipherstellern. Das 20-köpfige Startup, das eine Seed-Runde über 20 Millionen US-Dollar von Investoren wie 20VC und LocalGlobe eingeworben hat, plant weitere Veröffentlichungen. Damit positioniert sich ZML im Inferenzmarkt als Konkurrent zu Unternehmen wie Baseten, Inferact und RadixArk und könnte die Adaption von KI-Chips jenseits von Nvidia beschleunigen.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein Startup-Produkt für chipübergreifende Inferenz kann Vendor Lock-in und Betriebskosten reduzieren, was die KI-Infrastrukturentscheidungen von Unternehmen und Cloud-Anbietern beeinflusst; dies stellt eine relevante Marktentwicklung dar, jedoch ohne plattformweiten regulatorischen oder technischen Systemwechsel.

SIGNAL RADAR

Marktsignale zu AMD in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • ZML hat LLMD veröffentlicht, einen LLM-Inferenzserver für den Betrieb von Modellen auf verschiedenen Chiptypen.
  • LLMD unterstützt diverse Chips wie Nvidia, AMD, Google TPU, Apple Metal und Intel Arc.
  • ZML ist ein in Paris ansässiges Startup mit rund 20 Mitarbeitern, gegründet von Steeve Morin.
  • ZML hat 20 Millionen US-Dollar von Investoren wie 20VC, Kima Ventures und LocalGlobe eingesammelt.
  • LLMD ist nicht Open-Source, wird aber als kostenloses Produkt zur Analyse des Nutzerverhaltens eingeführt.

Verknüpfte Unternehmen

9 verknüpfte Unternehmen

“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”

“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”

“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”

“has released inference-performance software that allows a variety of open source large language models to run on a variety of chips — includ...”

“the startup’s cap table confirms that other founders are paying attention, including Dagger and Docker founder Solomon Hykes...”

“the startup’s cap table confirms that other founders are paying attention, including ... Clément Delangue and Julien Chaumond from Hugging F...”

“Morin raised $20 million from venture firms including Harry Stebbings’ 20VC, >commit, AALVC, Drysdale Ventures, Xavier Niel’s Kima Ventures,...”

Ontologie & Marktkonzepte

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: techcrunch•Veröffentlicht: 8. Juli 2026
Ursprünglicher Berichttitel: “Hot French startup ZML releases free product to speed inference across lots of AI chips”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI24. Juni 2026

OpenAI und Broadcom präsentieren Jalapeño-Inferenzchip für LLMs

OpenAI und Broadcom haben Jalapeño vorgestellt, einen auf LLM-Inferenz optimierten Beschleuniger, der als erster „Intelligence Processor“ von OpenAI bezeichnet wird. Die gemeinsam mit Broadcom und Celestica entwickelte Hardware wurde von Grund auf für moderne sowie zukünftige LLM-Inferenz konzipiert und mithilfe von OpenAI-Modellen in nur neun Monaten vom Design zum Tape-out geführt. Erste Engineering-Samples laufen im Labor mit ML-Workloads wie GPT‑5.3‑Codex‑Spark. Laut internen Tests übertrifft die Performance pro Watt den aktuellen Branchenstandard deutlich; ein detaillierter technischer Bericht soll folgen. Ab 2026 planen die Partner gigawattgroße Deployments mit Rechenzentrumspartnern wie Microsoft, um die Inferenzkosten sowie Latenzen zu senken und die Zuverlässigkeit für interaktive LLM-Produkte im großen Maßstab zu verbessern.

Signal analysieren
Infrastructure / AI Inference23. März 2026

Gimlet Labs sammelt 80 Millionen US-Dollar für Multi-Silicon Inference Cloud ein

Das KI-Startup Gimlet Labs hat in einer von Menlo Ventures angeführten Series-A-Finanzierungsrunde 80 Millionen US-Dollar eingesucht, um eine sogenannte Multi-Silicon Inference Cloud zu kommerzialisieren. Die Software orchestriert KI-Workloads über verschiedene Hardware-Architekturen hinweg und verspricht eine dreifache bis zehnfache Beschleunigung der KI-Inference bei gleichen Kosten und Energieverbrauch. Gimlet arbeitet mit Chipherstellern wie NVIDIA, AMD, Intel, ARM, Cerebras und d-Matrix zusammen und bietet seine Lösung wahlweise als Software, API oder über die Gimlet Cloud für große Modelllabore und Rechenzentren an. Zum Marktstart verzeichnete das Unternehmen bereits Umsätze im zweistelligen Millionenenbereich, beschäftigt rund 30 Mitarbeiter und kommt inklusive vorheriger Seed- und Angel-Investments auf ein Gesamtkapital von 92 Millionen US-Dollar. Die Technologie setzt an einem zentralen Infrastruktur-Engpass im Bereich Künstliche Intelligenz an.

Signal analysieren
AI Infrastructure17. Sept. 2026

Z.ai meldet: KI-Modell baut eigene Inferenz-Infrastruktur autonom auf

Das chinesische KI-Unternehmen Z.ai (ehemals Zhipu AI) hat ein Research Paper veröffentlicht, das beschreibt, wie das firmeneigene GLM-5.3-Modell über einen spezialisierten Infra Agent die produktive Inferenz-Infrastruktur auf einem Cluster von über 100.000 chinesischen KI-Beschleunigern eigenständig aufgebaut und optimiert hat. Der Prozess von der Modellanpassung bis zur Produktivreife dauerte weniger als zwei Wochen und verdreifachte den End-to-End-Durchsatz, wobei die Leistung laut Z.ai mit Nvidia-GPUs vergleichbar sei. Über ein neuartiges 'Dense Feedback'-Verfahren identifiziert und behebt der KI-Agent System-Engpässe autonom – so wurde etwa ein Parallelisierungs-Bottleneck von 20 % auf unter 1 % reduziert. Z.ai wertet dies als Vorstufe einer Recursive Self-Improvement (RSI), wenn auch noch keine vollständige RSI erreicht ist. Gerüchte über ähnliche Durchbrüche bei Google DeepMind bleiben unbestätigt. Die Veröffentlichung erfolgte im September 2026.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.