Beobachtetes Signal · 14. Aug. 2026 · Technical Release · Quelle: techcrunch · Relevanz: 3/5 · Sentiment: Positiv
Kog optimiert GPUs zur massiven Beschleunigung von LLM-Inference
Das französische Startup Kog entwickelt Low-Level-Softwareoptimierungen, um die KI-Inference auf Standard-Rechenzentrum-GPUs wie AMD MI300X und Nvidia H200 deutlich zu beschleunigen. Gründer und CEO Gaël Delalleau zufolge erreichte eine frühe Tech-Preview beeindruckende 3.000 Token pro Sekunde und Anfrage mit einem kompakten, speziell entwickelten 2-Milliarden-Parameter-Modell namens Laneformer 2B, das mittlerweile als Open Source verfügbar ist. Kog verzeichnet starkes Kundeninteresse, kooperiert mit Design-Partnern und wird von Scaleway, Bpifrance sowie dem Programm French Tech 2030 unterstützt. Die Seed-Runde wurde von Varsity VC co-geleitet. Das elfköpfige Team plant, diesen Ansatz auf größere LLMs zu übertragen und ein erstes großes Modell mit zehnfacher Geschwindigkeit zu implementieren, bevor eine Series-A-Finanzierung angestrebt wird.
Softwareseitige Verbesserungen bei der GPU-Inference durch Startups können Kosten und Latenzen von LLMs signifikant senken und Echtzeitanwendungen ermöglichen. Es handelt sich hierbei jedoch um eine frühe Startup-Demonstration und noch nicht um ein marktdominantes Plattform-Release.
Marktsignale zu AMD in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Kog ist ein französisches Startup, das Softwareoptimierungen zur Beschleunigung der KI-Inference auf Standard-Rechenzentrum-GPUs entwickelt.
- Die Tech-Preview des Unternehmens erzielte rund 3.000 Token pro Sekunde und Anfrage mit dem Open-Source-Modell Laneformer 2B (2B Parameter).
- Für die Demonstration wurden Standard-Rechenzentrum-GPUs wie AMD MI300X und Nvidia H200 eingesetzt.
- Nach einer Tech-Preview im Mai verzeichnete Kog rund 200 konkrete Vertriebskontakte bei einem Team von elf Mitarbeitern.
- Varsity VC co-leitete die Seed-Runde von Kog; zudem wird das Startup von Scaleway, Bpifrance und French Tech 2030 unterstützt.
Verknüpfte Unternehmen
5 verknüpfte Unternehmen“such as the AMD MI300X and Nvidia H200 GPUs it used for its demo....”
“such as the AMD MI300X and Nvidia H200 GPUs it used for its demo....”
“The race for faster AI inference is on, and markets gave Cerebras and its purpose-built chips a warm welcome in its IPO debut in May....”
“Anthropic itself understands that speed is worth money, and charges a price multiple for Claude’s Fast Mode....”
“this could add sovereignty tailwinds for the startup, which is already supported by Scaleway and backed by France’s Bpifrance and French Tec...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Google TurboQuant halbiert KV-Cache und beschleunigt LLM-Inferenz drastisch
Ein Praxisbericht von 498Advance beleuchtet eine dreistufige Strategie zur Senkung der Produktionskosten für LLMs durch Fallback-Richtlinien, aufgabenbasiertes Routing und selektives lokales Hosting. Gleichzeitig rückt das neue Google-Research-Papier zu TurboQuant (ICLR 2026) in den Fokus, das von Amir Zandieh und Vahab Mirrokni verfasst wurde. TurboQuant kombiniert PolarQuant und eine Quantized Johnson-Lindenstrauss-Korrektur (QJL), um die KV-Cache-Größe und die Attention-Kosten ohne Retraining massiv zu reduzieren. Berichten zufolge ermöglicht dies eine bis zu sechsfache Reduzierung des KV-Cache-Speichers, eine achtfache Beschleunigung der Attention bei einer 4-Bit-Quantisierung auf H100-GPUs sowie eine effektive 3-Bit-Quantisierung ohne messbaren Genauigkeitsverlust. Ergänzt wird dies durch Best Practices von Branchengrößen wie LinkedIn, Roblox und Red Hat zur skalierbaren und effizienten Modellinferenz.
AKOOL stellt KI-Video-Inference-Engine für Echtzeitanwendungen vor
AKOOL hat eine produktionsreife KI-Video-Inference-Engine angekündigt, die laut Unternehmensangaben eine 10- bis 20-fach schnellere Performance im Vergleich zu herkömmlichen Ansätzen bietet und KI-Video in Echtzeit auf globaler Ebene ermöglicht. Die Generierungszeit für einzelne Clips soll von mehreren zehn Sekunden auf 1 bis 3 Sekunden sinken, während das System im Live-Streaming Latenzzeiten von unter 30 Millisekunden pro Frame unterstützt. AKOOL führt diese Leistungssteigerungen auf ein Full-Stack-Redesign zurück, das Algorithmen, GPU-Parallelisierung, die Reduzierung von Runtime-Overhead sowie Next-Gen-GPU-Architekturen umfasst. Die Engine ist für Deployments in der Cloud, im Streaming und auf Endgeräten ausgelegt und integriert Enterprise-Funktionen wie Echtzeit-Monitoring, automatisierte Qualitätskontrollen sowie modellbasierte Kostenüberwachung. Die Technologie treibt bereits interne Produkte wie die Akool Live Camera für digitale Avatare, Live-Übersetzungen und interaktive Videoerlebnisse an.
Google erzielt 6-fache KV-Cache-Kompression ohne Training
Diese Ausgabe von The Tokenizer beleuchtet aktuelle KI- und ML-Forschung mit Fokus auf Geschwindigkeit und Effizienz. Zu den Highlights gehört TurboQuant von Google Research, eine trainingsfreie KV-Cache-Kompression mittels Polarkoordinaten-Transformationen und Zufallsprojektionen. Dies ermöglicht eine 3-Bit-KV-Quantisierung, eine 6-fache Reduzierung des KV-Speichers und bis zu 8-fache Leistungssteigerungen auf H100 GPUs. Weitere Themen umfassen einen diffusionsbasierten OCR-Ansatz für bis zu 3,2-fach höheren Durchsatz, SkillNet als npm-ähnlichen Paketmanager für Agenten-Skills, Stripes interne KI-Coding-Agenten mit rund 1.300 PRs pro Woche, ByteDances Dateisystem-basierte Context-DB OpenViking sowie das Engram-Speichermodul von DeepSeek für Transformers. Der Newsletter fasst wegweisende Papers, Implementierungen und praxisnahe Walkthroughs zu Inferenz- und Agenteneffizienz zusammen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
