Beobachtetes Signal · 14. Aug. 2026 · Technical Release · Quelle: techcrunch · Relevanz: 3/5 · Sentiment: Positiv

Kog optimiert GPUs zur massiven Beschleunigung von LLM-Inference

Zusammenfassung des Signals

Das französische Startup Kog entwickelt Low-Level-Softwareoptimierungen, um die KI-Inference auf Standard-Rechenzentrum-GPUs wie AMD MI300X und Nvidia H200 deutlich zu beschleunigen. Gründer und CEO Gaël Delalleau zufolge erreichte eine frühe Tech-Preview beeindruckende 3.000 Token pro Sekunde und Anfrage mit einem kompakten, speziell entwickelten 2-Milliarden-Parameter-Modell namens Laneformer 2B, das mittlerweile als Open Source verfügbar ist. Kog verzeichnet starkes Kundeninteresse, kooperiert mit Design-Partnern und wird von Scaleway, Bpifrance sowie dem Programm French Tech 2030 unterstützt. Die Seed-Runde wurde von Varsity VC co-geleitet. Das elfköpfige Team plant, diesen Ansatz auf größere LLMs zu übertragen und ein erstes großes Modell mit zehnfacher Geschwindigkeit zu implementieren, bevor eine Series-A-Finanzierung angestrebt wird.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Softwareseitige Verbesserungen bei der GPU-Inference durch Startups können Kosten und Latenzen von LLMs signifikant senken und Echtzeitanwendungen ermöglichen. Es handelt sich hierbei jedoch um eine frühe Startup-Demonstration und noch nicht um ein marktdominantes Plattform-Release.

SIGNAL RADAR

Marktsignale zu AMD in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Kog ist ein französisches Startup, das Softwareoptimierungen zur Beschleunigung der KI-Inference auf Standard-Rechenzentrum-GPUs entwickelt.
  • Die Tech-Preview des Unternehmens erzielte rund 3.000 Token pro Sekunde und Anfrage mit dem Open-Source-Modell Laneformer 2B (2B Parameter).
  • Für die Demonstration wurden Standard-Rechenzentrum-GPUs wie AMD MI300X und Nvidia H200 eingesetzt.
  • Nach einer Tech-Preview im Mai verzeichnete Kog rund 200 konkrete Vertriebskontakte bei einem Team von elf Mitarbeitern.
  • Varsity VC co-leitete die Seed-Runde von Kog; zudem wird das Startup von Scaleway, Bpifrance und French Tech 2030 unterstützt.

Verknüpfte Unternehmen

5 verknüpfte Unternehmen
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: techcrunch•Veröffentlicht: 14. Aug. 2026
Ursprünglicher Berichttitel: “Kog is going deeper to squeeze more inference out of GPUs”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI26. März 2026

Google TurboQuant halbiert KV-Cache und beschleunigt LLM-Inferenz drastisch

Ein Praxisbericht von 498Advance beleuchtet eine dreistufige Strategie zur Senkung der Produktionskosten für LLMs durch Fallback-Richtlinien, aufgabenbasiertes Routing und selektives lokales Hosting. Gleichzeitig rückt das neue Google-Research-Papier zu TurboQuant (ICLR 2026) in den Fokus, das von Amir Zandieh und Vahab Mirrokni verfasst wurde. TurboQuant kombiniert PolarQuant und eine Quantized Johnson-Lindenstrauss-Korrektur (QJL), um die KV-Cache-Größe und die Attention-Kosten ohne Retraining massiv zu reduzieren. Berichten zufolge ermöglicht dies eine bis zu sechsfache Reduzierung des KV-Cache-Speichers, eine achtfache Beschleunigung der Attention bei einer 4-Bit-Quantisierung auf H100-GPUs sowie eine effektive 3-Bit-Quantisierung ohne messbaren Genauigkeitsverlust. Ergänzt wird dies durch Best Practices von Branchengrößen wie LinkedIn, Roblox und Red Hat zur skalierbaren und effizienten Modellinferenz.

Signal analysieren
Video / AI Infrastructure11. Mai 2026

AKOOL stellt KI-Video-Inference-Engine für Echtzeitanwendungen vor

AKOOL hat eine produktionsreife KI-Video-Inference-Engine angekündigt, die laut Unternehmensangaben eine 10- bis 20-fach schnellere Performance im Vergleich zu herkömmlichen Ansätzen bietet und KI-Video in Echtzeit auf globaler Ebene ermöglicht. Die Generierungszeit für einzelne Clips soll von mehreren zehn Sekunden auf 1 bis 3 Sekunden sinken, während das System im Live-Streaming Latenzzeiten von unter 30 Millisekunden pro Frame unterstützt. AKOOL führt diese Leistungssteigerungen auf ein Full-Stack-Redesign zurück, das Algorithmen, GPU-Parallelisierung, die Reduzierung von Runtime-Overhead sowie Next-Gen-GPU-Architekturen umfasst. Die Engine ist für Deployments in der Cloud, im Streaming und auf Endgeräten ausgelegt und integriert Enterprise-Funktionen wie Echtzeit-Monitoring, automatisierte Qualitätskontrollen sowie modellbasierte Kostenüberwachung. Die Technologie treibt bereits interne Produkte wie die Akool Live Camera für digitale Avatare, Live-Übersetzungen und interaktive Videoerlebnisse an.

Signal analysieren
Large Language Models (LLM) & AI26. März 2026

Google erzielt 6-fache KV-Cache-Kompression ohne Training

Diese Ausgabe von The Tokenizer beleuchtet aktuelle KI- und ML-Forschung mit Fokus auf Geschwindigkeit und Effizienz. Zu den Highlights gehört TurboQuant von Google Research, eine trainingsfreie KV-Cache-Kompression mittels Polarkoordinaten-Transformationen und Zufallsprojektionen. Dies ermöglicht eine 3-Bit-KV-Quantisierung, eine 6-fache Reduzierung des KV-Speichers und bis zu 8-fache Leistungssteigerungen auf H100 GPUs. Weitere Themen umfassen einen diffusionsbasierten OCR-Ansatz für bis zu 3,2-fach höheren Durchsatz, SkillNet als npm-ähnlichen Paketmanager für Agenten-Skills, Stripes interne KI-Coding-Agenten mit rund 1.300 PRs pro Woche, ByteDances Dateisystem-basierte Context-DB OpenViking sowie das Engram-Speichermodul von DeepSeek für Transformers. Der Newsletter fasst wegweisende Papers, Implementierungen und praxisnahe Walkthroughs zu Inferenz- und Agenteneffizienz zusammen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.