Beobachtetes Signal · 25. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv

Kmemo: Semantischer LLM-Cache verhindert fehlerhafte Treffer durch lexikalische Schutzschichten

Zusammenfassung des Signals

Kmemo ist ein Open-Source-Cache für LLM-Aufrufe, der Embedding-Ähnlichkeiten mit lexikalischen Schutzschichten und optionaler Verifikation kombiniert, um die Ausgabe falscher Cache-Antworten zu verhindern. Als Version 1.0.0 unter Apache-2.0-Lizenz veröffentlicht, bettet Kmemo Prompts einmal ein, nutzt Vektoren für Abfragen und Schreibvorgänge, bündelt parallele Anfragen und bietet Schnittstellen für Erklärbarkeit und Metriken. Die Lösung unterstützt Speicher-Adapter wie In-Memory, Redis mit RediSearch KNN, Postgres mit pgvector sowie einen optionalen prozessinternen HNSW-Speicher. Zudem liefert Kmemo Integrationen für Spring Boot, Spring AI, LangChain4j und Ktor. In Validierungstests wiesen die Schutzschichten 67 Prozent der Fehltreffer ab und behielten 88 Prozent der Paraphrasen bei. Das Projekt ist auf GitHub und Maven Central verfügbar.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Bietet eine pragmatische Open-Source-Lösung für das zuverlässige semantische Caching von LLM-Aufrufen, wodurch API-Kosten und Latenzen gesenkt und gleichzeitig falsche Cache-Antworten vermieden werden.

SIGNAL RADAR

Marktsignale zu OpenAI in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Kmemo ist ein Open-Source-semantischer Cache für LLM-Aufrufe, der Ähnlichkeitssuche mit lexikalischen Schutzschichten gegen False-Positive-Treffer kombiniert.
  • Der Kern ist als Version 1.0.0 unter der Apache-2.0-Lizenz auf Maven Central verfügbar (io.github.nacode-studios:kmemo-core:1.0.0).
  • Die Schutzschicht prüft auf konkrete Unterschiede wie vertauschte Zahlen, Negationen oder abweichende Entitäten und bevorzugt Verweigerung vor Spekulation.
  • Es werden Speicher-Adapter für In-Memory, Redis (RediSearch KNN) und Postgres (pgvector) sowie Framework-Integrationen für Spring Boot, Spring AI, LangChain4j und Ktor bereitgestellt.
  • In Blindvalidierungen wiesen die Schutzschichten 67 Prozent markierter Near-Misses ab und behielten 88 Prozent der Paraphrasen bei.

Verknüpfte Unternehmen

3 verknüpfte Unternehmen

“val cache = SemanticCache( embedder = Embedder { text -> openAi.embed(text) }, store = InMemoryStore(maxEntries = 10_000, ttl = 1.ho...”

“Redis (RediSearch KNN) and Postgres (pgvector) stores ship, plus an opt-in in-process HNSW store for when the exact scan stops scaling....”

“Redis (RediSearch KNN) and Postgres (pgvector) stores ship, plus an opt-in in-process HNSW store for when the exact scan stops scaling....”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 25. Juli 2026
Ursprünglicher Berichttitel: “Kmemo: a semantic cache for LLM calls that refuses to serve you the wrong answer”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large language model memory & retrieval31. März 2026

nan-forget: Neuartiges, vom Gehirn inspiriertes Gedächtnis für LLMs

nan-forget ist ein Open-Source-Langzeitgedächtnissystem für LLM-gestützte Coding-Tools, das drei neurologische Prinzipien nutzt: Vergessen durch zeitbasierten Verfall, Spreading Activation für mehrstufiges Retrieval und eine schlafähnliche Konsolidierung. Das System bewertet Speicherinhalte über Vektorähnlichkeit, einen Decay-Weight mit 30 Tagen Halbwertzeit und einen Frequency-Boost. Eine dreistufige Retrieval-Pipeline steuert die Kontextbereitstellung. Ein Konsolidierungsprozess fasst Einträge zusammen und archiviert Originale, während eine Garbage Collection Duplikate entfernt. Die Implementierung basiert auf einer SQLite-Datenbank mit sqlite-vec für Vektor-KNN, strukturierten JSON-Datensätzen und plattformübergreifender LLM-Unterstützung via MCP-Server, REST-API und CLI unter der MIT-Lizenz auf GitHub (NaNMesh/nan-forget).

Signal analysieren
Large Language Models (LLM) & AI14. Mai 2026

LLM-Inferenz beschleunigen durch Key-Value Caching

Ein am 14. Mai 2026 veröffentlichter technischer Leitfaden erläutert, wie Key-Value (KV) Caching die Inferenz von Large Language Models (LLMs) beschleunigt, indem das wiederholte Einlesen vorheriger Token vermieden wird. Der Artikel analysiert den Re-Reading-Engpass, definiert KV-Cache Keys und Values und beschreibt die beiden Inferenzphasen Prefill und Decoding. Zu den empfohlenen praktischen Optimierungsschritten gehören Bibliotheken mit integriertem Caching wie Hugging Face Transformers mit use_cache=True und vLLM mit PagedAttention, die Reduzierung der KV-Cache-Größe mittels Quantisierung zur VRAM-Einsparung sowie die Wahl von Architekturen wie Grouped-Query Attention (GQA). Eine kompakte Checkliste empfiehlt das Aktivieren von Caching, die VRAM-Überwachung, den Einsatz von vLLM in der Produktion sowie GQA-Modelle zur Verbesserung von Latenz und Speichereffizienz.

Signal analysieren
Large Language Models (LLM) & AI21. Juni 2026

KMM v0.0.2 ermöglicht Knowledge-Pipeline für AI Agents

KMM (Knowledge-and-Memory-Management) v0.0.2 ist ein Open-Source-Plugin, das eine vollständige Knowledge-Pipeline für AI Agents implementiert: Sammlung, Aufbereitung, Abruf und Synchronisation. Statt Speichermedien zu ersetzen, fokussiert sich KMM auf die automatisierte Datenaufnahme aus über 40 Tools für Web, Video und Dokumente, strukturiert Inhalte in Notizen sowie Knowledge-Graph-Nodes und synchronisiert einen geteilten Wissenspool über Geräte hinweg via rclone bisync. Der Abruf erfolgt in drei Stufen: lokale FTS5-Suche, semantische Hindsight-Vektorsuche und gbrain Knowledge-Graph-Lookup für assoziatives Reasoning. Das Projekt bietet Beispielcode, Medienverarbeitungs-Workflows und ein unter der MIT-Lizenz veröffentlichtes GitHub-Repository.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.