Beobachtetes Signal · 16. Aug. 2026 · Product Launch · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Open-Source-Tool cache-assembler senkt Claude-Code-API-Kosten um das 8,2-Fache
Michael Nash hat cache-assembler veröffentlicht, einen unter der MIT-Lizenz stehenden Proxy, der Prompts normalisiert, die Serialisierung von Tools stabilisiert und gleichzeitige Cache-Schreibvorgänge dedupliziert. Ziel ist es, das Prompt Caching für Anthropics Claude Code signifikant zu verbessern. In Testläufen sanken die Kosten für eine Konversation mit 100 Runden von 1,33 US-Dollar bei direkter Nutzung auf 0,16 US-Dollar über den Proxy, was einer Kostenreduktion um das 8,2-Fache entspricht. Die tatsächlichen Einsparungen hängen vom Nutzungsmuster ab: Stark paralleler Agenten-Traffic verzeichnet die größten Effekte, während leichtere Nutzer eine Einsparung um das 2- bis 3-Fache erwarten können. Das Projekt ist auf GitHub verfügbar und wurde auf Product Hunt gelauncht. Die Implementierung ist derzeit für Anthropic und Claude getestet, während Codex und Gemini andere Caching-Mechanismen erfordern.
Ein Open-Source-Tool zur spürbaren Senkung von LLM-API-Kosten bei agentenbasierten und parallelen Workflows, das besonders für Teams mit hohem Claude-Aufkommen relevant ist, sich derzeit jedoch primär auf Anthropic konzentriert.
Marktsignale zu Anthropic in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Michael Nash hat cache-assembler als Open-Source-Projekt unter der MIT-Lizenz veröffentlicht.
- In einem Test mit 100 Konversationsrunden sanken die API-Kosten von 1,33 US-Dollar direkt auf 0,16 US-Dollar über den Proxy (eine Reduktion um das 8,2-Fache).
- cache-assembler ist ein Proxy, der eine konsistente Tool-Serialisierung erzwingt, volatile Prompt-Teile entfernt und gleichzeitige Cache-Schreibvorgänge dedupliziert.
- Das Tool wurde für Anthropics Claude Code getestet; Codex und Gemini nutzen abweichende Caching-Mechanismen und erfordern separate Anpassungen.
- Das Projekt ist auf GitHub (nash-software/cache-assembler) gehostet und auf Product Hunt gelistet.
Verknüpfte Unternehmen
6 verknüpfte Unternehmen“Anthropic's the only one this actually ships for right now....”
“https://github.com/nash-software/cache-assembler...”
“PSA: If you're using Claude Code, you can monitor every session with Sentry...”
“DEV Community...”
“Powered by Algolia...”
“Built on Forem — the open source software that powers DEV...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Fünf Tipps zur Reduzierung der Claude-Code-Token-Kosten um 30 Prozent
Ein auf DEV Community veröffentlichter Beitrag zeigt fünf praxisnahe Methoden auf, um den Token-Verbrauch bei der Nutzung von Anthropic Claude Code signifikant zu senken. Zu den empfohlenen Maßnahmen gehören das Hinterlegen einer präzisen CLAUDE.md-Datei im Projektstammverzeichnis für dauerhaften Kontext, die Beschränkung jeder Session auf exakt eine Aufgabe sowie die konsequente Nutzung von Prompt Caching. Anwender sollten zudem das Read-Tool bevorzugen, statt große Dateien manuell einzufügen, und für Routineaufgaben kleinere Modellvarianten wie Sonnet oder Haiku einsetzen. Der Autor verzeichnet Einsparungen beim Token-Verbrauch von 25 bis 35 Prozent und gibt konkrete Praxisbeispiele an, bei denen die Input-Kosten pro Session von 0,60 auf 0,18 US-Dollar sanken. Ergänzend listet der Beitrag relative Modellkosten auf und warnt vor unseriösen Drittanbieter-Relays sowie manueller Prompt-Kompression zur Kostenoptimierung.
Proxy halbiert Token-Kosten von Claude Code durch Optimierung
Ein Entwickler hat Lynkr entwickelt, einen Open-Source-Reverse-Proxy unter Apache-2.0-Lizenz, um den Token-Verbrauch und die Abrechnung für agentische Coding-Tools wie Claude Code zu reduzieren. Analysen zeigten, dass die meisten Token für Tool-Schemas und wortstämmige JSON-Ausgaben anfallen, nicht für Prompts oder Modellantworten. Lynkr nutzt vier Techniken: das Entfernen nicht genutzter Tool-Schemas, token-orientierte JSON-Kompression (TOON) inklusive Feld-Bereinigung, semantisches Caching sowie ein komplexitätsbasiertes Routing zu lokalen oder günstigeren Modellen. Dies führt zu messbaren Einsparungen, wie 53 Prozent weniger Token bei toolastigen Anfragen und 87,6 Prozent Reduktion bei einer Grep-JSON-Nutzlast. In den Sitzungen des Autors wurden 70 bis 90 Prozent der Anfragen lokal als SIMPLE oder MEDIUM geroutet, wodurch kostenpflichtige Cloud-Inferenz nur für komplexe Aufgaben vorgehalten wird. Projekt und Benchmarks sind auf GitHub verfügbar.
Entwickler investiert 8.857 Dollar in Claude Code: Praxis-Erkenntnisse und Kostenanalyse
Ein Entwickler analysierte ein 14-tägiges Experiment mit Claude Code (Opus 4.8, 1M Context Window) über sechs Projekte hinweg. Bei Gesamtausgaben von 8.857,62 US-Dollar fielen 3,884 Milliarden Tokens und 47.235 API-Requests an. Den größten Kostenblock bildete LightCraft V2 (~4.200 USD), gefolgt von einer AI-News-Video-Pipeline (~1.800 USD). Zentraler Effizienztreiber war Prompt/Context Caching mit einer Cache-Hit-Rate von 86,4 % (2,499 Mrd. Hits), was die Grenzkosten drastisch senkte, da Cache Hits nur mit etwa einem Zehntel neuer Inputs bepreist werden. Der Bericht differenziert zwischen Opus für Architektur- und Ermessensaufgaben sowie Sonnet für Routineaufgaben. Zudem betont der Autor Konfigurationshebel wie CLAUDE.md-Vorgaben, PreToolUse/PostToolUse-Hooks und 'effortLevel=xhigh' in settings.json, warnt jedoch vor blinden Flecken der KI bei Legacy-Stacks, Plattform-Richtlinien und Edge Cases.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
