Beobachtetes Signal · 18. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Deterministische SCP-Serialisierung reduziert LLM-Token drastisch
Ein Autor hat ein deterministisches, positionelles ASCII-Serialisierungsprotokoll (SCP) für Multi-Agent LLM-Sessions veröffentlicht, das strukturierte Nachrichten anhand eines externen, versionierten Wörterbuchs kodiert. Benchmarks mit dem cl100k_base Tokenizer zeigen, dass der SCP ASCII ID-Stack nur 11 Token benötigt, verglichen mit 38 Token für Standard JSON (3,45-mal weniger) und 49 Token für russischen Fließtext. Bei nicht-lateinischen Sprachen wie Hindi steigen die Einsparungen auf bis zum 9,89-Fachen. Der Ansatz erfordert ein festes, enumarables Schema (keinen Freitext), ist in Python implementiert und unter der AGPLv3 verfügbar. Der Beitrag verweist auf Cache-Ökonomien bei Anthropic und OpenAI sowie auf Einschränkungen und empfohlene Re-Benchmarks für andere Tokenizer und Modellfamilien.
Bietet eine praxisnahe Technik zur spürbaren Reduzierung des LLM-Token-Verbrauchs, insbesondere bei nicht-englischen Skripten, was die Inferenzkosten für Multi-Agent LLM-Systeme senkt, jedoch auf strukturierte Daten beschränkt und ein Open-Source-MVP ist.
Marktsignale zu Anthropic in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Entwicklung eines deterministischen, positionellen ASCII-Serialisierungsprotokolls (SCP) für Multi-Agent LLM-Sessions zur Senkung der Token-Kosten.
- Benchmark auf cl100k_base: Russisch = 49 Token, Standard JSON = 38 Token, SCP ASCII ID-Stack = 11 Token (3,45x weniger als JSON).
- Gemessene Sprachmultiplikatoren vs. SCP: Englisch 1,89x, Russisch 5,11x, Arabisch 5,56x, Japanisch 4,22x, Hindi 9,89x.
- SCP setzt ein festes externes Schema/Wörterbuch voraus und funktioniert ausschließlich für strukturierte, enumarable Felder.
- Referenzimplementierung unter AGPLv3 veröffentlicht im Repository andrey-architect/scp-protocol.
Verknüpfte Unternehmen
2 verknüpfte Unternehmen“Anthropic and OpenAI both offer ~90% discounts on cached input tokens....”
“Anthropic and OpenAI both offer ~90% discounts on cached input tokens....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Open-Source-CLI „mcptoon“ reduziert MCP-Token-Nutzung um 91 Prozent
Ein Autor hat einen technischen Beitrag über „mcptoon“ veröffentlicht, eine Open-Source-CLI, die den Token-Overhead von MCP (Multi-Client Plugin) durch die Komprimierung von JSON-Tool-Schemas in ein kompaktes SLIM-Format reduziert. Das Tool ermöglicht eine kontextfreie Erkennung und gibt Ergebnisse in einem TOON-Key-Value-Format aus. Der Autor berichtet über eine Reduzierung von 255 Tool-Schemas von 39.964 Token auf 3.511 Token (eine Einsparung von 91 %), verifiziert mit tiktoken.get_encoding("cl100k_base"). Eine Lektion über Tokenizer führte dazu, dass Unicode-Abkürzungen nach entsprechenden Messungen vermieden wurden. Der Beitrag enthält Kostenbeispiele auf Basis der GPT-4o-Preise (5 US-Dollar pro Million Token), Nutzungsbefehle, einen GitHub-Link sowie Pläne für weitere Server und Benchmarks.
MCP Tools Cut Agent Token Costs and Hallucinations
A developer describes building 24 custom Model Context Protocol (MCP) tools (organized into six categories) to power an autonomous agent managing six production services. The post argues MCP tool schemas act as "native prompts," reducing system-prompt length, lowering hallucination risk, and enforcing constraints in code rather than prose. In an example workflow, structured MCP calls reduced a three-turn, ~809-token interaction to a single ~250-token turn (≈3.2x token savings). Additional optimizations include dynamic per-execution mini-configs (load only relevant servers/tools) and session-based context retention, which compound token and cost savings. Implementation details: a single-file Python MCP server using the MCP SDK, claude -p (Claude Code CLI) as the agent runtime (Max plan), tool-level blocklists and hard-coded constraints, and practical cost comparisons across subscription and per-token pricing models.
KODA: Schema-First Format Cuts LLM Token Usage
KODA (Knowledge-Oriented Data Abstraction) is a schema-first transport format designed to reduce token usage when sending structured data to large language models. Instead of repeating JSON keys per record, KODA defines schemas once and encodes values positionally, removing redundancy. Benchmarks (using a gpt-4o-mini tokenizer) show large token reductions on repetitive datasets (e.g., 61.5% for logs, 37.7% for GitHub issues), though small datasets can see worse results due to schema overhead. The project is published on GitHub (Om7035/koda) and is positioned for high-volume LLM use cases such as RAG pipelines, tool-calling systems and agent workflows.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
