Beobachtetes Signal · 13. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Prototyp detektiert Token-Verschwendung in Multi-Agenten-LLM-Systemen
Ein Entwickler hat das Tool Clew zur Erkennung redundanter Schleifen, Wiederholungsabfragen und Handoffs entwickelt, die bei interagierenden AI-Agenten die Token-Kosten treiben. Ein initialer Ansats zur Fehlervorhersage anhand von UC Berkeleys MAST-Data lieferte schlechte Ergebnisse (AUC ≈ 0,455) und wurde verworfen. Stattdessen erfolgte ein Schwenk auf eine unüberwachte Struktur-zu-Semantik-Kaskade basierend auf einem IBM-Research-Benchmark. Bei synthetischen Testdaten erreichte Clew einen F1-Score von 0,857 mit null False Positives über drei definierte Verschwendungsmuster hinweg. Der Einsatz an echten LangGraph-Instrumentierungen offenbarte konkrete Optimierungspotenziale wie das Zusammenlegen von LLM-Sub-Spans sowie das Ausschließen von Router-Spans ohne Token. Als verbleibendes Risiko erwies sich, dass der synthetisch kalibrierte Ähnlichkeitsschwellenwert möglicherweise nicht verlustfrei auf reale Outputs übertragbar ist. Der Autor sucht nun nach produktiven Multi-Agenten-Traces zur Validierung und zur Messung tatsächlicher Token-Einsparungen.
Ein praxisnaher Prototyp gegen Token-Ineffizienzen in Multi-Agenten-Systemen hilft Engineering-Teams bei der Senkung von Inferenzkosten, muss seine Leistungsfähigkeit jedoch erst noch an echten Produktionsdaten beweisen.
Marktsignale zu CrewAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Entwickler baute Clew zur Erkennung redundanter Schleifen, Re-Queries und Handoffs in Multi-Agenten-LLM-Systemen.
- Ein initialer Ansatz zur Fehlervorhersage auf Basis von UC Berkeleys MAST-Data lieferte eine AUC von rund 0,455 und wurde eingestellt.
- Clews Einzelauswertung bei synthetischen Tests ergab einen F1-Score von 0,857, null False Positives und 100 % Recall bei drei Mustern.
- Ein IBM-Research-Paper beschrieb eine Kaskade, die auf 1.575 LangGraph-Trajektorien einen F1-Wert von 0,72 erzielte.
- Der Einsatz an echten LangGraph-Traces deckte drei Praxisprobleme auf: Span-Kollabierung, Router-bedingte Scheindoppelungen und potenzielle Schwellenwert-Diskrepanzen.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Warum AI Agents scheitern: Drei fehlerhafte Modi bei der Token-Nutzung
Ein AWS-Entwicklerbeitrag analysiert drei verbreitete, unbemerkte Fehlerquellen bei AI Agents – Kontextfenster-Überläufe, MCP-Tool-Timeouts und Reasoning-Schleifen – und liefert forschungsbasierte Korrekturen samt ausführbarer Demos. Der Artikel stellt das Memory-Pointer-Pattern vor, um das Überlaufen des LLM-Kontexts zu verhindern, indem große Tool-Ausgaben im Agentenstatus gespeichert und kurze Pointer übergeben werden. Ein async handleId-Pattern für langsame externe APIs gibt ein Job-Handle zurück und nutzt Polling. Framework-übergreifende Kontrollen (klare Terminalzustände und ein DebounceHook) unterbinden wiederholte, identische Tool-Aufrufe. Die Demos nutzen Strands Agents mit OpenAI (GPT-4o-mini) und sind auf LangGraph, AutoGen sowie CrewAI anwendbar. Der Quellcode ist auf GitHub (aws-samples/sample-why-agents-fail) verfügbar. Ein zitiertes IBM-Beispiel zeigt, dass ein Workflow mit 20 Millionen gescheiterten Tokens mithilfe von Memory Pointers mit nur 1.234 Tokens erfolgreich war.
Verschwendete Token treiben die Kosten für Large Language Models in die Höhe
Der Artikel beleuchtet massive Token-Verschwendungen beim Einsatz von Large Language Models, insbesondere wenn Nutzer ChatGPT-Gewohnheiten auf Anthropic Claude übertragen. Dies führt zu fünf- bis zwanzigmal höheren Kosten und dem schnellen Erreichen von Nutzungslimits. Anhand einer Production AI-Pipeline wird gezeigt, dass effizientes Engineering Multi-Konversations-Analysen und personalisierte Outputs für unter 0,25 US-Dollar pro Nutzer ermöglicht. Die Analyse beschreibt das Migrationsproblem, vier Stufen der Token-Verschwendung, die Ökonomie dahinter und einen sechsteiligen Diagnoseleitfaden. Zur Reduzierung der Ineffizienzen wurden im OB1-Repository spezifische Lösungsansätze wie die KISS-Prinzipien und eine File-Ingestion-Skill veröffentlicht. Der Autor argumentiert, dass die Belastung der Nutzungslimits größtenteils durch optimiertes Session-Design und angepasste Tooling-Strategien behoben werden kann.
Agenten-Kontrollfluss verhindert unkontrollierte LLM-Kostenexplosionen
Der Autor argumentiert, dass deterministischer Kontrollfluss bei LLM-Agenten essenziell für vorhersehbare Verhaltensweisen und Kosten ist. Offene Agenten-Loops erzeugen eine hohe Varianz bei der Token-Nutzung, was durch kürzliche Preisanpassungen von Anbietern wie GitHub Copilot, Anthropic und OpenAI verschärft wurde. Messungen zeigen eine bimodale Kostenverteilung, bei der ein kleiner Long Tail die Ausgaben dominiert. Um finanzielle Risiken zu minimieren, hat der Autor das Open-Source-Dashboard llmeter entwickelt. Er empfiehlt praktische Maßnahmen wie die Protokollierung von Per-Call-Metadaten, getrennte Abrechnungen für gecachte Tokens, das Taggen von Agenten-Loops mit Task-IDs, Warnmeldungen basierend auf P95- statt Durchschnittswerten sowie die Berücksichtigung von Anbieter-Promos in Budgets.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
