Beobachtetes Signal · 24. Juli 2026 · Technical Analysis · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Negativ

KI verbraucht 42.000 Token für die Frage „Wer bist du?“

Zusammenfassung des Signals

Ein Entwickler hat Netzwerkprotokolle einer Claude-Code-Sitzung analysiert und festgestellt, dass eine 19 Byte kurze Frage eine Anfrage-Nutzlast von 118.693 Bytes erzeugte. Vor der Ausgabe einer 127 Token langen Antwort musste das Modell rund 42.270 Token an Kontext einlesen. Die Anfrage umfasste 38 Tool-JSON-Schemas mit viel englischem Text, einen 20,7 KB großen System-Prompt sowie zahlreiche serverseitige Feature-Flags. Zudem wurden parallele Aufrufe, Token-Zählungs-APIs und rund 600 KB an Telemetriedaten generiert. Viele dieser Kernkomponenten werden serverseitig gesteuert und lassen sich vom Endanwender nicht deaktivieren, was weitreichende Implikationen für Kosten, Latenz und Datenschutz bei der Implementierung von Conversational AI hat.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Die Analyse offenbart massive, nicht abschaltbare Kontext- und Telemetrielasten in LLM-Anfragen, die erhebliche Auswirkungen auf Kosten, Latenz, Datenschutz und die Entwicklerkontrolle bei der Bereitstellung von Conversational AI haben.

SIGNAL RADAR

Marktsignale zu Anthropic in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Ein Entwickler stellte Claude Code die 19 Byte große Frage „Wer bist du?“.
  • Die Nutzlast der Anfrage betrug 118.693 Bytes, was einer ca. 6.200-fachen Verstärkung der Eingabegröße entspricht.
  • 38 Tool-JSON-Schemas machten 78.935 Bytes aus, davon 44.392 Bytes in englischer Prosa.
  • Das Modell verarbeitete ca. 42.270 Kontext-Token für eine 127-Token-Antwort bei einer Latenz von 8,7 Sekunden.
  • Der Client erzeugte parallele API-Aufrufe, Token-Zählungen und rund 600 KB Telemetriedaten über mehr als 184 ‚tengu_‘-Ereignisse.

Verknüpfte Unternehmen

1 verknüpfte Unternehmen

“And the telemetry. Oh, the telemetry. In the same 15-second window: ~600KB across 184+ events, every one namespaced `tengu_` — Anthropic's i...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 24. Juli 2026
Ursprünglicher Berichttitel: “I Asked My AI "Who Are You" — It Cost 42,000 Tokens to Answer”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI13. Mai 2026

Cursor sendete 8.400 Tokens für einfache Umbenennung

Ein Entwickler hat beobachtet, dass eine simple Umbenennung einer dreizeiligen Funktion in Cursor eine Anfrage mit 8.400 Input-Tokens an Anthropic auslöste, während ein direkter API-Aufruf lediglich rund 1.900 Input-Tokens benötigte. Wiederholte Tests zeigten, dass Cursor regelmäßig tausende Extratokens übermittelt, was vermutlich auf System-Prompts, indizierten Kontext und Agenten-Tool-Definitionen zurückzuführen ist. Um die Kosten zu kontrollieren, entwickelte der Autor eine rund 200-Zeilen TypeScript-Routing-Schicht mit einer simplen Intentionstypisierung, die Prompts an günstigere Modelle weiterleitet. Dies reduzierte die monatlichen KI-Kosten in der Praxis um etwa 41 Prozent. Der Beitrag verdeutlicht, dass IDE-Integrationen und Wrapper-Anwendungen wirtschaftliche Anreize haben, konservativ viel Kontext mitzusenden, während Entwickler durch eine eigene Routing-Schicht die LLM-Infrastrukturkosten spürbar senken können.

Signal analysieren
Large Language Models (LLM) & AI8. Apr. 2026

KI-Tokenmaxxing: Metas 60-Billionen-Token-Wette und die Ökonomie des Overcomputings

Diese Analyse untersucht das wachsende Phänomen des „Tokenmaxxings“, bei dem KI-Teams massive Mengen an Inference-Token als Statuszeichen und technische Strategie verbrauchen. Dem Bericht zufolge nutzten Meta-Mitarbeiter eine interne Bestenliste namens „Claudeonomics“, wobei die Dashboard-Nutzung in einem 30-Tage-Zeitraum rund 60 Billionen Token erreichte. Es werden Zitate von Nvidia-CEO Jensen Huang zu großen Token-Budgets sowie das OpenAI-Programm „Tokens of Appreciation“ angeführt. Kritisiert werden Architekturen, die Modelle zu tokenbasiertem Schließen zwingen, während alternative Forschungsansätze von Meta/FAIR wie JEPA und Coconut vorgestellt werden, die im kontinuierlichen latenten Raum arbeiten. Zudem wirft der Newsletter Fragen auf, ob Meta Claude-Outputs von Anthropic als Trainingsdaten genutzt hat, was ethische und vertragliche Bedenken hinsichtlich des großflächigen Modelltrainings und der Compute-Ökonomie aufwirft.

Signal analysieren
Large Language Models (LLM) & AI4. Juni 2026

Tool-I/O bläht Claude Code auf; Throughline senkt Token um 90 %

Eine Entwickleranalyse von Claude-Code-Transkripten ergab, dass rund 87 % der Token aus dem Gesprächsverlauf stammen, wobei etwa 80 % davon auf Tool-I/O wie Dateiausgaben und Kommandoergebnisse entfallen. Da die Reduzierung von CLAUDE.md und Tool-Definitionen kaum ins Gewicht fällt, wurde Throughline entwickelt – ein Open-Source-Node.js-Tool, das verdrängte Tool-I/O in SQLite speichert. Durch ein dreistufiges Kontextmodell (L1-Skelett-Zusammenfassungen, L2-Verlauf der letzten 20 Turns, L3-ausgelagerter Tool-I/O in der Datenbank) sank der Kontextverbrauch in einem Test mit 50 Turns von rund 125.000 auf etwa 13.000 Token. Throughline steht unter MIT-Lizenz auf GitHub zur Verfügung, erfordert Node.js 22.5+ sowie einen Claude-MAX-Vertrag und adressiert damit Effizienzprobleme bei KI-Agenten-Workflows.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.