Beobachtetes Signal · 28. Juni 2026 · Technical Guidance · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Schluss mit tiktoken für Claude: Warum countTokens unverzichtbar ist
Der Autor deckt eine Unterzählung von 15 bis 20 Prozent auf, wenn OpenAI's tiktoken zur Schätzung der Claude Token-Nutzung und der damit verbundenen Kosten verwendet wird. Da Claude einen anderen, modellspezifischen Tokenizer nutzt, divergieren die Ergebnisse – insbesondere bei Quellcode oder nicht-englischen Texten – und können sich zwischen Claude-Modellversionen verändern. Anthropic stellt hierfür einen messages.countTokens Endpoint bereit, der die exakte Anzahl der Input-Token für ein spezifisches Claude-Modell liefert. Entwickler sollten diesen abrufen, um präzise Kosten- und Kontextschätzungen zu erhalten, das Caching von Token-Zahlen über Modellversionen hinweg vermeiden und berücksichtigen, dass Output-Token maßgeblich die Generierungskosten treiben. Der Beitrag enthält SDK-Beispiele sowie veröffentlichte Preise pro Million Token für Haiku 4.5, Opus 4.8 und Fable 5. Veröffentlichungsdatum ist der 28. Juni 2026.
Eine präzise Token-Zählung beeinflusst das Kosten- und Kontext-Budgetierung für LLM-Anwendungen maßgeblich. Der Artikel adressiert einen typischen Entwicklerfehler und verweist auf die modellspezifische countTokens API zur korrekten Budgetierung.
Marktsignale zu OpenAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- tiktoken ist für OpenAI-Modelle optimiert und unterschätzt Claude-Token bei normalem englischen Text um etwa 15 bis 20 Prozent.
- Anthropic bietet einen messages.countTokens Endpoint (eingebunden in das SDK), der modellspezifische Token-Zahlen für Claude liefert.
- Token-Zahlen können sich zwischen Claude-Modellversionen unterscheiden (z. B. erzeugt Opus 4.7 einen höheren Wert als Opus 4.6 für denselben Input).
- Veröffentlichte Raten pro Million Token (2026): Haiku 4.5 Input 1 USD / Output 5 USD; Opus 4.8 Input 5 USD / Output 25 USD; Fable 5 Input 10 USD / Output 50 USD.
- Empfehlung: Stets countTokens für das exakt genutzte Inferenz-Modell aufrufen und keine gecachten Zählungen über Modellversionen hinweg wiederverwenden.
Verknüpfte Unternehmen
2 verknüpfte Unternehmen“I was counting Claude tokens with `tiktoken`, which is OpenAI's tokenizer....”
“import Anthropic from "@anthropic-ai/sdk"; const client = new Anthropic(); // The SDK wraps a dedicated count_tokens endpoint....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Fünf Tipps zur Reduzierung der Claude-Code-Token-Kosten um 30 Prozent
Ein auf DEV Community veröffentlichter Beitrag zeigt fünf praxisnahe Methoden auf, um den Token-Verbrauch bei der Nutzung von Anthropic Claude Code signifikant zu senken. Zu den empfohlenen Maßnahmen gehören das Hinterlegen einer präzisen CLAUDE.md-Datei im Projektstammverzeichnis für dauerhaften Kontext, die Beschränkung jeder Session auf exakt eine Aufgabe sowie die konsequente Nutzung von Prompt Caching. Anwender sollten zudem das Read-Tool bevorzugen, statt große Dateien manuell einzufügen, und für Routineaufgaben kleinere Modellvarianten wie Sonnet oder Haiku einsetzen. Der Autor verzeichnet Einsparungen beim Token-Verbrauch von 25 bis 35 Prozent und gibt konkrete Praxisbeispiele an, bei denen die Input-Kosten pro Session von 0,60 auf 0,18 US-Dollar sanken. Ergänzend listet der Beitrag relative Modellkosten auf und warnt vor unseriösen Drittanbieter-Relays sowie manueller Prompt-Kompression zur Kostenoptimierung.
KI-Agenten-Tokenkosten über CLI reduzieren (Leitfaden 2026)
Ein technischer Leitfaden aus dem Mai 2026 zeigt, wie CLI-basierte Coding-Agenten wie Claude Code und Codex Token verschwenden, und liefert praxisnahe Taktiken zur Kostensenkung ohne Qualitätsverlust. Zu den empfohlenen Maßnahmen gehören das Einschränken des Datei- und Verzeichnis-Scopes, das Kürzen von Projekt-Memory-Dateien wie CLAUDE.md, das Komprimieren oder Zurücksetzen langer Sitzungen sowie die Nutzung von Prompt-Caching. Weitere Hebel sind das Routing einfacher Teilaufgaben zu günstigeren Modellen, das Filtern lauter Tool-Outputs, die Begrenzung von RAG-Retrieval-Größen sowie das Tracking der Token- und Laufzeitkosten. Der Artikel bietet konkrete Befehlsbeispiele, geschätzte Einsparpotenziale pro Taktik, eine Implementierungs-Checkliste sowie Formeln zur Kostenberechnung. Zudem wird auf relevante Tools wie Apidog und anbieterspezifische Besonderheiten von OpenAI und Anthropic verwiesen, um die Effizienz im Engineering-Alltag nachhaltig zu steigern.
Benchmark: Claude Code sendet 33k Tokens im Vergleich zu OpenCodes 7k
Ein Systima-Benchmark hat den Token-Overhead von zwei Agent-Harnesses gemessen: Claude Code 2.1.207 und OpenCode 1.17.18 (jeweils im Zielmodus auf claude-sonnet-4-5). Dabei injizierte Claude Code vor dem eigentlichen Prompt des Nutzers rund 33.000 Tokens an System-Prompts, Tool-Schemas und Scaffolding, während OpenCode bei etwa 7.000 Tokens lag. Zudem schrieb Claude Code pro Sitzung deutlich mehr Prompt-Cache-Tokens neu (bis zum 54-Fachen), was die abrechenbaren Kosten für Cache-Writes erhöht. Die Studie verdeutlicht, dass reale Produktionsumgebungen (Instruction-Dateien, MCP-Server, Gateways) die Bootstrap-Nutzlast vor der ersten Benutzereingabe auf 75.000 bis 85.000 Tokens steigern können. Dabei bestimmt die Struktur der Sitzung – Batching versus wiederholte kleine Turns – maßgeblich die Gesamtkosten.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
