Beobachtetes Signal · 28. Juni 2026 · Technical Guidance · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv

Schluss mit tiktoken für Claude: Warum countTokens unverzichtbar ist

Zusammenfassung des Signals

Der Autor deckt eine Unterzählung von 15 bis 20 Prozent auf, wenn OpenAI's tiktoken zur Schätzung der Claude Token-Nutzung und der damit verbundenen Kosten verwendet wird. Da Claude einen anderen, modellspezifischen Tokenizer nutzt, divergieren die Ergebnisse – insbesondere bei Quellcode oder nicht-englischen Texten – und können sich zwischen Claude-Modellversionen verändern. Anthropic stellt hierfür einen messages.countTokens Endpoint bereit, der die exakte Anzahl der Input-Token für ein spezifisches Claude-Modell liefert. Entwickler sollten diesen abrufen, um präzise Kosten- und Kontextschätzungen zu erhalten, das Caching von Token-Zahlen über Modellversionen hinweg vermeiden und berücksichtigen, dass Output-Token maßgeblich die Generierungskosten treiben. Der Beitrag enthält SDK-Beispiele sowie veröffentlichte Preise pro Million Token für Haiku 4.5, Opus 4.8 und Fable 5. Veröffentlichungsdatum ist der 28. Juni 2026.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Eine präzise Token-Zählung beeinflusst das Kosten- und Kontext-Budgetierung für LLM-Anwendungen maßgeblich. Der Artikel adressiert einen typischen Entwicklerfehler und verweist auf die modellspezifische countTokens API zur korrekten Budgetierung.

SIGNAL RADAR

Marktsignale zu OpenAI in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • tiktoken ist für OpenAI-Modelle optimiert und unterschätzt Claude-Token bei normalem englischen Text um etwa 15 bis 20 Prozent.
  • Anthropic bietet einen messages.countTokens Endpoint (eingebunden in das SDK), der modellspezifische Token-Zahlen für Claude liefert.
  • Token-Zahlen können sich zwischen Claude-Modellversionen unterscheiden (z. B. erzeugt Opus 4.7 einen höheren Wert als Opus 4.6 für denselben Input).
  • Veröffentlichte Raten pro Million Token (2026): Haiku 4.5 Input 1 USD / Output 5 USD; Opus 4.8 Input 5 USD / Output 25 USD; Fable 5 Input 10 USD / Output 50 USD.
  • Empfehlung: Stets countTokens für das exakt genutzte Inferenz-Modell aufrufen und keine gecachten Zählungen über Modellversionen hinweg wiederverwenden.

Verknüpfte Unternehmen

2 verknüpfte Unternehmen
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 28. Juni 2026
Ursprünglicher Berichttitel: “Token Counting Done Right: Stop Using tiktoken for Claude”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models & AI18. Mai 2026

Fünf Tipps zur Reduzierung der Claude-Code-Token-Kosten um 30 Prozent

Ein auf DEV Community veröffentlichter Beitrag zeigt fünf praxisnahe Methoden auf, um den Token-Verbrauch bei der Nutzung von Anthropic Claude Code signifikant zu senken. Zu den empfohlenen Maßnahmen gehören das Hinterlegen einer präzisen CLAUDE.md-Datei im Projektstammverzeichnis für dauerhaften Kontext, die Beschränkung jeder Session auf exakt eine Aufgabe sowie die konsequente Nutzung von Prompt Caching. Anwender sollten zudem das Read-Tool bevorzugen, statt große Dateien manuell einzufügen, und für Routineaufgaben kleinere Modellvarianten wie Sonnet oder Haiku einsetzen. Der Autor verzeichnet Einsparungen beim Token-Verbrauch von 25 bis 35 Prozent und gibt konkrete Praxisbeispiele an, bei denen die Input-Kosten pro Session von 0,60 auf 0,18 US-Dollar sanken. Ergänzend listet der Beitrag relative Modellkosten auf und warnt vor unseriösen Drittanbieter-Relays sowie manueller Prompt-Kompression zur Kostenoptimierung.

Signal analysieren
Large Language Models (LLM) & AI20. Mai 2026

KI-Agenten-Tokenkosten über CLI reduzieren (Leitfaden 2026)

Ein technischer Leitfaden aus dem Mai 2026 zeigt, wie CLI-basierte Coding-Agenten wie Claude Code und Codex Token verschwenden, und liefert praxisnahe Taktiken zur Kostensenkung ohne Qualitätsverlust. Zu den empfohlenen Maßnahmen gehören das Einschränken des Datei- und Verzeichnis-Scopes, das Kürzen von Projekt-Memory-Dateien wie CLAUDE.md, das Komprimieren oder Zurücksetzen langer Sitzungen sowie die Nutzung von Prompt-Caching. Weitere Hebel sind das Routing einfacher Teilaufgaben zu günstigeren Modellen, das Filtern lauter Tool-Outputs, die Begrenzung von RAG-Retrieval-Größen sowie das Tracking der Token- und Laufzeitkosten. Der Artikel bietet konkrete Befehlsbeispiele, geschätzte Einsparpotenziale pro Taktik, eine Implementierungs-Checkliste sowie Formeln zur Kostenberechnung. Zudem wird auf relevante Tools wie Apidog und anbieterspezifische Besonderheiten von OpenAI und Anthropic verwiesen, um die Effizienz im Engineering-Alltag nachhaltig zu steigern.

Signal analysieren
Large Language Models (LLM) & AI12. Juli 2026

Benchmark: Claude Code sendet 33k Tokens im Vergleich zu OpenCodes 7k

Ein Systima-Benchmark hat den Token-Overhead von zwei Agent-Harnesses gemessen: Claude Code 2.1.207 und OpenCode 1.17.18 (jeweils im Zielmodus auf claude-sonnet-4-5). Dabei injizierte Claude Code vor dem eigentlichen Prompt des Nutzers rund 33.000 Tokens an System-Prompts, Tool-Schemas und Scaffolding, während OpenCode bei etwa 7.000 Tokens lag. Zudem schrieb Claude Code pro Sitzung deutlich mehr Prompt-Cache-Tokens neu (bis zum 54-Fachen), was die abrechenbaren Kosten für Cache-Writes erhöht. Die Studie verdeutlicht, dass reale Produktionsumgebungen (Instruction-Dateien, MCP-Server, Gateways) die Bootstrap-Nutzlast vor der ersten Benutzereingabe auf 75.000 bis 85.000 Tokens steigern können. Dabei bestimmt die Struktur der Sitzung – Batching versus wiederholte kleine Turns – maßgeblich die Gesamtkosten.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.