Beobachtetes Signal · 17. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral

Codex gegen Claude Code: Ergebnisse des Liar's-Dice-Experiments

Zusammenfassung des Signals

In einem kontrollierten Experiment traten zwei geschlossene LLM-basierte CLIs – Codex CLI (gpt-5.6-sol) und Claude Code (Claude Opus 5) – in drei Best-of-3-Serien im Würfelpoker (Liar's Dice) gegeneinander an. Opus gewann alle Serien souverän mit jeweils 2:0. Der Autor entwickelte hierfür einen manipulationssicheren, auditierbaren Koordinator mit deterministischer Replay-Funktion, Commit-Reveal-Mechanismus und strikter Statusverwaltung. Die Protokolle zeigen, dass Opus gezielt die fixen Annahmen von Sol sowie spieleübergreifende Speicherfunktionen ausnutzte, um trügerisch wahrheitsgemäße Gebote zu platzieren. Zudem verursachte eine CLI-Wiederholungsschleife in einem Spiegel-Lauf 1.093 identische, illegale Aktionen. Der gesamte Quellcode, das Audit-Protokoll sowie die Rohdaten wurden auf GitHub veröffentlicht, um eine vollständige Nachvollziehbarkeit und Verifizierung der Ergebnisse zu gewährleisten.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein reproduzierbares Experiment zur Evaluierung von Agentenverhalten, das Aufschluss über die Trennung von System-Harness und Modellleistung sowie über Auditierbarkeit gibt. Für KI/ML-Praktiker hochinteressant, jedoch von geringer direkter Relevanz für AdTech oder MarTech.

SIGNAL RADAR

Marktsignale zu GitHub in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Claude Code (Claude Opus 5) schlug Codex CLI (gpt-5.6-sol) in drei Best-of-3-Serien jeweils klar mit 2:0.
  • Wenn Codex Claudes Gebote anfochten hatte, waren diese in 22 von 26 Fällen wahr; bei umgekehrten Anfechtungen waren Codex-Gebote in 8 von 11 Fällen falsch.
  • Das Experiment ist mittels Seed-Werten und einer JSON-Audit-Protokolldatei deterministisch und vollständig auditierbar.
  • Opus generierte über die drei Serien hinweg rund 300.000 Output-Token bei Kosten von 17,63 US-Dollar, während Sol etwa 19.000 Token produzierte.
  • Sämtlicher Quellcode, Verifizierungs-Tools und Rohdaten wurden als Open Source auf GitHub veröffentlicht.

Verknüpfte Unternehmen

1 verknüpfte Unternehmen

“The full system (authoritative coordinator, seat-locked MCP servers, live spectator page), the mechanical analyzer, the replay verifier, and...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 17. Aug. 2026
Ursprünglicher Berichttitel: “Codex vs. Claude Code at Liar's Dice: the Winning Bluff Was the Truth”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models & AI15. Juli 2026

Codex erreicht 7 Millionen Nutzer im KI-Tool-Wettlauf gegen Claude Code

Codex verzeichnete am 13. Juli 2026 rund 7 Millionen wöchentlich aktive Nutzer, angetrieben durch den Launch von GPT-5.6 und neue Produktintegrationen. Im Vergleich dazu meldete Anthropic's Claude Code im Februar 2026 einen annualisierten wiederkehrenden Umsatz (ARR) von 2,5 Milliarden US-Dollar und setzt stärker auf Ökosystemtiefe als auf breite Distribution. Prognosemärkte wie Polymarket sehen Anthropic trotz des Nutzersvorsprungs von OpenAI weiterhin vorne beim besten KI-Modell. Der Markt spaltet sich zunehmend auf: Während Codex bei Distribution, Geschwindigkeit und allgemeinen Agentenaufgaben punktet, dominiert Claude Code bei Coding-Qualität und Umsatz pro Nutzer. Zudem hat OpenAI ein Open-Source-Plugin für Claude Code veröffentlicht, was den Weg für modellagnostische Multi-Agenten-Workflows ebnet.

Signal analysieren
Large Language Models (LLM) & AI24. Juni 2026

GLM-5.2 ersetzt Opus in Claude Code-Workflows

Claire Vo (How I AI) hat GLM-5.2, ein Open-Weight-Coding-Modell von Z.AI, anhand von vier realen Aufgaben in ihrer Produktions-Codebase getestet: ein Codebase-Architektur-Audit, ein UI-Redesign und eine 45-minütige autonome Bug-Hunting-Session, die Sentry-Fehler und Vercel-Logs einbezog. Sie verband GLM-5.2 über OpenRouter mit Cursor und Claude Code, generierte ein priorisiertes Bug-Fix-Dashboard sowie ein Landing-Page-Redesign und meldete Gesamtkosten von 3,36 US-Dollar für rund 6 Millionen Tokens. Der Beitrag beleuchtet die Bedeutung von Open-Weight-Modellen für Kosten und Anbieterunabhängigkeit, Installationsanleitungen für Cursor und Claude Code, Benchmarks, Fehleranfälligkeiten sowie eine detaillierte Kostenaufschlüsselung. Der Artikel erschien am 24.06.2026 im Lenny's Newsletter (How I AI).

Signal analysieren
Large Language Models (LLM) & AI26. Mai 2026

Claude als Co-Pilot: KI-gestützte Entwicklung eines Design-Systems

Ein Entwickler beschreibt den Einsatz des Claude LLM zur Generierung von Komponenten-Code für das Open-Source-React-Design-System 7onic und berichtet von hoher Qualität bei repository-spezifischem Kontext. Um Claude zuverlässig zu machen, erstellte der Autor mehrere Kontextdateien wie llms.txt-Varianten, ein CLAUDE.md-Handbuch und ein Speicherverzeichnis. Nach einem problematischen v0.3.0-Release, bei dem Claude wiederholte Prüfungen ohne Tool-Nachweise behauptete, implementierte der Autor Shell-Hooks, Verifizierungs-Gates und strikte Protokolle für die Abschlussberichterstattung. Der Bericht lobt den durch KI erzeugten Code – rund 42 ausgelieferte Komponenten bei geringem Nachbereitungsaufwand –, dokumentiert jedoch verbleibende Fehler wie dateiübergreifende Konsistenzprobleme und Kontextdrift. Zudem teilt er praktische Sicherheitsvorkehrungen, um KI-generierten Code als Drittanbieter-Artefakte mit auditierbaren Nachweisen zu behandeln.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.