Beobachtetes Signal · 29. Juli 2026 · Technical Release · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
Zwei API-Einstellungen verdreifachen ARC-AGI-3-Ergebnisse
OpenAI berichtet, dass die Aktivierung von zwei Responses API-Einstellungen – beibehaltenes Reasoning und Kompaktierung – die Agenten-Performance beim ARC-AGI-3 2D-Puzzle-Benchmark erheblich gesteigert hat. Durch den Einsatz des eigenen Responses API-Harness, das private Reasoning-Nachrichten über mehrere Turns hinweg speichert und lange Historien anstelle einer rollierenden Kürzung komprimiert, stieg der Score von GPT-5.6 Sol auf dem öffentlichen ARC-AGI-3-Datensatz von 13,3 Prozent (mit dem offiziellen Harness) auf 38,3 Prozent. Dies entspricht einer etwa dreifachen Verbesserung, während sich die Output-Token um den Faktor sechs verringerten. Der Beitrag erläutert, dass das offizielle ARC-Harness private Reasoning-Prozesse nach jeder Aktion verwarf und eine rollierende Kürzung verwendete, was das kontinuierliche Lernen des Agenten verhinderte. OpenAI empfiehlt den Einsatz dieser Funktionen in Evaluierungen, um die Bedingungen besser an Produktionseinsätze wie ChatGPT und Codex anzupassen.
Ein führender Anbieter demonstriert, dass die Wahl des Evaluierungs-Harness (beibehaltenes Reasoning und Kompaktierung) die Benchmark-Ergebnisse und Token-Kosten drastisch verändert; dies beeinflusst die Reproduzierbarkeit, Modellvergleiche und Best Practices für den produktiven Einsatz von LLM-Agenten.
Marktsignale zu OpenAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Die Aktivierung von beibehaltenem Reasoning und Kompaktierung steigerte den ARC-AGI-3-Public-Score von GPT-5.6 Sol von 13,3 Prozent (offizielles Harness) auf 38,3 Prozent mit dem Responses API-Harness von OpenAI.
- OpenAI meldet eine Verdreifachung des Scores bei gleichzeitiger Reduzierung der Output-Token um das Sechsfache auf dem öffentlichen Datensatz.
- GPT-5.6 Sol erzielte zuvor 7,8 Prozent bei ARC-AGI-3 (gesamt), während GPT-5.5 vor den Anpassungen des Harness 0,4 Prozent erreichte.
- Das offizielle ARC-Harness verwarf private Reasoning-Daten nach jeder Aktion und nutzte eine rollierende Kürzung, was die kontinuierliche Entwicklung des Agenten beeinträchtigte.
- OpenAI implementierte das ARC-AGI-3-Harness mit seiner Responses API, um private Reasoning-Prozesse über Tool-Aufrufe hinweg beizubehalten und Kompaktierung statt rollierender Kürzung zu nutzen.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“To better match our production setup, we implemented the ARC-AGI-3 harness with our Responses API. Our API makes it easy to manage context: ...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
GPT-5.6 Scores 7.8% on ARC‑AGI‑3 Benchmark
An analysis of OpenAI’s GPT-5.6 (Sol variant) highlights a surprising benchmark result: the model scored 7.8% on the ARC-AGI-3 benchmark, a test of fluid intelligence that humans typically score above 90%. Although GPT-5.6 shows large gains versus GPT-5.5 (0.43%) and strong performance on other ARC-AGI versions, the low absolute ARC-AGI-3 score reveals remaining gaps in planning and long-chain reasoning despite improved scene comprehension and orientation in novel environments. The author notes the evaluation cost (at max reasoning effort) approached $20,000 and cites ARC Prize commentary that Sol succeeded by correctly orienting itself in new environments but fails more often in deeper planning/execution stages.
OpenAI veröffentlicht GPT-5.6 mit massiven Effizienzsteigerungen
OpenAI hat die GPT-5.6-Modellfamilie angekündigt, die das Flaggschiff GPT-5.6 Sol sowie die kostengünstigeren Varianten Terra und Luna umfasst. Das System zielt darauf ab, Leistung und Betriebskosten durch intelligentes Routing auszubalancieren. Sol ist über ChatGPT, Codex und die API verfügbar und kostet 5 US-Dollar pro Million Input-Tokens sowie 30 US-Dollar pro Million Output-Tokens. Der Fokus liegt auf der Deployment-Effizienz, Programmatic Tool Calling und Multi-Agenten-Support. Systemseitige Laufzeitoptimierungen wie Load Balancing, KV-Cache-Tuning, Prompt Caching und Kernel-Verbesserungen sollen die Serving-Kosten um rund 20 Prozent senken und die Token-Generierung um über 15 Prozent steigern. Laut OpenAI übertrifft Sol Claude Fable 5 auf einem Coding-Agenten-Index bei weniger als der Hälfte der Kosten. Unternehmen wird empfohlen, die gesamtheitliche Deployment-Ökonomie zu bewerten, anstatt sich nur auf veröffentlichte Token-Preise zu verlassen.
GPT-5.4 startet: ChatGPT visualisiert Denkprozesse und steuert Anwendungen
OpenAI rollt GPT-5.4 schrittweise für ChatGPT, die API und Codex aus und führt mit GPT-5.4 Thinking und GPT-5.4 Pro dedizierte Modelle für komplexe Aufgabenstellungen ein. Das Update setzt auf ein Reasoning-First-Interface: Nutzer sehen den geplanten Lösungspfad transparent ein und können vor der finalen Antwort intervenieren. GPT-5.4 Thinking ersetzt GPT-5.2 Thinking für Plus-, Team- und Pro-Nutzer; GPT-5.2 bleibt bis zum 5. Juni 2026 als Legacy-Option verfügbar. OpenAI berichtet von signifikanten Fortschritten bei der Verlässlichkeit – darunter 33 % weniger fehlerhafte Einzelaussagen und 18 % weniger Fehler in Gesamtausgaben gegenüber GPT-5.2. In den GDPval-Benchmarks über 44 Berufsfelder hinweg erreicht oder übertrifft das Modell Branchenexperten in 83 % der Fälle. Zudem ermöglicht ein neues Excel-Add-in die Tabellenerstellung und -analyse per natürlicher Sprache. OpenAI forciert damit die tiefere Integration von KI-Agenten in unternehmensweite Workflows und Softwareumgebungen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
