Beobachtetes Signal · 22. Apr. 2026 · Technical Release · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
WebSockets beschleunigen agentische Workflows in der Responses API
OpenAI hat einen WebSocket-Modus für seine Responses API eingeführt, um den API-Overhead für agentische Workflows zu reduzieren. Durch eine persistente Verbindung und das Caching des vorherigen Antwortstatus vermeidet die Responses API wiederholte Tokenisierungs- und Validierungsarbeiten, überlappt Pipeline-Stufen und verarbeitet ausschließlich neue Eingaben. In Kombination mit Caching, weniger Netzwerk-Hops und schnelleren Sicherheitsprüfungen meldet OpenAI eine Beschleunigung der End-to-End-Agentenschleifen von rund 40 Prozent. Dies ermöglicht es GPT-5.3-Codex-Spark, mit etwa 1.000 Tokens-per-Second (TPS) bei Spitzenwerten von bis zu 4.000 TPS zu laufen. Eine Alpha-Version mit Coding-Partnern wie Vercel, Cline und Cursor zeigte deutliche Latenzverbesserungen. Die Funktion behält die vertraute Struktur über einen previous_response_id-Mechanismus bei. Der Blogbeitrag stammt vom 22. April 2026 von Brian Yu und Ashwin Nathan.
Dieses technische Release einer großen KI-Plattform reduziert die API-Latenz für LLM-gestützte agentische Workflows signifikant, steigert den Inferenz-Durchsatz und ist hochrelevant für Entwickler sowie MarTech-Anwendungen, die schnelle Agenten integrieren.
Marktsignale zu Vercel in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI hat einen WebSocket-Modus für die Responses API für persistente Verbindungen und im Arbeitsspeicher gecachten Antwortstatus gestartet.
- Agentische Workflows im WebSocket-Modus erreichen bis zu ~40 % schnellere End-to-End-Latenzen verglichen mit sequenziellen HTTP-Anfragen.
- GPT-5.3-Codex-Spark erreichte nach dem Launch ca. 1.000 Tokens-per-Second (TPS) in der Produktion mit Spitzenwerten bis zu 4.000 TPS.
- Optimierungen umfassen das Caching gerenderter Tokens, den Wegfall von Zwischenschritten im Netzwerk und schnellere Sicherheitsprüfungen.
- Alpha-Integrationen bei Partnern wie Vercel, Cline und Cursor zeigten Latenzsenkungen von bis zu 40 %, 39 % bzw. 30 %.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI Unveils Lightning-Fast GPT-5.3 Codex-Spark Model
OpenAI announced a research preview of GPT‑5.3‑Codex‑Spark, a smaller, ultra-fast variant of GPT‑5.3‑Codex optimized for real‑time coding. Launched February 12, 2026, Codex‑Spark is served on low‑latency Cerebras hardware and delivers over 1,000 tokens per second with a 128k text-only context window. Initially available to ChatGPT Pro users as a research preview and to a small set of API design partners, Codex‑Spark emphasizes minimal, targeted edits for interactive workflows. OpenAI also rolled out end-to-end latency improvements (persistent WebSocket support and Responses API optimizations) that reduce roundtrip and per-token overheads and speed time-to-first-token. The model is evaluated under OpenAI’s safety processes and is text-only at launch; broader capabilities and access will expand over time.
OpenAI Unveils Lightning-Fast Codex with New Cerebras Chip
OpenAI announced a lightweight, low-latency version of its coding agent Codex called GPT-5.3-Codex-Spark, designed for faster inference and rapid prototyping. Spark is intended for real-time collaboration and shorter development tasks, and is available as a research preview to ChatGPT Pro users in the Codex app. To deliver the lower latency, OpenAI is running Spark on Cerebras’ Wafer Scale Engine 3 (WSE-3) as part of a recently disclosed multi-year compute agreement between the two companies reportedly worth over $10 billion. Cerebras’ WSE-3 is described as its third-generation waferscale megachip with roughly 4 trillion transistors. Cerebras also recently raised $1 billion in funding at a reported $23 billion valuation. OpenAI framed Spark as the first milestone in deeper hardware integration with Cerebras to speed model responses.
Two API Settings Tripled ARC‑AGI‑3 Scores
OpenAI reports that enabling two Responses API settings—retained reasoning and compaction—substantially improved agent performance on the ARC‑AGI‑3 2D puzzle benchmark. Using their Responses API harness (which retains private reasoning messages across turns and compacts long histories instead of rolling truncation), GPT‑5.6 Sol's score on the ARC‑AGI‑3 public set rose from 13.3% with the official harness to 38.3%, roughly a 3x improvement, while output tokens fell by about 6x. The post explains that the official ARC harness discarded private reasoning and used rolling truncation, which prevented models from carrying forward internal thoughts and older actions. OpenAI recommends using retained reasoning and compaction in evaluations to better match production deployments like ChatGPT and Codex.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
