Beobachtetes Signal · 3. Aug. 2026 · Technical Release · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
OpenAI stellt GPT-Live für latenzfreie Full-Duplex-Sprachinteraktion vor
OpenAI hat Details zu GPT-Live veröffentlicht, einem neuen Full-Duplex-Echtzeit-Sprachsystem. Die Architektur verzichtet auf bisherige Turn-Detector-Modelle und verarbeitet Audio kontinuierlich via Streaming-Inference, wodurch gleichzeitiges Hören und Sprechen ermöglicht wird. Über einen asynchronen Delegationspfad können komplexe Abfragen und Tool-Calls an Frontier-Modelle wie GPT-5.5 ausgelagert werden, ohne den Live-Media-Stream zu unterbrechen. Technisch setzt OpenAI auf ein in Go neu geschriebenes Media-Frontend und Inferenz-Routing, WebRTC sowie eigene Protokolloptimierungen (WARP und Instant Connect). Die Entkopplung von Mediapfad und Applikationslogik erlaubt nahtlose Modell-Handoffs und Context-Compaction bei minimierten Latenzen. Das System wurde bereits via Shadow-Testing im Produktivbetrieb von ChatGPT Voice validiert und bildet das Fundament für künftige GPT-Live APIs.
Die neue GPT-Live-Architektur von OpenAI setzt mit Full-Duplex-Streaming und standardisierten WebRTC-Optimierungen neue Maßstäbe für Conversational Voice UX und die echtzeitfähige Inferenz-Infrastruktur.
Marktsignale zu OpenAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI entwickelt GPT-Live als Full-Duplex-System, das simultanes Hören und Sprechen ohne separaten Turn-Detector ermöglicht.
- Komplexe Denkprozesse und Tool-Aufrufe werden asynchron an Frontier-Modelle (z. B. GPT-5.5) delegiert, ohne den Audiostream zu blockieren.
- Die Umstellung des Media-Frontends von Python asyncio auf Go verbesserte die Frame-Delivery-Latenz signifikant (p95-Latenz erreichte bisheriges p50-Niveau).
- Eigens entwickelte Transportoptimierungen (WARP, Instant Connect) wurden in libwebrtc sowie Pion integriert und bei der IETF TSVWG eingebracht.
- Die Architektur wurde vorab über ein stilles Shadow-Testing mit realen ChatGPT Voice-Sessions auf Skalierbarkeit und Latenz getestet.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“GPT‑Live, our third‑generation voice system, removes the turn detector from the audio path....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI launcht GPT-Live: Neue Voice-Modelle für echtzeitfähige Konversationen
OpenAI hat mit GPT-Live eine neue Voice-Modellfamilie vorgestellt, die ChatGPT Voice antreibt und dank Full-Duplex-Technologie gleichzeitiges Hören und Sprechen ermöglicht. Die Modelle GPT-Live-1 und GPT-Live-1 mini bieten Features wie Live-Übersetzungen, visuelle Answer Cards sowie eine verbesserte Rauschunterdrückung. Die Mini-Version steht auch Nutzern des kostenlosen ChatGPT-Tiers zur Verfügung. Ein zentraler technologischer Fortschritt ist die Hintergrund-Delegation: GPT-Live kann komplexe Analysen an leistungsstärkere Modelle wie GPT-5.5 oder das angekündigte GPT-5.6 auslagern und die Resultate nahtlos in den laufenden Dialog integrieren. Der Rollout erfolgt über Web, iOS und Android; zudem ist ein API-Zugang für Entwickler geplant. Laut OpenAI nutzen bereits über 150 Millionen Menschen die bestehenden Voice- und Diktierfunktionen der Plattform.
OpenAI bringt Voice-Modell GPT-Live-1 in die API
OpenAI hat GPT-Live-1 als API-Modell veröffentlicht, das speziell für Voice-native Anwendungen und geschäftliche Workflows konzipiert ist. Die Architektur verarbeitet simultanes Hören und Sprechen, wodurch die Latenz durch den Wegfall getrennter Speech-to-Text-, Reasoning- und Text-to-Speech-Pipelines drastisch sinkt. Zu den Kernfunktionen zählen eine optimierte Handhabung von Gesprächsunterbrechungen, hohe Robustheit gegenüber Hintergrundgeräuschen sowie die Delegation komplexer Logik und Tool Calls an Backend-Modelle wie GPT-6 Astra oder Drittanbietersysteme. Die Schnittstelle bietet zudem native Telefonie-Unterstützung für Full-Duplex-Sprachagenten. Das Pricing liegt bei 0,05 USD pro Minute für den Voice-Layer; Backend-Modelle werden separat abgerechnet. Erste Evaluierungen verzeichnen im Vergleich zu sequenziellen Systemen eine Reduktion fehlerhafter Unterbrechungen um 80 Prozent, was insbesondere für interaktive AdTech-, Customer-Service- und E-Commerce-Szenarien neue Standards setzt.
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
