Beobachtetes Signal · 10. Sept. 2026 · Product Launch · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
OpenAI bringt Voice-Modell GPT-Live-1 in die API
OpenAI hat GPT-Live-1 als API-Modell veröffentlicht, das speziell für Voice-native Anwendungen und geschäftliche Workflows konzipiert ist. Die Architektur verarbeitet simultanes Hören und Sprechen, wodurch die Latenz durch den Wegfall getrennter Speech-to-Text-, Reasoning- und Text-to-Speech-Pipelines drastisch sinkt. Zu den Kernfunktionen zählen eine optimierte Handhabung von Gesprächsunterbrechungen, hohe Robustheit gegenüber Hintergrundgeräuschen sowie die Delegation komplexer Logik und Tool Calls an Backend-Modelle wie GPT-6 Astra oder Drittanbietersysteme. Die Schnittstelle bietet zudem native Telefonie-Unterstützung für Full-Duplex-Sprachagenten. Das Pricing liegt bei 0,05 USD pro Minute für den Voice-Layer; Backend-Modelle werden separat abgerechnet. Erste Evaluierungen verzeichnen im Vergleich zu sequenziellen Systemen eine Reduktion fehlerhafter Unterbrechungen um 80 Prozent, was insbesondere für interaktive AdTech-, Customer-Service- und E-Commerce-Szenarien neue Standards setzt.
Der Release markiert einen Technologiesprung hin zu echtzeitfähigen Full-Duplex-Sprachschnittstellen, was die Automatisierung im Kundenservice, Conversational Commerce und Voice-basierten Werbeformaten signifikant beschleunigt.
Marktsignale zu OpenAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI launcht GPT-Live-1 in der API ab 0,05 USD pro Minute für den Voice-Layer.
- Das Modell beherrscht simultanes Hören und Sprechen inklusive robuster Interruption-Handling-Logik.
- Reasoning und Tool Calls können flexibel an Backend-Modelle wie GPT-6 Astra oder Drittanbieter delegiert werden.
- Im Full Duplex Bench übertrifft das Modell GPT-Realtime-2.1 um 30 Prozentpunkte.
- Erste Praxistests (u. a. Speak) zeigen 80 Prozent weniger Unterbrechungsfehler im Vergleich zu Turn-based-Systemen.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“We’re launching GPT‑Live‑1 in the API, giving developers a powerful, natural voice model......”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI launcht GPT-Live: Neue Voice-Modelle für echtzeitfähige Konversationen
OpenAI hat mit GPT-Live eine neue Voice-Modellfamilie vorgestellt, die ChatGPT Voice antreibt und dank Full-Duplex-Technologie gleichzeitiges Hören und Sprechen ermöglicht. Die Modelle GPT-Live-1 und GPT-Live-1 mini bieten Features wie Live-Übersetzungen, visuelle Answer Cards sowie eine verbesserte Rauschunterdrückung. Die Mini-Version steht auch Nutzern des kostenlosen ChatGPT-Tiers zur Verfügung. Ein zentraler technologischer Fortschritt ist die Hintergrund-Delegation: GPT-Live kann komplexe Analysen an leistungsstärkere Modelle wie GPT-5.5 oder das angekündigte GPT-5.6 auslagern und die Resultate nahtlos in den laufenden Dialog integrieren. Der Rollout erfolgt über Web, iOS und Android; zudem ist ein API-Zugang für Entwickler geplant. Laut OpenAI nutzen bereits über 150 Millionen Menschen die bestehenden Voice- und Diktierfunktionen der Plattform.
OpenAI stellt GPT-Live für latenzfreie Full-Duplex-Sprachinteraktion vor
OpenAI hat Details zu GPT-Live veröffentlicht, einem neuen Full-Duplex-Echtzeit-Sprachsystem. Die Architektur verzichtet auf bisherige Turn-Detector-Modelle und verarbeitet Audio kontinuierlich via Streaming-Inference, wodurch gleichzeitiges Hören und Sprechen ermöglicht wird. Über einen asynchronen Delegationspfad können komplexe Abfragen und Tool-Calls an Frontier-Modelle wie GPT-5.5 ausgelagert werden, ohne den Live-Media-Stream zu unterbrechen. Technisch setzt OpenAI auf ein in Go neu geschriebenes Media-Frontend und Inferenz-Routing, WebRTC sowie eigene Protokolloptimierungen (WARP und Instant Connect). Die Entkopplung von Mediapfad und Applikationslogik erlaubt nahtlose Modell-Handoffs und Context-Compaction bei minimierten Latenzen. Das System wurde bereits via Shadow-Testing im Produktivbetrieb von ChatGPT Voice validiert und bildet das Fundament für künftige GPT-Live APIs.
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
