Beobachtetes Signal · 7. Mai 2026 · Product Launch · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
Die Einführung neuer Echtzeit-Sprachmodelle durch OpenAI erweitert die Möglichkeiten für konversationelle KI, Sprachschnittstellen und agentische Workflows erheblich, was direkten Einfluss auf Customer Experience (CX) und audiobasierte Produktprozesse branchenübergreifend hat.
Marktsignale zu Vimeo in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Audiomodelle veröffentlicht: GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper.
- GPT-Realtime-2 ist ein Reasoning-Sprachmodell der GPT-5-Klasse für realistische Konversationen und agentische Workflows.
- GPT-Realtime-Translate unterstützt über 70 Eingangs- und 13 Ausgangssprachen für die konversationelle Live-Übersetzung.
- GPT-Realtime-Whisper bietet eine Live-Streaming-Transkription von Sprache zu Text.
- Translate und Whisper werden nach Minuten abgerechnet, GPT-Realtime-2 nach Token-Verbrauch; zudem wurden Schutzmechanismen gegen Missbrauch integriert.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI veröffentlicht GPT-Realtime-2, Translate und Whisper
OpenAI hat eine Chrome-Extension für Codex eingeführt, die es dem Coding-Agenten ermöglicht, im Browser-Hintergrund über Tabs hinweg zu arbeiten. Die Erweiterung ist aktuell in der Codex-App integriert, jedoch noch nicht in UK und der EU verfügbar, während Codex nach Unternehmensangaben über vier Millionen wöchentliche Nutzer verzeichnet. Parallel dazu hat OpenAI drei neue Realtime API Sprachmodelle veröffentlicht — GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper —, die Reasoning auf GPT-5-Niveau und Latenzarmes Streaming für Sprachagenten bereitstellen. GPT-Realtime-2 unterstützt Unterbrechungswiederherstellung und Tool Use, Translate deckt über 70 Eingangs- und 13 Ausgangssprachen ab, und Whisper liefert Streaming-Transkriptionen. Die Preisstruktur wurde ebenfalls bekannt gegeben: GPT-Realtime-2 kostet 32 USD pro 1 Mio. Audio-Input-Token und 64 USD pro 1 Mio. Audio-Output-Token, während Translate ca. 0,00034 USD und Whisper ca. 0,00017 USD pro Minute kosten. Entsprechende Voice-Updates für ChatGPT sollen in künftigen Versionen folgen.
OpenAI GPT‑Realtime‑2 Adds GPT‑5‑Class Reasoning for Voice
OpenAI released three speech-focused models and highlighted GPT‑Realtime‑2 as the first voice model it describes as having “GPT‑5‑class” reasoning. The article examines what changes for voice agents when reasoning happens inside a real‑time speech model versus the traditional pipeline (speech-to-text → text LLM → text-to-speech). Native speech-to-speech with on-model reasoning promises lower latency and preserved nonverbal cues, but retains tradeoffs: loss of an auditable text transcript, harder deterministic tool-calling, and potential response latency that is audible in voice interactions. The author recommends structured, production-focused evaluations (multi-step retention, interruption handling, latency under load, tool-call accuracy, and graceful uncertainty) and advises teams to run the existing pipeline in shadow mode while measuring with their real prompts and tooling before migrating. Publication date: 2026-05-20.
OpenAI launcht GPT-Live: Neue Voice-Modelle für echtzeitfähige Konversationen
OpenAI hat mit GPT-Live eine neue Voice-Modellfamilie vorgestellt, die ChatGPT Voice antreibt und dank Full-Duplex-Technologie gleichzeitiges Hören und Sprechen ermöglicht. Die Modelle GPT-Live-1 und GPT-Live-1 mini bieten Features wie Live-Übersetzungen, visuelle Answer Cards sowie eine verbesserte Rauschunterdrückung. Die Mini-Version steht auch Nutzern des kostenlosen ChatGPT-Tiers zur Verfügung. Ein zentraler technologischer Fortschritt ist die Hintergrund-Delegation: GPT-Live kann komplexe Analysen an leistungsstärkere Modelle wie GPT-5.5 oder das angekündigte GPT-5.6 auslagern und die Resultate nahtlos in den laufenden Dialog integrieren. Der Rollout erfolgt über Web, iOS und Android; zudem ist ein API-Zugang für Entwickler geplant. Laut OpenAI nutzen bereits über 150 Millionen Menschen die bestehenden Voice- und Diktierfunktionen der Plattform.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
