Beobachtetes Signal · 7. Mai 2026 · Product Launch · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv

OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API

Zusammenfassung des Signals

OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Die Einführung neuer Echtzeit-Sprachmodelle durch OpenAI erweitert die Möglichkeiten für konversationelle KI, Sprachschnittstellen und agentische Workflows erheblich, was direkten Einfluss auf Customer Experience (CX) und audiobasierte Produktprozesse branchenübergreifend hat.

SIGNAL RADAR

Marktsignale zu Vimeo in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Audiomodelle veröffentlicht: GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper.
  • GPT-Realtime-2 ist ein Reasoning-Sprachmodell der GPT-5-Klasse für realistische Konversationen und agentische Workflows.
  • GPT-Realtime-Translate unterstützt über 70 Eingangs- und 13 Ausgangssprachen für die konversationelle Live-Übersetzung.
  • GPT-Realtime-Whisper bietet eine Live-Streaming-Transkription von Sprache zu Text.
  • Translate und Whisper werden nach Minuten abgerechnet, GPT-Realtime-2 nach Token-Verbrauch; zudem wurden Schutzmechanismen gegen Missbrauch integriert.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: OpenAI Blog•Veröffentlicht: 7. Mai 2026
Ursprünglicher Berichttitel: “Advancing voice intelligence with new models in the API”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Conversational AI & Voice Models8. Mai 2026

OpenAI veröffentlicht GPT-Realtime-2, Translate und Whisper

OpenAI hat eine Chrome-Extension für Codex eingeführt, die es dem Coding-Agenten ermöglicht, im Browser-Hintergrund über Tabs hinweg zu arbeiten. Die Erweiterung ist aktuell in der Codex-App integriert, jedoch noch nicht in UK und der EU verfügbar, während Codex nach Unternehmensangaben über vier Millionen wöchentliche Nutzer verzeichnet. Parallel dazu hat OpenAI drei neue Realtime API Sprachmodelle veröffentlicht — GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper —, die Reasoning auf GPT-5-Niveau und Latenzarmes Streaming für Sprachagenten bereitstellen. GPT-Realtime-2 unterstützt Unterbrechungswiederherstellung und Tool Use, Translate deckt über 70 Eingangs- und 13 Ausgangssprachen ab, und Whisper liefert Streaming-Transkriptionen. Die Preisstruktur wurde ebenfalls bekannt gegeben: GPT-Realtime-2 kostet 32 USD pro 1 Mio. Audio-Input-Token und 64 USD pro 1 Mio. Audio-Output-Token, während Translate ca. 0,00034 USD und Whisper ca. 0,00017 USD pro Minute kosten. Entsprechende Voice-Updates für ChatGPT sollen in künftigen Versionen folgen.

Signal analysieren
Conversational AI & Voice Models20. Mai 2026

OpenAI GPT‑Realtime‑2 Adds GPT‑5‑Class Reasoning for Voice

OpenAI released three speech-focused models and highlighted GPT‑Realtime‑2 as the first voice model it describes as having “GPT‑5‑class” reasoning. The article examines what changes for voice agents when reasoning happens inside a real‑time speech model versus the traditional pipeline (speech-to-text → text LLM → text-to-speech). Native speech-to-speech with on-model reasoning promises lower latency and preserved nonverbal cues, but retains tradeoffs: loss of an auditable text transcript, harder deterministic tool-calling, and potential response latency that is audible in voice interactions. The author recommends structured, production-focused evaluations (multi-step retention, interruption handling, latency under load, tool-call accuracy, and graceful uncertainty) and advises teams to run the existing pipeline in shadow mode while measuring with their real prompts and tooling before migrating. Publication date: 2026-05-20.

Signal analysieren
Conversational AI & Chatbots9. Juli 2026

OpenAI launcht GPT-Live: Neue Voice-Modelle für echtzeitfähige Konversationen

OpenAI hat mit GPT-Live eine neue Voice-Modellfamilie vorgestellt, die ChatGPT Voice antreibt und dank Full-Duplex-Technologie gleichzeitiges Hören und Sprechen ermöglicht. Die Modelle GPT-Live-1 und GPT-Live-1 mini bieten Features wie Live-Übersetzungen, visuelle Answer Cards sowie eine verbesserte Rauschunterdrückung. Die Mini-Version steht auch Nutzern des kostenlosen ChatGPT-Tiers zur Verfügung. Ein zentraler technologischer Fortschritt ist die Hintergrund-Delegation: GPT-Live kann komplexe Analysen an leistungsstärkere Modelle wie GPT-5.5 oder das angekündigte GPT-5.6 auslagern und die Resultate nahtlos in den laufenden Dialog integrieren. Der Rollout erfolgt über Web, iOS und Android; zudem ist ein API-Zugang für Entwickler geplant. Laut OpenAI nutzen bereits über 150 Millionen Menschen die bestehenden Voice- und Diktierfunktionen der Plattform.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.