Beobachtetes Signal · 29. Aug. 2025 · Technical Release · Quelle: OnlineMarketing.de · Relevanz: 5/5 · Sentiment: Positiv
OpenAI veröffentlicht gpt-realtime API mit erweiterten Features und EU-Datenschutz
OpenAI hat gpt-realtime eingeführt, ein neues Sprach- und Text-KI-Modell samt allgemein verfügbarer Real-Time API. Das Update umfasst Remote MCP Server-Konnektivität, Bildeingaben, SIP-Telefoniintegration und wiederverwendbare Prompts. Erste Praxistests durch Unternehmen wie Zillow, T-Mobile, StubHub und Oscar Health belegen den produktiven Einsatz jenseits von Labortests. Zudem senkt OpenAI die Preise im Vergleich zum Vorgänger gpt-4o-realtime-preview um rund 20 Prozent; Audio-Input-Token kosten 32 US-Dollar und Audio-Output-Token 64 US-Dollar pro Million. Die Plattform bietet feinere Steuerungsmöglichkeiten für den Konversationskontext, darunter Token-Limits pro Sitzung. Der Datenschutz wird durch EU Data Residency, aktive Content-Filter, eine Kennzeichnungspflicht für KI-Dialoge sowie ein Agents SDK für zusätzliche Sicherheitsvorkehrungen gestärkt.
Technologischer Release einer großen Plattform mit einer neuen Real-Time API, Preisstrukturen und entscheidenden Implikationen für die EU-Datenschutzkonformität.
Marktsignale zu TIME in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI veröffentlicht die allgemein verfügbare Realtime API und das neue gpt-realtime-Modell.
- Zu den neuen Features gehören Remote MCP Server, Bildeingabe, SIP-Telefonie und Reusable Prompts.
- Unternehmen wie Zillow, T-Mobile, StubHub und Oscar Health testen gpt-realtime bereits im Praxisbetrieb.
- Preissenkung von rund 20 % gegenüber gpt-4o-realtime-preview: Audio-Input bei 32 USD, Audio-Output bei 64 USD pro Million Token.
- Unterstützung von EU Data Residency sowie mehrstufige Sicherheit durch Content-Filter und ein Agents SDK.
Verknüpfte Unternehmen
8 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
OpenAI veröffentlicht GPT-Realtime-2, Translate und Whisper
OpenAI hat eine Chrome-Extension für Codex eingeführt, die es dem Coding-Agenten ermöglicht, im Browser-Hintergrund über Tabs hinweg zu arbeiten. Die Erweiterung ist aktuell in der Codex-App integriert, jedoch noch nicht in UK und der EU verfügbar, während Codex nach Unternehmensangaben über vier Millionen wöchentliche Nutzer verzeichnet. Parallel dazu hat OpenAI drei neue Realtime API Sprachmodelle veröffentlicht — GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper —, die Reasoning auf GPT-5-Niveau und Latenzarmes Streaming für Sprachagenten bereitstellen. GPT-Realtime-2 unterstützt Unterbrechungswiederherstellung und Tool Use, Translate deckt über 70 Eingangs- und 13 Ausgangssprachen ab, und Whisper liefert Streaming-Transkriptionen. Die Preisstruktur wurde ebenfalls bekannt gegeben: GPT-Realtime-2 kostet 32 USD pro 1 Mio. Audio-Input-Token und 64 USD pro 1 Mio. Audio-Output-Token, während Translate ca. 0,00034 USD und Whisper ca. 0,00017 USD pro Minute kosten. Entsprechende Voice-Updates für ChatGPT sollen in künftigen Versionen folgen.
OpenAI stellt GPT-Live für latenzfreie Full-Duplex-Sprachinteraktion vor
OpenAI hat Details zu GPT-Live veröffentlicht, einem neuen Full-Duplex-Echtzeit-Sprachsystem. Die Architektur verzichtet auf bisherige Turn-Detector-Modelle und verarbeitet Audio kontinuierlich via Streaming-Inference, wodurch gleichzeitiges Hören und Sprechen ermöglicht wird. Über einen asynchronen Delegationspfad können komplexe Abfragen und Tool-Calls an Frontier-Modelle wie GPT-5.5 ausgelagert werden, ohne den Live-Media-Stream zu unterbrechen. Technisch setzt OpenAI auf ein in Go neu geschriebenes Media-Frontend und Inferenz-Routing, WebRTC sowie eigene Protokolloptimierungen (WARP und Instant Connect). Die Entkopplung von Mediapfad und Applikationslogik erlaubt nahtlose Modell-Handoffs und Context-Compaction bei minimierten Latenzen. Das System wurde bereits via Shadow-Testing im Produktivbetrieb von ChatGPT Voice validiert und bildet das Fundament für künftige GPT-Live APIs.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
