Beobachtetes Signal · 21. März 2025 · Technical Release · Quelle: OnlineMarketing.de · Relevanz: 3/5 · Sentiment: Positiv

OpenAI stellt neue Sprachmodelle und Voice Agents für die API vor

Zusammenfassung des Signals

OpenAI hat in seiner API neue Speech-to-Text- und Text-to-Speech-Modelle auf Basis von GPT-4o und GPT-4o mini veröffentlicht, die eine deutlich höhere Transkriptions- und Syntheseleistung als Whisper und ältere TTS-Modelle bieten sollen. Das Text-to-Speech-Modell ermöglicht durch elf Stimmen und fünf Stimmungsvorgaben (Vibes) stark personalisierbare und charakterstarke Sprachausgaben. Entwickler können dem Modell nicht nur den Inhalt, sondern auch die exakte Aussprache und den Tonfall vorgeben. Die beiden neuen Speech-to-Text-Modelle gewährleisten selbst in anspruchsvollen Audio-Umgebungen wie lauten Störgeräuschen oder bei starken Akzenten eine hohe Zuverlässigkeit, was den Einsatz in Callcentern und bei Meeting-Notizen optimiert. Zudem erlaubt die Integration in das Agents SDK die Umwandlung textbasierter Agents in performante Voice Agents, wodurch die Automatisierungsmöglichkeiten für sprachgesteuerte Applikationen in Marketing und Kundenservice maßgeblich erweitert werden.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Die neuen Sprachmodelle von OpenAI ermöglichen leistungsstarke Voice Agents und die Integration in das Agents SDK. Dies ist hochrelevant für moderne Sprach- und Automatisierungstechnologien im datengestützten Marketing und Customer Experience Management.

SIGNAL RADAR

Marktsignale zu OpenAI in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • OpenAI hat neue, auf GPT-4o und GPT-4o mini basierende Speech-to-Text- und Text-to-Speech-Modelle in seiner API veröffentlicht.
  • Das Text-to-Speech-Modell unterstützt elf Stimmen und fünf Vibes, um den Tonfall und Charakter flexibel zu konfigurieren.
  • Entwickler können steuern, wie etwas gesagt wird, was stark personalisierte Audio-Erlebnisse ermöglicht.
  • Durch die Integration mit dem Agents SDK lassen sich textbasierte Agents nahtlos in interaktive Voice Agents umwandeln.
  • Die neuen Speech-to-Text-Modelle bieten eine robuste Transkriptionsleistung in lauten Umgebungen und bei starken Akzenten.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: OnlineMarketing.de•Veröffentlicht: 21. März 2025
Ursprünglicher Berichttitel: “Hello Voice Agents: Das können OpenAIs neue Sprachmodelle | OnlineMarketing.de”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Conversational AI & Chatbots7. Mai 2026

OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API

OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.

Signal analysieren
Conversational AI & Voice Models8. Mai 2026

OpenAI veröffentlicht GPT-Realtime-2, Translate und Whisper

OpenAI hat eine Chrome-Extension für Codex eingeführt, die es dem Coding-Agenten ermöglicht, im Browser-Hintergrund über Tabs hinweg zu arbeiten. Die Erweiterung ist aktuell in der Codex-App integriert, jedoch noch nicht in UK und der EU verfügbar, während Codex nach Unternehmensangaben über vier Millionen wöchentliche Nutzer verzeichnet. Parallel dazu hat OpenAI drei neue Realtime API Sprachmodelle veröffentlicht — GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper —, die Reasoning auf GPT-5-Niveau und Latenzarmes Streaming für Sprachagenten bereitstellen. GPT-Realtime-2 unterstützt Unterbrechungswiederherstellung und Tool Use, Translate deckt über 70 Eingangs- und 13 Ausgangssprachen ab, und Whisper liefert Streaming-Transkriptionen. Die Preisstruktur wurde ebenfalls bekannt gegeben: GPT-Realtime-2 kostet 32 USD pro 1 Mio. Audio-Input-Token und 64 USD pro 1 Mio. Audio-Output-Token, während Translate ca. 0,00034 USD und Whisper ca. 0,00017 USD pro Minute kosten. Entsprechende Voice-Updates für ChatGPT sollen in künftigen Versionen folgen.

Signal analysieren
Conversational AI & Chatbots9. Juli 2026

OpenAI launcht GPT-Live: Neue Voice-Modelle für echtzeitfähige Konversationen

OpenAI hat mit GPT-Live eine neue Voice-Modellfamilie vorgestellt, die ChatGPT Voice antreibt und dank Full-Duplex-Technologie gleichzeitiges Hören und Sprechen ermöglicht. Die Modelle GPT-Live-1 und GPT-Live-1 mini bieten Features wie Live-Übersetzungen, visuelle Answer Cards sowie eine verbesserte Rauschunterdrückung. Die Mini-Version steht auch Nutzern des kostenlosen ChatGPT-Tiers zur Verfügung. Ein zentraler technologischer Fortschritt ist die Hintergrund-Delegation: GPT-Live kann komplexe Analysen an leistungsstärkere Modelle wie GPT-5.5 oder das angekündigte GPT-5.6 auslagern und die Resultate nahtlos in den laufenden Dialog integrieren. Der Rollout erfolgt über Web, iOS und Android; zudem ist ein API-Zugang für Entwickler geplant. Laut OpenAI nutzen bereits über 150 Millionen Menschen die bestehenden Voice- und Diktierfunktionen der Plattform.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.