Beobachtetes Signal · 1. Sept. 2026 · Product Launch · Quelle: https://martechseries.com/feed/ · Relevanz: 3/5 · Sentiment: Positiv
Phonely lanciert Alma: Voice-LLM schlägt OpenAI bei Tempo und Kosten
Phonely, eine Plattform für KI-gestützte Sprachagenten, hat Alma vorgestellt, ein speziell für Sprachassistenten entwickeltes Large Language Model (LLM). Trainiert auf über zehn Millionen realen Telefongesprächen, bewältigt Alma Unterbrechungen, Hintergrundgeräusche sowie Transkriptionsfehler mühelos. Das Modell erreicht eine Latenz von unter 185 Millisekunden bis zum ersten Token – was 63 Prozent schneller als OpenAI GPT-4.1 ist – und kostet mit 0,55 US-Dollar pro Million gemischter Token 84 Prozent weniger. Alma steuert bereits sämtliche Agenten-Gespräche von Phonely und verarbeitet monatlich Millionen Anrufe. Die Lösung ist mit beliebigen Transkribierern sowie Text-to-Speech-Anbietern kompatibel und bietet selbstoptimierende Funktionen durch Live-Feedback. Ein Referenzkunde verzeichnete nach dem Wechsel von OpenAI zu Alma einen Anstieg der Vertriebskonversion um drei Prozent, was monatliche Zusatzumsätze von 300.000 US-Dollar generierte.
Ein auf Sprache spezialisiertes LLM mit massiven Kosten- und Latenzvorteilen gegenüber GPT-4.1 könnte die Akzeptanz von KI-Sprachagenten im Kundendialog und Marketing beschleunigen, auch wenn Phonely kein etablierter Technologiegigant ist.
Marktsignale zu OpenAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Alma wurde auf über 10 Millionen realen Telefongesprächen trainiert.
- Das Modell erzielt eine Latenz von unter 185 ms im Vergleich zu rund 500 ms bei OpenAI GPT-4.1.
- Mit 0,55 USD pro Million gemischter Token ist Alma 84 Prozent günstiger als GPT-4.1 (3,50 USD).
- Alma treibt bereits 100 Prozent der Sprachagenten-Konversationen von Phonely an.
- Ein Kunde steigerte durch den Wechsel zu Alma die Conversion-Rate um 3 Prozent und erzielte 300.000 USD mehr Monatsumsatz.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“...compared with roughly 500 milliseconds for OpenAI’s GPT-4.1......”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI bringt Voice-Modell GPT-Live-1 in die API
OpenAI hat GPT-Live-1 als API-Modell veröffentlicht, das speziell für Voice-native Anwendungen und geschäftliche Workflows konzipiert ist. Die Architektur verarbeitet simultanes Hören und Sprechen, wodurch die Latenz durch den Wegfall getrennter Speech-to-Text-, Reasoning- und Text-to-Speech-Pipelines drastisch sinkt. Zu den Kernfunktionen zählen eine optimierte Handhabung von Gesprächsunterbrechungen, hohe Robustheit gegenüber Hintergrundgeräuschen sowie die Delegation komplexer Logik und Tool Calls an Backend-Modelle wie GPT-6 Astra oder Drittanbietersysteme. Die Schnittstelle bietet zudem native Telefonie-Unterstützung für Full-Duplex-Sprachagenten. Das Pricing liegt bei 0,05 USD pro Minute für den Voice-Layer; Backend-Modelle werden separat abgerechnet. Erste Evaluierungen verzeichnen im Vergleich zu sequenziellen Systemen eine Reduktion fehlerhafter Unterbrechungen um 80 Prozent, was insbesondere für interaktive AdTech-, Customer-Service- und E-Commerce-Szenarien neue Standards setzt.
Microsoft stellt MAI-Transcribe-2 vor: Günstigstes und präzisestes Speech-to-Text-Modell am Markt
Microsoft AI hat MAI-Transcribe-2 gelauncht, ein hochentwickeltes Speech-to-Text-Modell, das 60 Sprachen unterstützt und im FLEURS-Benchmark eine branchenführende durchschnittliche Word Error Rate (WER) von 5,2 Prozent erzielt. Das Modell arbeitet signifikant schneller als vergleichbare Lösungen wie GPT-Transcribe von OpenAI, Scribe v2 von ElevenLabs oder Gemini 3.5 Transcribe von Google. Es bietet fortschrittliche Funktionen wie Speaker Diarization, Word-Level Timestamps, Keyword Biasing und Code-Switching. Mit einem aggressiven Einführungspreis von 0,10 US-Dollar pro Audiostunde unterbietet Microsoft den Wettbewerb drastisch. Speziell für die thailändische Sprache wird eine herausragende WER von 3,4 Prozent erreicht. Das über Microsoft Foundry, MAI Playground und OpenRouter verfügbare Modell unterstreicht die strategische Initiative des Konzerns, proprietäre OpenAI-Technologien schrittweise durch leistungsstarke Inhouse-Modelle zu ersetzen, was auch workflows in AdTech und MarTech spürbar beeinflussen wird.
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
