Beobachtetes Signal · 20. Mai 2026 · Product Launch · Quelle: https://martechseries.com/feed/ · Relevanz: 2/5 · Sentiment: Neutral

Corti stellt Symphony für klinische Spracherkennung vor

Zusammenfassung des Signals

Corti hat Symphony for Speech-to-Text angekündigt, eine neue Generation klinischer Spracherkennungsmodelle samt production-grade API für Echtzeit-Diktate, konversationelle Transkription und Batch-Verarbeitung von Audiodaten. Laut Unternehmensangaben übertrifft Symphony generalistische Modelle und etablierte Standards deutlich: So erzielte das System bei englischer medizinischer Terminologie eine Word Error Rate (WER) von 1,4 Prozent (gegenüber 17 bis 19 Prozent bei getesteten Generalisten) und eine Recall-Rate von 98,3 Prozent bei formatierten klinischen Entitäten wie Dosierungen oder Messwerten. Bei realen englischen medizinischen Diktaten lag die WER bei 4,6 Prozent im Vergleich zu 5,7 Prozent bei Dragon Medical One, begleitet von starken Ergebnissen in Deutsch (2,4 Prozent WER) und Französisch (3,9 Prozent WER). Corti positioniert Symphony als spezialisierte Sprachschicht für die kommende Generation agentischer klinischer KI-Anwendungen, die bereits von Unternehmen wie Voicepoint in multilinguistischen Umgebungen eingesetzt wird.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Eine technische Produktveröffentlichung, die die klinische Spracherkennungsgenauigkeit und strukturierte medizinische Ausgaben deutlich verbessert, was für Healthcare-KI und Sprach-Workflows von Bedeutung ist, jedoch nur begrenzten direkten Einfluss auf das klassische AdTech- und MarTech-Ökosystem hat.

SIGNAL RADAR

Marktsignale zu ElevenLabs in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Corti hat Symphony for Speech-to-Text gelauncht: klinische Sprachmodelle und eine production-grade API für Echtzeit-, Konversations- und Batch-Transkription.
  • Das System verzeichnet eine um bis zu 93 Prozent niedrigere Word Error Rate (WER) bei englischer, deutscher und französischer medizinischer Terminologie.
  • Symphony erreichte eine Recall-Rate von 98,3 Prozent bei formatierten klinischen Entitäten im Vergleich zu 44,3 Prozent bei der stärksten Baseline.
  • Bei realen englischen medizinischen Diktaten lag die WER bei 4,6 Prozent (Dragon Medical One: 5,7 Prozent) neben starken multilingualen Werten für Deutsch und Französisch.
  • Voicepoint setzt Symphony bereits als Early Adopter in multilinguistischen klinischen Umgebungen in der Schweiz ein.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: https://martechseries.com/feed/•Veröffentlicht: 20. Mai 2026
Ursprünglicher Berichttitel: “Corti launches Symphony for Speech-to-Text”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models & AI26. März 2026

Cohere veröffentlicht Open-Source-Sprachmodell Transcribe für automatisierte Spracherkennung

Cohere hat mit Transcribe sein erstes Open-Source-Modell zur automatischen Spracherkennung (ASR) vorgestellt, das speziell für Transkriptionsaufgaben wie Notizen und Sprachanalyse entwickelt wurde. Das Modell umfasst zwei Milliarden Parameter, ist für Consumer-GPUs optimiert und unterstützt 14 Sprachen. Laut Cohere erzielte Transcribe im Hugging Face Open ASR Leaderboard eine durchschnittliche Word Error Rate (WER) von 5,42 und übertraf damit mehrere Vergleichsmodelle, während es Audiodaten mit geschätzten 525 Minuten pro Minute verarbeitete. Menschliche Tester bevorzugten die Ergebnisse in direkten Vergleichen mit einer durchschnittlichen Win-Rate von 61 Prozent, wobei jedoch Schwächen bei Portugiesisch, Deutsch und Spanisch auftraten. Cohere bietet Transcribe kostenlos über seine API sowie im Model Vault an und plant die Integration in seine Enterprise-Orchestrierungsplattform North.

Signal analysieren
Infrastructure6. Sept. 2026

Microsoft stellt MAI-Transcribe-2 vor: Günstigstes und präzisestes Speech-to-Text-Modell am Markt

Microsoft AI hat MAI-Transcribe-2 gelauncht, ein hochentwickeltes Speech-to-Text-Modell, das 60 Sprachen unterstützt und im FLEURS-Benchmark eine branchenführende durchschnittliche Word Error Rate (WER) von 5,2 Prozent erzielt. Das Modell arbeitet signifikant schneller als vergleichbare Lösungen wie GPT-Transcribe von OpenAI, Scribe v2 von ElevenLabs oder Gemini 3.5 Transcribe von Google. Es bietet fortschrittliche Funktionen wie Speaker Diarization, Word-Level Timestamps, Keyword Biasing und Code-Switching. Mit einem aggressiven Einführungspreis von 0,10 US-Dollar pro Audiostunde unterbietet Microsoft den Wettbewerb drastisch. Speziell für die thailändische Sprache wird eine herausragende WER von 3,4 Prozent erreicht. Das über Microsoft Foundry, MAI Playground und OpenRouter verfügbare Modell unterstreicht die strategische Initiative des Konzerns, proprietäre OpenAI-Technologien schrittweise durch leistungsstarke Inhouse-Modelle zu ersetzen, was auch workflows in AdTech und MarTech spürbar beeinflussen wird.

Signal analysieren
Conversational AI & Speech9. März 2026

Devnagri AI stellt Speech AI für mehrsprachige Unternehmensanwendungen vor

Devnagri AI hat mit Speech AI eine neue Funktion innerhalb seiner Sovereign Language Infrastructure angekündigt, die enterprise-grade Spracherkennung und Sprachsynthese in die Plattform integriert. Speech AI kombiniert eine Conversational Speech Layer (Automatic Speech Recognition, ASR) und Enterprise Voice Generation (Text-to-Speech, TTS), um Echtzeit-Sprach-zu-Text sowie natürliche Sprachantworten in über 15 indischen Hauptsprachen zu ermöglichen. Die Lösung lässt sich nahtlos in bestehende Unternehmenssysteme wie CRMs, Contact-Center-Plattformen und Mobile Apps einbinden, um mehrsprachige Customer Journeys zu unterstützen. Dazu gehören Anwendungsfälle wie Contact Center, sprachbasiertes KYC und Onboarding, Automatisierung von Forderungseinzügen im Finanzsektor sowie behördliche Hotlines. Damit schließt Devnagri die Lücke zwischen englischzentrierten digitalen Systemen und den Präferenzen regionaler Sprachgruppen in Indien.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.