Beobachtetes Signal · 26. März 2026 · Product Launch · Quelle: techcrunch · Relevanz: 3/5 · Sentiment: Positiv

Cohere veröffentlicht Open-Source-Sprachmodell Transcribe für automatisierte Spracherkennung

Zusammenfassung des Signals

Cohere hat mit Transcribe sein erstes Open-Source-Modell zur automatischen Spracherkennung (ASR) vorgestellt, das speziell für Transkriptionsaufgaben wie Notizen und Sprachanalyse entwickelt wurde. Das Modell umfasst zwei Milliarden Parameter, ist für Consumer-GPUs optimiert und unterstützt 14 Sprachen. Laut Cohere erzielte Transcribe im Hugging Face Open ASR Leaderboard eine durchschnittliche Word Error Rate (WER) von 5,42 und übertraf damit mehrere Vergleichsmodelle, während es Audiodaten mit geschätzten 525 Minuten pro Minute verarbeitete. Menschliche Tester bevorzugten die Ergebnisse in direkten Vergleichen mit einer durchschnittlichen Win-Rate von 61 Prozent, wobei jedoch Schwächen bei Portugiesisch, Deutsch und Spanisch auftraten. Cohere bietet Transcribe kostenlos über seine API sowie im Model Vault an und plant die Integration in seine Enterprise-Orchestrierungsplattform North.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein effizientes Open-Source-ASR-Modell, das Wettbewerber übertrifft und selbst gehostet werden kann, beschleunigt Transkriptions-, Untertitelungs- und Audio-Analytics-Tools in Medien- und Marketing-Workflows. Die kostenlose API und die Integration in Cohere's Enterprise-Stack treiben die breite Marktakadoption voran.

SIGNAL RADAR

Marktsignale zu Cohere in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Cohere hat Transcribe als Open-Source-Modell für automatische Spracherkennung (ASR) veröffentlicht.
  • Transcribe verfügt über zwei Milliarden Parameter und unterstützt 14 Sprachen, darunter Englisch, Französisch, Deutsch, Italienisch, Spanisch und Chinesisch.
  • Das Modell erzielte eine durchschnittliche WER von 5,42 auf dem Hugging Face Open ASR Leaderboard und platzierte sich vor Modellen wie Zoom Scribe v1 und IBM Granite 4.0 1B.
  • Transcribe verarbeitet 525 Minuten Audio pro Minute und erreichte eine durchschnittliche Win-Rate von 61 Prozent bei menschlichen Evaluierungen, zeigte aber Schwächen bei Portugiesisch, Deutsch und Spanisch.
  • Cohere stellt Transcribe kostenlos über seine API und den Model Vault bereit und plant die Integration in die Enterprise-Agentenplattform North.

Ontologie & Marktkonzepte

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: techcrunch•Veröffentlicht: 26. März 2026
Ursprünglicher Berichttitel: “Cohere launches an open source voice model specifically for transcription | TechCrunch”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Infrastructure6. Sept. 2026

Microsoft stellt MAI-Transcribe-2 vor: Günstigstes und präzisestes Speech-to-Text-Modell am Markt

Microsoft AI hat MAI-Transcribe-2 gelauncht, ein hochentwickeltes Speech-to-Text-Modell, das 60 Sprachen unterstützt und im FLEURS-Benchmark eine branchenführende durchschnittliche Word Error Rate (WER) von 5,2 Prozent erzielt. Das Modell arbeitet signifikant schneller als vergleichbare Lösungen wie GPT-Transcribe von OpenAI, Scribe v2 von ElevenLabs oder Gemini 3.5 Transcribe von Google. Es bietet fortschrittliche Funktionen wie Speaker Diarization, Word-Level Timestamps, Keyword Biasing und Code-Switching. Mit einem aggressiven Einführungspreis von 0,10 US-Dollar pro Audiostunde unterbietet Microsoft den Wettbewerb drastisch. Speziell für die thailändische Sprache wird eine herausragende WER von 3,4 Prozent erreicht. Das über Microsoft Foundry, MAI Playground und OpenRouter verfügbare Modell unterstreicht die strategische Initiative des Konzerns, proprietäre OpenAI-Technologien schrittweise durch leistungsstarke Inhouse-Modelle zu ersetzen, was auch workflows in AdTech und MarTech spürbar beeinflussen wird.

Signal analysieren
Speech Recognition / Conversational AI20. Mai 2026

Corti stellt Symphony für klinische Spracherkennung vor

Corti hat Symphony for Speech-to-Text angekündigt, eine neue Generation klinischer Spracherkennungsmodelle samt production-grade API für Echtzeit-Diktate, konversationelle Transkription und Batch-Verarbeitung von Audiodaten. Laut Unternehmensangaben übertrifft Symphony generalistische Modelle und etablierte Standards deutlich: So erzielte das System bei englischer medizinischer Terminologie eine Word Error Rate (WER) von 1,4 Prozent (gegenüber 17 bis 19 Prozent bei getesteten Generalisten) und eine Recall-Rate von 98,3 Prozent bei formatierten klinischen Entitäten wie Dosierungen oder Messwerten. Bei realen englischen medizinischen Diktaten lag die WER bei 4,6 Prozent im Vergleich zu 5,7 Prozent bei Dragon Medical One, begleitet von starken Ergebnissen in Deutsch (2,4 Prozent WER) und Französisch (3,9 Prozent WER). Corti positioniert Symphony als spezialisierte Sprachschicht für die kommende Generation agentischer klinischer KI-Anwendungen, die bereits von Unternehmen wie Voicepoint in multilinguistischen Umgebungen eingesetzt wird.

Signal analysieren
Large Language Models (LLM) & AI1. Juni 2026

Gemini 3.1 Pro ermöglicht direkte Audiotranskription über eine API

Dieser technische Leitfaden erläutert die Audiotranskription mittels multimodaler LLMs und hebt hervor, dass Google Gemini 3.1 Pro Preview Audiodaten als Input akzeptiert und Transkriptionen sowie semantische Ergebnisse in einer einzigen Anfrage liefert. Der Prozess unterteilt sich in ASR (Audio-to-Text) und LLM-Postprocessing (Bereinigung, Zusammenfassungen). Promptra, ein OpenAI-kompatibler API-Aggregator, stellt Flaggschiff-Modelle über einen Endpoint (https://api.promptra.ru/v1) mit Abrechnung in Rubel auf Basis des Zentralbankkurses und einer Servicegebühr von 5 Prozent bereit. Die Token-Preise für Gemini 3.1 Pro liegen bei 2 USD für Input und 12 USD für Output pro 1 Million Token (ca. 140 bzw. 860 RUB). Die Kosten für Transkription und Protokollerstellung eines einstündigen Meetings belaufen sich auf rund 30 bis 40 RUB. Dedizierte STT-Endpoints wie Whisper fehlen im Katalog.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.