Beobachtetes Signal · 1. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Positiv
Gemini 3.1 Pro ermöglicht direkte Audiotranskription über eine API
Dieser technische Leitfaden erläutert die Audiotranskription mittels multimodaler LLMs und hebt hervor, dass Google Gemini 3.1 Pro Preview Audiodaten als Input akzeptiert und Transkriptionen sowie semantische Ergebnisse in einer einzigen Anfrage liefert. Der Prozess unterteilt sich in ASR (Audio-to-Text) und LLM-Postprocessing (Bereinigung, Zusammenfassungen). Promptra, ein OpenAI-kompatibler API-Aggregator, stellt Flaggschiff-Modelle über einen Endpoint (https://api.promptra.ru/v1) mit Abrechnung in Rubel auf Basis des Zentralbankkurses und einer Servicegebühr von 5 Prozent bereit. Die Token-Preise für Gemini 3.1 Pro liegen bei 2 USD für Input und 12 USD für Output pro 1 Million Token (ca. 140 bzw. 860 RUB). Die Kosten für Transkription und Protokollerstellung eines einstündigen Meetings belaufen sich auf rund 30 bis 40 RUB. Dedizierte STT-Endpoints wie Whisper fehlen im Katalog.
Das native Audio-Input- und Multimodalitäts-Feature von Google Gemini 3.1 Pro verändert in Kombination mit lokalen Aggregatoren und kosteneffizienter Abrechnung die Enterprise-Workflows für ASR und Automatisierung grundlegend.
Marktsignale zu Google in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Google Gemini 3.1 Pro Preview akzeptiert Audio-Input und kann Audio in einer einzigen Anfrage transkribieren.
- Promptra bietet einen OpenAI-kompatiblen Endpoint (https://api.promptra.ru/v1) mit Flaggschiff-Modellen und Rubel-Abrechnung zum Zentralbankkurs.
- Beispielpreise für Gemini 3.1 Pro: 2 USD / 12 USD pro 1M Token (Input / Output), umgerechnet 140 / 860 RUB.
- Geschätzter Token-Verbrauch: ca. 32 Token pro Sekunde Audio; eine Stunde entspricht rund 115.000 Input-Token bei Gesamtkosten von etwa 30–40 RUB inklusive Postprocessing.
- Promptra berechnet 5 Prozent Servicegebühr auf Guthabenaufladungen; ein spezialisierter STT-Endpoint wie Whisper ist im Katalog nicht enthalten.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Gemini 3.5 Transcribe: Echtzeit-Transkription und Diarisierung in macOS-App
Ein Entwickler-Blogbeitrag dokumentiert die Integration von Echtzeit-Transkription und Offline-Sprecherdiarisierung in eine macOS-Meeting-Übersetzungs-App mithilfe von Googles Gemini 3.5 Transkriptionsmodellen. Der Autor erläutert die kritischen Unterschiede zwischen gemini-3.5-transcribe-live (Live API, Streaming, ohne Diarisierung, 10-Minuten-Sessions) und gemini-3.5-transcribe (Interactions API, Batch, Sprecherdiarisierung für bis zu 8 Sprecher, wortgenaue Zeitstempel, 30-Minuten-Diarisierungslimit). Der Artikel beschreibt erforderliche Anfragefelder für Wort-Annotationen, typische Fallstricke wie Chunking und CJK-Abstände, Datenschutzpraktiken sowie testgetriebene Engineering-Lehren. Der Quellcode ist auf GitHub veröffentlicht. Das Publikationsdatum ist der 28. August 2026.
Google launcht Gemini 3.8 Live und Extended Thinking Audiomodelle
Google hat zwei neue KI-Audiomodelle vorgestellt: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Beide Modelle sind für latenzfreie Echtzeit-Konversationen sowie komplexe, mehrstufige Aufgaben konzipiert. Sie unterstützen die parallele Verarbeitung von Sprache, visuellen Inputs und Function Calls, was unterbrechungsfreie Interaktionen ermöglicht. Verfügbar sind die Modelle über die Gemini Live API und Google AI Studio zu Preisen von 0,005 US-Dollar pro Minute für Audio-Input und 0,018 US-Dollar für Output. Während Gemini 3.8 Live in Search Live für kamerabasierte Interaktionen integriert wird, richtet sich Extended Thinking an Google AI-Abonnenten in Gemini Live und Google Workspace (Docs, Gmail, Keep). Zur Sicherstellung der Transparenz versieht Google alle generierten Audiosignale mit einem SynthID-Wasserzeichen. Ergänzend stellte Google das Streaming-Speech-to-Text-Modell Gemini 3.5 Transcribe mit einer Word Error Rate von nur 4,0 % vor.
GPT Proto erweitert KI-Katalog um Google Gemini 3.1 Pro Preview
Die in Hongkong ansässige API-Plattform GPT Proto, betrieben von Talent Tech Global Limited, hat Google Gemini 3.1 Pro Preview in ihr einheitliches Entwickler-API-Gateway integriert. Diese Integration ermöglicht es Entwicklern, über die RESTful-API von GPT Proto – die mit dem OpenAI SDK kompatibel ist – auf Googles neuestes multimodales Modell zuzugreifen. Neben Google umfasst der Katalog Modelle von OpenAI, Anthropic, Meta und weiteren Anbietern. Gemini 3.1 Pro Preview unterstützt erweiterte Kontextfenster, mehrstufige logische Argumentation sowie die Verarbeitung von Text, Code und strukturierten Daten in einem einzigen Aufruf. Das Gateway von GPT Proto unterstützt Streaming, Function Calling, Batch-Verarbeitung und Model Routing für Anwendungsfälle wie RAG-Pipelines, Codegenerierung, automatisierte Inhalte und Analysen. Gründerin und CEO Sammi Cen betonte, dass diese Erweiterung separate Onboarding- oder Abrechnungsprozesse für den Zugriff auf das Google-Modell überflüssig mache.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
