Beobachtetes Signal · 28. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Neutral

Gemini 3.5 Transcribe: Echtzeit-Transkription und Diarisierung in macOS-App

Zusammenfassung des Signals

Ein Entwickler-Blogbeitrag dokumentiert die Integration von Echtzeit-Transkription und Offline-Sprecherdiarisierung in eine macOS-Meeting-Übersetzungs-App mithilfe von Googles Gemini 3.5 Transkriptionsmodellen. Der Autor erläutert die kritischen Unterschiede zwischen gemini-3.5-transcribe-live (Live API, Streaming, ohne Diarisierung, 10-Minuten-Sessions) und gemini-3.5-transcribe (Interactions API, Batch, Sprecherdiarisierung für bis zu 8 Sprecher, wortgenaue Zeitstempel, 30-Minuten-Diarisierungslimit). Der Artikel beschreibt erforderliche Anfragefelder für Wort-Annotationen, typische Fallstricke wie Chunking und CJK-Abstände, Datenschutzpraktiken sowie testgetriebene Engineering-Lehren. Der Quellcode ist auf GitHub veröffentlicht. Das Publikationsdatum ist der 28. August 2026.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Googles Gemini-Transkriptionsfunktionen und deren Einschränkungen (Streaming vs. Batch, Diarisierung, Zeitstempel, API-Unterschiede) beeinflussen maßgeblich, wie Entwickler Echtzeit-Untertiere, Diarisierungs-Workflows und Datenschutz gestalten – relevant für Audio-Untertitelung, Podcast-Indizierung und Voice Analytics in Medien und AdTech.

SIGNAL RADAR

Marktsignale zu Google in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Google hat zwei ähnlich benannte Modelle veröffentlicht: gemini-3.5-transcribe-live (Live API / WebSocket-Streaming) und gemini-3.5-transcribe (Interactions API / Batch HTTP).
  • gemini-3.5-transcribe-live (Streaming) unterstützt keine Sprecherdiarisierung, hat ein Limit von 10 Minuten pro Session und liefert interimInputTranscription für vorläufige Untertitel.
  • gemini-3.5-transcribe (Batch) unterstützt Sprecherdiarisierung (bis zu 8 Sprecher) sowie wortgenaue Zeitstempel; die Diarisierung ist auf 30 Minuten pro Chunk begrenzt, und Audio muss vor dem API-Aufruf in die Files API hochgeladen werden.
  • Sprecherdiarisierung erfordert die explizite Anforderung von wortgenauen Annotationen (z. B. timestamp_granularities: ["word"]); das Weglassen dieses Felds kann zu einem vollständigen Transkript ohne Annotationen und ohne Fehlermeldung führen.
  • Implementierungscode und Beispiele sind im GitHub-Repository kkdai/gemini-live-translate-macos verfügbar; der Artikel wurde am 28. August 2026 veröffentlicht.

Verknüpfte Unternehmen

2 verknüpfte Unternehmen

“However, after checking the documentation, I realized that Google released **two models with very similar names but very different capabilit...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 28. Aug. 2026
Ursprünglicher Berichttitel: “[AI in Practice] Gemini 3.5 Transcribe: Real-time Transcription and Speaker Diarization in a macOS Meeting Translation App”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI1. Juni 2026

Gemini 3.1 Pro ermöglicht direkte Audiotranskription über eine API

Dieser technische Leitfaden erläutert die Audiotranskription mittels multimodaler LLMs und hebt hervor, dass Google Gemini 3.1 Pro Preview Audiodaten als Input akzeptiert und Transkriptionen sowie semantische Ergebnisse in einer einzigen Anfrage liefert. Der Prozess unterteilt sich in ASR (Audio-to-Text) und LLM-Postprocessing (Bereinigung, Zusammenfassungen). Promptra, ein OpenAI-kompatibler API-Aggregator, stellt Flaggschiff-Modelle über einen Endpoint (https://api.promptra.ru/v1) mit Abrechnung in Rubel auf Basis des Zentralbankkurses und einer Servicegebühr von 5 Prozent bereit. Die Token-Preise für Gemini 3.1 Pro liegen bei 2 USD für Input und 12 USD für Output pro 1 Million Token (ca. 140 bzw. 860 RUB). Die Kosten für Transkription und Protokollerstellung eines einstündigen Meetings belaufen sich auf rund 30 bis 40 RUB. Dedizierte STT-Endpoints wie Whisper fehlen im Katalog.

Signal analysieren
Productivity & Collaboration14. Aug. 2026

Google Meet: Gemini erstellt automatisierte Notizen für Präsenz-Meetings

Google erweitert die Gemini-Funktionen in Google Meet um die automatisierte Transkription und Zusammenfassung von Präsenz-Meetings. Über einen neuen Button können Nutzer auf Laptops und Smartphones gesprochene Inhalte aufzeichnen lassen. Das KI-Modell generiert daraus eine strukturierte Zusammenfassung, Aufgabenlisten sowie ein vollständiges Transkript. Die Dokumente werden automatisch in Google Docs beziehungsweise Google Drive gespeichert und per E-Mail verlinkt. Der Rollout startete am 11. August 2026 für Android und am 14. August für Web-Nutzer; iOS-Geräte folgen nach dem 31. August. Das Feature richtet sich primär an Unternehmenskunden mit Google Workspace Business- und Enterprise-Tarifen. Privatanwender erhalten Zugriff über Abonnements von Google AI Pro oder Ultra. Damit forciert der Konzern die Integration generativer KI in tägliche Business-Workflows.

Signal analysieren
AI16. Sept. 2026

Google launcht Gemini 3.8 Live und Extended Thinking Audiomodelle

Google hat zwei neue KI-Audiomodelle vorgestellt: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Beide Modelle sind für latenzfreie Echtzeit-Konversationen sowie komplexe, mehrstufige Aufgaben konzipiert. Sie unterstützen die parallele Verarbeitung von Sprache, visuellen Inputs und Function Calls, was unterbrechungsfreie Interaktionen ermöglicht. Verfügbar sind die Modelle über die Gemini Live API und Google AI Studio zu Preisen von 0,005 US-Dollar pro Minute für Audio-Input und 0,018 US-Dollar für Output. Während Gemini 3.8 Live in Search Live für kamerabasierte Interaktionen integriert wird, richtet sich Extended Thinking an Google AI-Abonnenten in Gemini Live und Google Workspace (Docs, Gmail, Keep). Zur Sicherstellung der Transparenz versieht Google alle generierten Audiosignale mit einem SynthID-Wasserzeichen. Ergänzend stellte Google das Streaming-Speech-to-Text-Modell Gemini 3.5 Transcribe mit einer Word Error Rate von nur 4,0 % vor.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.