Beobachtetes Signal · 12. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Open-Source-App für lokale Meeting-Transkription auf macOS
Ein Entwickler hat Scripta vorgestellt, eine Open-Source-macOS-App, die Meetings über Mikrofon und System-Audio aufzeichnet, vollständig lokal transkribiert und KI-Zusammenfassungen ohne Cloud-Anbindung generiert. Die Anwendung nutzt whisper.cpp mit Metal GPU-Beschleunigung für das Mikrofon und Apples SFSpeechRecognizer für System-Audio via ScreenCaptureKit. Für das Streaming von Zusammenfassungen integriert Scripta eine lokale Ollama-Instanz (Standardmodell qwen2.5:3b). Der Beitrag dokumentiert technische Details wie die Erstellung einer statischen whisper.cpp-Bibliothek, Swift-Bridging, eine 5-Sekunden-Sliding-Window-Strategie, die Bewältigung von Voice Processing IO-Besonderheiten sowie die Distribution über GitHub Releases anstelle des App Stores.
Demonstriert einen praxisnahen, datenschutzkonformen Workflow für lokale Transkription und lokale LLMs, der für Unternehmen mit hohen Anforderungen an den Datenschutz relevant ist, wenngleich es sich um ein Entwicklerprojekt und keine plattformweite Änderung handelt.
Marktsignale zu Apple in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Scripta ist eine Open-Source-macOS-App zur getrennten Aufzeichnung von Mikrofon und System-Audio mit lokaler Echtzeit-Transkription und KI-Zusammenfassung.
- Mikrofon-Audio wird über whisper.cpp mit Metal GPU-Beschleunigung verarbeitet; das Basismodell (142 MB) läuft >15x in Echtzeit auf Apple Silicon.
- System- und Remote-Audio werden mittels ScreenCaptureKit erfasst und über Apples lokalen SFSpeechRecognizer transkribiert.
- Scripta nutzt einen lokalen Ollama-Server für das Streaming von Zusammenfassungen; das Standardmodell ist qwen2.5:3b.
- Voice Processing IO erfordert manuelle Kanallextraktion und Resampling, um unerwartete 9-Kanal-Formate und Audio-Ducking zu umgehen.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Meetergo Log: Free Offline Meeting Transcription
t3n reviewed Meetergo Log, a free meeting-transcription tool from German meetings specialist Meetergo that performs transcription and optional summarization entirely on the user’s machine. The application captures audio from the local microphone and speakers and does not send data to a cloud interface; it leverages the open-source Whisper transcription model and can run a large language model locally to generate post-meeting summaries. The article situates Meetergo Log in a broader market for offline privacy-preserving tools, cites a 2025 Bitkom survey on widespread use of video-conferencing software, and notes reporting (Huffington Post) about potential legal risks from incorrect AI summaries. t3n tests remaining usability and accuracy trade-offs in its Tool Time episode and highlights the privacy rationale for local transcription.
Voice2Sub: Lokaler KI-Desktop-Untertitelgenerator für Video und Audio
Voice2Sub ist eine Desktop-Anwendung für Untertitel und Transkription, die entwickelt wurde, um lokal aus Video- und Audiodateien Untertitel und Transkripte zu generieren, ohne Medien in browserbasierte Tools hochladen zu müssen. Die im Mai 2026 veröffentlichte App nutzt Whisper AI-Erkennung für Speech-to-Text, läuft auf Windows x64, macOS Apple Silicon sowie Linux x64 und unterstützt Hardwarebeschleunigung (CUDA bei kompatiblen Windows- und Linux-Systemen sowie Metal auf Apple Silicon). Voice2Sub exportiert gängige Untertitel- und Transkriptformate wie SRT, VTT, TXT, LRC und CSV und gibt Anwendern die volle Kontrolle über die Modellauswahl sowie Transkriptionseinstellungen. Das Projekt ist über eine Website, direkte Download-Releases sowie ein zugehöriges GitHub-Repository verfügbar und richtet sich gezielt an Kreative sowie datenschutzorientierte Anwendungsfälle im Bereich Video- und Audio-Workflows.
Gemini 3.5 Transcribe: Echtzeit-Transkription und Diarisierung in macOS-App
Ein Entwickler-Blogbeitrag dokumentiert die Integration von Echtzeit-Transkription und Offline-Sprecherdiarisierung in eine macOS-Meeting-Übersetzungs-App mithilfe von Googles Gemini 3.5 Transkriptionsmodellen. Der Autor erläutert die kritischen Unterschiede zwischen gemini-3.5-transcribe-live (Live API, Streaming, ohne Diarisierung, 10-Minuten-Sessions) und gemini-3.5-transcribe (Interactions API, Batch, Sprecherdiarisierung für bis zu 8 Sprecher, wortgenaue Zeitstempel, 30-Minuten-Diarisierungslimit). Der Artikel beschreibt erforderliche Anfragefelder für Wort-Annotationen, typische Fallstricke wie Chunking und CJK-Abstände, Datenschutzpraktiken sowie testgetriebene Engineering-Lehren. Der Quellcode ist auf GitHub veröffentlicht. Das Publikationsdatum ist der 28. August 2026.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
