Beobachtetes Signal · 15. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Lokale LLM-Chrome-Extension ersetzt Grammarly-UX durch On-Device-Korrektur
Ein Entwickler hat 'inline-scribe' veröffentlicht, eine Open-Source-Chrome-Extension, die Texte lokal über ein Ollama-gehostetes LLM Korrektur liest, sodass keine Tastenanschläge das lokale Gerät verlassen. Die Extension lässt das Modell ausschließlich korrigierten Text generieren, während ein deterministischer Word-Level-LCS-Diff-Algorithmus im Client Änderungen für eine granulare Annehmen/Ablehnen-UI berechnet. Um CORS-Probleme zu umgehen, nutzt das Tool Chrome MV3 'declarativeNetRequest' zum Entfernen des Origin-Headers und führt den Fetch-Vorgang im Service Worker aus, um Page-CSP-Restriktionen zu umgehen. Das unter der MIT-Lizenz stehende Projekt unterstützt kleinere, lokale Modelle wie Llama 3.2 und demonstriert einen modellunabhängigen, testbaren Client-Side-Ansatz für datenschutzkonforme LLM-Integrationen.
Das Projekt demonstriert konkrete, reproduzierbare Design-Patterns für datenschutzkonforme On-Device-LLM-Integrationen (deterministische Client-Side-Diffs, Origin-Stripping via DNR, Service-Worker-Fetch), die Cloud-Abhängigkeiten reduzieren, auch wenn die sofortige branchenweite Auswirkung begrenzt bleibt.
Marktsignale zu Grammarly in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- inline-scribe ist eine Chrome-Extension, die Texte über ein lokales LLM via Ollama direkt auf dem Gerät des Nutzers korrigiert.
- Die Extension generiert korrigierte Prosa über das Modell und berechnet clientseitig einen deterministischen Word-Level-LCS-Diff für granulare UI-Änderungen.
- Die Extension nutzt Chrome MV3 declarativeNetRequest, um den Origin-Headers bei Ollama-Anfragen zu entfernen und OLLAMA_ORIGINS zu umgehen.
- Der Fetch-Aufruf an das lokale Ollama-Endpoint erfolgt im Service Worker (nicht im Content Script), um Content-Security-Policy-Restriktionen der Seite zu umgehen.
- Das Projekt ist Open-Source (MIT) und unterstützt OpenAI-kompatible Endpoints sowie kleine Modelle wie Llama 3.2 (~2GB).
Verknüpfte Unternehmen
6 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
230 Zeilen lange Chrome-MV3-Erweiterung kopiert Auswahl als Markdown
Ein Entwickler hat eine kompakte, Open-Source-basierte Chrome-Manifest-V3-Erweiterung veröffentlicht, die Seitenaus- oder -inhalte in GitHub-konformes Markdown konvertiert und direkt in die Zwischenablage schreibt. Die Implementierung umfasst rund 230 Zeilen Vanilla-JavaScript, wobei die Konverter-Logik sowohl im Browser als auch via Node und jsdom für 35 automatisierte Tests ausgeführt wird. Das Projekt verzichtet bewusst auf die Deklaration von host_permissions beziehungsweise <all_urls> und setzt stattdessen auf das Berechtigungsmuster aus activeTab, scripting und contextMenus. Der Beitrag dokumentiert architektonische Entscheidungen zu MV3 wie den Service-Worker, das Zwei-Aufruf-Muster von chrome.scripting.executeScript sowie Details zur Nachrichtenübermittlung zwischen Popup und Service-Worker. Der Quellcode ist auf GitHub unter MIT-Lizenz verfügbar, und es wird eine gehostete Demo bereitgestellt.
So betreiben Entwickler Large Language Models lokal auf eigener Hardware
Ein von Nilesh Raut veröffentlichter Praxis-Leitfaden zeigt, wie Entwickler Large Language Models lokal ausführen können, um API-Kosten zu senken, Datenschutzvorgaben zu erfüllen, Offline-Workflows zu ermöglichen und die Experimentiergeschwindigkeit zu erhöhen. Die Anleitung demonstriert die Installation von Ollama, das Laden von Modellen wie Llama 3 und Qwen2.5-Coder:7b sowie die Nutzung einer lokalen REPL-Umgebung. Zudem wird die Integration in VS Code mithilfe von Continue.dev und Cline sowie das Hosting einer ChatGPT-ähnlichen Benutzeroberfläche über Open WebUI in Docker auf Port 3000 erläutert. Empfohlen werden Modelle wie Qwen2.5 Coder, DeepSeek Coder, Llama 3, Phi und Mistral bei einer Mindesthardwareausstattung von 16 GB RAM, einer SSD und idealerweise einer NVIDIA-GPU für verbesserte Inferenz-Performance. Typische Anwendungsfälle umfassen Coding-Assistenz, Refactoring, Dokumentation und kleinere Agenten-Workflows.
Lokale LLM-Inferenz für datenschutzkonforme Browser-Intelligence neu entwickelt
Ein Entwicklerpapier beschreibt die Kathon Local AI Engine, eine offene On-Device-Architektur zur Ausführung von Large Language Models und Vision-Language-Modellen direkt im Browser ohne Cloud-Inferenz. Das System nutzt llama.cpp mit einem quantisierten Qwen 2.5 VL 2B Q4 GGUF-Modell, einen Rust-basierten Inferenz-Server (llama-server), der über eine lokale WebSocket-API mit einem React/TypeScript-Frontend kommuniziert, sowie zahlreiche Optimierungen wie Speculative Decoding, KV-Cache-Quantisierung, Prompt Caching und GPU-beschleunigte Tensor-Operationen. Das Design setzt auf vollständig isolierten Betrieb (Airgapping) und kryptografische Auditierbarkeit über ein unveränderliches SHA3-256-.aioss-Ledger. Der Autor Lois-Kleinner Alpasan veröffentlichte ein formales Papier im The Anticloud Research Corpus und positioniert das Projekt als datenschutzorientierte Alternative zur Cloud-Inferenz, die Nutzerdaten lokal belässt und durch Endanwender auditierbar macht.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
