Beobachtetes Signal · 22. Apr. 2026 · Technical Release · Quelle: OpenAI Blog · Relevanz: 4/5 · Sentiment: Positiv
OpenAI veröffentlicht Privacy Filter zur Redigierung personenbezogener Daten
OpenAI hat mit Privacy Filter ein Open-Weight-Modell zur Erkennung und Redigierung von personenbezogenen Daten (PII) in Texten vorgestellt. Das am 22. April 2026 veröffentlichte Modell basiert auf einer bidirektionalen Token-Klassifizierung mit 1,5 Milliarden Parametern (davon 50 Millionen aktiv), unterstützt Kontextfenster von bis zu 128.000 Token und nutzt BIOES-Tags für die Span-Dekodierung. Es klassifiziert acht Schutzbereiche wie private Adressen, E-Mails oder Kontonummern, lässt sich lokal ausführen und für domainspezifische Anwendungsfälle fine-tunen. Auf dem Benchmark PII-Masking-300k erreicht es einen F1-Score von 96 Prozent (bzw. 97,43 Prozent in einer korrigierten Version). Die Veröffentlichung erfolgt unter einer Apache-2.0-Lizenz auf Hugging Face und GitHub. OpenAI betont jedoch, dass das Tool keine formelle Compliance-Zertifizierung ersetzt, sondern als grundlegende Datenschutz-Infrastruktur für sicherere KI-Workflows dient.
Ein führender KI-Anbieter stellt ein quelloffenes, lokal ausführbares PII-Erkennungsmodell mit starken Benchmarks und permissiver Lizenzierung bereit. Dies kann massiv beeinflussen, wie Unternehmen personenbezogene Daten in Trainings-, Logging-, Indexierungs- und Compliance-Workflows handhaben.
Marktsignale zu GitHub in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- OpenAI hat am 22. April 2026 den Privacy Filter als Open-Weight-Modell zur PII-Erkennung und -Redigierung veröffentlicht.
- Modellarchitektur: Bidirektionale Token-Klassifizierung mit Span-Dekodierung, 1,5B Parametern (50M aktive) und Unterstützung für bis zu 128.000 Token Kontext.
- Das Modell deckt acht Datenschutz-Kategorien ab (darunter private_person, private_address, private_email und secret) und nutzt BIOES-Tags.
- Benchmark-Leistung: F1-Score von 96 % auf PII-Masking-300k (94,04 % Präzision, 98,04 % Recall) sowie 97,43 % auf einer korrigierten Benchmark-Version.
- Verfügbarkeit: Unter Apache-2.0-Lizenz auf Hugging Face und GitHub für lokale Ausführung, Fine-Tuning und kommerzielle Nutzung bereitgestellt.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
OpenAI erläutert Datenschutz und Datennutzung für das ChatGPT-Training
OpenAI hat einen Leitfaden veröffentlicht, der detailliert darlegt, welche Daten für das Training von ChatGPT verwendet werden, welche Schutzmechanismen zum Einsatz kommen und welche Kontrolloptionen Nutzern zur Verfügung stehen. Zu den Trainingsquellen zählen öffentlich zugängliche Inhalte, Partnerdaten sowie nutzer- und forschergenerierte Inhalte. Ein zentrales Element ist der interne OpenAI Privacy Filter, der personenbezogene Daten in mehreren Phasen der Trainingspipeline identifiziert und maskiert. Nutzer erhalten verschiedene Kontrollmöglichkeiten: Über die Datenschutzeinstellungen lässt sich die Modellverbesserung deaktivieren. Zudem gibt es Temporäre Chats, die nach 30 Tagen gelöscht und nicht für das Training genutzt werden, sowie eine optionale Memory-Funktion. Ergänzend können Nutzer ihre Daten exportieren, Konten löschen und über ein spezielles Portal Datenschutzanfragen einreichen. Diese Maßnahmen beeinflussen branchenweit die Governance von Trainingsdaten und die Gestaltung von Einwilligungsprozessen im Bereich Conversational AI.
Privacy Gateway filtert sensible Daten vor ChatGPT
Forscher der FernUniversität Hagen (Pascal Tippe und Michael Maximilian Grötzner) haben Privacy Gateway entwickelt, einen Prototypen zur automatischen Erkennung und Entfernung sensibler Informationen aus User-Prompts vor der Übermittlung an Large Language Models. Das System nutzt ein Codebook, das DSGVO-Vorgaben (Art. 4 und 9) sowie das deutsche Geschäftsgeheimnisgesetz in operative Regeln übersetzt, um den Prompt-Kontext ganzheitlich zu bewerten statt auf einfache Keyword-Filter zu vertrauen. Evaluierungen anhand eines Datensatzes alltäglicher Szenarien (DOI: 10.56553/popets-2026-0090) belegen eine zuverlässige Anonymisierung, offenbaren jedoch einen Zielkonflikt: Die Entfernung umfangreicher personenbezogener Daten, etwa komplexer medizinischer Fälle, beeinträchtigt die Antwortqualität der KI spürbar. Zudem verweist der Bericht auf eine Bitkom-Umfrage, wonach rund ein Drittel der Bürger in Deutschland KI mindestens wöchentlich nutzt.
OpenAI kündigt Private Safety Processing für Zero Data Retention an
OpenAI hat Zero Data Retention (ZDR) für berechtigte API-Kunden bekräftigt und Private Safety Processing vorgestellt, eine datenschutzorientierte Sicherheitsfunktion. Diese erkennt Muster über zusammenhängende Interaktionen hinweg, ohne dass zugrundeliegende Prompts oder Modell-Outputs für OpenAI-Mitarbeiter sichtbar werden. Unter ZDR werden Kundendaten nicht gespeichert und nicht zum Training von Modellen verwendet, es sei denn, Kunden stimmen dem ausdrücklich zu. Private Safety Processing läuft auf vom Kunden kontrollierten Infrastrukturen oder auf OpenAI-gehostetem Speicher, der mit kundeneigenen Schlüsseln verschlüsselt ist, auf die OpenAI keinen Zugriff hat. Statt Kundeninhalte zurückzugeben, werden präzise automatisierte Sicherheitssignale ausgegeben. Das Feature befindet sich in der Testphase; ein breiterer Rollout sowie ein technisches Whitepaper sind für September geplant. Die Ankündigung dient der wettbewerblichen Differenzierung gegenüber Anthropic und dessen neuer 30-Tage-Speicherrichtlinie.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
