Projekt
Erkennung und Ersetzung von personenbezogenen Daten in Dokumenten mithilfe von KI-Modellen
Ziel dieser Arbeit ist die Entwicklung eines On-Premise-Systems zur automatisierten Erkennung und Pseudonymisierung personenbezogener Daten in deutschen Verwaltungsdokumenten. Aufgrund der datenschutzrechtlichen Anforderungen und des Steuergeheimnisses erfolgt die gesamte Verarbeitung vollständig lokal ohne Cloud-Anbi…
Ziel dieser Arbeit ist die Entwicklung eines On-Premise-Systems zur automatisierten Erkennung und Pseudonymisierung personenbezogener Daten in deutschen Verwaltungsdokumenten. Aufgrund der datenschutzrechtlichen Anforderungen und des Steuergeheimnisses erfolgt die gesamte Verarbeitung vollständig lokal ohne Cloud-Anbindung. Hierfür wurde eine hybride Pipeline entwickelt, die regelbasierte Verfahren (Regex), statistische NLP-Komponenten (spaCy) sowie ein lokal betriebenes Large Language Model kombiniert. Das System identifiziert verschiedene sensible Informationen wie Namen, Adressen, Steueridentifikationsnummern, Bankdaten und weitere administrative Identifikatoren. Die extrahierten Daten werden strukturiert verarbeitet und durch konsistente Platzhalter pseudonymisiert. Die Evaluation erfolgte anhand eines Testdatensatzes mit deutschsprachigen Verwaltungsdokumenten unterschiedlicher Formate. Die Ergebnisse zeigen, dass die Kombination aus regelbasierten Verfahren, statistischer Entitätenerkennung und Sprachmodellen die Erkennungsqualität deutlich verbessert und eine praktikable Lösung für datenschutzkonforme Dokumentverarbeitung in sicherheitskritischen Umgebungen darstellt.
Technologien
- Generative AI Generative AI – Überblick über Forschungsprojekte, Patente und Akteure im TechnologieAtlas.
Themengebiete
- Digitale Verwaltung Digitale Verwaltung – Überblick über Forschungsprojekte, Patente und Akteure im TechnologieAtlas.