Anonymisation de documents à l’échelle
Un pipeline d’anonymisation de documents juridiques à grande échelle, pour produire des corpus de formation exploitables sans exposer de données personnelles ni d’informations identifiantes.
Stack technique
- Python
- spaCy
- Presidio
- Reconnaissance d’entités (NER)
- Règles & regex
- PostgreSQL
- Traitement par lots
Typologie des données
Inventaire des entités à masquer (noms, adresses, numéros, références d’affaires) et définition des règles de cohérence pour préserver la lisibilité des documents.
Détection hybride
Combinaison de modèles NER et de règles déterministes (regex, dictionnaires) pour maximiser le rappel sur les données sensibles.
Anonymisation cohérente
Substitution stable par pseudonymes : une même entité reçoit le même remplacement dans tout le corpus, pour garder le sens.
Contrôle qualité
Échantillonnage et revue manuelle des sorties, mesure du taux de fuite résiduel, itérations sur les règles.
Aperçus
Captures à venir — projet sous accord de confidentialité.