Aller au contenu
FREN
Travaux

Anonymisation de documents à l’échelle

Juridique

Un pipeline d’anonymisation de documents juridiques à grande échelle, pour produire des corpus de formation exploitables sans exposer de données personnelles ni d’informations identifiantes.

Stack technique

  • Python
  • spaCy
  • Presidio
  • Reconnaissance d’entités (NER)
  • Règles & regex
  • PostgreSQL
  • Traitement par lots

Typologie des données

Inventaire des entités à masquer (noms, adresses, numéros, références d’affaires) et définition des règles de cohérence pour préserver la lisibilité des documents.

Détection hybride

Combinaison de modèles NER et de règles déterministes (regex, dictionnaires) pour maximiser le rappel sur les données sensibles.

Anonymisation cohérente

Substitution stable par pseudonymes : une même entité reçoit le même remplacement dans tout le corpus, pour garder le sens.

Contrôle qualité

Échantillonnage et revue manuelle des sorties, mesure du taux de fuite résiduel, itérations sur les règles.

Aperçus

Captures à venir — projet sous accord de confidentialité.