Toute la recherche
Évaluation sur jeu complet

AI4Privacy : 47 566 documents en six langues

Le même protocole que PII-INDEXBENCH, appliqué au corpus PII public le plus cité et noté par langue et par type de donnée personnelle. Il s'accompagne aussi des réserves qu'impose un corpus aussi largement distribué.

Réalisée par Hexagone AI, septembre 2026. Jeu de données public, reproductible.

47 566 e-mails, formulaires, conversations et charges JSON synthétiques en six langues : anglais, français, allemand, espagnol, italien et néerlandais. C'est le corpus PII public le plus cité, et cette notoriété joue dans les deux sens, puisqu'il est public depuis assez longtemps pour qu'un grand modèle l'ait probablement lu pendant son entraînement.

Même protocole que l'exécution PII-INDEXBENCH, mêmes cinq systèmes, même scoreur, sur l'intégralité du split de validation : 47 566 documents et 293 712 valeurs annotées.

95,3 %
Rappel
Part des valeurs personnelles annotées retirées par la sortie, la plus élevée des cinq systèmes ici également, l'OpenAI Privacy Filter venant ensuite à 82,9 %.
80,2 %
Précision
Plus basse que sur PII-INDEXBENCH, pour une raison qui mérite lecture : les trois quarts de ce qui nous coûte ici ne sont annotés comme données personnelles nulle part dans le corpus. La section ci-dessous démonte le chiffre.
1,3 pt
Écart entre les langues
Entre la meilleure langue (français, 95,9 %) et la moins bonne (néerlandais, 94,7 %) en rappel.

Tous les types de données annotés par le benchmark

Précision, rappel et F1 sur AI4Privacy PII-Masking-300k, tous types annotés, cinq systèmes
SystèmeRappelpart des données personnelles trouvéesPrécisionF1F1 · bornes exactes
Hexagone AIapi.hexagone.ai, masking mode95,3 %80,2 %87,1 %67,7 %
OpenMed PIIOpenMed/OpenMed-PII-SuperClinical-Large-434M-v186,8 %86,8 %86,8 %65,4 %
OpenAI Privacy Filteropenai/privacy-filter, 1.5B, run locally82,9 %89,5 %86,1 %54,0 %
GLiNERurchade/gliner_multi-v2.150,8 %60,1 %55,1 %47,9 %
Microsoft Presidiopresidio-analyzer + spaCy en_core_web_lg49,0 %65,5 %56,1 %31,8 %

Hexagone AI, langue par langue

Résultats Hexagone AI par langue sur AI4Privacy
LangueDocumentsRappelpart des données personnelles trouvéesPrécision
Anglais7 94295,9 %79,9 %
Français8 39095,9 %81,9 %
Allemand8 10095,2 %78,9 %
Espagnol7 80395,6 %81,1 %
Italien7 87894,6 %80,1 %
Néerlandais7 45394,7 %79,4 %

Le français passe devant l'anglais ici, ce à quoi on peut s'attendre d'un système construit en France, et c'est l'inverse du schéma habituel pour les outils de cette catégorie.

Couverture de détection par type de donnée personnelle sur AI4Privacy
Type de donnée personnelleSegmentsHexagone AIOpenMedOPFPresidioGLiNER
NomsPERSON52 29897,8 %93,7 %95,2 %36,3 %83,4 %
Adresses postalesADDRESS41 02495,4 %70,8 %97,4 %pas d'étiquette56,9 %
LieuxLOCATION36 31891,9 %94,0 %40,2 %37,3 %41,5 %
Numéros de téléphonePHONE_NUMBER12 60197,0 %85,2 %99,4 %64,1 %60,5 %
Adresses e-mailEMAIL_ADDRESS15 88399,8 %99,5 %99,6 %99,7 %58,3 %
Numéros de sécurité socialeSSN15 79198,0 %86,8 %99,7 %71,2 %23,6 %
Dates et heuresDATE_TIME49 28591,2 %92,8 %53,1 %50,1 %62,5 %
Numéros d'identité nationaleNATIONAL_ID16 69396,4 %pas d'étiquette95,5 %pas d'étiquettepas d'étiquette
Numéros de passeportPASSPORT_NUMBER15 57096,0 %pas d'étiquette95,9 %46,6 %29,7 %
Permis de conduireDRIVER_LICENSE15 20797,4 %pas d'étiquette99,0 %74,7 %18,9 %
Adresses IPIP_ADDRESS14 11099,0 %99,4 %99,1 %99,6 %pas d'étiquette
Mots de passe, clés et jetonsPASSWORD10 30390,3 %74,6 %97,7 %pas d'étiquettepas d'étiquette

Le meilleur de chaque ligne est en gras. « Pas d'étiquette » signifie que le système n'a aucune catégorie pour ce type de donnée : il n'est donc ni noté ni pénalisé sur cette ligne, ce qui est la lecture la plus généreuse d'un vocabulaire incomplet. La teinte de chaque cellule suit la valeur qu'elle contient.

Pourquoi lire cette exécution avec PII-INDEXBENCH

AI4Privacy est sur HuggingFace depuis des années, si bien que n'importe quel grand modèle l'a plausiblement vu pendant son entraînement, ce qui avantage tout système contenant un modèle de langue, le nôtre compris. PII-INDEXBENCH n'y est pas distribué, et en cas de désaccord entre les deux séries de chiffres, nous ferions davantage confiance à celle de PII-INDEXBENCH.

Lire le chiffre de précision

Les trois quarts ne sont jamais annotés

La précision est de 80,2 % ici contre 93,5 % sur PII-INDEXBENCH, et l'écart tient au périmètre d'annotation plutôt qu'à une différence de pipeline. Ce benchmark étiquette les valeurs elles-mêmes sans étiqueter les champs qui les entourent, et il n'étiquette aucune organisation.

Le corpus est multilingue, et une liste manuelle d'intitulés de champs et de formules d'appel en six langues reviendrait à un classifieur ajusté jusqu'à ce que le résultat nous arrange. Chaque segment signalé est donc confronté aux 210 529 chaînes distinctes que ce benchmark annote comme données personnelles quelque part dans ses 47 566 documents, une vérification que n'importe qui peut refaire à partir des enregistrements publiés.

Les 94 924 segments qui nous coûtent de la précision

Chaque prédiction sur AI4Privacy qui ne touche aucun segment annoté, classée face aux annotations du benchmark.

  • 74,1 % Une valeur que ce benchmark n'annote jamais comme donnée personnelle, nulle part (70 298)
  • 25,9 % Une valeur qu'il annote ailleurs dans le corpus, mais pas ici (24 626)
  1. 64,7 %61 395 segments

    Intitulés de champs et structure du document, en six langues

    Règle. La chaîne exacte n'apparaît comme valeur annotée dans aucun des 47 566 documents.

    State, Country, Street, Stadt, Straße, Rue, Calle, Postleitzahl, IP-Adresse. Nous masquons l'intitulé en plus de la valeur qu'il introduit, ce qui reste du sur-masquage quelle que soit la lecture, même si le coût porte sur la lisibilité plutôt que sur la confidentialité. C'est aussi la première raison pour laquelle ce chiffre reste sous les 93,5 % atteints sur PII-INDEXBENCH.

    Ce qu'Hexagone AI a retiré

    - Land: Deutschland - Gebäude: 543 - Straße: Amselreutehof - Stadt: Rosenfeld - Bundesland: BW

    Ce que le benchmark annote

    - Land: Deutschland - Gebäude: 543 - Straße: Amselreutehof - Stadt: Rosenfeld - Bundesland: BW

    Le même extrait des deux côtés, tiré de l'enregistrement doc-27758 d'AI4Privacy, à l'identique.

  2. 9,4 %8 903 segments

    Les organisations, que ce référentiel n'annote jamais

    Règle. Notre prédiction est typée COMPANY. AI4Privacy annote douze types de données personnelles, et les organisations n'en font pas partie.

    Chaque employeur, hôpital, université ou plateforme que nous retirons joue contre nous ici, faute d'une catégorie dans laquelle il aurait pu être compté juste : Universidad de Madrid, Université de Genève, Università di Zurigo. En écartant ces prédictions, la précision passe de 80,2 % à 81,7 %, et c'est le chiffre non corrigé que nous affichons en tête.

    Ce qu'Hexagone AI a retiré

    password reset has been requested for your EduPortal account

    Ce que le benchmark annote

    password reset has been requested for your EduPortal account

    Le même extrait des deux côtés, tiré de l'enregistrement doc-11 d'AI4Privacy, à l'identique.

  3. 25,9 %24 626 segments

    Une valeur annotée dans d'autres documents, mais pas dans celui-ci

    Règle. La chaîne exacte est une valeur annotée quelque part dans le corpus, mais pas à cette occurrence.

    Noms de pays (Deutschland, Suisse, España, Nederland), formules d'appel (Cher, Gentile, Herr), initiales et nombres isolés. Le benchmark traite un pays comme une donnée personnelle dans un document et comme de la prose ordinaire dans le suivant, et rien dans le texte ne permet de distinguer les deux cas. Un pays accompagné d'une profession et d'une date se trouve aussi être la combinaison qui réduit le champ des personnes possibles : nous préférons donc le retirer plutôt que de parier.

    Ce qu'Hexagone AI a retiré

    die Gesundheitsversorgung in Deutschland zu optimieren und die Gesundheit der Bevölkerung nachhaltig zu fördern

    Ce que le benchmark annote

    die Gesundheitsversorgung in Deutschland zu optimieren und die Gesundheit der Bevölkerung nachhaltig zu fördern

    Le même extrait des deux côtés, tiré de l'enregistrement doc-25142 d'AI4Privacy, à l'identique.

Testez-le sur vos propres documents.

Un benchmark, ce sont les données de quelqu'un d'autre. Une semaine gratuite, sans carte bancaire, et les fichiers ne quittent jamais votre machine : vous ne risquez rien à vérifier vous-même.