47 566 e-mails, formulaires, conversations et charges JSON synthétiques en six langues : anglais, français, allemand, espagnol, italien et néerlandais. C'est le corpus PII public le plus cité, et cette notoriété joue dans les deux sens, puisqu'il est public depuis assez longtemps pour qu'un grand modèle l'ait probablement lu pendant son entraînement.
Même protocole que l'exécution PII-INDEXBENCH, mêmes cinq systèmes, même scoreur, sur l'intégralité du split de validation : 47 566 documents et 293 712 valeurs annotées.
95,3 %
- Rappel
- Part des valeurs personnelles annotées retirées par la sortie, la plus élevée des cinq systèmes ici également, l'OpenAI Privacy Filter venant ensuite à 82,9 %.
80,2 %
- Précision
- Plus basse que sur PII-INDEXBENCH, pour une raison qui mérite lecture : les trois quarts de ce qui nous coûte ici ne sont annotés comme données personnelles nulle part dans le corpus. La section ci-dessous démonte le chiffre.
1,3 pt
- Écart entre les langues
- Entre la meilleure langue (français, 95,9 %) et la moins bonne (néerlandais, 94,7 %) en rappel.
Hexagone AI, langue par langue
Résultats Hexagone AI par langue sur AI4Privacy| Langue | Documents | Rappelpart des données personnelles trouvées | Précision |
|---|
| Anglais | 7 942 | 95,9 % | 79,9 % |
|---|
| Français | 8 390 | 95,9 % | 81,9 % |
|---|
| Allemand | 8 100 | 95,2 % | 78,9 % |
|---|
| Espagnol | 7 803 | 95,6 % | 81,1 % |
|---|
| Italien | 7 878 | 94,6 % | 80,1 % |
|---|
| Néerlandais | 7 453 | 94,7 % | 79,4 % |
|---|
Le français passe devant l'anglais ici, ce à quoi on peut s'attendre d'un système construit en France, et c'est l'inverse du schéma habituel pour les outils de cette catégorie.
Couverture de détection par type de donnée personnelle sur AI4Privacy| Type de donnée personnelle | Segments | Hexagone AI | OpenMed | OPF | Presidio | GLiNER |
|---|
| NomsPERSON | 52 298 | 97,8 % | 93,7 % | 95,2 % | 36,3 % | 83,4 % |
|---|
| Adresses postalesADDRESS | 41 024 | 95,4 % | 70,8 % | 97,4 % | pas d'étiquette | 56,9 % |
|---|
| LieuxLOCATION | 36 318 | 91,9 % | 94,0 % | 40,2 % | 37,3 % | 41,5 % |
|---|
| Numéros de téléphonePHONE_NUMBER | 12 601 | 97,0 % | 85,2 % | 99,4 % | 64,1 % | 60,5 % |
|---|
| Adresses e-mailEMAIL_ADDRESS | 15 883 | 99,8 % | 99,5 % | 99,6 % | 99,7 % | 58,3 % |
|---|
| Numéros de sécurité socialeSSN | 15 791 | 98,0 % | 86,8 % | 99,7 % | 71,2 % | 23,6 % |
|---|
| Dates et heuresDATE_TIME | 49 285 | 91,2 % | 92,8 % | 53,1 % | 50,1 % | 62,5 % |
|---|
| Numéros d'identité nationaleNATIONAL_ID | 16 693 | 96,4 % | pas d'étiquette | 95,5 % | pas d'étiquette | pas d'étiquette |
|---|
| Numéros de passeportPASSPORT_NUMBER | 15 570 | 96,0 % | pas d'étiquette | 95,9 % | 46,6 % | 29,7 % |
|---|
| Permis de conduireDRIVER_LICENSE | 15 207 | 97,4 % | pas d'étiquette | 99,0 % | 74,7 % | 18,9 % |
|---|
| Adresses IPIP_ADDRESS | 14 110 | 99,0 % | 99,4 % | 99,1 % | 99,6 % | pas d'étiquette |
|---|
| Mots de passe, clés et jetonsPASSWORD | 10 303 | 90,3 % | 74,6 % | 97,7 % | pas d'étiquette | pas d'étiquette |
|---|
Le meilleur de chaque ligne est en gras. « Pas d'étiquette » signifie que le système n'a aucune catégorie pour ce type de donnée : il n'est donc ni noté ni pénalisé sur cette ligne, ce qui est la lecture la plus généreuse d'un vocabulaire incomplet. La teinte de chaque cellule suit la valeur qu'elle contient.
Pourquoi lire cette exécution avec PII-INDEXBENCH
AI4Privacy est sur HuggingFace depuis des années, si bien que n'importe quel grand modèle l'a plausiblement vu pendant son entraînement, ce qui avantage tout système contenant un modèle de langue, le nôtre compris. PII-INDEXBENCH n'y est pas distribué, et en cas de désaccord entre les deux séries de chiffres, nous ferions davantage confiance à celle de PII-INDEXBENCH.