Les performances d'Hexagone AI.
Tous les éditeurs d'anonymisation revendiquent une bonne précision. Très peu précisent sur quel jeu de données, selon quelle métrique, ni face à quoi. Cette page rassemble les évaluations que nous avons menées et publiées, avec la méthodologie de chacune et les articles et rapports à lire en entier. Si vous y trouvez une erreur, dites-le nous et nous corrigerons la page.
Résultats principaux
- des valeurs personnelles annotées retirées sur PII-INDEXBENCH
- Mesuré sur le jeu de données entier plutôt que sur un échantillon : 12 079 documents et 226 428 valeurs annotées. Le système suivant, un Qwen3-14B à poids ouverts interrogé comme détecteur, en trouve 91,7 %, et la précision sur la même exécution est de 93,5 %.
- des valeurs personnelles annotées retirées, en six langues
- 47 566 documents en anglais, français, allemand, espagnol, italien et néerlandais, et le meilleur rappel des cinq systèmes comparés. L'écart entre la meilleure et la moins bonne langue est de 1,3 point.
- de ré-identification au niveau 1, le taux le plus bas des outils comparés
- Azure obtient 22 % et un prompt purificateur GPT-4.1 26 % sur les mêmes textes. Au niveau 2, où les identifiants sont obfusqués : 27 % contre 33 % et 58 %.
- identifiant direct retrouvé dans les textes anonymisés
- Aucun nom, numéro de téléphone ou numéro de sécurité sociale n'était récupérable, aux deux niveaux de difficulté. Azure et le prompt GPT-4.1 en ont laissé fuiter.
Mesuré sur : PII-INDEXBENCH v1.2, tous les splits · septembre 2026
Mesuré sur : AI4Privacy PII-Masking-300k, split de validation complet · septembre 2026
Mesuré sur : Jeu de test RAT-Bench · Imperial College London
Mesuré sur : Jeu de test RAT-Bench · Imperial College London
Ces chiffres décrivent la performance sur les jeux de test publics nommés ci-dessus, et ne constituent pas une garantie sur vos propres documents. Un corpus différent donne des chiffres différents, et c'est pourquoi chaque résultat indique ici le corpus sur lequel il a été mesuré.
Les études
- Évaluation sur jeu complet
PII-INDEXBENCH : 12 079 documents conçus pour être difficiles
Chaque enregistrement passé dans l'API de production, noté face aux annotations du benchmark aux côtés de cinq autres systèmes, dont Qwen3-14B interrogé comme détecteur. Le chiffre de précision est décortiqué face à ces mêmes annotations plus bas dans la page.
Réalisée par Hexagone AI, septembre 2026. Jeu de données PII-INDEXBENCH v1.2, CC BY 4.0.
- 97,9 %
- de rappel, le plus élevé des six systèmes
- 93,5 %
- de précision
- Évaluation sur jeu complet
AI4Privacy : 47 566 documents en six langues
Le même protocole que PII-INDEXBENCH, appliqué au corpus PII public le plus cité et noté par langue et par type de donnée personnelle. Il s'accompagne aussi des réserves qu'impose un corpus aussi largement distribué.
Réalisée par Hexagone AI, septembre 2026. Jeu de données public, reproductible.
- 95,3 %
- de rappel, le plus élevé des cinq systèmes
- 6
- langues, 1,3 point d'écart
- Benchmark indépendant
RAT-Bench : un attaquant peut-il encore retrouver la personne ?
Un benchmark de ré-identification construit à l'Imperial College London, et une meilleure question que celle posée par la plupart des évaluations. Nous y avons exécuté notre pipeline aux côtés d'Azure et d'un prompt de masquage GPT-4.1, avec les critères de notation des auteurs inchangés.
Benchmark de Krčo, Yao, Meeus et de Montjoye, Imperial College London, 2026
- 14 %
- de ré-identification au niveau 1, le taux le plus bas comparé
- 0
- identifiant direct retrouvé
- 0,83
- de BLEU : la part du texte qui survit
- Évaluation interne, 2024
Taux de détection face à Microsoft Presidio
Notre première comparaison publiée, en novembre 2024, et la seule accompagnée d'un PDF de méthodologie de dix pages. Dépassée en ampleur par les deux exécutions complètes ci-dessus, et conservée ici parce que ses chiffres tiennent toujours.
Réalisée par Hexagone AI, novembre 2024. Jeu de données public, reproductible.
- 96,95 %
- des entités détectées, contre 75,30 %
- 93,34 %
- sur texte dégradé, contre 65,89 %
Comment lire n'importe quel benchmark éditeur. Posez trois questions. Quel jeu de données, et est-il public ? Quelle métrique, et mesure-t-elle un risque ou seulement un rappel ? Quels systèmes ont été comparés, et étaient-ils configurés équitablement ? Un chiffre sans ces trois réponses, y compris les nôtres, est du marketing. Chaque étude ci-dessus porte les trois.
Testez-le sur vos propres documents.
Un benchmark, ce sont les données de quelqu'un d'autre. Une semaine gratuite, sans carte bancaire, et les fichiers ne quittent jamais votre machine : vous ne risquez rien à vérifier vous-même.