Recherche

Les performances d'Hexagone AI.

Tous les éditeurs d'anonymisation revendiquent une bonne précision. Très peu précisent sur quel jeu de données, selon quelle métrique, ni face à quoi. Cette page rassemble les évaluations que nous avons menées et publiées, avec la méthodologie de chacune et les articles et rapports à lire en entier. Si vous y trouvez une erreur, dites-le nous et nous corrigerons la page.

Résultats principaux

97,9 %
des valeurs personnelles annotées retirées sur PII-INDEXBENCH
Mesuré sur le jeu de données entier plutôt que sur un échantillon : 12 079 documents et 226 428 valeurs annotées. Le système suivant, un Qwen3-14B à poids ouverts interrogé comme détecteur, en trouve 91,7 %, et la précision sur la même exécution est de 93,5 %.

Mesuré sur : PII-INDEXBENCH v1.2, tous les splits · septembre 2026

95,3 %
des valeurs personnelles annotées retirées, en six langues
47 566 documents en anglais, français, allemand, espagnol, italien et néerlandais, et le meilleur rappel des cinq systèmes comparés. L'écart entre la meilleure et la moins bonne langue est de 1,3 point.

Mesuré sur : AI4Privacy PII-Masking-300k, split de validation complet · septembre 2026

14 %
de ré-identification au niveau 1, le taux le plus bas des outils comparés
Azure obtient 22 % et un prompt purificateur GPT-4.1 26 % sur les mêmes textes. Au niveau 2, où les identifiants sont obfusqués : 27 % contre 33 % et 58 %.

Mesuré sur : Jeu de test RAT-Bench · Imperial College London

0
identifiant direct retrouvé dans les textes anonymisés
Aucun nom, numéro de téléphone ou numéro de sécurité sociale n'était récupérable, aux deux niveaux de difficulté. Azure et le prompt GPT-4.1 en ont laissé fuiter.

Mesuré sur : Jeu de test RAT-Bench · Imperial College London

Ces chiffres décrivent la performance sur les jeux de test publics nommés ci-dessus, et ne constituent pas une garantie sur vos propres documents. Un corpus différent donne des chiffres différents, et c'est pourquoi chaque résultat indique ici le corpus sur lequel il a été mesuré.

Les études

  1. Évaluation sur jeu complet

    PII-INDEXBENCH : 12 079 documents conçus pour être difficiles

    Chaque enregistrement passé dans l'API de production, noté face aux annotations du benchmark aux côtés de cinq autres systèmes, dont Qwen3-14B interrogé comme détecteur. Le chiffre de précision est décortiqué face à ces mêmes annotations plus bas dans la page.

    Réalisée par Hexagone AI, septembre 2026. Jeu de données PII-INDEXBENCH v1.2, CC BY 4.0.

    97,9 %
    de rappel, le plus élevé des six systèmes
    93,5 %
    de précision
    Voir les résultats
  2. Évaluation sur jeu complet

    AI4Privacy : 47 566 documents en six langues

    Le même protocole que PII-INDEXBENCH, appliqué au corpus PII public le plus cité et noté par langue et par type de donnée personnelle. Il s'accompagne aussi des réserves qu'impose un corpus aussi largement distribué.

    Réalisée par Hexagone AI, septembre 2026. Jeu de données public, reproductible.

    95,3 %
    de rappel, le plus élevé des cinq systèmes
    6
    langues, 1,3 point d'écart
    Voir les résultats
  3. Benchmark indépendant

    RAT-Bench : un attaquant peut-il encore retrouver la personne ?

    Un benchmark de ré-identification construit à l'Imperial College London, et une meilleure question que celle posée par la plupart des évaluations. Nous y avons exécuté notre pipeline aux côtés d'Azure et d'un prompt de masquage GPT-4.1, avec les critères de notation des auteurs inchangés.

    Benchmark de Krčo, Yao, Meeus et de Montjoye, Imperial College London, 2026

    14 %
    de ré-identification au niveau 1, le taux le plus bas comparé
    0
    identifiant direct retrouvé
    0,83
    de BLEU : la part du texte qui survit
    Voir les résultats
  4. Évaluation interne, 2024

    Taux de détection face à Microsoft Presidio

    Notre première comparaison publiée, en novembre 2024, et la seule accompagnée d'un PDF de méthodologie de dix pages. Dépassée en ampleur par les deux exécutions complètes ci-dessus, et conservée ici parce que ses chiffres tiennent toujours.

    Réalisée par Hexagone AI, novembre 2024. Jeu de données public, reproductible.

    96,95 %
    des entités détectées, contre 75,30 %
    93,34 %
    sur texte dégradé, contre 65,89 %
    Voir les résultats

Comment lire n'importe quel benchmark éditeur. Posez trois questions. Quel jeu de données, et est-il public ? Quelle métrique, et mesure-t-elle un risque ou seulement un rappel ? Quels systèmes ont été comparés, et étaient-ils configurés équitablement ? Un chiffre sans ces trois réponses, y compris les nôtres, est du marketing. Chaque étude ci-dessus porte les trois.

Testez-le sur vos propres documents.

Un benchmark, ce sont les données de quelqu'un d'autre. Une semaine gratuite, sans carte bancaire, et les fichiers ne quittent jamais votre machine : vous ne risquez rien à vérifier vous-même.