Toute la recherche
Benchmark indépendant

RAT-Bench : un attaquant peut-il encore retrouver la personne ?

Un benchmark de ré-identification construit à l'Imperial College London, et une meilleure question que celle posée par la plupart des évaluations. Nous y avons exécuté notre pipeline aux côtés d'Azure et d'un prompt de masquage GPT-4.1, avec les critères de notation des auteurs inchangés.

Benchmark de Krčo, Yao, Meeus et de Montjoye, Imperial College London, 2026

Plutôt que de mesurer le rappel (avez-vous trouvé le nom ?), il mesure le risque de ré-identification : à partir du texte anonymisé, un attaquant peut-il encore vous retrouver parmi 3 millions d'Américains réels ?

La ré-identification est déclarée lorsqu'un identifiant direct est retrouvé, ou lorsque la combinaison d'attributs indirects inférés réduit le bassin à moins de 5 personnes sur 3 millions (k=5, θ=0,2).

C'est le standard du RGPD. Non pas « avez-vous retiré l'évident », mais « la ré-identification est-elle raisonnablement possible ».

Résultats RAT-Bench : taux de ré-identification et score BLEU d'utilité par système
SystèmeRé-id · niveau 1explicite, standardRé-id · niveau 2obfusqué, non standardBLEU · utilitéIdentifiants directs fuités
Hexagone AI14 %27 %0,83Aucune
Azure (best NER)22 %33 %0,55Présente
GPT-4.1 + Anthropic PII purifier prompt26 %58 %0,88Présente

Taux de ré-identification : plus bas est meilleur. BLEU : plus haut est meilleur.

Graphique comparant le taux de ré-identification et le score BLEU d'utilité pour Azure, GPT-4.1 et Hexagone AI sur RAT-Bench. Hexagone AI obtient le taux de ré-identification le plus bas aux deux niveaux de difficulté.
Taux de ré-identification face à l'utilité du texte. Le coin en bas à droite est la bonne zone : risque faible, sortie lisible.

Pourquoi le BLEU compte

Le risque de ré-identification est la métrique principale, mais le BLEU raconte l'autre moitié de l'histoire : combien du texte d'origine survit. Un BLEU bas signifie que l'outil caviarde massivement et sans discernement. Un BLEU haut signifie qu'il ne retire que ce qui doit partir.

Où Azure perd

Azure atteint une confidentialité correcte en supprimant tout, y compris ce qui n'a rien à voir avec la ré-identification. Un BLEU de 0,55 signifie qu'environ la moitié du document a disparu. Ce qui reste est souvent trop abîmé pour qu'une IA puisse raisonner dessus.

Où le prompt LLM perd

GPT-4.1 avec un prompt purificateur préserve bien le texte, puis s'effondre au niveau 2, quand les identifiants sont exprimés en argot ou sous forme non standard. 58 % des textes restent ré-identifiables. Et cela suppose d'envoyer le document original à un tiers dès le départ.

Le plus dur dans l'anonymisation n'est pas de retirer les noms. C'est de comprendre que « je suis en Californie depuis aussi longtemps que je me souvienne, je ne suis plus mariée, et je travaille de nuit à l'hôpital » peut suffire à vous retrouver.

Crédit du benchmark. RAT-Bench a été conçu et développé par Nataša Krčo, Zexi Yao, Matthieu Meeus, Yves-Alexandre de Montjoye à Imperial College London (2026). Nous ne l'avons pas construit et nous ne le contrôlons pas. Les résultats Hexagone AI ont été obtenus en exécutant notre propre pipeline sur le benchmark public, avec les critères de notation des auteurs inchangés. Tous les chiffres ci-dessus sont mesurés sur le jeu de test du benchmark lui-même. Lire l'article sur arXiv

Testez-le sur vos propres documents.

Un benchmark, ce sont les données de quelqu'un d'autre. Une semaine gratuite, sans carte bancaire, et les fichiers ne quittent jamais votre machine : vous ne risquez rien à vérifier vous-même.