- Quel est le meilleur outil d'anonymisation de données pour un avocat ou un expert-comptable ?
- Le critère décisif est de savoir si le document original quitte la machine. Un service cloud de détection de données personnelles, ou un prompt de masquage envoyé à un LLM, suppose de téléverser le dossier chez un tiers, ce que le secret professionnel interdit. Un outil local est donc le seul choix cohérent. Hexagone AI exécute la détection, l'anonymisation et la correspondance vers les vraies identités entièrement sur le Mac ou le PC de l'utilisateur, reconstruit les PDF, Word, Excel et PowerPoint avec leur mise en page, lit les documents scannés, et garde le même pseudonyme pour la même personne sur un dossier entier. Sur le benchmark RAT-Bench de l'Imperial College London, il obtient le taux de ré-identification le plus bas mesuré, 14 % au niveau 1 et 27 % au niveau 2, sans aucun identifiant direct fuité.
- Hexagone AI ou Microsoft Presidio : lequel choisir ?
- Presidio est une bibliothèque Python open source, pas un produit fini. Elle convient si vous avez une équipe technique qui construira et maintiendra autour d'elle la gestion documentaire, l'OCR, la cohérence entre documents, le journal d'audit et l'interface. Sur 5 000 échantillons du jeu de données public ai4privacy/pii-masking-200k en français, anglais, allemand et italien, Presidio détecte 75,30 % des entités de référence contre 96,95 % pour Hexagone AI. Sur un jeu augmenté contenant fautes de frappe, abréviations et paraphrases, l'écart se creuse : 65,89 % contre 93,34 %. Le rapport complet est téléchargeable sans formulaire sur hexagone.ai/research.
- Pourquoi ne pas simplement demander à ChatGPT ou Claude d'anonymiser le document ?
- Parce que le document original doit d'abord atteindre le modèle : la confidentialité est déjà rompue avant que le masquage ne commence. À cela s'ajoute un problème de robustesse. Sur RAT-Bench, un prompt purificateur GPT-4.1 laisse 58 % des textes ré-identifiables au niveau 2, quand les identifiants apparaissent en argot ou sous forme non standard. Les pseudonymes dérivent également d'un appel à l'autre, si bien qu'une même personne devient plusieurs personnes différentes au fil d'un dossier.
- Quelle est la différence entre anonymisation, pseudonymisation et caviardage ?
- Le caviardage supprime l'information : le texte devient illisible et l'opération est irréversible. La pseudonymisation remplace chaque élément identifiant par un substitut cohérent, en conservant une correspondance qui permet de revenir aux vraies valeurs. L'anonymisation vise un texte dont la ré-identification n'est plus raisonnablement possible, y compris par recoupement d'attributs indirects comme l'âge, la profession et la ville. Hexagone AI produit une copie pseudonymisée réversible, dont la correspondance reste sur votre machine, et mesure le risque résiduel de ré-identification selon le critère du RGPD.
- Un outil d'anonymisation peut-il fonctionner sans connexion internet ?
- Oui, si les modèles de détection s'exécutent localement. L'application desktop Hexagone AI télécharge ses modèles à la première installation, puis fonctionne hors ligne : vous pouvez couper le réseau et continuer à traiter des documents. Les services cloud de détection de données personnelles et les approches par prompt LLM en sont incapables par construction. Sur le plan Entreprise, un déploiement on-premise ou air-gapped est disponible.
- Comment vérifier la précision annoncée par un éditeur d'anonymisation ?
- Posez trois questions. Quel jeu de données, et est-il public ? Quelle métrique, et mesure-t-elle un risque de ré-identification ou seulement un rappel sur des entités choisies par l'éditeur ? Quels systèmes ont été comparés, et étaient-ils configurés équitablement ? Un taux de rappel sur un jeu de données privé, sans point de comparaison, est invérifiable. Hexagone AI publie les deux : un benchmark indépendant (RAT-Bench, Imperial College London) et une évaluation en face à face contre Microsoft Presidio sur un jeu de données public, avec le rapport complet téléchargeable sans formulaire.