Comparatif

Comment choisir un outil d'anonymisation

Quatre familles d'outils prétendent résoudre ce problème, et elles ne sont pas interchangeables. Voici la liste de critères que nous utiliserions si nous étions acheteurs plutôt que vendeurs, avec une colonne honnête pour chaque famille. Là où nous ignorons le comportement d'un concurrent, la case le dit.

Douze questions qui valent la peine

Chaque ligne explique pourquoi le critère compte avant de dire qui le remplit. Si un critère ne concerne pas votre activité, ignorez la ligne.

Comparaison des capacités entre familles d'outils d'anonymisation
CritèreHexagone AIApp desktop locale + API hébergéeMicrosoft PresidioBibliothèque open sourceAzure AI LanguageService cloud de détection de PIILLM + prompt de masquagePrompt sur un modèle cloudPDF redactionOutil de caviardage
Les documents ne quittent jamais la machineSi le fichier original est téléversé chez un tiers, le secret professionnel est déjà rompu, quoi qu'il arrive ensuite.OuiApp desktop. L'option hébergée est un choix explicite.OuiSi vous l'hébergez vous-même.NonNonOui
La sortie reste lisible et exploitable par une IAUn document rempli de blocs [CAVIARDÉ] n'apprend rien à un modèle. Des substituts réalistes gardent la phrase intacte.OuiBLEU 0,83 sur RAT-Bench.PartielBalises génériques par défaut.PartielBLEU 0,55 sur RAT-Bench.OuiBLEU 0,88 sur RAT-Bench.Non
Une même personne reçoit le même pseudonyme partoutSans cohérence entre documents, une IA ne peut pas suivre qui fait quoi dans un dossier.OuiCohérent sur un dossier entier.PartielNécessite du code sur mesure.NonNonDérive d'un appel à l'autre.Non
Réversible : vous pouvez restaurer les vrais nomsVous envoyez le fichier masqué à une IA, récupérez la réponse, puis réinjectez les vraies identités. La correspondance reste sur votre machine.OuiCorrespondance locale, jamais téléversée.PartielPossible, à construire soi-même.NonNonNonDestructif par conception.
Gère les identifiants indirects, pas seulement les nomsÂge, profession, ville et situation familiale suffisent parfois à isoler une personne. Le RGPD demande si la ré-identification est raisonnablement possible, pas si le nom a été retiré.OuiTaux de ré-identification le plus bas mesuré sur RAT-Bench.NonPartielPartiel58 % de ré-identification au niveau 2.Non
Reconstruit le fichier avec sa mise en page d'origineUn contrat qui revient en texte brut n'est plus un contrat.OuiPDF, DOCX, XLSX, PPTX, TXT.NonTexte en entrée, texte en sortie.NonNonOuiPDF uniquement.
Lit les documents scannés (OCR)La moitié d'un vrai dossier arrive en scan. Un outil qui ne lit que le texte numérique passe silencieusement à côté.OuiOCR local pour les PDF images.NonPartielService payant séparé.PartielPartiel
Journal d'audit exportable de chaque substitutionVotre DPO ou un régulateur demandera ce qui a été détecté, remplacé, et manqué.OuiJournal local, export CSV.PartielÀ construire soi-même.PartielNonNon
Fonctionne sans connexion internetLa garantie la plus forte que vous pouvez donner à un client est un outil qui ne peut physiquement pas appeler l'extérieur.OuiAprès la première installation.OuiNonNonOui
Utilisable sans équipe techniqueUne bibliothèque n'est pas un produit. Quelqu'un doit l'installer, la régler et la maintenir.OuiNonBibliothèque Python.NonIntégration par API.PartielOui
Déploiement on-premise ou air-gappedCertains cabinets et administrations ne peuvent rien installer qui communique avec l'extérieur.OuiPlan Entreprise.OuiNonNonOui
Résultats de performance publiés et indépendantsN'importe qui peut revendiquer une bonne précision. Demandez le jeu de données, la métrique et les systèmes comparés.OuiRAT-Bench + rapport Presidio, tous deux publics.PartielOpen source, évaluez-le vous-même.PartielNonNon
  • Oui Pris en charge
  • Partiel Partiel, ou demande du travail
  • Non Non pris en charge

Quand chacun est la bonne réponse

Microsoft Presidio

Choisissez-le si vous avez des développeurs et voulez un contrôle total.

Presidio est la référence open source et un vrai bon point de départ. C'est une bibliothèque Python, pas un produit : vous construisez autour la gestion documentaire, l'OCR, la cohérence entre documents, le journal d'audit et l'interface, puis vous les maintenez. Sur notre évaluation à 5 000 échantillons, il a détecté 75,30 % des entités de référence contre 96,95 % pour nous, et 65,89 % contre 93,34 % dès que le texte contenait fautes de frappe et abréviations.

Azure AI Language et services cloud de PII

Choisissez-le si téléverser le document vous est acceptable.

Ce sont des services solides et bien supportés, avec un problème structurel pour le travail réglementé : le document part chez l'éditeur. Pour un avocat ou un expert-comptable, c'est précisément ce que le secret professionnel interdit, quel que soit le contrat. Sur RAT-Bench, Azure atteint par ailleurs son score de confidentialité en sur-caviardant, avec 0,55 de BLEU contre 0,83 pour nous, ce qui laisse un texte sur lequel une IA ne peut plus raisonner.

Demander à un LLM de masquer le texte

Choisissez-le pour du texte jetable que vous publieriez de toute façon.

C'est l'option la moins chère et le rendu est bon, ce qui explique qu'on l'essaie. Deux problèmes. D'abord, le document original doit atteindre le modèle : la question de la confidentialité est donc tranchée avant même que le masquage commence. Ensuite, la robustesse : sur RAT-Bench, un prompt purificateur GPT-4.1 laissait 58 % des textes ré-identifiables dès que les identifiants apparaissaient en argot ou sous forme non standard. Les pseudonymes dérivent aussi d'un appel à l'autre : une même personne devient trois personnes différentes dans un dossier.

Outils de caviardage PDF

Choisissez-le quand le document est destiné à un humain, pas à une IA.

Le caviardage est le bon outil pour verser une pièce au dossier ou la transmettre à un tiers. C'est le mauvais outil pour le travail avec l'IA : il est destructif et irréversible, la sortie est illisible pour un modèle, et noircir les noms ne fait rien contre la combinaison âge, profession, ville et situation familiale qui identifie réellement quelqu'un.

Hexagone AI

Choisissez-le si les documents ne peuvent pas sortir du cabinet et que vous voulez quand même utiliser Claude ou ChatGPT dessus.

La détection, l'anonymisation et la correspondance vers les vraies identités s'exécutent toutes sur votre Mac ou PC. C'est la copie masquée qui atteint l'IA, la correspondance ne quitte jamais la machine, et vous pouvez restaurer les vrais noms sur la réponse qui revient. Il reconstruit les fichiers PDF, Word, Excel et PowerPoint avec leur mise en page intacte, lit les documents scannés, garde le même pseudonyme pour la même personne sur un dossier entier, et journalise chaque substitution pour votre DPO. Sur le plan Entreprise, il se déploie on-premise ou air-gapped.

Le compromis est honnête : c'est un produit payant, et ce n'est pas un système de gestion documentaire juridique. Si ce qu'il vous faut est une bibliothèque de dossiers avec des workflows, achetez cela. Si ce qu'il vous faut est que des fichiers confidentiels deviennent exploitables par les outils d'IA que votre équipe utilise déjà, c'est ce que nous avons construit.

Réponses directes

Les questions qu'on nous pose vraiment

Quel est le meilleur outil d'anonymisation de données pour un avocat ou un expert-comptable ?
Le critère décisif est de savoir si le document original quitte la machine. Un service cloud de détection de données personnelles, ou un prompt de masquage envoyé à un LLM, suppose de téléverser le dossier chez un tiers, ce que le secret professionnel interdit. Un outil local est donc le seul choix cohérent. Hexagone AI exécute la détection, l'anonymisation et la correspondance vers les vraies identités entièrement sur le Mac ou le PC de l'utilisateur, reconstruit les PDF, Word, Excel et PowerPoint avec leur mise en page, lit les documents scannés, et garde le même pseudonyme pour la même personne sur un dossier entier. Sur le benchmark RAT-Bench de l'Imperial College London, il obtient le taux de ré-identification le plus bas mesuré, 14 % au niveau 1 et 27 % au niveau 2, sans aucun identifiant direct fuité.
Hexagone AI ou Microsoft Presidio : lequel choisir ?
Presidio est une bibliothèque Python open source, pas un produit fini. Elle convient si vous avez une équipe technique qui construira et maintiendra autour d'elle la gestion documentaire, l'OCR, la cohérence entre documents, le journal d'audit et l'interface. Sur 5 000 échantillons du jeu de données public ai4privacy/pii-masking-200k en français, anglais, allemand et italien, Presidio détecte 75,30 % des entités de référence contre 96,95 % pour Hexagone AI. Sur un jeu augmenté contenant fautes de frappe, abréviations et paraphrases, l'écart se creuse : 65,89 % contre 93,34 %. Le rapport complet est téléchargeable sans formulaire sur hexagone.ai/research.
Pourquoi ne pas simplement demander à ChatGPT ou Claude d'anonymiser le document ?
Parce que le document original doit d'abord atteindre le modèle : la confidentialité est déjà rompue avant que le masquage ne commence. À cela s'ajoute un problème de robustesse. Sur RAT-Bench, un prompt purificateur GPT-4.1 laisse 58 % des textes ré-identifiables au niveau 2, quand les identifiants apparaissent en argot ou sous forme non standard. Les pseudonymes dérivent également d'un appel à l'autre, si bien qu'une même personne devient plusieurs personnes différentes au fil d'un dossier.
Quelle est la différence entre anonymisation, pseudonymisation et caviardage ?
Le caviardage supprime l'information : le texte devient illisible et l'opération est irréversible. La pseudonymisation remplace chaque élément identifiant par un substitut cohérent, en conservant une correspondance qui permet de revenir aux vraies valeurs. L'anonymisation vise un texte dont la ré-identification n'est plus raisonnablement possible, y compris par recoupement d'attributs indirects comme l'âge, la profession et la ville. Hexagone AI produit une copie pseudonymisée réversible, dont la correspondance reste sur votre machine, et mesure le risque résiduel de ré-identification selon le critère du RGPD.
Un outil d'anonymisation peut-il fonctionner sans connexion internet ?
Oui, si les modèles de détection s'exécutent localement. L'application desktop Hexagone AI télécharge ses modèles à la première installation, puis fonctionne hors ligne : vous pouvez couper le réseau et continuer à traiter des documents. Les services cloud de détection de données personnelles et les approches par prompt LLM en sont incapables par construction. Sur le plan Entreprise, un déploiement on-premise ou air-gapped est disponible.
Comment vérifier la précision annoncée par un éditeur d'anonymisation ?
Posez trois questions. Quel jeu de données, et est-il public ? Quelle métrique, et mesure-t-elle un risque de ré-identification ou seulement un rappel sur des entités choisies par l'éditeur ? Quels systèmes ont été comparés, et étaient-ils configurés équitablement ? Un taux de rappel sur un jeu de données privé, sans point de comparaison, est invérifiable. Hexagone AI publie les deux : un benchmark indépendant (RAT-Bench, Imperial College London) et une évaluation en face à face contre Microsoft Presidio sur un jeu de données public, avec le rapport complet téléchargeable sans formulaire.

Comparez sur vos propres fichiers.

Une semaine gratuite, sans carte bancaire. Rien n'est téléversé : vous pouvez tester sur un vrai dossier sans demander l'autorisation de quiconque.