Anonymiser les données et la solution italienne

Chaque fois qu'un avocat colle un contrat dans ChatGPT pour se faire résumer une clause, ou qu'un expert-comptable demande à Claude de relire un bilan, il se produit quelque chose que ni l'un ni l'autre ne remarque vraiment : un numéro d'identification fiscale, un IBAN ou le nom d'un client traversent une frontière. Pas seulement géographique, mais juridique. Ils sortent du périmètre protégé de l'entreprise et atterrissent sur les serveurs d'un fournisseur qui, dans la plupart des cas, se trouve ailleurs, parfois dans des juridictions où les garanties restent à vérifier. Le sujet s'appelle l'anonymisation des données, et avec l'IA générative, il est passé de question de spécialistes à problème quotidien de quiconque rédigera un prompt contenant de vraies informations.
Qu'est-ce que l'anonymisation (et pourquoi presque personne ne la pratique vraiment)
Le règlement européen sur la protection des données distingue deux notions souvent confondues dans le langage courant. L'anonymisation est un processus irréversible : une fois réalisée, la donnée ne peut plus être reliée à la personne d'aucune façon, même en la croisant avec d'autres informations. Si elle réussit vraiment, ces données sortent du champ d'application du RGPD et peuvent circuler presque librement. La pseudonymisation est autre chose : elle remplace les noms, codes et adresses par des étiquettes neutres, mais conserve en lieu sûr la clé permettant de revenir en arrière. La donnée reste « à caractère personnel » à tous les effets de la loi, comme l'explique bien un guide technique sur le RGPD et la pseudonymisation, mais elle peut entre-temps être traitée, déplacée et analysée en toute sécurité.
La différence n'est pas une querelle de juristes. Dans la pratique des entreprises, l'effacement total de la traçabilité n'est presque jamais nécessaire : ce qu'il faut, c'est pouvoir dire, en fin de journée, qui a fait quoi, réassocier une analyse au bon client ou corriger une erreur. C'est-à-dire que la réversibilité est nécessaire. Et c'est là que la frontière théorique entre les deux définitions devient le choix pratique dont dépend la véritable utilité d'un outil.
Pourquoi ce sujet explose-t-il précisément aujourd'hui avec l'IA générative ? Les modèles linguistiques ingèrent d'énormes quantités de texte, souvent les documents les plus confidentiels d'une organisation : courriels, procès-verbaux, dossiers médicaux, dossiers judiciaires. Et pour ce faire, ce texte doit d'abord transiter, presque toujours, par une infrastructure cloud externe, avec tous les risques qu'entraîne un transfert international de données — de l'entraînement accidentel sur des informations confidentielles aux sanctions, jusqu'au préjudice réputationnel qu'entraîne une fuite de données, comme le rappelle une analyse des meilleures pratiques de sécurité PII pour l'IA. Pour compliquer le tableau, cet été, l'EDPB (l'organisme qui coordonne les autorités européennes de protection des données) a publié un projet de nouvelles lignes directrices sur l'anonymisation (les Guidelines 02/2026, en consultation publique jusqu'au 30 octobre) qui adoptent une approche « relative » : un même jeu de données peut être anonyme pour celui qui le détient et parfaitement identifiable pour quelqu'un ayant accès à d'autres informations liées — un principe né de l'affaire EDPS contre SRB devant la Cour de justice de l'UE. En clair : prouver qu'une anonymisation est « vraie » devient plus difficile, pas plus facile.
Le problème concret : documents italiens, cloud étranger
Un cabinet d'avocats souhaitant faire résumer cent contrats par un LLM se heurte immédiatement à un obstacle bureaucratique majeur : ces contrats contiennent des numéros d'identification fiscale (codici fiscali), des numéros de TVA (partite IVA), des données cadastrales, des IBAN. Les envoyer à un fournisseur hors UE signifie déclencher toute la machinerie des transferts internationaux de données : accords de traitement, garanties appropriées et conscience que ce texte pourrait théoriquement alimenter l'entraînement d'un futur modèle. Pour les secteurs réglementés comme la santé, la finance ou l'administration publique, le risque se multiplie, comme l'illustre un guide pratique sur l'anonymisation et la pseudonymisation dans les flux de travail avec LLM.
Les outils généralistes existants, comme Presidio ou les filtres de confidentialité intégrés chez les grands fournisseurs, fonctionnent, mais ils sont calibrés pour le monde anglo-saxon : ils reconnaissent bien les numéros de sécurité sociale américains, mais beaucoup moins bien un code fiscal italien ou une référence cadastrale — des formats tout simplement absents de leurs jeux de données d'entraînement. C'est la même limite que l'on retrouve dans de nombreux guides internationaux sur les techniques d'anonymisation de PII pour les LLM : très utiles, mais conçus ailleurs. Et c'est exactement dans cet espace que s'insère un projet né en Italie.
Le hérisson gardien : Rizzo-pii
Le nom du projet, avant même le projet lui-même, dit déjà quelque chose : la mascotte est un hérisson violet protégeant un document avec un bouclier, comme on peut le voir sur la page du dépôt. Sous l'illustration un peu pop se trouve un modèle open source de seulement 0,3 milliard de paramètres, construit sur un backbone mmBERT/ModernBERT, conçu spécialement pour tourner sur CPU, sans besoin de GPU ni de clés API, avec une empreinte RAM d'environ un demi-gigaoctet : la définition technique est « token classification », c'est-à-dire que le modèle lit le texte mot à mot et signale les fragments qui constituent des données personnelles.
Vingt-deux catégories sont reconnues : non seulement les courriels classiques, numéros de téléphone, adresses et IBAN, mais aussi les identifiants juridiques italiens qu'aucun modèle international ne couvre correctement — code fiscal, numéro de TVA, données cadastrales. Le flux de travail est celui décrit au départ et fonctionne réellement ainsi : le document est analysé en local, les entités sensibles sont remplacées par des étiquettes neutres (placeholders), le texte « nettoyé » peut être envoyé sans crainte à un LLM dans le cloud, et lorsque la réponse arrive, un dictionnaire de correspondance, conservé uniquement sur la machine de l'utilisateur, restaure les valeurs d'origine. La partie sensible ne quitte jamais le périmètre local, seules les étiquettes voyagent.
Dans sa version la plus récente, la 2.0, le projet a ajouté un détail digne d'un manuel de conception responsable : chaque catégorie de données peut être désactivée individuellement, laissant ce type d'information en clair. C'est utile lorsque l'on souhaite comparer les montants d'un contrat sans les masquer, ou conserver lisibles l'âge et le genre dans un cas clinique, comme le raconte la page des versions sur GitHub. Le dictionnaire réversible possède également son propre interrupteur : on peut l'éteindre s'il n'est pas nécessaire de revenir en arrière. Le code est sous licence MIT, le rapport technique est public, tout comme le jeu de données ayant servi à l'entraînement, et des applications de bureau prêtes à l'emploi sont disponibles pour Windows, macOS et Linux, ainsi qu'une API HTTP pour ceux qui souhaitent l'intégrer dans une pipeline existante.
Sur le plan purement technique, le projet ne cache pas ses limites. Un fine-tuning spécialisé sur les documents de sécurité, publié par un autre utilisateur de la communauté, montre une vraie marge d'amélioration par rapport au modèle de base, avec une analyse statistique détaillée des tags où les performances varient : signe que le projet est vivant, mis à l'épreuve, et que toutes les catégories ne fonctionnent pas au même niveau de précision.

Qui est derrière : Simone Rizzo, entre vulgarisation et code
Derrière le hérisson violet se trouve Simone Rizzo, ingénieur IA et vulgarisateur qui gravite sur les réseaux sociaux autour de sa Rizzo AI Academy, un projet promettant d'enseigner l'intelligence artificielle « par ceux qui la construisent au quotidien ». Rizzo-pii, en ce sens, n'est pas un contenu de plus à consommer : c'est la preuve que cette vulgarisation produit aussi des outils concrets, avec du code public, un jeu de données téléchargeable et un rapport technique vérifiable.
Le lien le plus intéressant, et le moins évident, se fait avec Annota AI, une startup italienne basée en Italie qui s'occupe d'annotation de données assistée par IA pour préparer images et documents destinés à l'entraînement ou au fine-tuning de modèles. D'après la page « Qui sommes-nous » du site officiel, Simone Rizzo figure dans l'équipe en tant que AI Strategist & Advisor, tandis que le rôle de CEO et cofondateur est occupé par Davide Pascucci, avec Massimiliano De Luca comme CFO et Alessio Dionisi comme CTO. Il ne s'agit donc pas d'un second projet fondé par la même personne, mais d'un pont réel entre deux initiatives complémentaires : Rizzo-pii protège les données avant qu'elles ne quittent la machine de l'utilisateur ; Annota AI construit, en aval, les jeux de données étiquetés sur lesquels les modèles s'entraînent, avec une infrastructure que l'entreprise elle-même déclare hébergée principalement dans des régions de l'UE et la promesse explicite que les contenus des clients ne servent pas à entraîner des modèles tiers. Deux pièces différentes d'une même chaîne de valeur, unies par le même souci de la souveraineté des données.
Du cabinet d'avocats à l'administration publique : où c'est vraiment nécessaire
La valeur d'un tel outil se mesure sur le terrain, pas sur une fiche technique. Un cabinet d'avocats peut anonymiser en local contrats et avis juridiques avant de demander à un LLM de comparer des clauses ou d'établir une synthèse. Un expert-comptable peut analyser bilans et extraits de registre du commerce sans que les données fiscales de ses clients ne traversent jamais un serveur externe. Dans la santé et l'administration publique, où les documents contiennent des données d'état civil et de santé particulièrement protégées, la pseudonymisation locale devient presque un prérequis avant tout traitement par des modèles externes. Et les entreprises qui développent des produits au-dessus d'un LLM peuvent insérer un tel outil comme gardien en amont de l'appel au modèle, au sein d'une pipeline RAG ou d'un script d'automatisation.
Le mini-flux est toujours le même : document en entrée, passage par Rizzo-pii, appel au LLM avec les seuls placeholders, réponse, restauration des données réelles. Une chorégraphie qui rappelle, par certains côtés, le mécanisme des noms de code dans les romans d'espionnage — comme ceux de John le Carré, mais à la sauce administrative : la vraie information reste enfermée au coffre, et seul son alias voyage dans le monde.
Ouvert contre fermé : deux manières de faire confiance
Le choix entre un projet open source comme Rizzo-pii et une plateforme propriétaire comme Annota AI n'est pas une compétition avec un gagnant unique, mais une bifurcation qui dépend des besoins réels de l'utilisateur. L'open source offre une transparence totale : n'importe qui peut inspecter le code, vérifier comment les catégories de données sont classées, ou créer un fork si les besoins évoluent. Il n'y a pas de dépendance envers un fournisseur (vendor lock-in), et pour qui doit répondre à un audit RGPD ou aux exigences de l'AI Act, pouvoir montrer le fonctionnement interne du système est un argument de poids. Le revers de la médaille est qu'il faut des compétences internes, ou un partenaire de confiance, pour l'installation, les mises à jour et le suivi : ce n'est pas un service « clé en main ».
Une plateforme comme Annota AI joue sur le terrain opposé : utilisation immédiate, support enterprise, flux de bout en bout de l'annotation au déploiement, et responsabilité contractuelle claire en cas de problème. Le prix à payer est une transparence technique publique moindre sur les algorithmes d'annotation, et une certaine dépendance envers le fournisseur pour la tarification et la feuille de route. Le point le plus intéressant, cependant, est que les deux modèles ne s'excluent pas : un scénario hybride, de plus en plus répandu parmi les entreprises italiennes soucieuses du sujet, consiste à pseudonymiser les données en local avec un outil comme Rizzo-pii avant de les envoyer sur une plateforme cloud européenne pour l'annotation, gardant ainsi le contrôle sur les données sensibles sans renoncer au confort du SaaS.
Le pari italien (et européen)
Ici la réflexion s'élargit, et c'est le point le plus inconfortable de tout le débat. Les États-Unis et la Chine peuvent compter sur des capitaux, des infrastructures et des années d'avance accumulées sur les modèles fondateurs et le matériel dédié — des GPU et TPU à une échelle qui n'existe simplement pas en Europe. Les poursuivre avec un énième modèle généraliste de plusieurs centaines de milliards de paramètres serait, pour l'Italie en particulier, une bataille perdue d'avance, comme le soutient clairement une analyse désignant l'open source comme la seule carte que l'Europe puisse jouer.
Mais il existe un terrain sur lequel l'Europe peut peser lourd : la réglementation. Le RGPD et l'AI Act, souvent présentés uniquement comme des fardeaux bureaucratiques, peuvent au contraire devenir une barrière à l'entrée et un vecteur de confiance pour ceux qui les respectent vraiment, tout en restant un obstacle pour ceux qui ne sont pas prêts à s'y conformer. La souveraineté des données, c'est-à-dire la garantie que les informations restent sous juridiction européenne, est un argument commercial concret pour la santé, la finance ou l'administration publique. C'est ce qu'a réaffirmé en termes très nets Pasquale Stanzione, président de la Cnil italienne (Garante per la protezione dei dati personali), dans le rapport annuel présenté à la Chambre des députés le 2 juillet 2026 : un document plaçant au centre la relation entre intelligence artificielle, protection des droits fondamentaux et souveraineté numérique, dans ce que le président décrit lui-même comme une phase de transformation presque historique, comme l'a rapporté AgendaDigitale dans son compte rendu de la présentation. Ce n'est pas un soutien à un produit spécifique, évidemment, mais c'est le signal que le sujet de la souveraineté des données appliquée à l'IA est arrivé au plus haut niveau institutionnel, et pas seulement dans les documents de présentation des startups.
Rizzo-pii et Annota AI incarnent à leur échelle ce même pari : le premier transforme une contrainte réglementaire en fonctionnalité technique — la privacy by design dès la première étape du document ; le second construit une chaîne de valeur européenne pour les données d'entraînement, avec une conformité déjà intégrée au produit.
Des niches, pas des colosses : la vraie opportunité
S'il y a une leçon à tirer de ces deux cas, c'est que la verticalité rapporte plus que la généralité, du moins pour qui démarre avec des ressources limitées. Connaître à fond un domaine local, avec ses documents, ses réglementations et ses pratiques administratives, permet de construire un outil que les grands acteurs internationaux n'ont pas intérêt à répliquer, car le marché est trop petit à leurs yeux. Legaltech et conformité, santé et action sociale (avec dossiers médicaux et démarches administratives), finance et fiscalité, administration publique : ce sont tous des terrains où une entreprise italienne comprenant le contexte local peut se bâtir un avantage qu'un colosse généraliste mettrait trop cher à reproduire.
Rizzo-pii, de ce point de vue, fonctionne presque comme un cas d'école : ce n'est pas un modèle générique de plus qualifié de révolutionnaire, mais un outil pensé dès le départ pour les documents et les catégories de données italiennes. Ce n'est pas un cas isolé d'ailleurs : un panorama des meilleures IA européennes de 2026 reflète la même tendance, des projets petits mais ciblés qui choisissent de rivaliser sur la spécificité plutôt que sur l'échelle.
Les limites qui subsistent, et ce qui manque encore
Il serait malhonnête de conclure sur une note triomphaliste. Rizzo-pii reste un outil très ajusté à l'italien : les autres langues européennes sont moins bien couvertes ou ne le sont pas du tout, et chaque nouveau format de document ou domaine très spécialisé nécessite une validation supplémentaire, comme le montre la comparaison entre le modèle de base et sa version optimisée pour le domaine de la sécurité. C'est un petit projet géré par peu de mainteneurs : sa force — la proximité avec un problème spécifique — est aussi sa fragilité, car la continuité dans le temps dépend de l'énergie de ceux qui le portent, non d'un budget d'entreprise structuré. Et la visibilité reste un défi : un projet open source italien peine à rivaliser, sur le plan du marketing, avec des produits soutenus par des campagnes internationales multimillionnaires.
Il manque en outre, au niveau européen, quelque chose de plus structurel : des normes et des benchmarks partagés pour mesurer réellement l'efficacité de la détection de PII et la qualité des jeux de données d'entraînement, accompagnés de guides pratiques reliant les exigences de l'AI Act et du RGPD à des choix d'architecture concrets (on-premise vs cloud européen, journaux d'événements, audits). Et il manque peut-être une plus grande collaboration entre projets verticaux comme celui-ci, qui naissent souvent de manière isolée au lieu de s'intégrer dans des pipelines plus vastes d'annotation ou de RAG d'entreprise.
Une feuille de route possible, pas seulement un vœu
Au bout du compte, la question n'est pas de savoir si l'Italie, ou l'Europe, aura un jour son modèle généraliste rivalisant d'égal à égal avec ceux d'OpenAI, de Google ou des grandes entreprises chinoises. Probablement pas, du moins pas à court terme, et poursuivre cet objectif risque d'être du temps et de l'énergie gaspillés. L'enjeu est de savoir si elles sauront devenir la référence sur trois terrains plus étroits mais bien réels : la privacy by design appliquée aux LLM (dont rizzo-pii est un exemple concret et vérifiable) ; une chaîne de valeur de données conforme et de qualité (comme Annota AI tente de la construire) ; et l'intégration de l'IA dans les secteurs réglementés avec une approche locale et ouverte.
Pour ceux qui travaillent en entreprise ou dans les professions libérales, la démarche pratique consiste à évaluer des outils local-first pour la gestion des PII avant d'adopter un LLM cloud sur des documents sensibles. Pour les développeurs logiciels, contribuer à des projets open source italiens et européens, produire des benchmarks publics et documenter des cas d'usage réels reste le moyen le plus concret de faire grandir un écosystème aujourd'hui encore composé d'initiatives dispersées. Pour les décideurs politiques, encourager l'adoption de solutions ouvertes et locales dans les domaines les plus sensibles, pourquoi pas avec des bacs à sable réglementaires (sandboxes) dédiés, permettrait de transformer une contrainte perçue comme un fardeau en un véritable avantage concurrentiel. Il n'est pas nécessaire de gagner la guerre des capitaux. Il suffit, plus simplement, de gagner celle de la confiance.