Datenanonymisierung und die italienische Lösung

Jedes Mal, wenn ein Anwalt einen Vertrag in ChatGPT einfügt, um sich eine Klausel zusammenfassen zu lassen, oder ein Steuerberater Claude bittet, eine Bilanz gegenzulesen, geschieht etwas, das keiner von beiden wirklich bemerkt: Eine Steuernummer, eine IBAN oder der Name eines Kunden überschreiten eine Grenze. Nicht nur eine geografische, sondern eine rechtliche. Sie verlassen den geschützten Bereich des Unternehmens und landen auf den Servern eines Anbieters, der sich in den meisten Fällen woanders befindet – manchmal in Rechtsordnungen, in denen die Garantien erst noch überprüft werden müssen. Das Thema heißt Datenanonymisierung, und mit der generativen KI hat es sich von einer Spezialistenfrage zu einem alltäglichen Problem für jeden entwickelt, der einen Prompt mit echten Informationen verfasst.
Was Anonymisierung ist (und warum sie kaum jemand wirklich durchführt)
Die europäische Datenschutz-Grundverordnung unterscheidet zwischen zwei Begriffen, die im Alltagsgebrauch oft verwechselt werden. Anonymisierung ist ein irreversibler Prozess: Ist er einmal abgeschlossen, lassen sich die Daten auf keinerlei Weise mehr einer Person zuordnen – selbst nicht durch Abgleich mit anderen Informationen. Gelingt sie wirklich, fallen diese Daten aus dem Anwendungsbereich der DSGVO und können nahezu frei zirkulieren. Pseudonymisierung ist etwas Anderes: Sie ersetzt Namen, Codes und Adressen durch neutrale Kennzeichnungen, bewahrt jedoch an einem sicheren Ort den Schlüssel auf, um den Prozess rückgängig zu machen. Die Daten bleiben in jeder rechtlicher Hinsicht „personenbezogen“, wie ein technischer Leitfaden zur DSGVO und Pseudonymisierung anschaulich erklärt, können jedoch in der Zwischenzeit sicher verarbeitet, verschoben und analysiert werden.
Der Unterschied ist keine juristische Haarspalterei. In der Unternehmenspraxis ist die vollständige Löschung der Rückverfolgbarkeit fast nie erforderlich: Benötigt wird die Möglichkeit zu sagen, wer am Ende des Tages was getan hat, eine Analyse wieder dem richtigen Kunden zuzuordnen oder einen Fehler zu korrigieren. Erforderlich ist also die Reversibilität. Und genau hier wird die theoretische Grenze zwischen den beiden Definitionen zur praktischen Entscheidung, von der der tatsächliche Nutzen eines Werkzeugs abhängt.
Warum explodiert dieses Thema gerade jetzt mit der generativen KI? Sprachmodelle verdauen riesige Textmengen – oft genau die sensibelsten Dokumente einer Organisation: E-Mails, Protokolle, Krankenakten, Gerichtsakten. Und um dies zu tun, muss dieser Text fast immer zuerst über eine externe Cloud-Infrastruktur transferiert werden, mit allen Risiken, die ein internationaler Datentransfer mit sich bringt: vom versehentlichen Training mit vertraulichen Informationen über Bußgelder bis hin zum Reputationsschaden, den eine Datenpanne nach sich zieht, wie eine Analyse von Sicherheits-Best-Practices für PII in der KI in Erinnerung ruft. Um das Bild weiter zu verkomplizieren, hat der EDSA (das Gremium, das die europäischen Datenschutzbehörden koordiniert) diesen Sommer einen Entwurf neuer Leitlinien zur Anonymisierung veröffentlicht (die Leitlinien 02/2026, in öffentlicher Konsultation bis zum 30. Oktober), die einen „relativen“ Ansatz verfolgen: Derselbe Datensatz kann für denjenigen, der ihn besitzt, anonym sein, während er für jemanden mit Zugang zu anderen verknüpften Informationen vollkommen identifizierbar ist – ein Prinzip, das aus der Rechtssache EDPS gegen SRB vor dem EuGH hervorgegangen ist. Übersetzt heißt das: Nachzuweisen, dass eine Anonymisierung „echt“ ist, wird schwieriger, nicht einfacher.
Das konkrete Problem: Italienische Dokumente, ausländische Cloud
Kanzleien, die ein LLM nutzen möchten, um hundert Verträge zusammenzufassen, stoßen sofort auf eine nicht unerhebliche bürokratische Hürde: Diese Verträge enthalten italienische Steuernummern (codici fiscali), Umsatzsteuer-IDs (partite IVA), Katasterdaten und IBANs. Sie an einen Anbieter außerhalb der EU zu senden bedeutet, den gesamten Apparat des internationalen Datentransfers in Gang zu setzen: Auftragsverarbeitungsverträge, angemessene Garantien und das Bewusstsein, dass dieser Text theoretisch das Training eines künftigen Modells speisen könnte. Für regulierte Sektoren wie das Gesundheitswesen, das Finanzwesen oder die öffentliche Verwaltung vervielfacht sich das Risiko, wie ein praktischer Leitfaden zur Anonymisierung und Pseudonymisierung in LLM-Workflows illustriert.
Bereits existierende generalistische Werkzeuge wie Presidio oder die in große Anbieter integrierten Datenschutzfilter funktionieren zwar, sind jedoch auf eine angelsächsische Welt kalibriert: Sie erkennen amerikanische Sozialversicherungsnummern problemlos, schneiden jedoch bei einer italienischen Steuernummer oder einem Katastereintrag weit schlechter ab – Formate, die in ihren Trainingsdatensätzen schlichtweg fehlen. Dieselbe Einschränkung findet sich in vielen internationalen Leitfäden zu PII-Anonymisierungstechniken für LLMs: sehr nützlich, aber andernorts konzipiert. Und genau in diese Lücke stößt ein in Italien entstandenes Projekt.
Der Igel auf Wache: Rizzo-pii
Schon der Name des Projekts verrät einiges: Das Maskottchen ist ein violetter Igel, der ein Dokument mit einem Schild schützt, wie auf der Repository-Seite zu sehen ist. Unter der leicht poppigen Illustration verbirgt sich ein Open-Source-Modell mit gerade einmal 0,3 Milliarden Parametern, das auf einem mmBERT/ModernBERT-Backbone aufgebaut ist. Es wurde speziell dafür entwickelt, auf CPUs zu laufen – ohne Notwendigkeit von GPUs oder API-Schlüsseln – bei einem RAM-Bedarf von etwa einem halben Gigabyte: Die technische Definition lautet „Token-Klassifizierung“, das heißt, das Modell liest den Text Wort für Wort und markiert, welche Fragmente personenbezogene Daten darstellen.
Zweiundzwanzig Kategorien werden erkannt: nicht nur klassische E-Mails, Telefonnummern, Adressen und IBANs, sondern auch die spezifischen italienischen Rechtsidentifikatoren, die kein internationales Modell gut abdeckt – Steuernummer, Umsatzsteuer-ID, Katasterdaten. Der Workflow entspricht dem eingangs beschriebenen Ablaufschema und funktioniert tatsächlich so: Das Dokument wird lokal analysiert, sensible Entitäten werden durch Platzhalter ersetzt, der „bereinigte“ Text kann unbesorgt an ein Cloud-LLM gesendet werden, und sobald die Antwort eintrifft, stellt ein Zuordnungswörterbuch, das ausschließlich auf dem Rechner des Benutzers aufbewahrt wird, die ursprünglichen Werte wieder her. Der sensible Teil verlässt niemals den lokalen Bereich – nur die Platzhalter reisen.
In der neuesten Version 2.0 hat das Projekt ein Detail hinzugefügt, das wie aus dem Lehrbuch für verantwortungsvolles Design wirkt: Jede Datenkategorie kann einzeln deaktiviert werden, wodurch dieser Informationstyp im Klartext belassen wird. Das ist nützlich, wenn man die Beträge eines Vertrags vergleichen möchte, ohne sie zu verschleiern, oder Alter und Geschlecht in einem klinischen Fall lesbar halten will, wie die Release-Seite auf GitHub berichtet. Das reversible Wörterbuch verfügt ebenfalls über einen eigenen Schalter: Es kann ausgeschaltet werden, wenn eine Rückverwandlung nicht erforderlich ist. Der Code steht unter MIT-Lizenz, der technische Bericht ist öffentlich, ebenso wie der Trainingsdatensatz, und es stehen fertig einsatzbereite Desktop-Anwendungen für Windows, macOS und Linux sowie eine HTTP-API für diejenigen zur Verfügung, die das Tool in eine bestehende Pipeline integrieren möchten.
Auf rein technischer Ebene verbirgt das Projekt seine Grenzen nicht. Ein spezialisiertes Fine-Tuning für Sicherheitsdokumente, das von einem anderen Community-Nutzer veröffentlicht wurde, zeigt eine reale Verbesserungsmarge gegenüber dem Basismodell, mit einer detaillierten statistischen Analyse der Tags, bei denen die Leistung variiert: ein Zeichen dafür, dass das Projekt lebt, auf die Probe gestellt wird und nicht alle Kategorien auf demselben Präzisionsniveau arbeiten.

Wer dahintersteckt: Simone Rizzo, zwischen Vermittlung und Code
Hinter dem violetten Igel steht Simone Rizzo, KI-Ingenieur und Vermittler, der sich in den sozialen Medien im Umfeld seiner Rizzo AI Academy bewegt – ein Projekt, das verspricht, künstliche Intelligenz „von denjenigen zu lehren, die sie jeden Tag bauen“. Rizzo-pii ist in diesem Sinne kein bloßer Inhalt zum Konsumieren: Es ist der Beweis dafür, dass diese Vermittlungsarbeit auch konkrete Werkzeuge hervorbringt, mit öffentlichem Code, herunterladbarem Datensatz und einem überprüfbaren technischen Bericht.
Die interessanteste und weniger offensichtliche Verbindung besteht zu Annota AI, einem italienischen Start-up mit Sitz in Italien, das sich mit KI-gestützter Datenannotation befasst, um Bilder und Dokumente für das Training oder Fine-Tuning von Modellen vorzubereiten. Auf der „Über uns“-Seite der offiziellen Website geht hervor, dass Simone Rizzo im Team als AI Strategist & Advisor geführt wird, während die Rolle des CEO und Mitgründers von Davide Pascucci besetzt wird, mit Massimiliano De Luca als CFO und Alessio Dionisi als CTO. Es handelt sich also nicht um ein zweites Projekt, das von derselben Person gegründet wurde, sondern um eine reale Brücke zwischen zwei komplementären Initiativen: Rizzo-pii schützt die Daten, bevor sie den Rechner des Nutzers verlassen; Annota AI baut nachgelagert die gelabelten Datensätze auf, auf denen Modelle trainiert werden – mit einer Infrastruktur, die das Unternehmen selbst als hauptsächlich in EU-Regionen gehostet angibt, und mit dem expliziten Versprechen, dass Kundeninhalte nicht zum Training von Modellen Dritter verwendet werden. Zwei verschiedene Bausteine derselben Wertschöpfungskette, zusammengehalten von derselben Aufmerksamkeit für Datensouveränität.
Von der Anwaltskanzlei zur öffentlichen Verwaltung: Wo es wirklich gebraucht wird
Der Wert eines solchen Werkzeugs bemisst sich in der Praxis, nicht auf dem Datenblatt. Eine Anwaltskanzlei kann Verträge und Gutachten lokal anonymisieren, bevor sie ein LLM bittet, Klauseln zu vergleichen oder eine Zusammenfassung zu erstellen. Ein Steuerberater kann Bilanzen und Handelsregisterauszüge analysieren lassen, ohne dass die Steuerdaten seiner Mandanten jemals einen externen Server kreuzen. Im Gesundheitswesen und in der öffentlichen Verwaltung, wo Dokumente besonders geschützte Personendaten und Gesundheitsdaten enthalten, wird die lokale Pseudonymisierung nahezu zu einer Vorbedingung vor jeglicher Verarbeitung mit externen Modellen. Und auch Unternehmen, die Produkte auf Basis eines LLM entwickeln, können ein solches Tool als Schutzschild vor dem Modellaufruf in eine RAG-Pipeline oder ein Automatisierungsskript einbauen.
Der Mini-Ablauf ist immer derselbe: eingehendes Dokument, Durchlauf durch Rizzo-pii, LLM-Aufruf nur mit Platzhaltern, Antwort, Wiederherstellung der echten Daten. Eine Choreografie, die in gewisser Weise an die Decknamen in Spionageromanen erinnert – etwa bei John le Carré, aber in Verwaltungsform: Die echte Information bleibt stets im Tresor verschlossen, und unterwegs ist nur ihr Alias.
Offen gegen geschlossen: Zwei Wege des Vertrauens
Die Wahl zwischen einem Open-Source-Projekt wie Rizzo-pii und einer proprietären Plattform wie Annota AI ist kein Wettbewerb mit einem einzigen Gewinner, sondern eine Weichenstellung, die davon abhängt, was der Nutzer wirklich benötigt. Open Source bietet totale Transparenz: Jeder kann den Code prüfen, verifizieren, wie Datenkategorien klassifiziert werden, oder das Projekt forken, wenn sich die Anforderungen ändern. Es gibt keinen Vendor Lock-in, und für diejenigen, die sich einem DSGVO-Audit oder den Anforderungen des AI Acts stellen müssen, ist die Offenlegung der internen Funktionsweise des Systems ein gewichtiges Argument. Die Kehrseite der Medaille ist, dass internes Fachwissen oder ein verlässlicher Partner für Installation, Updates und Überwachung erforderlich sind: Es handelt sich um keinen Schlüsselfertig-Dienst.
Eine Plattform wie Annota AI agiert auf entgegengesetztem Terrain: sofortige Nutzbarkeit, Enterprise-Support, ein End-to-End-Workflow von der Annotation bis zum Deployment und eine klare vertragliche Haftung im Problemfall. Der zu zahlende Preis ist eine geringere öffentliche technische Transparenz bezüglich der Annotationsalgorithmen und eine gewisse Abhängigkeit vom Anbieter hinsichtlich Preisen und Roadmap. Der interessanteste Punkt ist jedoch, dass sich die beiden Modelle nicht ausschließen: Ein hybrides Szenario, das unter italienischen Unternehmen mit erhöhtem Problembewusstsein immer verbreiteter ist, sieht vor, Daten lokal mit einem Tool wie Rizzo-pii zu pseudonymisieren, bevor sie zur Annotation auf eine europäische Cloud-Plattform hochgeladen werden – so behält man die Kontrolle über sensible Daten, ohne auf den Komfort von SaaS zu verzichten.
Die italienische (und europäische) Wette
Hier weitet sich die Betrachtung, und dies ist der unbequemste Punkt der gesamten Diskussion. Die USA und China können auf Kapital, Infrastruktur und jahrelangen Vorsprung bei Basismodellen und dedizierter Hardware zurückgreifen – GPUs und TPUs in einem Maßstab, der in Europa schlichtweg nicht existiert. Ihnen mit dem x-ten Allzweckmodell mit Hunderten von Milliarden Parametern hinterherzulaufen, wäre insbesondere für Italien von vornherein ein verlorener Kampf, wie eine Analyse anschaulich darlegt, die Open Source als die einzige Karte bezeichnet, die Europa spielen kann.
Aber es gibt ein Feld, auf dem Europa reales Gewicht in die Waagschale werfen kann: die Regulierung. DSGVO und AI Act, die oft nur als bürokratischer Ballast dargestellt werden, können im Gegenteil zu einer Eintrittsbarriere und einem Vertrauensfaktor für diejenigen werden, die sie wirklich respektieren, während sie für diejenigen ein Hindernis bleiben, die nicht bereit sind, sich anzupassen. Datensouveränität – die Garantie, dass Informationen unter europäischer Gerichtsbarkeit bleiben – ist ein konkretes Verkaufsargument für Gesundheitswesen, Finanzsektor und öffentliche Verwaltung. Dies bekräftigte in deutlichen Worten auch Pasquale Stanzione, Präsident der italienischen Datenschutzbehörde (Garante per la protezione dei dati personali), in seinem am 2. Juli 2026 vor der Abgeordnetenkammer vorgelegten Jahresbericht: ein Dokument, das das Verhältnis zwischen künstlicher Intelligenz, Schutz der Grundrechte und digitaler Souveränität in den Mittelpunkt einer Transformation rückt, die der Präsident selbst als epochal beschreibt, wie AgendaDigitale in der Berichterstattung über die Präsentation berichtete. Das ist natürlich keine Befürwortung eines spezifischen Produkts, aber es ist das Signal, dass das Thema der auf KI angewendeten Datensouveränität auf höchster institutioneller Ebene angekommen ist, nicht nur in den Whitepapern von Start-ups.
Rizzo-pii und Annota AI verkörpern auf ihrer Ebene genau diese Wette: Ersteres verwandelt eine regulatorische Vorgabe in eine technische Funktion – Privacy by Design ab dem ersten Bearbeitungsschritt des Dokuments; Letzteres baut eine europäische Wertschöpfungskette für Trainingsdaten auf, bei der die Konformität bereits im Produkt verankert ist.
Nischen, keine Kolosse: Die echte Chance
Wenn sich aus diesen beiden Fällen eine Lehre ziehen lässt, dann jene, dass sich Vertikalität mehr auszahlt als Generalität – zumindest für diejenigen, die mit begrenzten Ressourcen starten. Eine lokale Domäne mit ihren Dokumenten, Vorschriften und Verwaltungspraktiken tiefgehend zu kennen, ermöglicht es, ein Werkzeug zu bauen, an dessen Replikation die großen internationalen Akteure kein Interesse haben, weil der Markt nach ihren Maßstäben zu klein ist. Legal Tech und Compliance, Gesundheitswesen und Sozialwesen (mit Krankenakten und Anträgen), Finanzen und Steuerwesen, öffentliche Verwaltung: Das sind alles Felder, auf denen ein italienisches Unternehmen, das den lokalen Kontext versteht, einen Vorteil aufbauen kann, dessen Replikation einen generalistischen Koloss zu viel kosten würde.
Rizzo-pii funktioniert aus dieser Perspektive fast wie ein Schulbeispiel: Es ist nicht das x-te generische Modell, das als revolutionär angepriesen wird, sondern ein von Grund auf für italienische Dokumente und Datenkategorien konzipiertes Werkzeug. Es ist im Übrigen kein Einzelfall: Auch eine Übersicht über die besten europäischen KIs des Jahres 2026 spiegelt denselben Trend wider – kleine, aber gezielte Projekte, die sich dafür entscheiden, über Spezifität statt über Skalierung zu konkurrieren.
Die verbleibenden Grenzen und was noch fehlt
Es wäre unehrlich, das Thema in Siegesstimmung abzuschließen. Rizzo-pii bleibt ein stark auf das Italienische zugeschnittenes Werkzeug: Andere europäische Sprachen werden schlechter oder gar nicht abgedeckt, und jedes neue Dokumentenformat oder hochspezialisierte Domäne erfordert eine zusätzliche Validierung, wie der Vergleich zwischen dem Basismodell und seiner auf den Sicherheitsbereich feinabstimmten Version zeigt. Es ist ein kleines Projekt, das von wenigen Maintainern verwaltet wird: Seine Stärke – die Nähe zum spezifischen Problem – ist auch seine Fragilität, da die Kontinuität im Laufe der Zeit von der Energie derjenigen abhängt, die es vorantreiben, nicht von einem strukturierten Unternehmensbudget. Und Sichtbarkeit bleibt weiterhin eine Hürde: Ein italienisches Open-Source-Projekt tut sich im Marketing schwer, mit Produkten zu konkurrieren, die von multimillionenschweren internationalen Kampagnen getragen werden.
Darüber hinaus fehlt auf europäischer Ebene etwas Strukturelleres: gemeinsame Standards und Benchmarks, um die Wirksamkeit der PII-Erkennung und die Qualität der Trainingsdatensätze wirklich zu messen, zusammen mit praktischen Leitfäden, die die Anforderungen des AI Acts und der DSGVO mit konkreten Architekturentscheidungen verknüpfen (On-Premise vs. europäische Cloud, Logging, Auditing). Und es fehlt vielleicht an einer engeren Zusammenarbeit zwischen vertikalen Projekten dieser Art, die oft isoliert entstehen, anstatt sich in breitere Unternehmens-Annotationen oder RAG-Pipelines zu integrieren.
Eine mögliche Roadmap, nicht nur ein Wunsch
Letztlich geht es nicht darum, ob Italien oder Europa jemals ein eigenes Allzweckmodell haben werden, das auf Augenhöhe mit jenen von OpenAI, Google oder den großen chinesischen Konzernen konkurrieren kann. Wahrscheinlich nicht, zumindest nicht kurzfristig, und diesem Ziel nachzujagen birgt das Risiko, Zeit und Energie zu verschwenden. Der entscheidende Punkt ist, ob sie es verstehen werden, auf drei engeren, aber sehr realen Feldern zur Referenz zu werden: Privacy by Design angewendet auf LLMs (wofür Rizzo-pii ein konkretes und überprüfbares Beispiel ist); eine konforme und qualitativ hochwertige Datenwertschöpfungskette (wie Annota AI sie aufzubauen versucht); und die Integration von KI in regulierte Sektoren mit einem lokalen und offenen Ansatz.
Für diejenigen, die in Unternehmen oder freien Berufen arbeiten, besteht der praktische Schritt darin, Local-First-Tools für das PII-Management zu evaluieren, bevor sie Cloud-LLMs auf sensible Dokumente anwenden. Für Softwareentwickler bleibt der Beitrag zu italienischen und europäischen Open-Source-Projekten, das Erstellen öffentlicher Benchmarks und das Dokumentieren realer Anwendungsfälle der meiste konkrete Weg, um ein Ökosystem wachsen zu lassen, das heute noch aus verstreuten Initiativen besteht. Für Gesetzgeber würde die Förderung offener und lokaler Lösungen in den sensibelsten Bereichen – etwa durch dedizierte regulatorische Reallabore (Sandboxes) – bedeuten, eine als Ballast wahrgenommene Vorgabe in einen echten Wettbewerbsvorteil zu verwandeln. Man muss den Kapital-Krieg nicht gewinnen. Man muss schlicht und ergreifend den Vertrauens-Krieg gewinnen.