Notizie IA Logo

AITalk

Noticias y análisis sobre Inteligencia Artificial

Anonimizar los datos y la solución italiana

Generative AIApplicationsStartups

anonimizzazione.jpg

Cada vez que un abogado pega un contrato en ChatGPT para que le resuma una cláusula, o un asesor fiscal le pide a Claude que revise un balance, ocurre algo que ninguno de los dos nota realmente: un número de identificación fiscal, un IBAN o el nombre de un cliente cruzan una frontera. No solo geográfica, sino jurídica. Salen del perímetro protegido de la empresa y terminan en los servidores de un proveedor que, en la mayoría de los casos, está en otra parte, a veces en jurisdicciones donde las garantías están aún por verificar. El tema se llama anonimización de datos, y con la IA generativa ha pasado de ser un asunto de especialistas a un problema cotidiano de cualquiera que escriba un prompt con información real dentro.

Qué es la anonimización (y por qué casi nadie la hace de verdad)

El reglamento europeo de protección de datos distingue dos conceptos que en el lenguaje común se confunden. La anonimización es un proceso irreversible: una vez realizada, el dato ya no se puede vincular a la persona de ninguna manera, ni siquiera cruzándolo con otra información. Si realmente tiene éxito, esos datos quedan fuera del ámbito de aplicación del RGPD y pueden circular casi libremente. La seudonimización es otra cosa: sustituye nombres, códigos y direcciones por etiquetas neutras, pero conserva en algún lugar, protegida, la clave para deshacer el camino. El dato sigue siendo "personal" a todos los efectos legales, como aclara bien una guía técnica sobre RGPD y seudonimización, pero mientras tanto puede ser tratado, trasladado y analizado con seguridad.

La diferencia no es tiquismiquis de juristas. En la práctica empresarial casi nunca se necesita la eliminación total de la trazabilidad: se necesita poder decir, al final de la jornada, quién ha hecho qué, volver a vincular un análisis al cliente correcto o corregir un error. Se necesita, es decir, la reversibilidad. Y es aquí donde el límite teórico entre las dos definiciones se convierte en la elección práctica de la que depende la verdadera utilidad de una herramienta.

¿Por qué estalla este tema precisamente ahora con la IA generativa? Los modelos lingüísticos digieren enormes cantidades de texto, a menudo los documentos más delicados de una organización: correos electrónicos, actas, historiales médicos, expedientes judiciales. Y para hacerlo, ese texto debe transitar primero, casi siempre, por una infraestructura cloud externa, con todos los riesgos que conlleva una transferencia internacional de datos, desde el entrenamiento accidental con información confidencial hasta las sanciones, pasando por el daño reputacional que arrastra una brecha de datos, como recuerda un análisis sobre las mejores prácticas de seguridad para la PII en la IA. Para complicar más el panorama, este verano el EDPB (el organismo que coordina a las autoridades europeas de protección de datos) publicó un borrador de nuevas directrices sobre anonimización (las Guidelines 02/2026, en consulta pública hasta el 30 de octubre) que adoptan un enfoque "relativo": el mismo conjunto de datos puede ser anónimo para quien lo posee y perfectamente identificable para quien tiene acceso a otra información vinculada, un principio surgido del asunto EDPS contra SRB ante el Tribunal de Justicia de la UE. Traducido: demostrar que una anonimización es "verdadera" se está volviendo más difícil, no más fácil.

El problema concreto: documentos italianos, cloud extranjero

Un despacho de abogados que quiera resumir cien contratos con un LLM tropieza de inmediato con un obstáculo burocrático nada menor: esos contratos contienen códigos fiscales, números de IVA (partite IVA), datos catastrales, IBAN. Enviarlos a un proveedor fuera de la UE significa activar toda la maquinaria de la transferencia internacional de datos: acuerdos de tratamiento, garantías adecuadas y la conciencia de que ese texto podría, en teoría, alimentar el entrenamiento de un modelo futuro. Para sectores regulados como la sanidad, las finanzas o la administración pública el riesgo se multiplica, como ilustra una guía práctica sobre anonimización y seudonimización en flujos de trabajo con LLM.

Las herramientas generalistas ya existentes, como Presidio o los filtros de privacidad integrados en los grandes proveedores, funcionan, pero están calibradas para un mundo anglosajón: reconocen bien los números de la seguridad social estadounidense, pero mucho peor un código fiscal italiano o una referencia catastral, formatos que simplemente no figuran en sus conjuntos de datos de entrenamiento. Es la misma limitación que se encuentra en muchas guías internacionales sobre técnicas de anonimización de PII para LLM: muy útiles, pero pensadas en otra parte. Y es exactamente en este espacio donde se introduce un proyecto nacido en Italia.

El erizo guardián: Rizzo-pii

El nombre del proyecto, antes incluso que el proyecto mismo, dice algo: la mascota es un erizo morado que protege un documento con un escudo, como se ve en la página del repositorio. Bajo la ilustración un tanto pop hay un modelo de código abierto de apenas 0,3 mil millones de parámetros, construido sobre un backbone mmBERT/ModernBERT, pensado a propósito para funcionar en CPU, sin necesidad de GPU ni de claves API, con un consumo de RAM de aproximadamente medio gigabyte: la definición técnica es "clasificación de tokens", es decir, el modelo lee el texto palabra por palabra y señala qué fragmentos son datos personales.

Las categorías reconocidas son veintidós: no solo los clásicos correos electrónicos, números de teléfono, direcciones e IBAN, sino también los identificadores jurídicos italianos que ningún modelo internacional cubre bien: código fiscal, número de IVA, datos catastrales. El flujo de trabajo es el descrito en el esquema inicial, y realmente funciona así: el documento se analiza en local, las entidades sensibles se sustituyen por marcadores de posición (placeholders), el texto "limpio" puede enviarse con tranquilidad a un LLM en la nube, y cuando llega la respuesta, un diccionario de correspondencias, guardado únicamente en la máquina del usuario, reconstruye los valores originales. La parte sensible nunca abandona el perímetro local, solo viajan las etiquetas.

En la versión más reciente, la 2.0, el proyecto ha añadido un detalle de manual de diseño responsable: cada categoría de datos se puede desactivar individualmente, dejando ese tipo de información en claro. Resulta útil cuando se quieren comparar los importes de un contrato sin ocultarlos, o mantener legibles la edad y el género en un caso clínico, como relata la página de lanzamientos en GitHub. El diccionario reversible también tiene su propio interruptor: se puede apagar si no se necesita volver atrás. El código tiene licencia MIT, el informe técnico es público, al igual que el conjunto de datos con el que ha sido entrenado, y hay disponibles aplicaciones de escritorio listas para Windows, macOS y Linux, además de una API HTTP para quienes quieran integrarlo en una pipeline existente.

En el plano puramente técnico, el proyecto no oculta sus límites. Un ajuste fino (fine-tuning) especializado en documentos de seguridad, publicado por otro usuario de la comunidad, muestra un margen de mejora real respecto al modelo base, con un análisis estadístico detallado de las etiquetas donde varía el rendimiento: señal de que el proyecto está vivo, se pone a prueba y no todas las categorías funcionan con el mismo nivel de precisión. immagine1.jpg Imagen extraída del repositorio oficial

Quién está detrás: Simone Rizzo, entre divulgación y código

Detrás del erizo morado está Simone Rizzo, AI engineer y divulgador que en redes sociales se mueve en la órbita de su Rizzo AI Academy, un proyecto que promete enseñar inteligencia artificial "de la mano de quien la construye cada día". Rizzo-pii, en este sentido, no es un contenido más para consumir: es la demostración de que esa divulgación produce también herramientas concretas, con código público, conjunto de datos descargable y un informe técnico verificable.

La conexión más interesante, y menos obvia, es con Annota AI, una startup italiana con sede social en Italia dedicada a la anotación de datos asistida por inteligencia artificial para preparar imágenes y documentos que se usarán en el entrenamiento o fine-tuning de modelos. En la página "Quiénes somos" de su sitio oficial consta que Simone Rizzo figura en el equipo como AI Strategist & Advisor, mientras que el puesto de CEO y cofundador lo ocupa Davide Pascucci, con Massimiliano De Luca como CFO y Alessio Dionisi como CTO. No se trata por tanto de un segundo proyecto fundado por la misma persona, sino de un puente real entre dos iniciativas complementarias: Rizzo-pii protege los datos antes de que salgan de la máquina del usuario; Annota AI construye, aguas abajo, los conjuntos de datos etiquetados sobre los que se entrenan los modelos, con una infraestructura que la propia empresa declara alojada principalmente en regiones de la UE y con la promesa explícita de que los contenidos de los clientes no terminan entrenando modelos de terceros. Dos piezas distintas de la misma cadena de valor, unidas por la misma atención a la soberanía de los datos.

Del despacho de abogados a la Administración Pública: dónde hace falta de verdad

El valor de una herramienta como esta se mide sobre el terreno, no en la ficha técnica. Un despacho de abogados puede anonimizar en local contratos y dictámenes antes de pedirle a un LLM que compare cláusulas o elabore un borrador de resumen. Un asesor fiscal puede analizar balances e informes societarios sin que los datos fiscales de sus clientes crucen jamás un servidor externo. En sanidad y administración pública, donde los documentos custodian datos personales y médicos especialmente protegidos, la seudonimización local se convierte casi en un requisito previo antes de cualquier procesamiento con modelos externos. Y también las empresas que construyen productos sobre un LLM pueden insertar una herramienta así como guardián antes de la llamada al modelo, dentro de una pipeline RAG o un script de automatización.

El miniflujo es siempre el mismo: documento de entrada, paso por Rizzo-pii, llamada al LLM solo con marcadores de posición, respuesta y restauración de los datos reales. Una coreografía que recuerda, en cierto modo, al mecanismo de los nombres en clave en las novelas de espionaje —como las de John le Carré, pero en versión administrativa—: la información real se queda siempre bajo llave en la caja fuerte, y lo único que circula por el mundo es su alias.

Abierto frente a cerrado: dos formas de confiar

La elección entre un proyecto de código abierto como Rizzo-pii y una plataforma propietaria como Annota AI no es una competición con un único ganador, sino una bifurcación que depende de lo que realmente necesite quien lo usa. El código abierto ofrece transparencia total: cualquiera puede inspeccionar el código, verificar cómo se clasifican las categorías de datos o hacer un fork si cambian las necesidades. No hay dependencia de proveedor (vendor lock-in), y para quien deba responder a una auditoría del RGPD o a las exigencias de la AI Act, poder mostrar el funcionamiento interno del sistema es un argumento de peso. La otra cara de la moneda es que se requiere competencia interna, o un socio de confianza, para la instalación, actualizaciones y supervisión: no es un servicio "llave en mano".

Una plataforma como Annota AI juega en el terreno opuesto: usabilidad inmediata, soporte empresarial, un flujo integral que va desde la anotación hasta el despliegue y una responsabilidad contractual clara en caso de problemas. El precio a pagar es una menor transparencia técnica pública sobre los algoritmos de anotación y cierta dependencia del proveedor en cuanto a precios y hoja de ruta. El punto más interesante, sin embargo, es que ambos modelos no se excluyen: un escenario híbrido, cada vez más extendido entre las empresas italianas más atentas al tema, pasa por seudonimizar los datos en local con una herramienta como Rizzo-pii antes de subirlos a una plataforma cloud europea para la anotación, manteniendo así el control sobre los datos sensibles sin renunciar a la comodidad del SaaS.

La apuesta italiana (y europea)

Aquí la reflexión se amplía, y es el punto más incómodo de todo el debate. Estados Unidos y China pueden contar con capitales, infraestructuras y años de ventaja acumulada en modelos fundacionales y hardware dedicado, GPU y TPU a una escala que en Europa sencillamente no existe. Perseguirlos con otro modelo generalista de cientos de miles de millones de parámetros sería, para Italia en particular, una batalla perdida de antemano, como sostiene con claridad un análisis sobre el código abierto como única baza que Europa puede jugar.

Pero existe un terreno en el que Europa puede contar de verdad: la normativa. El RGPD y la AI Act, a menudo presentados solo como un lastre burocrático, pueden convertirse por el contrario en una barrera de entrada y un elemento de confianza para quien realmente los respete, mientras siguen siendo un obstáculo para quien no esté dispuesto a adaptarse. La soberanía de los datos, la garantía de que la información permanezca bajo jurisdicción europea, es un argumento de venta concreto para la sanidad, las finanzas o la administración pública. Lo reiteró con rotundidad Pasquale Stanzione, presidente del Garante italiano de Protección de Datos Personales, en la memoria anual presentada ante la Cámara de Diputados el 2 de julio de 2026: un documento que sitúa en el centro la relación entre inteligencia artificial, tutela de derechos fundamentales y soberanía digital, en lo que el propio presidente describe como una fase de transformación de calado monumental, según relató AgendaDigitale en la crónica de la presentación. No es un respaldo a un producto específico, obviamente, pero sí la señal de que el tema de la soberanía de los datos aplicada a la IA ha alcanzado el máximo nivel institucional, no solo en los documentos de presentación de las startups.

Rizzo-pii y Annota AI encarnan a su escala esta misma apuesta: el primero convierte una exigencia regulatoria en una funcionalidad técnica —privacy by design desde el primer paso del documento—; el segundo construye una cadena de valor europea para los datos de entrenamiento, con el cumplimiento normativo ya incorporado en el producto.

Nichos, no colosos: la verdadera oportunidad

Si hay una lección que se puede extraer de estos dos casos, es que la verticalidad resulta más rentable que la generalidad, al menos para quien empieza con recursos limitados. Conocer a fondo un dominio local, con sus documentos, sus normativas y sus prácticas administrativas, permite construir una herramienta que los grandes actores internacionales no tienen interés en replicar, porque el mercado es pequeño para sus estándares. Legaltech y cumplimiento normativo, sanidad y bienestar social (con historias clínicas y trámites administrativos), finanzas y fiscalidad, administración pública: son todos terrenos donde una empresa italiana que entienda el contexto local puede construir una ventaja que a un coloso generalista le costaría demasiado replicar.

Rizzo-pii, desde esta perspectiva, funciona casi como un caso de libro: no es otro modelo genérico anunciado como revolucionario, sino una herramienta pensada desde cero para los documentos y las categorías de datos italianas. Y no es un caso aislado: una muestra de las mejores IA europeas de 2026 refleja la misma tendencia, proyectos pequeños pero dirigidos que eligen competir en especificidad en lugar de escala.

Los límites que quedan, y lo que aún falta

Sería deshonesto cerrar con una nota triunfalista. Rizzo-pii sigue siendo una herramienta muy adaptada al italiano: otras lenguas europeas están peor cubiertas o no lo están en absoluto, y cada nuevo formato de documento o dominio muy especializado requiere validación adicional, como demuestra la comparación entre el modelo base y su versión adaptada al dominio de la seguridad. Es un proyecto pequeño, gestionado por pocos mantenedores: su fuerza —la cercanía al problema específico— es también su fragilidad, porque la continuidad en el tiempo depende de la energía de quienes lo impulsan, no de un presupuesto corporativo estructurado. Y la visibilidad sigue siendo un reto: un proyecto de código abierto italiano tiene difícil competir, en términos de marketing, con productos respaldados por campañas internacionales multimillonarias.

Falta además, a nivel europeo, algo más estructural: normas y benchmarks compartidos para medir de verdad la eficacia de la detección de PII y la calidad de los conjuntos de datos de entrenamiento, junto con guías prácticas que conecten las exigencias de la AI Act y del RGPD con elecciones arquitectónicas concretas (on-premise frente a cloud europeo, registros, auditorías). Y falta, quizá, mayor colaboración entre proyectos verticales como este, que a menudo nacen aislados en lugar de integrarse en pipelines más amplias de anotación o RAG empresarial.

Una hoja de ruta posible, no solo un deseo

Al final, la cuestión no es si Italia, o Europa, podrán tener algún día su propio modelo generalista para competir de tú a tú con los de OpenAI, Google o las grandes empresas chinas. Probablemente no, al menos no a corto plazo, y perseguir ese objetivo corre el riesgo de ser un despilfarro de tiempo y energías. Lo verdaderamente importante es si sabrán convertirse en la referencia en tres terrenos más acotados pero muy reales: la privacidad por diseño aplicada a los LLM (de la que Rizzo-pii es un ejemplo concreto y verificable); una cadena de valor de datos garantizada y de calidad (como la que intenta construir Annota AI); y la integración de la IA en sectores regulados con un enfoque local y abierto.

Para quienes trabajáis en empresas o profesiones liberales, la medida práctica es evaluar herramientas locales (local-first) para la gestión de la PII antes de adoptar un LLM en la nube sobre documentos sensibles. Para quienes desarrolláis software, contribuir a proyectos de código abierto italianos y europeos, producir benchmarks públicos y documentar casos de uso reales sigue siendo la forma más concreta de hacer crecer un ecosistema hoy formado por iniciativas dispersas. Para quienes redactáis las normas, incentivar la adopción de soluciones abiertas y locales en los ámbitos más sensibles —tal vez con entornos de prueba regulatorios (sandboxes) dedicados— significaría convertir una exigencia percibida como un lastre en una verdadera ventaja competitiva. No hace falta ganar la guerra del capital. Hace falta, de forma mucho más modesta, ganar la guerra de la confianza.