Anonimización y trazabilidad de datos en una base poblacional sanitaria
Cómo convertimos una anonimización manual en un proceso estandarizado, reproducible y trazable para el Servicio Navarro de Salud-Osasunbidea
Quitar el nombre y el DNI no basta para anonimizar
El Servicio difunde datos procedentes de Bardena, la base poblacional que cubre cerca del 97% de la población navarra. La anonimización se hacía a mano, sin criterios formalizados, y una vez entregado un conjunto de datos no había forma de rastrear su origen.
El Servicio de Evaluación y Difusión de Resultados en Salud del SNS-O extrae, trata y difunde datos sanitarios para investigación, gestión y publicación. Hasta ahora, cada extracción se anonimizaba de forma manual o semiautomática, según el criterio del técnico que la atendía, sin un marco común que garantizase consistencia entre entregas ni umbrales verificables de protección.
A esa anonimización no formalizada se sumaba una limitación de fondo: si un conjunto de datos entregado acababa filtrado o se usaba de forma indebida, el Servicio no disponía de ningún mecanismo para identificar su origen. El encargo pedía tres cosas a la vez —anonimización segura y consistente, menor riesgo de reidentificación y trazabilidad inversa— y que todo ello fuera compatible con la infraestructura existente y con el modelo OMOP/CDM en adopción. El estudio se enmarca en el Espacio Nacional de Datos de Salud (Componente 18 del PRTR, financiado por Next Generation EU).
4
Módulos funcionales en R, del pseudonimizado a la verificación forense
410
Pruebas automatizadas que garantizan el comportamiento del prototipo
17
Escenarios de demostración sobre población sintética
Un marco a medida del sistema real, no una plantilla genérica
Protocolo de anonimización personalizado
Antes de prescribir nada, evaluamos los modos de fallo del proceso vigente para ajustar el protocolo a las necesidades reales del Servicio, en lugar de aplicar una plantilla estándar. El resultado clasifica cada petición según su uso y su granularidad, y prescribe mediante árboles de decisión las técnicas y los umbrales que le corresponden: k-anonimato, l-diversidad, privacidad diferencial para agregados publicables y pseudonimización por instancia. El protocolo establece una verificación previa que bloquea lo que no cumple los umbrales.
Sistema de trazabilidad inversa
Diseñamos un sistema que marca cada entrega de forma invisible y única por destinatario, combinando varias técnicas complementarias sobre los datos tabulares. El marcado se diseña para minimizar su impacto sobre el uso analítico legítimo y se valida mediante escenarios documentados. Si un conjunto de datos se filtra, el sistema permite identificar su origen, con un procedimiento de verificación y una cadena de custodia digital que dejan la atribución documentada, trazable y reproducible.
Prototipo funcional validado
Materializamos los dos protocolos en un paquete de R con cuatro módulos, del pseudonimizado por instancia a la verificación forense del origen. Como el Servicio no podía facilitar acceso a datos reales, construimos una población sintética diseñada para reproducir las estructuras necesarias para validar el prototipo, y lo demostramos en diecisiete escenarios documentados en un informe web. Es un prototipo parametrizable para que el Servicio lo adapte e integre, entregado como valor añadido sobre lo solicitado.
De una anonimización que solo borra identificadores a una protección frente al cruce de datos
Anonimización estandarizada y reproducible
El criterio del técnico de turno deja paso a un protocolo con categorías, árboles de decisión y umbrales verificables. La misma petición recibe el mismo tratamiento con independencia de quién la atienda, y cada entrega queda registrada y es reproducible.
Capacidad de atribuir el origen de una filtración
El Servicio pasa de no poder rastrear una entrega filtrada a disponer de un sistema de trazabilidad inversa que documenta el origen de cada conjunto de datos de forma trazable y reproducible. Entre varios destinatarios de una misma extracción, puede determinar de cuál salió un conjunto de datos.
Una hoja de ruta apoyada en lo que ya tienen
El estudio se cierra con un plan de implantación en tres horizontes, diseñado sobre el software y el hardware que el Servicio ya posee, con una necesidad de adquisición mínima. El primer tramo, de bajo coste y alto impacto, está al alcance inmediato.
Qué demuestra este caso sobre nuestra forma de trabajar
Personalización sobre el sistema real
No partimos de una plantilla de anonimización, sino del diagnóstico del proceso concreto del Servicio. El protocolo se diseñó sobre el sistema tal como es, no sobre un sistema ideal.
Rigor metodológico
Aplicamos modelos de privacidad formales y el marco europeo de los tres ataques de reidentificación —singularización, vinculación e inferencia— sobre los escenarios reales de uso del Servicio.
Código probado y reproducible
El prototipo se entrega con 410 pruebas automatizadas y ejecuciones reproducibles en condiciones controladas, manteniendo la parametrización específica de cada instancia y destinatario.
Compatible con su infraestructura
Todo el diseño está planteado para integrarse con la herramienta de pseudonimización en uso y adaptarse tanto al modelo dimensional actual como al esquema OMOP/CDM en adopción, sin rediseñar la lógica central.
Capacidades desplegadas en este proyecto
¿Hablamos?
Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.