Anonimización y trazabilidad de datos en una base poblacional sanitaria

Cómo convertimos una anonimización manual en un proceso estandarizado, reproducible y trazable para el Servicio Navarro de Salud-Osasunbidea

Sector

Investigación sanitaria

Cliente

Servicio Navarro de Salud-Osasunbidea (SNS-O)

Alcance

Estudio en seis fases con validación intermedia

Entregable

Protocolos, prototipo funcional en R y plan de implantación

Desafío

Quitar el nombre y el DNI no basta para anonimizar

El Servicio difunde datos procedentes de Bardena, la base poblacional que cubre cerca del 97% de la población navarra. La anonimización se hacía a mano, sin criterios formalizados, y una vez entregado un conjunto de datos no había forma de rastrear su origen.

El Servicio de Evaluación y Difusión de Resultados en Salud del SNS-O extrae, trata y difunde datos sanitarios para investigación, gestión y publicación. Hasta ahora, cada extracción se anonimizaba de forma manual o semiautomática, según el criterio del técnico que la atendía, sin un marco común que garantizase consistencia entre entregas ni umbrales verificables de protección.

A esa anonimización no formalizada se sumaba una limitación de fondo: si un conjunto de datos entregado acababa filtrado o se usaba de forma indebida, el Servicio no disponía de ningún mecanismo para identificar su origen. El encargo pedía tres cosas a la vez —anonimización segura y consistente, menor riesgo de reidentificación y trazabilidad inversa— y que todo ello fuera compatible con la infraestructura existente y con el modelo OMOP/CDM en adopción. El estudio se enmarca en el Espacio Nacional de Datos de Salud (Componente 18 del PRTR, financiado por Next Generation EU).

4

Módulos funcionales en R, del pseudonimizado a la verificación forense

410

Pruebas automatizadas que garantizan el comportamiento del prototipo

17

Escenarios de demostración sobre población sintética

Solución

Un marco a medida del sistema real, no una plantilla genérica

Protocolo de anonimización personalizado

Antes de prescribir nada, evaluamos los modos de fallo del proceso vigente para ajustar el protocolo a las necesidades reales del Servicio, en lugar de aplicar una plantilla estándar. El resultado clasifica cada petición según su uso y su granularidad, y prescribe mediante árboles de decisión las técnicas y los umbrales que le corresponden: k-anonimato, l-diversidad, privacidad diferencial para agregados publicables y pseudonimización por instancia. El protocolo establece una verificación previa que bloquea lo que no cumple los umbrales.

Sistema de trazabilidad inversa

Diseñamos un sistema que marca cada entrega de forma invisible y única por destinatario, combinando varias técnicas complementarias sobre los datos tabulares. El marcado se diseña para minimizar su impacto sobre el uso analítico legítimo y se valida mediante escenarios documentados. Si un conjunto de datos se filtra, el sistema permite identificar su origen, con un procedimiento de verificación y una cadena de custodia digital que dejan la atribución documentada, trazable y reproducible.

Prototipo funcional validado

Materializamos los dos protocolos en un paquete de R con cuatro módulos, del pseudonimizado por instancia a la verificación forense del origen. Como el Servicio no podía facilitar acceso a datos reales, construimos una población sintética diseñada para reproducir las estructuras necesarias para validar el prototipo, y lo demostramos en diecisiete escenarios documentados en un informe web. Es un prototipo parametrizable para que el Servicio lo adapte e integre, entregado como valor añadido sobre lo solicitado.

Impacto

De una anonimización que solo borra identificadores a una protección frente al cruce de datos

Anonimización estandarizada y reproducible

El criterio del técnico de turno deja paso a un protocolo con categorías, árboles de decisión y umbrales verificables. La misma petición recibe el mismo tratamiento con independencia de quién la atienda, y cada entrega queda registrada y es reproducible.

Capacidad de atribuir el origen de una filtración

El Servicio pasa de no poder rastrear una entrega filtrada a disponer de un sistema de trazabilidad inversa que documenta el origen de cada conjunto de datos de forma trazable y reproducible. Entre varios destinatarios de una misma extracción, puede determinar de cuál salió un conjunto de datos.

Una hoja de ruta apoyada en lo que ya tienen

El estudio se cierra con un plan de implantación en tres horizontes, diseñado sobre el software y el hardware que el Servicio ya posee, con una necesidad de adquisición mínima. El primer tramo, de bajo coste y alto impacto, está al alcance inmediato.

Valor diferencial de Azahar

Qué demuestra este caso sobre nuestra forma de trabajar

Personalización sobre el sistema real

No partimos de una plantilla de anonimización, sino del diagnóstico del proceso concreto del Servicio. El protocolo se diseñó sobre el sistema tal como es, no sobre un sistema ideal.

Rigor metodológico

Aplicamos modelos de privacidad formales y el marco europeo de los tres ataques de reidentificación —singularización, vinculación e inferencia— sobre los escenarios reales de uso del Servicio.

Código probado y reproducible

El prototipo se entrega con 410 pruebas automatizadas y ejecuciones reproducibles en condiciones controladas, manteniendo la parametrización específica de cada instancia y destinatario.

Compatible con su infraestructura

Todo el diseño está planteado para integrarse con la herramienta de pseudonimización en uso y adaptarse tanto al modelo dimensional actual como al esquema OMOP/CDM en adopción, sin rediseñar la lógica central.

¿Hablamos?

Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.