Anonimización de datos sanitarios

Un marco con categorías, umbrales verificables y árboles de decisión que dan garantías formales sobre el riesgo de reidentificación

Qué es

Diseñamos el marco metodológico para anonimizar extracciones de datos sanitarios de forma consistente y verificable. Cada petición se clasifica por uso y granularidad, y a cada clase le corresponden unas técnicas y unos umbrales prescritos mediante árboles de decisión.

El marco se apoya en modelos de privacidad formales: k-anonimato, l-diversidad y privacidad diferencial. Usa pseudonimización por instancia, y es compatible tanto con un modelo dimensional como con OMOP/CDM.

Objetivos

  • Diseñar un protocolo de anonimización con clasificación por categorías y árboles de decisión deterministas.
  • Definir umbrales verificables para cada clase de petición (k, l, tamaño mínimo de celda en agregados).
  • Establecer un checklist de validación previa a la entrega que bloquea lo que no cumple los umbrales.
  • Aplicar pseudonimización por instancia que impide cruzar extracciones distintas de un mismo individuo.
Puntos clave

Clasificación de peticiones y árboles de decisión

  • Cada petición se clasifica por solicitante, uso previsto y granularidad de los datos.
  • El árbol de decisión de cada clase prescribe técnicas y umbrales de forma determinista.
  • Técnicas de tratamiento según el caso: generalización jerarquizada, supresión, microagregación, desplazamiento de fechas.

Modelos de privacidad formales

  • k-anonimato y l-diversidad sobre microdatos, con el umbral que corresponde a cada clase.
  • Privacidad diferencial para los agregados publicables, donde aporta garantía sin destruir la utilidad.
  • El modelo se elige por tipo de salida, no se aplica uno solo a todo.

Pseudonimización por instancia

  • Un pseudónimo estable entre entregas permite reconstruir la trayectoria de un individuo cruzando extracciones.
  • Generamos un pseudónimo distinto por instancia para neutralizar ese cruce.
  • Implementado de forma reproducible mediante derivación con HMAC.

Verificación previa a la entrega

  • Cada salida pasa una comprobación de umbrales antes de salir.
  • Un checklist de validación deja constancia de qué se ha verificado.
  • Lo que no alcanza el umbral no se entrega: la verificación es una puerta, no un informe a posteriori.

Para qué sirve

  • Difundir o compartir microdatos y agregados sanitarios para investigación o gestión sin exponer a las personas a reidentificación.
  • Publicar indicadores en portales de datos abiertos con garantías formales sobre el riesgo asumido.
  • Dotar a la anonimización de un marco reproducible y verificable, que produce el mismo tratamiento ante la misma clase de petición.
Por qué contratar este servicio

Anonimizar no es quitar el nombre. La reidentificación llega por el cruce de cuasi-identificadores, no por el identificador directo.

Suprimir nombre y DNI deja intactos la edad, el código postal, la fecha de un ingreso o un diagnóstico poco frecuente, y esa combinación basta para señalar a una persona. El marco que diseñamos parte de los tres ataques de reidentificación (singularización, vinculación e inferencia) y prescribe, para cada tipo de petición, qué hay que tratar y hasta qué umbral.

Consistencia entre extracciones

La misma clase de petición recibe el mismo tratamiento, de forma reproducible. El criterio queda fijado en un protocolo verificable, no en una decisión que se rehace en cada entrega.

Defensa frente al cruce de cuasi-identificadores

El protocolo se diseña contra el vector real de reidentificación: la combinación de variables aparentemente inocuas. Los umbrales de k-anonimato y l-diversidad acotan ese riesgo de forma medible.

Publicación segura de agregados

Para los indicadores que se publican, la privacidad diferencial pone una garantía formal sobre lo que un tercero podría inferir, sin vaciar de utilidad la tabla publicada.

Proceso reproducible y verificable

Las categorías, los árboles de decisión y el checklist hacen que el tratamiento aplicado a cada entrega quede documentado y se pueda revisar, mantener y reejecutar sin ambigüedad.

Nuestro proceso

Así es trabajar con nosotros

Aplicamos nuestra metodología D²I (Data to Insights) a todos nuestros servicios. Un proceso estructurado, iterativo y transparente que convierte datos complejos en conocimiento accionable.

01

Kick-off y definición del problema

Nos reunimos contigo para entender el problema clínico, los datos disponibles y los objetivos del proyecto. Acordamos entregables, plazos y canales de comunicación. Firmamos los acuerdos de confidencialidad que necesites para proteger tus datos.

02

Revisión y preparación de datos

Evaluamos la calidad de tus datos, identificamos inconsistencias y limitaciones, y los estructuramos para el análisis. Si falta información crítica, te lo decimos antes de seguir. Documentamos todas las decisiones de limpieza para que el proceso sea trazable y reproducible. Clasificamos la petición por solicitante, uso y granularidad, e identificamos los cuasi-identificadores y las variables sensibles presentes en la extracción para situarla en la categoría que le corresponde.

03

Análisis y modelización

Aplicamos la metodología estadística adecuada para responder a tus preguntas. Trabajamos de forma iterativa: compartimos resultados preliminares contigo, discutimos hallazgos y ajustamos el enfoque si es necesario. No trabajamos a ciegas hasta la entrega final. Aplicamos las técnicas y los umbrales que prescribe el árbol de decisión de esa categoría, y comprobamos el resultado contra el checklist previo a la entrega antes de dar la salida por válida.

04

Comunicación de resultados

Traducimos los hallazgos en el formato que necesitas: informe técnico, tablas y figuras para publicación, dashboard interactivo o presentación ejecutiva. Incluimos siempre interpretación clínica, no solo cifras.

05

Sesión de revisión de impacto

30 días después de la entrega nos volvemos a reunir contigo en una sesión estratégica de 60 minutos. Es el momento en que ya has tenido tiempo de presentar los resultados internamente, han surgido las dudas reales de implementación, y puedes evaluar con perspectiva el impacto del trabajo. Resolvemos dudas, ajustamos interpretaciones si es necesario y validamos juntos el camino a seguir.

Este es nuestro proceso general. Si quieres entender cómo lo aplicamos técnicamente a cada tipo de análisis, consulta nuestra metodología D²I completa.

¿Tienes un proyecto de datos entre manos?

Cuéntanos tu caso y vemos juntos cómo abordarlo.

Agenda una sesión
FAQS

Preguntas frecuentes

Si quito el nombre y el DNI de mis datos, ¿no están ya anonimizados?

No. Suprimir los identificadores directos, como el nombre o el DNI, no anonimiza los datos, porque la reidentificación llega sobre todo por el cruce de cuasi-identificadores. Aplica a cualquier extracción sanitaria que se quiera difundir o compartir, donde variables aparentemente inocuas, como la edad, el código postal, la fecha de un ingreso o un diagnóstico poco frecuente, bastan en combinación para señalar a una persona. El marco parte de los tres ataques de reidentificación, la singularización, la vinculación y la inferencia, y prescribe, para cada tipo de petición, qué variables hay que tratar y hasta qué umbral. Quitar el identificador directo es solo el primer gesto; la combinación de cuasi-identificadores es el vector real, y es el que un marco formal acota de forma medible. Anonimizar es un problema de combinaciones, no de borrar una columna.

¿Qué es el k-anonimato y qué garantía da realmente sobre la reidentificación?

El k-anonimato es una propiedad formal que exige que cada combinación de cuasi-identificadores se repita en al menos k individuos, de modo que ninguno sea único por esa combinación. Aplica al tratamiento de microdatos sanitarios, donde el riesgo de singularización es alto. Sobre esa base, la l-diversidad añade una condición sobre las variables sensibles: que dentro de cada grupo haya suficiente variedad para que pertenecer al grupo no revele el atributo sensible. El umbral concreto de k y de l no es universal: corresponde a cada clase de petición según su uso y su granularidad, y se fija en el árbol de decisión. Conviene un límite: estos modelos acotan el riesgo de forma medible, no lo anulan, y su garantía depende de qué variables se traten como cuasi-identificadores. Lo que aportan es una garantía formal y verificable sobre el riesgo asumido, no una promesa de imposibilidad absoluta.

¿Anonimizar no destruye la utilidad de los datos para investigar?

No necesariamente: el objetivo del marco es acotar el riesgo de reidentificación preservando la utilidad analítica, eligiendo la técnica por tipo de salida en lugar de aplicar una sola a todo. Aplica cuando se teme que anonimizar deje los datos inservibles para el análisis previsto. Para microdatos se usan generalización jerarquizada, supresión, microagregación o desplazamiento de fechas con los umbrales de k-anonimato y l-diversidad que correspondan; para agregados publicables, la privacidad diferencial limita lo que un tercero podría inferir, manteniendo utilidad cuando el nivel de ruido es compatible con el uso previsto. La clave es que el modelo se elige por el tipo de salida y el uso previsto, no se impone uno único que arruine el resto. Hay un compromiso real entre privacidad y utilidad, y el marco lo gestiona de forma explícita y documentada, no a ciegas. Se busca el tratamiento que protege a las personas sin destruir la pregunta de investigación.

Voy a entregar varias extracciones del mismo registro en momentos distintos. ¿Pueden cruzarse para reconstruir a un individuo?

Ese cruce es un riesgo real, y se reduce con pseudonimización por instancia: un pseudónimo distinto en cada extracción que impide enlazar las salidas de un mismo individuo entre entregas. Aplica a cualquier organización que difunde datos de forma recurrente desde un mismo registro o sistema. Un pseudónimo estable entre entregas, el mismo código para la misma persona en todas las extracciones, permitiría reconstruir su trayectoria completa cruzando salidas, aunque cada una por separado pareciera segura. Generar un pseudónimo distinto por instancia rompe el enlace directo por identificador entre entregas; se implementa de forma reproducible mediante derivación con HMAC, de modo que el proceso sea consistente y reejecutable. El límite: esto protege frente al cruce entre extracciones, no sustituye al tratamiento de cuasi-identificadores dentro de cada una. Es la pieza que evita que la difusión repetida deshaga la anonimización de cada entrega.

¿Me garantizáis que los datos quedan anonimizados conforme al RGPD?

No se ofrece una garantía de cumplimiento del RGPD ni una validación jurídica de la anonimización, porque esa es una valoración legal que corresponde a otro ámbito. Lo que se diseña es el marco metodológico: la clasificación de peticiones, los modelos de privacidad formales, los umbrales verificables y el checklist previo a la entrega que da garantías formales sobre el riesgo de reidentificación. Aplica precisar este límite porque "anonimización" tiene una lectura jurídica además de la técnica, y conviene no confundirlas. La robustez efectiva del resultado depende también de cómo el cliente implante y mantenga el proceso en su entorno: ADI diseña el protocolo y analiza el riesgo; la organización posee los datos, los difunde y opera el marco. Lo que se entrega es una evaluación metodológica trazable y verificable del riesgo asumido, no un dictamen de conformidad normativa.

¿La anonimización que diseñáis es irreversible? ¿Puede garantizarse que nadie reidentifique nunca?

No se garantiza irreversibilidad absoluta, porque ningún marco serio de anonimización puede prometer que la reidentificación sea imposible en cualquier circunstancia futura. Aplica a toda difusión de datos sanitarios, donde el riesgo se gestiona y se acota, no se elimina por completo. Lo que el marco hace es cuantificar y limitar ese riesgo de forma medible: los umbrales de k-anonimato y l-diversidad acotan la singularización y la vinculación, la privacidad diferencial limita la inferencia sobre agregados, y el checklist bloquea lo que no alcanza el umbral antes de la entrega. El riesgo residual depende también de los datos auxiliares que un tercero pueda tener y del contexto futuro de disponibilidad de información. Por eso se habla de garantías formales sobre el riesgo asumido, con sus supuestos explícitos, no de imposibilidad de reidentificación. Anonimizar bien es acotar el riesgo a un nivel conocido y justificado, no prometer un imposible.

¿En qué se diferencia este servicio de la trazabilidad y el marcado forense de datos?

La anonimización de datos sanitarios se utiliza cuando el objetivo es difundir o compartir datos reduciendo el riesgo de que se reidentifique a las personas, tratando cuasi-identificadores y variables sensibles. La trazabilidad y el marcado forense encajan cuando lo que se busca es poder identificar el origen de una filtración o demostrar la procedencia de una extracción, marcando los datos de forma que cada copia sea atribuible. Son secuenciales y complementarios, ya que una organización puede anonimizar para difundir y, además, marcar cada entrega para rastrear su origen, pero no responden a la misma pregunta: la anonimización protege a las personas frente a la reidentificación; el marcado forense protege a la organización frente a la difusión no autorizada. Pueden contratarse por separado o como un proceso encadenado, según la necesidad.

¿Qué entregáis exactamente y quién aplica la anonimización en el día a día?

Se entrega el marco metodológico de anonimización: la clasificación de peticiones por uso y granularidad, los árboles de decisión que prescriben técnicas y umbrales para cada clase, los modelos de privacidad formales aplicados según el tipo de salida y el checklist de validación previa a la entrega. El reparto es deliberado: ADI diseña el protocolo, define los umbrales y analiza el riesgo; la organización posee los datos, los difunde y opera el marco en su día a día. El protocolo se diseña para ser reproducible y verificable, ya que las categorías, los árboles y el checklist quedan documentados, de modo que el tratamiento aplicado a cada entrega pueda revisarse, mantenerse y reejecutarse sin ambigüedad. Lo que se entrega no es una extracción anonimizada suelta, sino un marco reproducible para aplicar tratamientos consistentes ante la misma clase de petición.

¿Hablamos?

Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.