Calidad de datos y preparación de bases de datos sanitarias

Antes de analizar una base hay que saber qué contiene y en qué se puede confiar

Qué es

Auditoría de la calidad de una base de datos sanitaria y preparación para un análisis reproducible: evaluación de consistencia y completitud, detección de valores implausibles, revisión de valores atípicos, estudio de los datos faltantes y armonización de fuentes distintas en una estructura analítica documentada y trazable.

Es el punto de partida que condiciona la validez de todo lo que viene después. El trabajo no consiste solo en limpiar: consiste en dejar constancia de qué contiene la base, dónde están sus límites y qué se ha decidido en cada caso.

Objetivos

  • Evaluar la calidad de la base antes de extraer de ella ninguna conclusión.
  • Detectar inconsistencias y valores implausibles, también los que solo lo son al cruzar variables.
  • Evaluar los valores atípicos según la lógica interna del conjunto y definir una estrategia de manejo documentada, no aplicada por defecto.
  • Estudiar el patrón de los datos faltantes y definir una estrategia de manejo adecuada al tipo de variable y al mecanismo de ausencia.
  • Armonizar fuentes heterogéneas en una estructura analítica coherente, documentada y trazable.
Puntos clave

Auditoría de calidad y plausibilidad

  • Evaluación de completitud y consistencia interna: rangos plausibles, coherencia entre campos relacionados, duplicados.
  • Detección de implausibilidad condicional: un valor admisible en una variable deja de serlo a la luz de otra (p. ej. un IMC posible en un adulto pero imposible a una edad determinada, o fechas incoherentes entre sí).
  • Documentación del diccionario de variables, con su definición, su codificación y sus reglas, y de la trazabilidad entre la base cruda y la base analítica.

Evaluación y manejo de valores atípicos

  • Identificación de atípicos según la distribución real del conjunto, no según umbrales genéricos aplicados por defecto.
  • Estrategia ajustada al caso: conservación, revisión, exclusión justificada, winsorización o imputación avanzada cuando el dato y el análisis lo justifican.
  • Distinción entre el atípico que es error de registro y el que es un valor extremo legítimo, con la decisión documentada.

Datos faltantes y patrón de ausencia

  • Evaluación de la plausibilidad de distintos mecanismos de ausencia (MCAR, MAR, MNAR) y de si la propia ausencia puede ser informativa.
  • Definición de una estrategia de manejo de datos faltantes según la naturaleza del dato y el análisis previsto: análisis completo de casos, indicadores de ausencia, análisis de sensibilidad o imputación múltiple cuando esté justificada.
  • Documentación de los supuestos, sin sustituir la decisión clínica sobre qué dato es recuperable.

Armonización e integración

  • Unificación de bases con codificaciones, formatos o vocabularios distintos en una estructura común.
  • Vinculación de registros entre fuentes mediante reglas determinísticas o probabilísticas documentadas.
  • Estandarización de variables a un marco consistente, con las equivalencias registradas.

Para qué sirve

  • Saber, antes de analizar, qué contiene la base, dónde están sus límites y qué decisiones de depuración se han tomado.
  • Convertir varias fuentes dispersas, como registros, encuentros, laboratorio o seguimiento, en una única base analítica coherente.
  • Llegar al análisis con una base documentada y reproducible, de modo que cualquier resultado posterior sea trazable hasta el dato de origen.
Por qué contratar este servicio

Un análisis impecable sobre una base no auditada puede producir un resultado convincente y equivocado.

La calidad de cualquier análisis está acotada por la calidad de la base sobre la que se hace. Variables sin definir, valores que son posibles por separado pero imposibles juntos, atípicos tratados a la ligera o ausencias no caracterizadas se propagan en silencio hasta el resultado final. Auditar y preparar la base no es un trámite previo: es la parte que decide si el análisis significa algo.

Detectamos lo que un rango no ve

Comprobar que cada variable está dentro de su rango es lo básico. Nosotros detectamos además la implausibilidad condicional: el valor que es correcto en su columna pero imposible al cruzarlo con la edad, el sexo o la fecha. Ahí es donde se esconden los errores que sobreviven a una revisión superficial.

Outliers evaluados desde el dato, no desde la plantilla

Un valor extremo puede ser un error de registro o el hallazgo más relevante del estudio. Distinguirlos exige mirar la lógica interna del conjunto, no aplicar un umbral genérico. Elegimos el tratamiento (del criterio clásico a la winsorización o la imputación avanzada) según lo que el dato y el análisis justifican.

Estudiamos por qué falta lo que falta

La mayoría de los flujos se quedan en cuánto falta. Nosotros estudiamos el patrón de la ausencia y si esa ausencia es informativa en sí misma, porque un dato que falta de forma no aleatoria puede sesgar el análisis incluso cuando se aplican técnicas estándar. De ese estudio sale la estrategia de manejo de datos faltantes, no al revés.

Varias fuentes, una base analítica

Registros clínicos, laboratorio, seguimiento y bases administrativas rara vez hablan el mismo idioma. Armonizamos codificaciones y formatos y los integramos en una estructura única, con el diccionario y las equivalencias documentados como activo del equipo.

Nuestro proceso

Así es trabajar con nosotros

Aplicamos nuestra metodología D²I (Data to Insights) a todos nuestros servicios. Un proceso estructurado, iterativo y transparente que convierte datos complejos en conocimiento accionable.

01

Kick-off y definición del problema

Nos reunimos contigo para entender el problema clínico, los datos disponibles y los objetivos del proyecto. Acordamos entregables, plazos y canales de comunicación. Firmamos los acuerdos de confidencialidad que necesites para proteger tus datos.

02

Revisión y preparación de datos

Evaluamos la calidad de tus datos, identificamos inconsistencias y limitaciones, y los estructuramos para el análisis. Si falta información crítica, te lo decimos antes de seguir. Documentamos todas las decisiones de limpieza para que el proceso sea trazable y reproducible. Este servicio es, en sí mismo, una fase 02 exhaustiva: auditamos completitud, consistencia y plausibilidad condicional, tratamos los valores atípicos según la distribución real, estudiamos el patrón de los datos faltantes y armonizamos las fuentes hasta dejar una base analítica única y trazable.

03

Análisis y modelización

Aplicamos la metodología estadística adecuada para responder a tus preguntas. Trabajamos de forma iterativa: compartimos resultados preliminares contigo, discutimos hallazgos y ajustamos el enfoque si es necesario. No trabajamos a ciegas hasta la entrega final. Aquí el análisis es diagnóstico antes que inferencial: cuantificamos la calidad de la base, evaluamos los patrones de ausencia para definir la estrategia de manejo de datos faltantes y dejamos el pipeline de preparación versionado, de modo que sea reproducible sobre futuras actualizaciones de la base.

04

Comunicación de resultados

Traducimos los hallazgos en el formato que necesitas: informe técnico, tablas y figuras para publicación, dashboard interactivo o presentación ejecutiva. Incluimos siempre interpretación clínica, no solo cifras.

05

Sesión de revisión de impacto

30 días después de la entrega nos volvemos a reunir contigo en una sesión estratégica de 60 minutos. Es el momento en que ya has tenido tiempo de presentar los resultados internamente, han surgido las dudas reales de implementación, y puedes evaluar con perspectiva el impacto del trabajo. Resolvemos dudas, ajustamos interpretaciones si es necesario y validamos juntos el camino a seguir.

Este es nuestro proceso general. Si quieres entender cómo lo aplicamos técnicamente a cada tipo de análisis, consulta nuestra metodología D²I completa.

¿Tienes un proyecto de datos entre manos?

Cuéntanos tu caso y vemos juntos cómo abordarlo.

Agenda una sesión
FAQS

Preguntas frecuentes

¿Por qué necesito auditar y preparar la base antes de analizar si los datos ya están recogidos?

Porque la calidad de cualquier análisis está acotada por la calidad de la base sobre la que se hace, y un análisis impecable sobre una base no auditada puede producir un resultado convincente y equivocado. Aplica a cualquier estudio que parta de datos ya recogidos, como registros, encuentros, laboratorio o seguimiento, antes de extraer conclusiones. Variables sin definir, valores posibles por separado pero imposibles juntos, atípicos tratados a la ligera o ausencias no caracterizadas se propagan en silencio hasta el resultado final, donde ya no se distinguen del dato bueno. Auditar y preparar la base no es un trámite previo: es la fase que decide si el análisis significa algo. El trabajo deja además la base documentada y trazable, de modo que cualquier resultado posterior pueda seguirse hasta el dato de origen. Es la diferencia entre analizar sobre terreno firme y analizar sobre supuestos no comprobados.

¿Qué hacéis exactamente que no detecte una comprobación de rangos básica?

Además de comprobar que cada variable está dentro de su rango, se detecta la implausibilidad condicional: el valor admisible en su columna pero incompatible o clínicamente implausible al cruzarlo con otra. Aplica a bases sanitarias donde los errores más persistentes no son los que saltan en una sola variable, sino los que solo emergen al relacionar campos. Un ejemplo: un IMC posible en un adulto pero imposible a una edad determinada, o fechas que son válidas por separado pero incoherentes entre sí. El trabajo cubre completitud y consistencia interna, coherencia entre campos relacionados, duplicados, y la documentación del diccionario de variables, con su definición, su codificación y sus reglas, junto con la trazabilidad entre la base cruda y la base analítica. Ahí, en el cruce de variables, es donde suelen aparecer las incoherencias que sobreviven a una revisión superficial. Comprobar rangos es el mínimo; la implausibilidad condicional es lo que distingue una auditoría real.

Tengo valores extremos en mis datos. ¿Los eliminamos?

No por defecto: un valor extremo puede ser un error de registro o el hallazgo más relevante del estudio, y distinguirlos exige mirar la lógica interna del conjunto, no aplicar un umbral genérico. Aplica siempre que aparecen valores atípicos, donde la decisión automática, eliminar lo que se sale de un corte estándar, puede borrar tanto errores como información legítima. La identificación se hace según la distribución real del conjunto, y la estrategia se ajusta al caso: conservación, revisión, exclusión justificada, winsorización o imputación avanzada cuando el valor se considera no fiable y el análisis lo justifica. La distinción clave es entre el atípico que es error de registro y el que es un valor extremo legítimo, y la decisión queda documentada en cualquier caso. Eliminar un outlier sin entender su origen convierte una decisión analítica en una limpieza aparente. Lo que se entrega es un tratamiento justificado y trazable, no un recorte por plantilla.

¿Cómo se tratan los datos faltantes? ¿Los "rellenáis" sin más?

No se "rellenan" sin más: primero se estudia por qué falta lo que falta, y de ese estudio sale la estrategia de manejo, no al revés. Aplica a casi cualquier base real, donde el abandono, las visitas no realizadas o los campos no cumplimentados son la norma, no la excepción. Se evalúa la plausibilidad de distintos mecanismos de ausencia (MCAR, MAR, MNAR) y si la propia ausencia puede ser informativa, porque un dato que falta de forma no aleatoria puede sesgar el análisis si se trata con técnicas que no respetan ese mecanismo de ausencia. Según la naturaleza del dato y el análisis previsto, la estrategia puede ser análisis completo de casos, indicadores de ausencia, análisis de sensibilidad o imputación múltiple cuando esté justificada. La imputación es una técnica documentada con sus supuestos explícitos, no un invento del dato que el cliente no recogió, y no sustituye la decisión clínica sobre qué dato es recuperable. Estudiar el patrón de la ausencia es lo que evita que una técnica estándar tape un sesgo en lugar de corregirlo.

Tengo los datos en varias fuentes distintas (registro, laboratorio, seguimiento). ¿Podéis unificarlas?

Sí, cuando las fuentes pueden vincularse con criterios defendibles, la armonización e integración en una única base analítica es parte central del servicio. Aplica cuando los datos viven en sistemas que rara vez hablan el mismo idioma: registros clínicos, laboratorio, seguimiento y bases administrativas con codificaciones, formatos o vocabularios distintos. El trabajo unifica esas bases en una estructura común, vincula los registros entre fuentes mediante reglas determinísticas o probabilísticas documentadas, y estandariza las variables a un marco consistente con las equivalencias registradas. El resultado es una base analítica coherente acompañada de su diccionario y sus equivalencias, que queda como activo del equipo, no como una unión opaca imposible de auditar después. Lo que condiciona el alcance es la calidad de los identificadores que permiten enlazar las fuentes: cuando el vínculo entre registros es ambiguo, esa limitación se documenta y se trata de forma explícita.

¿Este servicio incluye también el análisis estadístico de los datos?

No: este servicio deja la base auditada, preparada y documentada; el análisis estadístico que responde la pregunta de investigación es la fase siguiente y se aborda en su servicio. Aplica aclarar el deslinde porque preparar y analizar son dos trabajos distintos, aunque encadenados. Aquí el análisis es diagnóstico antes que inferencial: se cuantifica la calidad de la base, se caracterizan los patrones de ausencia y atípicos, y se deja el pipeline de preparación versionado y reproducible sobre futuras actualizaciones. A partir de esa base preparada, el análisis bioestadístico, modelo predictivo, análisis de registros clínicos, RWE o cualquier otro análisis posterior entran como fase posterior, con la ventaja de partir de un dato fiable y trazable. Pueden contratarse de forma encadenada, con preparación y luego análisis, o por separado si el cliente solo necesita dejar su base en condiciones. Separar las fases protege la validez: un análisis sobre una base sin auditar arrastra los problemas que esta fase resuelve.

¿Qué tenéis que aportar vosotros y qué decido yo sobre mis datos?

El reparto es deliberado: el cliente recoge, posee y decide sobre el dato original; el servicio audita, caracteriza, trata y documenta. Aplica a todo el servicio, porque la frontera protege al cliente y a la validez del trabajo. El servicio identifica inconsistencias, evalúa atípicos y ausencias, propone y aplica estrategias de tratamiento y deja todo documentado; pero las decisiones que dependen del conocimiento clínico o del contexto, como qué valor es recuperable, qué registro es válido o qué criterio de inclusión aplica, las toma quien conoce el dato y su origen. La imputación, la exclusión o la armonización se aplican como técnicas justificadas y trazables, no como cambios silenciosos sobre la base del cliente. El cliente conserva en todo momento la base cruda y la trazabilidad hacia la analítica. Lo que se entrega es una base mejor caracterizada y documentada, con cada decisión a la vista, no una versión alterada que haya que aceptar a ciegas.

¿Qué entregáis al final y por qué importa que sea reproducible?

Se entrega la base analítica preparada junto con el pipeline de preparación versionado, el diccionario de variables, el registro de las decisiones de depuración y la trazabilidad entre la base cruda y la final. Aplica a quien necesita que su análisis posterior sea defendible, porque un resultado solo es tan auditable como la preparación que lo precede. La reproducibilidad importa por dos razones concretas: permite que cualquier conclusión se siga hasta el dato de origen y la decisión que lo trató, y permite reejecutar la preparación sobre una versión actualizada de la base sin rehacer el trabajo a mano. El pipeline documentado convierte la depuración en un activo reutilizable del equipo, no en una serie de retoques irrepetibles. Lo que se entrega no es solo una base limpia, sino el rastro completo de cómo se llegó a ella, que es lo que la hace defendible ante revisores, comités o auditorías internas.

¿Hablamos?

Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.