Inferencia causal y diseño de estudios observacionales

Diseño y análisis con enfoque causal para responder preguntas sobre efectos de intervenciones, exposiciones y políticas cuando la aleatorización no es posible

Qué es

Marco metodológico que permite estimar efectos causales a partir de datos observacionales, combinando diseño del estudio, formalización de supuestos causales mediante DAGs y técnicas estadísticas que controlan la confusión de forma explícita.

Incluye propensity score methods, g-computation, variables instrumentales, difference-in-differences y análisis de mediación causal. Aplicable cuando la pregunta es "qué efecto tiene X sobre Y" y no hay ensayo aleatorizado disponible.

Objetivos

  • Estimar el efecto causal de una intervención, exposición o política sobre un outcome de interés a partir de datos observacionales, controlando explícitamente la confusión medida y evaluando la sensibilidad ante confusión no medida.
  • Formalizar los supuestos causales del estudio mediante DAGs antes de ejecutar ningún modelo, identificando variables de confusión, mediadoras y colisionadoras.
  • Descomponer efectos causales en directos e indirectos (mediación) y evaluar si el efecto varía según subpoblaciones (moderación).
Puntos clave

DAGs y formalización de supuestos causales

  • Construcción de grafos acíclicos dirigidos (DAGs) para formalizar la estructura causal del problema antes del análisis.
  • Identificación del conjunto mínimo de ajuste: qué variables controlar y cuáles no tocar (mediadoras, colisionadoras).
  • Evaluación de si la pregunta causal es identificable con los datos disponibles, y transparencia cuando no lo es.

Propensity score methods y balanceo de grupos

  • Propensity score matching (nearest neighbor, caliper, óptimo) con evaluación de balance post-matching.
  • Inverse Probability of Treatment Weighting (IPTW) con estabilización de pesos y truncamiento.
  • Estratificación por propensity score y doubly robust estimation para protección ante mala especificación.

Mediación causal y descomposición de efectos

  • Estimación de ACME (Average Causal Mediation Effect) y ADE (Average Direct Effect) con bootstrap para outcomes continuos y binarios.
  • Análisis de moderación con términos de interacción y visualización de efectos condicionales.
  • Análisis de sensibilidad ante violación de la asunción de ignorabilidad secuencial.

Métodos avanzados y evaluación de políticas

  • G-computation para estimación de efectos marginales poblacionales.
  • Difference-in-differences para evaluación de impacto de intervenciones o políticas con datos pre/post.
  • Análisis de sensibilidad cuantitativo ante confusión no medida (E-value, bias analysis) para evaluar la robustez de las conclusiones causales.

Para qué sirve

  • Estimar el efecto de una intervención sanitaria cuando no hay ensayo clínico disponible, utilizando datos de registros, cohortes o bases de datos administrativas con diseño causal explícito.
  • Evaluar el impacto de una política de salud pública o un cambio de protocolo comparando periodos pre y post implementación con control de tendencias preexistentes.
  • Responder a revisores que exigen evidencia causal, no solo asociaciones ajustadas, proporcionando DAGs, análisis de sensibilidad y discusión formal de los supuestos de identificación.
Por qué contratar este servicio

Ajustar por confusores no es inferencia causal. Es un primer paso que muchos confunden con el último

Una regresión multivariante ajustada por edad y sexo no responde preguntas causales — responde preguntas de asociación condicional. Si quieres saber si tu intervención causa un efecto, necesitas un diseño con supuestos causales explícitos, un conjunto de ajuste derivado de la estructura causal del problema (no de la significación estadística), y análisis de sensibilidad que cuantifiquen cuánta confusión no medida invalidaría tus conclusiones.

El DAG va antes del modelo, no después

Construimos el grafo causal contigo antes de decidir qué variables ajustar. Si tu DAG indica que una variable es colisionadora, ajustar por ella introduce sesgo en lugar de eliminarlo. Si indica que es mediadora, ajustar por ella elimina parte del efecto que quieres estimar. La estructura causal determina el modelo, no al revés.

Propensity scores con diagnóstico de balance, no solo con p-valores

Un propensity score que reduce el p-valor de las diferencias entre grupos no garantiza buen balance. Evaluamos balance con diferencias estandarizadas, variance ratios y comparación visual de distribuciones. Si el matching o el weighting no logran balance aceptable, lo reportamos y evaluamos alternativas — no forzamos un resultado.

Análisis de sensibilidad que cuantifican la amenaza, no que la ignoran

Toda estimación causal observacional descansa en supuestos no verificables. En lugar de asumir que se cumplen y pasar al siguiente punto del manuscrito, proporcionamos E-values o quantitative bias analysis que dicen exactamente cuánta confusión no medida sería necesaria para anular el efecto estimado. Eso convierte un supuesto implícito en un argumento cuantificable.

Evaluación de impacto de políticas e intervenciones poblacionales

Difference-in-differences y diseños de regresión discontinua permiten evaluar el impacto de cambios de protocolo, nuevas políticas sanitarias o intervenciones poblacionales aprovechando variación temporal o administrativa. Cuando no hay grupo control aleatorizado, el diseño del estudio se convierte en el análisis — y diseñar bien es más importante que modelar sofisticado.

Nuestro proceso

Así es trabajar con nosotros

Aplicamos nuestra metodología D²I (Data to Insights) a todos nuestros servicios. Un proceso estructurado, iterativo y transparente que convierte datos complejos en conocimiento accionable.

01

Kick-off y definición del problema

Nos reunimos contigo para entender el problema clínico, los datos disponibles y los objetivos del proyecto. Acordamos entregables, plazos y canales de comunicación. Firmamos los acuerdos de confidencialidad que necesites para proteger tus datos.

02

Revisión y preparación de datos

Evaluamos la calidad de tus datos, identificamos inconsistencias y limitaciones, y los estructuramos para el análisis. Si falta información crítica, te lo decimos antes de seguir. Documentamos todas las decisiones de limpieza para que el proceso sea trazable y reproducible. En inferencia causal, esto incluye construir el DAG con el equipo de investigación, identificar el conjunto mínimo de ajuste, evaluar si los datos disponibles permiten identificar el efecto causal de interés, y preparar las variables para la estrategia de estimación seleccionada (matching, weighting, g-computation).

03

Análisis y modelización

Aplicamos la metodología estadística adecuada para responder a tus preguntas. Trabajamos de forma iterativa: compartimos resultados preliminares contigo, discutimos hallazgos y ajustamos el enfoque si es necesario. No trabajamos a ciegas hasta la entrega final. Para este servicio, implementamos la estrategia causal seleccionada (propensity score matching/weighting, mediación causal, difference-in-differences, g-computation), evaluamos balance y supuestos, ejecutamos análisis de sensibilidad ante confusión no medida, y documentamos explícitamente qué supuestos causales sostienen cada conclusión. Todo en R con código reproducible.

04

Comunicación de resultados

Traducimos los hallazgos en el formato que necesitas: informe técnico, tablas y figuras para publicación, dashboard interactivo o presentación ejecutiva. Incluimos siempre interpretación clínica, no solo cifras.

05

Sesión de revisión de impacto

30 días después de la entrega nos volvemos a reunir contigo en una sesión estratégica de 60 minutos. Es el momento en que ya has tenido tiempo de presentar los resultados internamente, han surgido las dudas reales de implementación, y puedes evaluar con perspectiva el impacto del trabajo. Resolvemos dudas, ajustamos interpretaciones si es necesario y validamos juntos el camino a seguir.

Este es nuestro proceso general. Si quieres entender cómo lo aplicamos técnicamente a cada tipo de análisis, consulta nuestra metodología D²I completa.

¿Tienes un proyecto de datos entre manos?

Cuéntanos tu caso y vemos juntos cómo abordarlo.

Agenda una sesión
FAQS

Preguntas frecuentes

Ya ajusto mi regresión por edad, sexo y otros confusores. ¿Eso no es inferencia causal?

No: ajustar por confusores es un primer paso que se confunde a menudo con el último, pero una regresión ajustada responde una pregunta de asociación condicional, no causal. Aplica cuando la pregunta real es "qué efecto tiene X sobre Y" y no solo "están X e Y asociadas tras ajustar". La diferencia es de fondo: una regresión multivariante ajustada por edad y sexo estima una asociación condicional; estimar un efecto causal exige un diseño con supuestos causales explícitos, un conjunto de ajuste derivado de la estructura causal del problema y no de la significación estadística, y un análisis de sensibilidad que evalúe cuánto dependería la conclusión de una posible confusión no medida. Elegir qué variables ajustar mirando los p-valores, sin un marco causal, puede introducir sesgo en lugar de quitarlo. Lo que distingue la inferencia causal no es un modelo más sofisticado, sino hacer explícitos y defendibles los supuestos bajo los que una asociación puede leerse como efecto.

¿Qué es un DAG y por qué se construye antes del modelo?

Un DAG (grafo acíclico dirigido) es la representación formal de la estructura causal del problema: qué causa qué, según el conocimiento del dominio, dibujado antes de ejecutar ningún modelo. Aplica a cualquier estudio con pretensión causal, porque la estructura causal es la que determina qué variables ajustar, no al revés. El DAG identifica el conjunto mínimo de ajuste, es decir, qué variables controlar y, sobre todo, cuáles no tocar: ajustar por una variable mediadora elimina parte del efecto que se quiere estimar, y ajustar por una colisionadora introduce sesgo donde no lo había. También permite evaluar si la pregunta causal es siquiera identificable con los datos disponibles, y ser transparente cuando no lo es. Construir el DAG con el equipo investigador, que aporta el conocimiento del dominio, es lo que ancla todo el análisis posterior. Decidir el ajuste sin un DAG es elegir a ciegas qué sesgos se corrigen y cuáles se crean.

¿Cómo se comparan grupos sin la aleatorización de un ensayo? ¿Qué son los propensity scores?

Sin aleatorización, los grupos difieren en características que afectan al desenlace, y los propensity score methods buscan equilibrar esas diferencias para hacer la comparación más defendible. Aplica cuando se quiere estimar el efecto de una intervención o exposición con datos observacionales de registros, cohortes o bases administrativas. El propensity score, la probabilidad de recibir el tratamiento dadas las covariables, se usa para emparejar (matching), ponderar (IPTW con estabilización y truncamiento) o estratificar, y puede combinarse con estimación doblemente robusta, que mejora la protección frente a mala especificación si al menos uno de los modelos implicados está correctamente especificado. La clave está en la evaluación del balance: un propensity score se valida comprobando que las covariables quedan equilibradas entre grupos, mediante diferencias estandarizadas y comparación de distribuciones, no con un p-valor. Si el matching o el weighting no logran un balance aceptable, se reporta y se evalúan alternativas, no se fuerza un resultado. Equilibrar los grupos observados reduce el sesgo, pero no sustituye la aleatorización ni elimina la confusión no medida.

Si es observacional, ¿no se puede demostrar causalidad? ¿Qué fiabilidad tiene la conclusión?

Toda estimación causal a partir de datos observacionales descansa en supuestos no verificables con los propios datos, así que el trabajo no es "demostrar causalidad" sino hacer esos supuestos explícitos y cuantificar cómo de sensible es la conclusión a su incumplimiento. Aplica a cualquier estudio observacional con pregunta causal, donde la honestidad sobre los supuestos es parte del rigor. En lugar de asumir que los supuestos se cumplen y seguir adelante, se ejecuta un análisis de sensibilidad cuantitativo, como el E-value o el quantitative bias analysis, que estima, bajo supuestos explícitos, qué magnitud de confusión no medida sería compatible con explicar o debilitar el efecto estimado. Eso convierte un supuesto implícito en un argumento cuantificable: un efecto que solo se debilita bajo escenarios de confusión poco plausibles es más defendible que uno que se desvanece con un sesgo pequeño. La conclusión no se presenta como prueba definitiva equivalente a un ensayo, sino como una estimación causal con sus supuestos de identificación declarados y su robustez cuantificada. Esa transparencia es justo lo que un revisor exigente pide.

¿Podéis evaluar el impacto de un cambio de política o de protocolo comparando antes y después?

Sí, si el diseño permite una comparación defendible; no basta con observar un antes y un después. Aplica cuando no hay grupo control aleatorizado, pero sí datos pre y post implementación y un grupo o discontinuidad que permita construir un contrafactual razonable, y se quiere separar el efecto del cambio de las tendencias que ya venían ocurriendo. Difference-in-differences compara la evolución del grupo afectado con la de un grupo de comparación, bajo el supuesto de tendencias paralelas que debe examinarse, no asumirse; según el caso, también pueden encajar diseños de regresión discontinua. La premisa de fondo es que, sin aleatorización, el diseño del estudio se convierte en el análisis: diseñar bien la comparación importa más que aplicar un modelo sofisticado sobre una comparación mal planteada. Lo que se entrega es una estimación de impacto con su diseño y sus supuestos explícitos, no una atribución automática del cambio observado a la política.

¿En qué se diferencia este servicio del análisis de mediación y moderación causal?

El análisis de mediación y moderación causal es, en realidad, una parte de la inferencia causal con público y entrada propios: encaja cuando la pregunta es por qué o para quién ocurre un efecto: descomponerlo en directo e indirecto a través de un mediador, o ver si varía según subgrupos. La inferencia causal y el diseño de estudios observacionales es el paraguas más amplio: estimar el efecto de una intervención o exposición sobre un outcome cuando no hay aleatorización, con DAGs, propensity scores, difference-in-differences, g-computation y análisis de sensibilidad. No responden exactamente a la misma pregunta: la mediación descompone un efecto en vías directas e indirectas bajo supuestos causales adicionales; la inferencia causal general estima el efecto total o marginal de una exposición, intervención o política. Quien busca específicamente "análisis de mediación" tiene un servicio propio para ello; quien plantea una pregunta causal más amplia entra por aquí. Se trabajan de forma coordinada: la mediación es un caso particular dentro de este marco.

¿En qué se diferencia este servicio del Real World Evidence (RWE)?

El aparato metodológico se solapa, con propensity scores, diseño observacional y control de confusión, pero el framing y el contexto difieren. El Real World Evidence encaja cuando el marco es la generación de evidencia clínica a partir de datos de práctica real para un contexto biofarmacéutico o de medical affairs, con su lenguaje y sus destinatarios propios. La inferencia causal y el diseño de estudios observacionales es el marco para preguntas causales en investigación sanitaria y salud pública: efectos de intervenciones, exposiciones o políticas en registros, cohortes o datos administrativos. No es que uno sea más riguroso que el otro: comparten métodos, pero responden a la misma familia de preguntas desde encuadres distintos. Si la necesidad se plantea como generación de evidencia de mundo real para biopharma, el encuadre natural es RWE; si se plantea como estimar un efecto causal en un estudio de investigación o de salud pública, es este servicio. La elección es de contexto, no de método.

¿Qué entregáis y cómo respondéis a los revisores que piden evidencia causal?

Se entrega la estimación del efecto causal con todo el andamiaje que la sostiene: el DAG que formaliza los supuestos, el conjunto de ajuste justificado y la estrategia de estimación (matching, weighting, g-computation, difference-in-differences o mediación, según la pregunta). Se acompaña de la evaluación de balance y del análisis de sensibilidad ante confusión no medida. Aplica a quien necesita responder a revisores que exigen evidencia causal y no solo asociaciones ajustadas. El material incluye la discusión formal de los supuestos de identificación y los análisis de sensibilidad que cuantifican la amenaza de la confusión no medida, que es justo lo que un revisor riguroso pregunta cuando cuestiona una afirmación causal. Todo queda documentado en R con código reproducible, de modo que cada estimación sea trazable hasta el modelo, el conjunto de ajuste y los supuestos que la sostienen. El reparto se mantiene: el equipo investigador aporta el conocimiento del dominio y firma el trabajo; el servicio aporta el marco causal, la estimación y su defensa metodológica. Lo que se entrega no es una afirmación causal rotunda, sino una estimación con sus supuestos a la vista y su robustez cuantificada.

¿Hablamos?

Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.