Machine learning para triaje farmacéutico
Modelos predictivos con explicabilidad SHAP para identificar pacientes de alto riesgo en más de 500 farmacias comunitarias del territorio español
Desarrollar un sistema de apoyo al triaje farmacéutico para identificar qué pacientes requieren derivación a atención primaria
El proyecto Indica+PRO disponía de un volumen masivo de datos sobre consultas farmacéuticas por síntomas menores, pero carecía de herramientas analíticas que apoyaran al farmacéutico en la identificación de pacientes que requerían evaluación médica.
En el marco de una colaboración académica internacional entre la Universidad de Granada y la University of Technology Sydney, más de 500 farmacias comunitarias en España participaban en un programa nacional de Servicio de Indicación Farmacéutica protocolizado. El proyecto acumulaba datos clínicos de más de 14.000 consultas por 39 categorías de síntomas menores, junto con información demográfica del paciente, características del farmacéutico y criterios de derivación aplicados.
El reto técnico tenía dos dimensiones. La primera, construir modelos predictivos capaces de clasificar correctamente la necesidad de derivación a atención primaria en un contexto con fuerte desbalance de clases y alta heterogeneidad clínica (39 síntomas con perfiles de derivación muy diferentes). La segunda, garantizar la interpretabilidad del modelo para que los resultados fueran comprensibles y útiles para farmacéuticos e investigadores clínicos, no solo para estadísticos.
+14.000
consultas incluidas en el análisis predictivo
39
categorías de síntomas menores evaluados
+500
farmacias comunitarias del territorio español
Pipeline predictivo iterativo con triple selección de variables, balanceo de clases y explicabilidad SHAP
Construcción del DataMart y selección de variables multimodal
Integración de tres bases de datos (pacientes, farmacéuticos, farmacias) en un DataMart unificado con 61 variables candidatas. Pipeline de selección de variables con tres métodos complementarios — Boruta (random forest-based importance), LVQ (Learning Vector Quantization) y RFE (Recursive Feature Elimination) — reteniendo las variables identificadas como relevantes por al menos uno de los tres. Este enfoque trimodal maximizó la captura de señal predictiva sin depender de un único criterio de selección.
Entrenamiento de 9 familias de algoritmos sobre la derivación al médico
Evaluación sistemática de kNN, Naive Bayes, regresión logística, redes neuronales artificiales, SVM lineal, SVM radial, C5.0, Random Forest y XGBoost. Balanceo de clases mediante SMOTE para contrarrestar la distribución asimétrica de derivaciones. Los nueve algoritmos se entrenaron para predecir la derivación al médico, definida según los protocolos clínicos previamente consensuados, con validación cruzada estratificada y métricas múltiples (Accuracy, Kappa, Sensibilidad, Especificidad, AUC). El modelo SVM radial alcanzó una accuracy de 0,934 con un AUC de 0,897.
Explicabilidad model-agnostic y evaluación por perfiles clínicos
Incorporación de SHAP (SHapley Additive exPlanations) para identificar el peso específico de cada variable en la predicción de derivación. Evaluación complementaria mediante 25 perfiles clínicos frecuentes (combinaciones de género × rango de edad × síntoma × duración), calculando probabilidades predichas específicas por subpoblación. El hallazgo metodológico clave fue que la incorporación de variables del farmacéutico como decisor (experiencia, formación, contexto laboral) aportó capacidad predictiva relevante, evidenciando que la decisión de derivación depende tanto del paciente como del profesional.
Evidencia para asistir al triaje farmacéutico mediante inteligencia artificial explicable
Accuracy del 93,4 % en una cohorte de prueba de 4.218 consultas
El modelo se entrenó con el 70 % de los 14.083 registros y se evaluó sobre el 30 % restante, una cohorte de prueba de 4.218 consultas. El modelo SVM radial identificó correctamente el 95,2 % de los verdaderos negativos y el 74,8 % de los verdaderos positivos, con un Cohen's kappa de 0,630 y un AUC de 0,897, sobre 20 variables predictoras seleccionadas de un total de 61 evaluadas. En la evaluación estratificada, el rendimiento se consideró adecuado en 14 de los 25 perfiles de pacientes más frecuentes, lo que refuerza su función como apoyo al profesional y no como sustituto de su juicio clínico.
Identificación de las variables del farmacéutico como factores predictivos relevantes
El análisis SHAP reveló que características del farmacéutico (experiencia profesional, tipo de formación, contexto de la farmacia) tenían un peso significativo en la predicción de derivación, un hallazgo no evidente desde la perspectiva clínica convencional. Esta identificación de variables del profesional y del contexto de la farmacia es directamente aplicable a cualquier contexto donde la decisión clínica dependa tanto del paciente como del profesional.
Producción científica de alto impacto y reconocimiento internacional
Publicación en Frontiers in Pharmacology recogiendo el modelo SVM radial, la selección de variables y la evaluación por perfiles clínicos. Primer premio a mejor comunicación en el Congreso de la Federación Internacional de Farmacéuticos. La explicabilidad SHAP corresponde a una iteración interna posterior del pipeline, no al contenido publicado. El modelo fue iterado y mejorado a lo largo de tres ciclos metodológicos durante 4 años de colaboración, demostrando capacidad de acompañar programas de investigación longitudinales.
Qué demuestra este caso sobre nuestra forma de trabajar
Pipeline ML completo iterado a lo largo de tres ciclos metodológicos
Evolución demostrable desde caret con evaluación por perfiles clínicos hasta tidymodels con SHAP, pasando por incorporación de NLP (topic modeling). Capacidad de mejorar iterativamente un sistema analítico a lo largo del tiempo manteniendo trazabilidad completa.
Selección de variables multimodal para maximizar señal predictiva
Combinación de tres métodos complementarios (Boruta, LVQ, RFE) en lugar de depender de un único criterio. Enfoque replicable en cualquier proyecto de modelado predictivo donde la selección de features sea crítica.
Explicabilidad incorporada como requisito planificado del pipeline
Integración de SHAP y evaluación por perfiles clínicos previstas desde la fase de diseño del pipeline, como requisito planificado y no como añadido improvisado. Los resultados son comprensibles para investigadores clínicos y farmacéuticos, no solo para estadísticos.
Identificación de variables del profesional y del contexto
Demostración empírica de que la decisión de derivación depende tanto de las características del paciente como del perfil del farmacéutico. Metodología aplicable a cualquier contexto de decisión clínica asistida.
Queríamos contaros una muy buena noticia: nuestro abstract que enviamos al Congreso de la Federación Internacional de Farmacéuticos fue seleccionado para una presentación oral de 15 minutos y ganamos el primer premio.
Emma L. Graham
Grupo de Investigación en Atención Farmacéutica · Universidad de Granada
Recursos del proyecto
Producción científica derivada
Capacidades desplegadas en este proyecto
¿Hablamos?
Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.