Topic modeling y NLP sobre literatura científica

Extracción no supervisada de temas latentes en un corpus científico mediante topic modeling y análisis de sentimiento

Sector

Salud pública y epidemiología

Proyecto

Investigación doctoral · Universidad Miguel Hernández de Elche

Alcance

70 artículos · corpus MEDLINE (vía PubMed)

Entregable

Tesis doctoral y publicación científica

Desafío

Explorar la estructura temática de un campo sin partir de categorías predefinidas

Cartografiar los temas dominantes de un corpus científico mediante revisión manual es lento y depende del criterio de quien clasifica. El reto era identificar la estructura temática a partir del propio texto, de forma reproducible y sin categorías predefinidas.

Las revisiones narrativas clásicas dependen del criterio del lector para decidir qué temas agrupan un conjunto de artículos. Ese criterio introduce un sesgo difícil de auditar y no escala cuando el corpus crece. En el campo de la salud laboral y los servicios de atención a domicilio —en expansión por el envejecimiento poblacional y la hospitalización domiciliaria— hacía falta un método que identificara los focos de interés de la literatura de forma sistemática y replicable.

El reto consistía en aplicar procesamiento de lenguaje natural no supervisado sobre el corpus de fichas documentales para que el modelo identificara patrones latentes sin categorías temáticas predefinidas, que posteriormente debían ser interpretados y etiquetados por los investigadores. A ello se sumaba una caracterización léxica de sentimientos y emociones del lenguaje científico del campo, controlando que la interpretación no excediera lo que un análisis descriptivo permite afirmar.

70 artículos

ensayos clínicos seleccionados de un cribado inicial de 1.889 referencias

4 temas

latentes identificados de forma no supervisada en el corpus

8 emociones

del modelo de Plutchik cuantificadas mediante lexicón NRC

Solución

Modelado de temas y análisis de sentimiento sobre el corpus, reproducible de principio a fin

Construcción y depuración del corpus documental

Recuperación sistemática de las fichas documentales de MEDLINE (vía PubMed) mediante ecuaciones de búsqueda construidas sobre los descriptores MeSH y DeCS del campo, con filtro de ensayos clínicos para acotar la evidencia. Control de la integridad de los datos mediante doble tabla de extracción y almacenamiento del corpus como texto plano normalizado, previo a su incorporación al análisis.

Topic modeling no supervisado con Asignación Latente de Dirichlet

Aplicación del algoritmo LDA, que trata cada documento como una mezcla de temas y cada tema como una mezcla de palabras, permitiendo que los documentos se solapen por contenido en lugar de forzarlos a grupos discretos. El modelo deriva las agrupaciones temáticas a partir de la repetición de patrones en el corpus, sin categorías predefinidas, y se identifican para cada tema los términos de mayor peso.

Análisis de sentimiento y caracterización léxica de sentimientos y emociones

Caracterización léxica de sentimientos y emociones del corpus con el lexicón NRC, que asocia cada término a las ocho emociones de la rueda de Plutchik y a los dos sentimientos generales. Contraste de la distribución de sentimientos y emociones mediante tests no paramétricos (U de Mann-Whitney, Kruskal-Wallis) y representación mediante nubes de palabras, gráfico de radar y evolución temporal. Todo el análisis ejecutado en R con un pipeline reproducible (`topicmodels`, `tidytext`).

Impacto

Una radiografía temática reproducible del campo de literatura científica

Cuatro temas latentes identificados de forma reproducible

El modelo identificó de forma no supervisada los cuatro focos de interés del corpus: cuidado domiciliario y satisfacción de los cuidadores, periodo de lactancia, programas de rehabilitación, y actividad física para mitigación del dolor. La estructura temática se obtuvo mediante un procedimiento computacional reproducible, sin categorías iniciales predefinidas, aunque la interpretación y denominación final de los temas correspondió a los investigadores.

Caracterización léxica de sentimientos y emociones del lenguaje científico

El análisis de sentimiento cuantificó una baja frecuencia de términos asociados a emociones y un predominio de la carga positiva sobre la negativa, con predominio de términos asociados por el lexicón a la categoría de confianza. El patrón se mantuvo estable a lo largo del periodo estudiado, coherente con la neutralidad del registro científico, y las diferencias entre sentimientos resultaron estadísticamente significativas.

Método transferible a cualquier corpus científico

El procedimiento —construcción del corpus, modelado de temas e interpretación— es independiente del dominio concreto y aplicable a cualquier campo donde interese cartografiar la literatura de forma sistemática: vigilancia de tendencias de investigación, exploración previa a una revisión sistemática o análisis de producción científica.

Valor diferencial de Azahar

Qué demuestra este caso sobre nuestra forma de trabajar

Los temas emergen del texto, no de categorías predefinidas

El enfoque no supervisado permite que la estructura temática emerja del corpus, reduciendo la imposición de categorías a priori y haciendo auditable el proceso de clasificación.

Reproducible y auditable

Todo el pipeline se ejecuta desde código en R, de modo que el análisis puede reproducirse bajo los mismos datos, parámetros, versiones y semilla aleatoria, y cada decisión queda trazada, frente a la opacidad de una síntesis hecha a mano.

Dos capas sobre el mismo corpus

Topic modeling y análisis de sentimiento se aplican sobre el mismo texto, combinando qué temas dominan el campo con cómo es el lenguaje que lo expresa.

Respaldado por publicación revisada por pares

La metodología forma parte de una tesis doctoral por compendio y fue publicada en una revista científica arbitrada, lo que respalda el rigor del procedimiento más allá de una demostración interna.

¿Hablamos?

Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.