Topic modeling y NLP sobre literatura científica
Extracción no supervisada de temas latentes en un corpus científico mediante topic modeling y análisis de sentimiento
Explorar la estructura temática de un campo sin partir de categorías predefinidas
Cartografiar los temas dominantes de un corpus científico mediante revisión manual es lento y depende del criterio de quien clasifica. El reto era identificar la estructura temática a partir del propio texto, de forma reproducible y sin categorías predefinidas.
Las revisiones narrativas clásicas dependen del criterio del lector para decidir qué temas agrupan un conjunto de artículos. Ese criterio introduce un sesgo difícil de auditar y no escala cuando el corpus crece. En el campo de la salud laboral y los servicios de atención a domicilio —en expansión por el envejecimiento poblacional y la hospitalización domiciliaria— hacía falta un método que identificara los focos de interés de la literatura de forma sistemática y replicable.
El reto consistía en aplicar procesamiento de lenguaje natural no supervisado sobre el corpus de fichas documentales para que el modelo identificara patrones latentes sin categorías temáticas predefinidas, que posteriormente debían ser interpretados y etiquetados por los investigadores. A ello se sumaba una caracterización léxica de sentimientos y emociones del lenguaje científico del campo, controlando que la interpretación no excediera lo que un análisis descriptivo permite afirmar.
70 artículos
ensayos clínicos seleccionados de un cribado inicial de 1.889 referencias
4 temas
latentes identificados de forma no supervisada en el corpus
8 emociones
del modelo de Plutchik cuantificadas mediante lexicón NRC
Modelado de temas y análisis de sentimiento sobre el corpus, reproducible de principio a fin
Construcción y depuración del corpus documental
Recuperación sistemática de las fichas documentales de MEDLINE (vía PubMed) mediante ecuaciones de búsqueda construidas sobre los descriptores MeSH y DeCS del campo, con filtro de ensayos clínicos para acotar la evidencia. Control de la integridad de los datos mediante doble tabla de extracción y almacenamiento del corpus como texto plano normalizado, previo a su incorporación al análisis.
Topic modeling no supervisado con Asignación Latente de Dirichlet
Aplicación del algoritmo LDA, que trata cada documento como una mezcla de temas y cada tema como una mezcla de palabras, permitiendo que los documentos se solapen por contenido en lugar de forzarlos a grupos discretos. El modelo deriva las agrupaciones temáticas a partir de la repetición de patrones en el corpus, sin categorías predefinidas, y se identifican para cada tema los términos de mayor peso.
Análisis de sentimiento y caracterización léxica de sentimientos y emociones
Caracterización léxica de sentimientos y emociones del corpus con el lexicón NRC, que asocia cada término a las ocho emociones de la rueda de Plutchik y a los dos sentimientos generales. Contraste de la distribución de sentimientos y emociones mediante tests no paramétricos (U de Mann-Whitney, Kruskal-Wallis) y representación mediante nubes de palabras, gráfico de radar y evolución temporal. Todo el análisis ejecutado en R con un pipeline reproducible (`topicmodels`, `tidytext`).
Una radiografía temática reproducible del campo de literatura científica
Cuatro temas latentes identificados de forma reproducible
El modelo identificó de forma no supervisada los cuatro focos de interés del corpus: cuidado domiciliario y satisfacción de los cuidadores, periodo de lactancia, programas de rehabilitación, y actividad física para mitigación del dolor. La estructura temática se obtuvo mediante un procedimiento computacional reproducible, sin categorías iniciales predefinidas, aunque la interpretación y denominación final de los temas correspondió a los investigadores.
Caracterización léxica de sentimientos y emociones del lenguaje científico
El análisis de sentimiento cuantificó una baja frecuencia de términos asociados a emociones y un predominio de la carga positiva sobre la negativa, con predominio de términos asociados por el lexicón a la categoría de confianza. El patrón se mantuvo estable a lo largo del periodo estudiado, coherente con la neutralidad del registro científico, y las diferencias entre sentimientos resultaron estadísticamente significativas.
Método transferible a cualquier corpus científico
El procedimiento —construcción del corpus, modelado de temas e interpretación— es independiente del dominio concreto y aplicable a cualquier campo donde interese cartografiar la literatura de forma sistemática: vigilancia de tendencias de investigación, exploración previa a una revisión sistemática o análisis de producción científica.
Qué demuestra este caso sobre nuestra forma de trabajar
Los temas emergen del texto, no de categorías predefinidas
El enfoque no supervisado permite que la estructura temática emerja del corpus, reduciendo la imposición de categorías a priori y haciendo auditable el proceso de clasificación.
Reproducible y auditable
Todo el pipeline se ejecuta desde código en R, de modo que el análisis puede reproducirse bajo los mismos datos, parámetros, versiones y semilla aleatoria, y cada decisión queda trazada, frente a la opacidad de una síntesis hecha a mano.
Dos capas sobre el mismo corpus
Topic modeling y análisis de sentimiento se aplican sobre el mismo texto, combinando qué temas dominan el campo con cómo es el lenguaje que lo expresa.
Respaldado por publicación revisada por pares
La metodología forma parte de una tesis doctoral por compendio y fue publicada en una revista científica arbitrada, lo que respalda el rigor del procedimiento más allá de una demostración interna.
Producción científica derivada
Capacidades desplegadas en este proyecto
¿Hablamos?
Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.