Bibliometría y análisis de producción científica
Mapeo cuantitativo de campos de investigación mediante análisis de redes, co-ocurrencia de términos, topic modeling y análisis de sentimiento sobre literatura científica
Qué es
Análisis cuantitativo de la estructura, evolución y dinámica de un campo de investigación a partir de bases de datos bibliográficas como PubMed, Web of Science o Scopus.
Permite sostener con datos afirmaciones que normalmente se hacen por intuición: que un tema está poco explorado, que un grupo es referencia en su nicho, que una línea está creciendo o agotándose.
Objetivos
- Cartografiar la estructura de un campo de investigación: quién publica, dónde, con quién, sobre qué temas y cómo ha evolucionado.
- Identificar nichos emergentes, temas consolidados y áreas en declive mediante mapas temáticos de centralidad-densidad.
- Cuantificar el tono y la orientación temática de la producción científica mediante análisis de sentimiento y topic modeling sobre abstracts.
Análisis bibliométrico descriptivo y temporal
- Producción científica por año, autor, institución, país y revista.
- Ley de Lotka (productividad de autores), ley de Bradford (dispersión de revistas), ley de Zipf (frecuencia de términos).
- Evolución temporal de temas y detección de puntos de inflexión en la producción.
Análisis de redes y estructura del campo
- Redes de co-autoría entre investigadores e instituciones con métricas de centralidad y clustering.
- Co-ocurrencia de keywords con análisis de correspondencias múltiples (MCA) y k-means para identificar clusters temáticos.
- Mapas temáticos de centralidad-densidad para clasificar temas en motores, básicos, emergentes o en declive.
Análisis de términos MeSH y taxonomía del campo
- Extracción y análisis de términos MeSH (Major y Minor) para identificar la estructura taxonómica del campo.
- Diagramas UpSet para visualizar co-ocurrencia de términos MeSH y combinaciones frecuentes.
- Detección de lagunas temáticas: combinaciones de MeSH ausentes que pueden representar oportunidades de investigación.
NLP sobre literatura científica: sentimiento y topic modeling
- Análisis de sentimiento sobre abstracts con diccionarios léxicos (NRC para emociones de Plutchik, Bing para polaridad positiva/negativa).
- Topic modeling con LDA (Latent Dirichlet Allocation) para descubrir temas latentes en el corpus sin supervisión.
- Visualización con wordclouds, stream plots y radar de emociones para comunicación ejecutiva de resultados.
Para qué sirve
- Justificar la novedad de una línea de investigación ante convocatorias competitivas (ISCIII, Horizon Europe, ERC) con evidencia cuantitativa de que el nicho existe y está poco explorado.
- Mapear un campo antes de iniciar una revisión sistemática para definir la ecuación de búsqueda, identificar autores clave y anticipar el volumen de resultados.
- Evaluar el posicionamiento de un grupo de investigación, institución o país dentro de un campo: con quién colaborar, dónde publicar, qué temas priorizar.
Escribir "es un campo emergente" en tu propuesta de financiación no es lo mismo que demostrarlo
Los evaluadores de convocatorias competitivas y los comités de revisión piden evidencia de que tu línea de investigación es relevante, novedosa y viable. Una frase genérica sobre el "creciente interés" no es evidencia. Un mapa bibliométrico con redes de colaboración, evolución temporal de la producción y detección de nichos temáticos sí lo es. Y un topic modeling sobre los abstracts del campo te dice no solo cuánto se publica, sino sobre qué exactamente y con qué orientación.
Mapa completo del campo en un solo entregable
Producción por año, autor, institución, país y revista. Redes de co-autoría e institucionales. Co-ocurrencia de keywords con clustering. Mapas temáticos de centralidad-densidad. Todo generado desde los registros bibliográficos sin necesidad de leer cada artículo individualmente. El resultado es una fotografía cuantitativa del estado del campo.
Detección de nichos y oportunidades con evidencia cuantitativa
Los mapas temáticos clasifican cada cluster en cuatro cuadrantes: temas motores (alta centralidad, alta densidad), temas básicos (alta centralidad, baja densidad), temas emergentes (baja centralidad, baja densidad) y temas en declive. Los diagramas UpSet de MeSH identifican combinaciones temáticas ausentes que pueden representar líneas de investigación sin explorar.
NLP que va más allá del conteo de palabras
El análisis de sentimiento con NRC clasifica el tono emocional de los abstracts según la rueda de Plutchik (alegría, confianza, miedo, sorpresa, tristeza, asco, ira, anticipación). El topic modeling con LDA descubre temas latentes que no coinciden necesariamente con las keywords declaradas por los autores. Ambos revelan patrones que la bibliometría clásica no captura.
Integrable con revisión sistemática o infodemiología
El análisis bibliométrico es a menudo el primer paso antes de una revisión sistemática (mapear el campo, dimensionar el volumen de resultados, identificar autores clave) o el complemento de un estudio infodemiológico (comparar lo que la población busca en Google con lo que los investigadores publican). Ofrecemos los tres servicios y los integramos cuando el proyecto lo justifica.
Así es trabajar con nosotros
Aplicamos nuestra metodología D²I (Data to Insights) a todos nuestros servicios. Un proceso estructurado, iterativo y transparente que convierte datos complejos en conocimiento accionable.
01
Kick-off y definición del problema
Nos reunimos contigo para entender el problema clínico, los datos disponibles y los objetivos del proyecto. Acordamos entregables, plazos y canales de comunicación. Firmamos los acuerdos de confidencialidad que necesites para proteger tus datos.
02
Revisión y preparación de datos
Evaluamos la calidad de tus datos, identificamos inconsistencias y limitaciones, y los estructuramos para el análisis. Si falta información crítica, te lo decimos antes de seguir. Documentamos todas las decisiones de limpieza para que el proceso sea trazable y reproducible. En bibliometría, esto incluye definir la ecuación de búsqueda en las bases de datos relevantes (PubMed, Web of Science, Scopus), descargar los registros en formato compatible, limpiar duplicados, normalizar nombres de autores e instituciones, y preparar el corpus para análisis con bibliometrix y tidytext.
03
Análisis y modelización
Aplicamos la metodología estadística adecuada para responder a tus preguntas. Trabajamos de forma iterativa: compartimos resultados preliminares contigo, discutimos hallazgos y ajustamos el enfoque si es necesario. No trabajamos a ciegas hasta la entrega final. Para este servicio, ejecutamos análisis bibliométrico descriptivo y estructural con bibliometrix, construimos redes de colaboración, generamos mapas temáticos de centralidad-densidad, extraemos y analizamos términos MeSH, y aplicamos NLP (sentimiento con NRC, topic modeling con LDA) sobre los abstracts del corpus. Cada visualización documentada en Quarto con código reproducible.
04
Comunicación de resultados
Traducimos los hallazgos en el formato que necesitas: informe técnico, tablas y figuras para publicación, dashboard interactivo o presentación ejecutiva. Incluimos siempre interpretación clínica, no solo cifras.
05
Sesión de revisión de impacto
30 días después de la entrega nos volvemos a reunir contigo en una sesión estratégica de 60 minutos. Es el momento en que ya has tenido tiempo de presentar los resultados internamente, han surgido las dudas reales de implementación, y puedes evaluar con perspectiva el impacto del trabajo. Resolvemos dudas, ajustamos interpretaciones si es necesario y validamos juntos el camino a seguir.
Este es nuestro proceso general. Si quieres entender cómo lo aplicamos técnicamente a cada tipo de análisis, consulta nuestra metodología D²I completa.
¿Tienes un proyecto de datos entre manos?
Cuéntanos tu caso y vemos juntos cómo abordarlo.
Agenda una sesiónCasos donde lo aplicamos
Preguntas frecuentes
¿Cómo demuestro con datos que mi línea de investigación es novedosa para una convocatoria competitiva?
Con un análisis bibliométrico que cuantifica el estado del campo: cuánto se publica, sobre qué temas, quién lidera y qué nichos están poco explorados. Aplica cuando un evaluador de una convocatoria competitiva, como el ISCIII, Horizon Europe o el ERC, pide evidencia de relevancia y novedad, y una frase sobre el "creciente interés" no la aporta. El análisis mapea la producción por año, autor, institución y país, construye redes de colaboración y genera mapas temáticos que clasifican cada área en consolidada, emergente o en declive, de modo que la afirmación "es un campo emergente" pase de retórica a dato. Los diagramas UpSet de términos MeSH añaden la detección de combinaciones temáticas ausentes, que pueden señalar líneas sin explorar. Lo que se entrega es evidencia cuantitativa que ayuda a sostener el argumento de novedad, no la garantía de que la propuesta se financie, que depende de muchos más factores.
¿Qué bases de datos bibliográficas usáis y quién define la ecuación de búsqueda?
El análisis parte de las grandes bases bibliográficas, como PubMed, Web of Science y Scopus, y la ecuación de búsqueda la define el servicio junto con el cliente, no la aporta el cliente cerrada. Aplica a cualquier proyecto bibliométrico, donde la calidad del mapa depende directamente de cómo se acote el corpus. La búsqueda bibliométrica busca una cobertura amplia y coherente del campo, con criterios distintos a los de una revisión sistemática, que persigue exhaustividad bajo criterios estrictos. El servicio traduce la pregunta del cliente en una ecuación, descarga los registros, limpia duplicados y normaliza nombres de autores e instituciones antes de analizar. El cliente aporta el conocimiento del campo y valida el alcance; el servicio construye y ejecuta la estrategia de búsqueda y prepara el corpus. Definir bien la ecuación es lo que separa un mapa útil y defendible de uno sesgado por una búsqueda mal planteada.
¿Qué es un mapa temático de centralidad-densidad y qué me dice sobre el campo?
Un mapa temático de centralidad-densidad clasifica los temas de un campo en cuatro cuadrantes según su relevancia estructural (centralidad) y su grado de desarrollo interno (densidad). Aplica cuando se quiere entender no solo cuánto se publica, sino cómo se organizan los temas y hacia dónde evoluciona el campo. Los temas se sitúan como motores, básicos y transversales, muy especializados o, cuando la lectura temporal lo permite, emergentes o en declive. La construcción parte de la co-ocurrencia de keywords y técnicas de agrupación temáticas, según el enfoque elegido, para identificar los grupos temáticos. Conviene un matiz: la posición de un tema depende del corpus y del periodo analizado, por lo que se interpreta como fotografía de un campo acotado, no como verdad absoluta. Lo que aporta es una lectura accionable de qué temas priorizar, consolidar o explorar.
¿El análisis de sentimiento y el topic modeling sobre abstracts qué añaden a la bibliometría clásica?
Añaden una lectura del contenido y el tono del corpus que el recuento bibliométrico no captura: de qué se habla exactamente y con qué orientación, más allá de cuánto se publica. Aplica cuando interesa el contenido temático y emocional de la literatura, no solo sus métricas de producción y colaboración. El topic modeling con LDA propone agrupaciones temáticas latentes en los abstracts sin supervisión, que no siempre coinciden con las keywords declaradas por los autores; el análisis de sentimiento con diccionarios léxicos como NRC o Bing aproxima patrones de polaridad o emoción presentes en el lenguaje de los abstracts. Conviene un límite: estas técnicas describen patrones léxicos del corpus, no juicios de calidad ni de veracidad de la investigación, y los temas latentes requieren interpretación experta para ser útiles. Lo que aportan es una capa de contenido (qué se dice y cómo) que complementa la estructura que ofrece la bibliometría clásica.
¿En qué se diferencia la bibliometría de un meta-análisis?
La bibliometría se utiliza para mapear la estructura, la evolución y la dinámica de un campo de investigación: quién publica, sobre qué, con quién y cómo cambia en el tiempo. El meta-análisis encaja cuando la pregunta es cuantitativa sobre un efecto concreto: combinar los resultados numéricos de varios estudios para estimar una magnitud de efecto agregada. No responden a la misma pregunta: la bibliometría analiza la literatura como objeto, es decir, su producción y su estructura; el meta-análisis sintetiza los resultados de la literatura para responder una pregunta clínica o epidemiológica. También difiere la estrategia de búsqueda: en bibliometría la ecuación se construye buscando una cobertura amplia del campo; en meta-análisis la selección de estudios se construye bajo criterios explícitos de elegibilidad y exhaustividad. Pueden encadenarse, por ejemplo con un mapa bibliométrico antes de decidir el alcance de una síntesis, pero son servicios distintos.
¿La bibliometría sustituye a una revisión sistemática o es un paso previo?
No la sustituye: la bibliometría es a menudo el paso previo que prepara y dimensiona una revisión sistemática, no su reemplazo. Aplica cuando un equipo va a emprender una revisión y necesita primero entender el terreno: explorar términos, autores, revistas y volumen de literatura antes de cerrar una estrategia de revisión. El mapa bibliométrico ofrece esa panorámica cuantitativa del campo sin necesidad de leer cada artículo, lo que ayuda a acotar el alcance antes de invertir el esfuerzo de una revisión completa. El límite es claro: la bibliometría describe la estructura de la literatura, no evalúa críticamente la evidencia ni extrae conclusiones sobre la eficacia de una intervención, que es el cometido de la revisión sistemática y, en su caso, del meta-análisis. Una cosa cartografía el campo; la otra valora la evidencia que contiene.
¿Hacéis análisis de texto sobre historias clínicas o solo sobre literatura científica?
Solo sobre literatura científica: el NLP de este servicio se aplica a abstracts y registros bibliográficos, no a historias clínicas ni a texto clínico de pacientes. Aplica precisar este límite porque "análisis de texto en salud" puede entenderse de dos formas muy distintas. Aquí el corpus son los abstracts de un campo, sobre los que se aplican topic modeling y análisis de sentimiento para caracterizar temas y tono de la producción científica. El procesamiento de lenguaje natural sobre historias clínicas, con extracción de entidades, codificación SNOMED-CT y minería de texto clínico, es una línea distinta, con sus propias fuentes, marco de privacidad y validación, y no forma parte de este servicio. La distinción no es un matiz: cambian las fuentes, los riesgos y los métodos. Quien necesite analizar texto clínico encontrará aquí una frontera clara, no una promesa difusa.
¿Qué entregáis exactamente en un análisis bibliométrico?
Se entrega un mapa cuantitativo del campo, documentado y reproducible: análisis descriptivo y temporal de la producción, redes de co-autoría e institucionales con métricas de centralidad, mapas temáticos de centralidad-densidad, análisis de términos MeSH y, cuando el proyecto lo incluye, NLP sobre los abstracts (sentimiento y topic modeling). Aplica a quien necesita una fotografía del estado de un campo para justificar una línea, preparar una revisión o evaluar el posicionamiento de un grupo. Las visualizaciones se entregan acompañadas de su interpretación, no como salidas sueltas: redes, mapas temáticos, diagramas UpSet, visualizaciones de términos, evolución temática y patrones léxicos. El análisis queda documentado en Quarto con código reproducible, de modo que pueda revisarse y actualizarse. El reparto se mantiene: el cliente aporta el conocimiento del campo y la pregunta; el servicio construye el corpus, lo analiza y lo interpreta. Lo que se entrega es un mapa accionable, no un volcado de métricas bibliográficas.
¿Hablamos?
Cuéntanos en qué estás trabajando y te damos una respuesta directa sobre cómo podemos ayudarte.