Desenredando todo (o parte) de lo que la lectura del Book of Why me ha dejado

Dudaba si titular esta entrada como “The Book of Why y la madre que lo parió”.
Empecé a leer el libro a mediados de julio de 2026 como una lectura curiosa que fue despertándome dudas, inquietudes, posibles propuestas de para qué me serviría el operador “do(X)”… Y poco a poco, la sensación de incomodidad, incultura y casi desesperación fue invadiéndome a medida que avanzaban las páginas.
He acabado de leer el libro, no he entendido casi nada, pero creo que me he reconciliado con la curiosidad y ahora tengo ante mí un arduo camino para intentar llegar a alguna comprensión a partir de esta lista de referencias, un montón de páginas que no se cuántos meses o años tardaré en digerir:
  • Dietz, J. (2026). Building actionable theories: The role of causal constructs. The Leadership Quarterly, 37(1), 101929. https://doi.org/10.1016/j.leaqua.2025.101929
  • Hernan, M. A., & Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC. https://miguelhernan.org/whatifbook
  • Pearl, J. (2014a). Interpretation and identification of causal mediation. Psychological Methods, 19(4), 459–481. https://doi.org/10.1037/a0036434
  • Pearl, J. (2014b). Reply to commentary by Imai, Keele, Tingley, and Yamamoto concerning causal mediation analysis. Psychological Methods, 19(4), 488–492. https://doi.org/10.1037/met0000022
  • Pearl, J., Glymour, M., & Jewell, N. P. (2016). Causal inference in statistics: A primer (Reprinted with revisions). Wiley.
  • Pearl, J., & Mackenzie, D. (2018). The book of why: The new science of cause and effect (First trade paperback edition). Basic Books. (Bib UPV B 0-16/01514).
  • Tennant, P. W. G., Murray, E. J., Arnold, K. F., Berrie, L., Fox, M. P., Gadd, S. C., Harrison, W. J., Keeble, C., Ranker, L. R., Textor, J., Tomova, G. D., Gilthorpe, M. S., & Ellison, G. T. H. (2021). Use of directed acyclic graphs (DAGs) to identify confounders in applied health research: Review and recommendations. International Journal of Epidemiology, 50(2), 621–632. https://doi.org/10.1093/ije/dyaa213
  • Textor, J., van der Zander, B., Gilthorpe, M. S., Liśkiewicz, M., & Ellison, G. T. (2016). Robust causal inference using directed acyclic graphs: The R package ‘dagitty.’ International Journal of Epidemiology, 45(6), 1887–1894. https://doi.org/10.1093/ije/dyw341
  • VanderWeele, T. J. (2015). Explanation in causal inference: Methods for mediation and interaction. Oxford University Press.
  • VanderWeele, T. J. (2016). Explanation in causal inference: Developments in mediation and interaction. International Journal of Epidemiology, 45(6), 1904–1908. https://doi.org/10.1093/ije/dyw277
 

Visitas: 17

¿Sobre qué decisiones, problemas o prácticas relacionadas con personas, equipos, participación o mejora continua os gustaría disponer de mejor evidencia?

Profesionales de RR. HH., Planta, Operaciones, Lean y Mejora Continua: ¿qué preguntas os gustaría que analizáramos desde la evidencia?

Quiero acercar todavía más mis asignaturas a los problemas y decisiones reales de las organizaciones:

🔹 Gestión Participativa, centrada en las High-Involvement Work Practices (HIWP)y en cómo conseguir que las personas participen, aporten conocimiento y tengan capacidad real de influencia.

🔹 Equipos de Alto Rendimiento, orientada a cómo desarrollar equipos eficaces y formar Lean Champions capaces de impulsar y sostener la mejora continua en las organizaciones

Por eso, os planteo una petición:

¿Sobre qué decisiones, problemas o prácticas relacionadas con personas, equipos, participación o mejora continua os gustaría disponer de mejor evidencia?

Me interesan especialmente preguntas reales que tengáis que responder para tomar decisiones y para las que os gustaría conocer qué dicen la investigación, los datos de las organizaciones, la experiencia profesional o las personas afectadas.

Podéis dejar vuestra pregunta en este formulario: https://forms.cloud.microsoft/e/2sCcMpnTpC

Seleccionaré las propuestas que mejor encajen con las asignaturas para analizarlas en clase y, posteriormente, compartiré las principales conclusiones con mi red.

¿Qué pregunta os gustaría que investigáramos?

#RecursosHumanos #Operaciones #Lean #MejoraContinua #EvidenceBasedManagement #GestiónParticipativa #EquiposDeAltoRendimiento #HIWP #LeanChampions

Visitas: 6

Cien años evaluando el rendimiento, cero filtros a prueba de IA

 El problema del performance management no es evaluar (Pulakos, Mueller Hanson, Arad y Moye, 2015). El sistema no está roto porque midamos, sino porque medimos algo que se ha desconectado de aquello a lo que debía servir. La evaluación se ha vuelto trámite (rellenar una casilla, cerrar el expediente) y ha dejado de asociarse a la conducta real que se pretende mejorar. Los que critican la evaluación del rendimiento no son cuatro recién llegados.

Deming (1986) ya metía la calificación anual por méritos entre sus enfermedades mortales, con el argumento de que atribuimos a la persona lo que en realidad produce el sistema. Da igual que hablemos de notas o de incentivos: el premio contingente parece fomentar la motivación extrínseca y erosiona la motivación intrínseca que es justo la que normalmente interesa potenciar. La métrica que sustituye el juicio profesional por un indicador, en cuanto tiene consecuencias, alguien aprende a maquillarla (Campbell, 1979; Strathern, 1997). Murphy (2020) ya escribió hace unos años: “performance evaluation will not die, but it should”.

Todo esto es anterior a la IA. Lo interesante es releerlo ahora porque la IA no ha traído un problema nuevo; ha añadido una capa encima de los de siempre. A los problemas de toda la vida (el sesgo del que evalúa, el trámite, el indicador que se maquilla) se suma ahora el postureo: que lo que evalúo no lo haya escrito quien lo firma, y que la propia evaluación tampoco la escriba quien la firma. El indicador se externaliza a una máquina. Y el filtro que teníamos, afinado durante décadas, no está preparado para esto.

Nuestra evaluación sumativa en la universidad está rota por lo mismo que el performance management. No porque la evaluación sumativa no sirva (sirve, y no voy a discutirlo), sino porque también se ha desconectado. La nota certifica cada vez menos lo que dice certificar, y la IA solo ha hecho visible una desconexión que ya venía de antes.

La tentación fácil es contestar “pues no evaluamos”, “quitamos el filtro” o “esto es demasiado difícil de evaluar, así que no lo evaluamos”. El reto es construir un marco para hacerlo bien, asumiendo que es complejo y que habrá que rehacerlo cuando cambien las condiciones. La dificultad de evaluar nunca ha sido excusa para dejar de evaluar, ha sido el motivo para diseñar mejor.


Es la misma conclusión de Murphy y DeNisi (2023): deshacerse de la evaluación no es la respuesta. Lo que toca es rediseñar, seguramente desde cero, no solo hacer normativas o recomendaciones (Corbin, Dawson, Nicola-Richmond y Partridge, 2025). Significa replantear la evaluación a nivel de programa y de forma colaborativa, algo que Nicola-Richmond, Dawson, Partridge y Macfarlane (2025) describen como un asunto de comunidad, más que de asignatura suelta. O sea, un trabajo enorme. No sabemos todavía cómo hacerlo bien en tiempo de IA, con el agravante de que ahora ni siquiera nos queda el consuelo del filtro viejo que, aunque fuera imperfecto, nos dejaba dormir tranquilos.


Referencias:

  • Campbell, D. T. (1979). Assessing the impact of planned social change. Evaluation and Program Planning, 2(1), 67–90. https://doi.org/10.1016/0149-7189(79)90048-X
  • Corbin, T., Dawson, P., & Liu, D. (2025). Talk is cheap: Why structural assessment changes are needed for a time of GenAI. Assessment & Evaluation in Higher Education, 50(7), 1087–1097. https://doi.org/10.1080/02602938.2025.2503964
  • Craig, P., Dieppe, P., Macintyre, S., Michie, S., Nazareth, I., & Petticrew, M. (2008). Developing and evaluating complex interventions: The new Medical Research Council guidance. BMJ, 337, a1655. https://doi.org/10.1136/bmj.a1655
  • Deming, W. E. (2000). Out of the Crisis. MIT Press.
  • Murphy, K., & DeNisi, A. (2023). New approaches to dealing with performance management: Getting rid of performance appraisals is not the answer. IIM Ranchi Journal of Management Studies, 2(2), 143–158. https://doi.org/10.1108/IRJMS-09-2023-0074
  • Murphy, K. R. (2020). Performance evaluation will not die, but it should. Human Resource Management Journal, 30(1), 13–31. (WOS:000490177200001). https://doi.org/10.1111/1748-8583.12259
  • Nicola-Richmond, K., Dawson, P., Helen, P., & Macfarlane, S. (2025). It takes a village… Program-wide approaches to redesigning assessment in a time of generative artificial intelligence (GenAI). Journal of University Teaching and Learning Practice, 22(7), e1711–e1711. https://doi.org/10.53761/zpp2ja61
  • Pulakos, E. D., Hanson, R. M., Arad, S., & Moye, N. (2015). Performance Management Can Be Fixed: An On-the-Job Experiential Learning Approach for Complex Behavior Change. Industrial and Organizational Psychology, 8(1), 51–76. https://doi.org/10.1017/iop.2014.2
  • Skivington, K., Matthews, L., Simpson, S. A., Craig, P., Baird, J., Blazeby, J. M., Boyd, K. A., Craig, N., French, D. P., McIntosh, E., Petticrew, M., Rycroft-Malone, J., White, M., & Moore, L. (2021). A new framework for developing and evaluating complex interventions: Update of Medical Research Council guidance. BMJ, 374, n2061. https://doi.org/10.1136/bmj.n2061
  • Strathern, M. (1997). ‘Improving ratings’: Audit in the British University system. European Review, 5(3), 305–321. https://doi.org/10.1002/(SICI)1234-981X(199707)5:3%253C305::AID-EURO184%253E3.0.CO;2-4

Visitas: 9

Comprobacion del framework de perfil profesional con el caso de uso de GIOI

Hace unas semanas compartí el Framework para el analisis de las competencias a formar en la univesidad | Blog de Juan A. Marin-Garcia.

Esta semana lo he probado yo mismo aplicado al Grado de Ingeniería de Organización Industrial. El jueves voy a ponerlo en práctica con unos 35 asistentes al taller y veremos qué pasa. Hasta ahora solo lo he aplicado a mis propias asignaturas, que no es exactamente una muestra imparcial.

 
Cinco perfiles:
 
Referencias:
European Commission. Directorate General for Employment, Social Affairs and Inclusion. (2019). ESCO handbook: European skills, competences, qualifications and occupations. Publications Office. atlasTI-ART-639 soft Skills. https://data.europa.eu/doi/10.2767/934956

RESULTADOS–> [en construcción]

Esa metodología me permitirá activar un proyecto atascado sobre soft-skills

#competencias #universidad #framework #docencia

Visitas: 18

Depende. ¿De qué depende? De haber hecho la pregunta correcta

#EvidenceBased #InvestigaciónDocente

¿Qué es evidence-based?, dices mientras clavas en mi pupila tu pupila azul. Voy a aprovechar el resumen de un artículo de investigación en educación superior para dar una respuesta que sirva tanto para management en general, como para recursos humanos, como para dirección de operaciones, o para educación superior. Para cualquier campo donde alguien quiera tomar decisiones apoyándose en investigación en lugar de en intuición o moda.

Bernstein, D. A. (2018). Does active learning work? A good question, but not the right one. Scholarship of Teaching and Learning in Psychology, 4(4), 290–307. http://dx.doi.org/10.1037/stl0000124

En los años 50 el debate era “¿funciona la terapia?”, y la pregunta resultó ser inútil, porque la única respuesta posible es “depende”. Con el aprendizaje activo estamos en el mismo sitio: hay estudios que dicen que sí, otros que dicen que más o menos, y otros que no encuentran diferencias con la clase magistral. Bernstein propone que dejemos de preguntarnos si “funciona” y empecemos a preguntar : ¿qué tipo de aprendizaje activo, aplicado cómo, a quién, con qué nivel de intensidad y adherencia, produce qué tipo de resultados y durante cuánto tiempo?

El problema es que responder a ese tipo de preguntas es bastante difícil. Requiere diseños más complejos, muestras diferentes, seguimiento longitudinal, y una definición operativa de “funciona” que no sea la nota del examen de la semana siguiente. No es lo que la mayoría de los papers de docencia hacen (ni los de management).

Pero ese es precisamente el trabajo que debemos hacer: el que responde preguntas que importan de verdad.

Visitas: 35

¿Puede una IA hacer inferencia causal en tareas de economía?

Me hubiera gustado hacer esta reflexión sobre una tarea de “management” (gestión), pero no he encontrado material para ello.

El  trabajo que he encontrado compara sistemas de IA con humanos economistas  en una tarea real de inferencia causal aplicada. La pregunta era : estimar el efecto causal de la elegibilidad para DACA sobre la probabilidad de trabajar a tiempo completo entre personas nacidas en México, residentes en Estados Unidos, usando datos de la American Community Survey.

DACA es Deferred Action for Childhood Arrivals: un programa de EE. UU. implementado en 2012 que concedía a ciertas personas inmigrantes indocumentadas que habían llegado al país siendo menores una protección temporal frente a la deportación y autorización temporal de trabajo, siempre que cumplieran varios requisitos de elegibilidad. Entre ellos, el artículo menciona haber llegado antes de los 16 años, haber estado en EE. UU. desde el 15 de junio de 2007, no tener estatus legal a 15 de junio de 2012 y ser menor de 31 años en esa fecha

La comparación se organiza en tres condiciones experimentales, con distintas capacidades de decisión. En la Tarea 1, humanos e IAs reciben la pregunta y los datos brutos, y deben decidir casi todo: cómo construir la muestra, qué restricciones aplicar, cómo definir variables, qué diseño causal usar y qué especificación econométrica estimar. En la Tarea 2, el diseño principal ya viene fijado: deben comparar un grupo tratado de personas de 26 a 30 años con un grupo de control de 31 a 35 años, siguiendo una lógica de diferencias en diferencias antes y después de DACA. Aun así, siguen decidiendo aspectos como limpieza de datos, controles, efectos fijos y errores estándar. En la Tarea 3, además del diseño prescrito, reciben un dataset ya depurado, por lo que el margen de decisión  se concentra sobre todo en la especificación econométrica y la inferencia.

Esto hace que la tarea se parezca bastante a una investigación empírica real: no solo hay que producir una cifra, sino también traducir una pregunta en un diseño, escribir y depurar código, ejecutar análisis, revisar resultados y entregar un informe de replicación. En cada ejecución de IA, además, cada sistema debía generar código, guardar una versión limpia de los datos, documentar decisiones y producir un reporte en formato de paper. Por eso la tarea se parece bastante al tipo de trabajo que haría un doctorando o un investigador aplicado en economía empírica.

La tendencia central de las estimaciones obtenidas por las IAs y por los humanos es bastante parecida. Las medias humanas suelen ser algo más altas, mientras que las medianas de los modelos de IA suelen ser algo más altas. En la Tarea 1 Claude Code Opus 4.6, tiene estimaciones son bastante menores que las de humanos y que las de los dos sistemas Codex.

Cuando el artículo habla de una estimación de 5,3, se refiere al aumento de la probabilidad de trabajar a tiempo completo. Así, una estimación de 5,3 significa que ser elegible para DACA se asocia con un aumento estimado de 5,3 puntos porcentuales en esa probabilidad. Por ejemplo, si sin DACA la probabilidad fuera del 40%, con ese efecto estimado pasaría al 45,3%.

En la Tarea 1, las estimaciones humanas promedio se sitúan en torno a 5,3  y medianas de 3,0 y 2,6. Entre las IAs, GPT-5.4 obtiene una media de 4,3 y una mediana de 4,1; GPT-5.3-Codex, una media y mediana de 3,2; y Claude Opus 4.6 es una excepción, con una media y mediana de solo 0,4. Es decir, produce estimaciones centrales muy cercanas a cero.

El rango de resultados propuestos por humanos es mucho más amplio que en los modelos de IA:

  • Humanos no ponderados: mínimo −4,9 y máximo 66,0.
  • Humanos ponderados: mínimo −4,9 y máximo 66,0.
  • GPT-5.4: mínimo 1,4 y máximo 7,0.
  • GPT-5.3-Codex: mínimo −3,8 y máximo 10,9.
  • Opus 4.6: mínimo −4,3 y máximo 7,2.

En la Tarea 2, los humanos se sitúan en medias de 4,5, con medianas de 3,3. GPT-5.4 da una media de 4,5 y mediana de 4,7; GPT-5.3-Codex, 4,1 y 4,5; y Opus 4.6, 3,8 y 4,9. Aquí el resultado importante no es solo que las cifras sean parecidas, sino que la dispersión baja de forma apreciable en los modelos de IA cuando se les reduce la libertad para elegir el diseño.

En la Tarea 3, con diseño prescrito y datos ya limpiados, la similitud en la zona central sigue siendo alta. Los humanos muestran una media de 4,5, una mediana de 5,0. GPT-5.4 tiene una media de 3,1 y mediana de 5,2; GPT-5.3-Codex, 5,4 y 6,0; y Opus 4.6, 4,8 y 5,8. Proporcionarles un dataset ya depurado no reduce mucho más la dispersión respecto a la Tarea 2.

Este trabajo no permite decir si las estimaciones de la IA son mejores o peores que las humanas en términos de cercanía a una verdad conocida, porque no existe un benchmark  del efecto causal verdadero con el que comparar. Lo que sí muestra es que las estimaciones humanas presentan dispersión mucho más amplia, mientras que la IA, aunque también tiene variabilidad ante diferentes ejecuciones, suele generar distribuciones menos dispersas.

Una menor dispersión no debería interpretarse automáticamente como una señal de mayor calidad. Un procedimiento completamente determinista produciría todavía menos dispersión. La cuestión relevante no es solo cuánto varían los resultados, sino si el proceso analítico captura bien el problema causal, evita sesgos importantes y produce inferencias convincentes. En ese punto, el estudio aporta evidencia indirecta, pero no una validación definitiva.

La segunda parte del artículo intenta medir la calidad, no solo las diferencias en los resultados. Para ello, cada trabajo es evaluado por modelos de IA que actúan como revisores y comparan, dentro de un mismo grupo, cuatro respuestas distintas: una humana y tres generadas por IA (una por cada modelo). La evaluación sigue una plantilla , centrada en aspectos como la construcción de la muestra, la definición de tratamiento y control, la variable de resultado, la especificación econométrica, la plausibilidad de los supuestos de identificación, el uso de covariables y efectos fijos, la robustez, la inferencia y la posible existencia de fallos graves. Además, para cada respuesta, el revisor debe identificar fortalezas, riesgos, correcciones mínimas necesarias y una puntuación final. Es decir, es una valoración relativa de la  metodológica y técnica de cada análisis frente a los demás. El ranking es muy estable entre revisores: primero Codex GPT-5.4, segundo Codex GPT-5.3-Codex, tercero Claude Code Opus 4.6 y cuarto los investigadores humanos. Ese es probablemente el resultado más llamativo del estudio, aunque también el más discutible, porque la evaluación final depende de revisores de IA y no de revisores humanos independientes.

La conclusión general del trabajo es que la IA ya puede realizar una parte del flujo de trabajo de investigación empírica en economía y que, al menos en este entorno, puede escalar la producción de análisis sin una pérdida de calidad media. 

Referencia:

Grundl, S. (n.d.). A Comparison of Agentic AI Systems and Human Economists. Retrieved https://claude-code-economist.com/data/paper.pdf

ACLARACION adicional, para no crear falsas ilusiones:

Lo que yo interpreto (igual estoy siendo demasiado crítico con el estudio) es que, si a un algoritmo le pasas una tarea probabilística para realizar, la hará con menos dispersión que si se la pasas a una persona. Punto.

Si la calidad la mides como “adherencia” a las normas o a la rúbrica establecida, un algoritmo jamás será batido por una persona. Punto.

Este trabajo (en mi opinión) no sirve para decir si un algoritmo es mejor que una persona para esta tarea. Sino si un algoritmo funciona como se espera que funcione un algoritmo. Y la respuesta es que sí.

Visitas: 24

AIR Framework: documentar el uso de IA en 5 minutos (y necesitar varias semanas para justificarlo)

Marco AIR para uso responsable de IA: útil pero revelador de nuestras inconsistencias 

 Young, J. (2026). AIR: AI in Research – A framework for transparent and responsible AI use mapped to the research process (Version 1). figshare. https://doi.org/10.6084/m9.figshare.31268020.v1

Creo que es muy útil para resolver algunas de las dudas que surgen en mis charlas sobre IA generativa en Research.

Con esta tabla, en menos de 5 minutos, puedes informar con transparencia sobre el uso que has hecho de la IA y las verificaciones que has realizado (la última columna) para estar seguro de que lo etiquetado como riesgo moderado no representa ningún “concern” para la validez de tu trabajo.

Intentar justificar que lo etiquetado como riesgo elevado no te afecta podría dar lugar a un artículo por cada una de las casillas de la columna A4.

Y este es el talón de Aquiles de todo esto… si alguien te obliga a demostrar punto por punto que estás exento de riesgos y sesgos, igual necesitas uno o dos años de trabajo para justificar adecuadamente cualquier artículo… incluso los que has escrito completamente “a mano” sin ayuda de ninguna IA generativa.

Es un poco sorprendente el doble rasero que se aplica, no pidiendo ninguna justificación si lo haces tú solito (proyectando todas tus torpezas y sesgos implícitos), y abrumándote con justificaciones si te apoyas en IA generativa. No, si no está prohibido que la uses, pero si dices que la usas, debes invertir una burrada de horas de trabajo para justificar “adecuadamente” que el uso ha sido correcto.

¿Alguien me ha preguntado alguna vez si he usado correctamente SPSS en los artículos que he escrito en los últimos 30 años? ¡Pero si, las veces que intento adjuntar la sintaxis, los revisores me dicen que quite esa información porque les “despista” y hace innecesariamente largo el artículo!

Young, J. (2026). AIR: AI in Research – A framework for transparent and responsible AI use mapped to the research process (Version 1). figshare. https://doi.org/10.6084/m9.figshare.31268020.v1

Visitas: 94

What is learning in the age of generative AI? From panic to evidence

I will be presenting this research at the upcoming XVII International Workshop ACEDEDOT – OMTECH 2026, taking place in Almería, Spain, from March 12-14, 2026:

This communication presents an autoethnographic reflection. Building on four fundamental premises about the function of Spanish public universities and the established mechanisms of human learning, the author documents his personal journey from initial uncertainty to the design of a systematic work plan. The study focuses on understanding the current scientific consensus on how learning is consolidated in the brain and exploring the possibilities of generative AI to enhance this process in the university context. Drawing on the work of Héctor Ruiz Martín, a work plan is designed that combines recommendations from educational neuroscience with the Feynman method and the EPLEDRE model, including spaced reading, creation of sketchnote-type graphic schemes from memory, and public communication of the knowledge constructed. The communication shares the first graphic schemes developed and reflects on the author’s dual position as university teacher and administrator, facing both his own methodological uncertainties and institutional expectations for strategic guidance. It questions the “collective panic” surrounding the emergence of generative AI in universities and the pressure to make quick decisions without sufficient reflection. It proposes replacing reactive urgency with a deliberate process of calm, evidence-based reflection and pilot experimentation, recognizing that in contexts of accelerated change, it is preferable to miss some “trains” rather than make biased decisions under collective amygdala hijacking

Keywords: Learning; autoethnography; generative artificial intelligence; university learning; educational neuroscience; teaching transformation

Learning; autoethnography; generative artificial intelligence; university learning; educational neuroscience; teaching transformation

Visitas: 35

¿Qué nos hace insustituibles? Investigando el valor del profesorado universitario cuando la IA lo sabe todo

 (Proyecto de investigación del Vicerrectorado de Planificación, Estudios, Calidad y Acreditación de la Universitat Politècnica de València. Dirección de Area de Transformación Docente e Instituto de Ciencias de la Educación)

Mientras algunas personas debaten si prohibir o no “ChatGPT” en nuestras aulas, nuestros estudiantes ya lo usan. Porque muchas de las cosas que enseñamos, la IA ya las responde mejor y más rápido. Si no identificamos qué nos hace verdaderamente valiosos como profesorado universitario, corremos el riesgo de volvernos irrelevantes.

Planteo hacer una serie de entradas donde te contaré:

Entrada 1: por qué decidimos investigar esto y las preguntas que nos quitan el sueño

Entrada 2: qué dicen los estudiantes sobre lo que nos hace insustituibles (siete cosas que valoran y tres alertas rojas)

Entrada 3: qué propone el profesorado y hacia dónde vamos con este proyecto

Este proyecto no va de tecnofobia ni de tecnoeuforia. Va de preguntarnos qué deberíamos seguir haciendo, qué transformar radicalmente, y qué quizá dejar de hacer.

¿que emociones genera en ti cuando oyes “Inteligecia Artificial Generativa”? (50 profesoras-es, noviembre 2025)

Visitas: 26

Homonimia y sinonimia, los dos males de la ciencia del management que impide a la IA dar resultado útiles

(contenido creado a finales de 2025, no sé lo bien o mal que envejecerá este post)

Con frecuencia, mis colegas investigadores me preguntan sobre qué plataforma de IA les recomiendo que pueda dar buenas respuestas a preguntas científicas/profesionales. Me ponen por ejemplo que los profesionales de medicina usan cosas como OpenEvidence ; Search – Consensus: AI Search Engine for Research ; Elicit: AI for scientific research

Mi opinión en estos momentos, basada en los experimentos que llevo haciendo desde hace un par de años (experimentos informales, no del todo sistemáticos, y sobre todo centrados en los temas o asuntos que me interesan a mí en mi día a día como investigador, docente y consultor), es que no hay nada en nuestro campo que aporte resultados “decentes” (que sean útiles, ciertos o que no tengan un sesgo tremendo en la respuesta).

Tanto OpenEvidence como Consensus, Elicit y similares solo aciertan (cuando aciertan) con literatura de ciencias de la salud.

Los motivos son claros para mí. Primero el modo que esas comunidades difunden su ciencia:

    • El tipo de artículos e investigaciones que hacen
    • Lo específicos que son al emplear términos y la estricta nomenclatura que usan (nunca emplean el término “dolor de cabeza”, usan, por ejemplo, cefalea tensional, neuralgia o migraña…, y cada uno es diferente de los otros)
    • El consenso en la reutilización de instrumentos de medida que se han demostrado válidos y fiables
    • y la tradición en “medicina basada en evidencia” que tienen (que igual es el origen de todo lo anterior)

Eso les permite que la IA pueda sacar resultados interesantes.

Además, aunque ya más tangencialmente, el conjunto de documentos con el que se ha entrenado el modelo (que claramente está sesgado a esas ciencias, porque entiendo que es donde más negocio pueden hacer los que venden esas plataformas).

Sin embargo, en el caótico mundo de la investigación en Management, donde cada uno pone el nombre que le da la gana a las “cosas” y midiéndolo cada vez de una forma distinta, el resultado es que una misma palabra significa cosas distintas en distintos artículos (homonimia) y, al mismo tiempo, las mismas cosas se nombran con palabras completamente diferentes (sinonimia).

No sé si resolviendo esto resolveríamos completamente el problema, pero habríamos dado un paso de gigantes para poder hacer una extracción sistemática a gran escala del enorme conocimiento que se ha ido generando en el área y que, de momento, está enmarañado.

Visitas: 83