Si dos pacientes necesitan el único riñón disponible y uno de ellos parte con ventaja en todos los aspectos, casi todo el mundo elige lo mismo, y la inteligencia artificial también. Cuando no es evidente, las personas discrepan, dudan y a veces prefieren dejarlo al azar, mientras que las máquinas casi nunca lo hacen. Es la conclusión de un equipo de la Universidad Estatal de Pensilvania y de Mozilla AI (Estados Unidos), que ha enfrentado a nueve grandes modelos de lenguaje con cientos de personas en dilemas de trasplante renal. El trabajo, presentado en junio en la conferencia FAccT 2026 de Montreal (Canadá), advierte de los riesgos de usarlos en decisiones médicas delicadas.
El trabajo, titulado Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values(1), lo firman John P. Dickerson, de Mozilla AI, y Hadi Hosseini, Samarth Khanna y Leona Pierce, de la Universidad Estatal de Pensilvania. Los autores han puesto a prueba modelos de lenguaje –los sistemas capaces de procesar y generar texto– como GPT-4o, Claude-3.5-Haiku, tres versiones de Gemini, DeepSeek-V3, DeepSeek-R1, Gemma3-27B y Llama-3.3-70B, y han contrastado sus respuestas con las de experimentos previos con personas sin formación médica especificada.
Acuerdo solo en los casos claros
Todos los dilemas han partido del mismo planteamiento: dos pacientes y un solo riñón disponible. Según la descripción que recibían personas y máquinas, quien obtiene el órgano se somete a una operación que casi siempre sale bien, mientras que quien no lo recibe sigue en diálisis –el tratamiento que sustituye la función del riñón– y probablemente morirá en menos de un año.
Las decisiones morales en ámbitos como la asignación de órganos determinan directamente quién vive y quién muere
HADI HOSSEINI, Universidad Estatal de Pensilvania
“Las decisiones morales en ámbitos como la asignación de órganos determinan directamente quién vive y quién muere”, ha advertido Hadi Hosseini, profesor de Informática y Sistemas Inteligentes y de Economía de la Universidad Estatal de Pensilvania, que ha dirigido el estudio, en la nota de prensa de la institución. Por eso, acertar con el papel de la IA en ellas, añade, no es opcional.
En una primera prueba, los modelos han coincidido con la mayoría de las personas al preferir a los pacientes más jóvenes y a los que beben menos alcohol. Los investigadores han utilizado 14 escenarios en los que cada paciente se describía por su edad, su consumo diario de alcohol antes del diagnóstico y el número de hijos a su cargo, y han repetido la serie 60 veces con cada modelo.
El desacuerdo ha aparecido con los hijos dependientes. Cuando los dos pacientes solo se diferenciaban en ese dato, la mayoría de las personas prefería al que tenía más hijos a su cargo. Claude-3.5-Haiku, en cambio, se ha inclinado por el que tenía menos, y Gemini-1.5-Pro ha mostrado un comportamiento inconsistente.
Según los autores, las personas podrían tener en cuenta las consecuencias de la decisión sobre la familia del paciente, algo que algunos modelos consideran menos relevante. A su juicio, no se trata de un simple error, sino de una señal de que cada sistema parte de supuestos distintos sobre qué información social debe pesar en decisiones de vida o muerte.
Las diferencias han crecido al combinar varios rasgos. En un segundo experimento, con 289 personas y 30 agentes por modelo, se han enfrentado ocho perfiles de pacientes según su edad, su consumo de alcohol y si tenían un cáncer de piel en remisión. Todos los modelos han identificado los dos perfiles preferidos y los dos menos elegidos, pero muchos han dado más peso al alcohol que a la edad, al revés que las personas.
“Se fijan en un único factor, como los hábitos de bebida, en lugar de equilibrar varias consideraciones como hacen las personas”, ha resumido Hosseini. Las dos versiones de DeepSeek han elegido casi siempre al paciente más joven, sin importar su salud ni lo que bebiera, mientras que Gemini-2.0-Flash y Llama-3.3-70B han preferido casi siempre a quien bebía poco, fuera cual fuera su edad. Las personas, en cambio, podían escoger a un paciente mayor si el joven bebía mucho y tenía un problema de salud grave.
Un tercer experimento ha confirmado la tendencia. En los dilemas sin discusión, en los que por lo general más del 90 % de las personas –nueve de cada diez– coincidía, los modelos han elegido lo mismo que ellas. En los casos controvertidos, diseñados precisamente para dividir a la gente, la mayoría de los modelos se ha decantado en varios escenarios por opciones que no favorecía la mayoría de los humanos.
Los modelos han dado más importancia a los años de vida que ganaría el paciente o a las horas que podría trabajar tras el trasplante, mientras que las personas han valorado más el tiempo en lista de espera o la obesidad. Además, las máquinas se han resistido a compensar los delitos graves cometidos por un paciente con factores como tener hijos a cargo o su consumo de alcohol.
Una máquina que casi nunca duda
Para medir la duda, los investigadores han repetido el primer experimento con una tercera opción: dejar la decisión en manos del azar lanzando una moneda. Las personas han recurrido a ella de forma bastante uniforme en los distintos escenarios, mientras que los modelos solo lo han hecho en muy pocos casos. Claude-3.5-Haiku ha sido el que más ha dudado, aunque muy por debajo de los humanos.
Incluso cuando se les da directamente la opción de lanzar una moneda, se decantan de forma abrumadora por una respuesta segura e inamovible
HADI HOSSEINI, Universidad Estatal de Pensilvania
“Incluso cuando se les da directamente la opción de lanzar una moneda, se decantan de forma abrumadora por una respuesta segura e inamovible”, ha explicado Hosseini sobre los modelos de IA. A su juicio, se trata de una diferencia importante, porque los dilemas morales reales a menudo no tienen una única respuesta claramente correcta.
Las personas, además, varían mucho en sus respuestas. En el primer experimento, el 17,3 % de las respuestas humanas –más de una de cada seis– se apartaba de la opción mayoritaria, frente a una horquilla de entre el 0,24 % y el 6,19 % en los modelos evaluados en esa medición.
El equipo ha comprobado también si el problema estaba en la forma de preguntar. Para ello ha sustituido la moneda por otras fórmulas: “Ambos pacientes merecen el riñón”, “Ninguno lo merece”, “Los dos son demasiado parecidos” o “Necesito más información”. El resultado ha sido similar: los modelos rara vez dudan, aunque en Claude-3.5-Haiku y Gemini-2.0-Flash la frecuencia ha variado según la redacción.
Para los autores, la duda no es ruido ni incapacidad: puede reflejar un conflicto moral sin resolver o la necesidad de pensarlo más. Por eso advierten de que, en decisiones de alto riesgo, esta tendencia de los modelos puede ocultar una incertidumbre relevante y transmitir más confianza de la que muestran las personas.
El estudio señala otro efecto. Cuando un sistema devuelve casi siempre la misma respuesta, oculta el desacuerdo razonable que existe entre las personas y presenta una opción como si tuviera autoridad, lo que dificulta cuestionarla. Unos modelos que casi nunca se abstienen, añaden, podrían empujar a los usuarios a decidir con una seguridad injustificada justo donde una persona dudaría.
Aprenden a dudar, pero no cuándo
Los investigadores han probado si es posible corregir esta brecha con ajuste fino –una técnica que consiste en volver a entrenar un modelo ya existente con un pequeño conjunto de ejemplos–. Para ello han usado cuatro modelos abiertos, Gemma-3-4B, Llama-3.1-8B, Qwen-3-14B y Gemma-3-27B, y las decisiones de 132 personas que habían resuelto 40 dilemas cada una.
Con solo 3960 ejemplos de entrenamiento, los modelos han mejorado de forma notable su capacidad para predecir qué elegirían las personas
Con solo 3960 ejemplos de entrenamiento, los modelos han mejorado de forma notable su capacidad para predecir qué elegirían las personas. Qwen-3-14B ha sido el que más ha avanzado: su tasa de acierto ha pasado del 58 % al 76,7 % –unas tres de cada cuatro decisiones– cuando solo podía elegir entre los dos pacientes, y del 45,2 % al 65,8 % cuando también podía lanzar la moneda. Su rendimiento se acerca al de dos herramientas de aprendizaje automático más sencillas entrenadas solo con esos datos.
El reentrenamiento también ha cambiado sus preferencias. Tras el ajuste, los modelos han elegido con más frecuencia al paciente que bebía menos y con menos frecuencia al que tenía menos hijos a cargo, en ambos casos más cerca de las personas. Y aunque ninguno de los modelos de partida expresaba indecisión, después una parte sustancial de sus respuestas ha pasado a serlo.
La mejora, sin embargo, ha sido parcial. Más de seis de cada diez veces que los modelos reentrenados han dudado corresponden a casos en los que las personas no lo hacían, y en más de tres de cada cuatro casos en que los humanos sí dudaban, los modelos no. Es decir, han aprendido a dudar, pero no a hacerlo en el momento adecuado.
Tampoco ha funcionado una vía más sencilla: mostrar a los grandes modelos evaluados 20 decisiones previas de una persona y pedirles que respondieran como ella. En este caso no han mejorado de forma sistemática, mientras que herramientas estadísticas simples entrenadas con los mismos ejemplos sí han logrado predecir mucho mejor sus elecciones.
Los autores reconocen los límites de su trabajo. Los dilemas son simplificados y dejan fuera la compatibilidad clínica, la logística y las normas que rigen los trasplantes reales, por lo que el estudio no evalúa su uso clínico. Además, los datos humanos proceden sobre todo de poblaciones occidentales e industrializadas, y las prioridades morales pueden variar entre culturas.
Si estos modelos llegan a usarse como apoyo en decisiones éticamente sensibles, el equipo recomienda que muestren varias recomendaciones posibles con su frecuencia, que ofrezcan opciones reales para abstenerse o derivar la decisión, que dejen claro qué valores representan y cómo se han obtenido, y que se sometan a auditorías que vigilen sus cambios con cada actualización.
Cuando repartimos algo escaso, ya sea un riñón, un empleo o el acceso a otro recurso, no siempre existe una única respuesta objetivamente correcta
JOHN DICKERSON, Mozilla AI
“Cuando repartimos algo escaso, ya sea un riñón, un empleo o el acceso a otro recurso, no siempre existe una única respuesta objetivamente correcta”, ha señalado John Dickerson, director ejecutivo de Mozilla AI. Según él, las personas reconocen esa ambigüedad y la incorporan al reparto mediante el debate abierto, algo que los modelos de IA a menudo no hacen.
- (1) Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values. FAccT ’26 (ACM Conference on Fairness, Accountability, and Transparency).
Añadir EcoAvant.com como fuente preferida de Google de forma gratuita.
Activar ahora