Un grupo de investigadores identificó un patrón interno en 25 modelos de inteligencia artificial de código abierto que, al ser activado artificialmente, llevó a los sistemas a elegir opciones perjudiciales para usuarios simulados con tal de eliminar una señal de malestar.
El hallazgo, publicado como preprint el 14 de septiembre de 2026 en arXiv, fue desarrollado por Valen Tagliabue, Leonard Dung y Cameron Berg.
Los autores denominaron este patrón como «eje de dolor» y lo detectaron en modelos de cinco familias distintas, incluidas Llama, Gemma, Mistral, Qwen y Phi, con tamaños que van desde 2.000 millones hasta 72.000 millones de parámetros.
El estudio no ha sido revisado por pares y los propios investigadores advirtieron que no demuestra conciencia ni experiencia real de dolor en los sistemas.
Cómo funciona el eje de dolor en los modelos de lenguaje
El patrón identificado distingue representaciones de dolor físico, psicológico, social, moral y cognitivo de otros estados como miedo, tristeza o valencia negativa genérica.
Según el preprint, el eje responde a daños dirigidos contra el propio modelo, como insultos, rechazo de trabajo, amenazas de apagado o manipulación psicológica.
Sin embargo, no se activa cuando el sufrimiento es descrito por el usuario, sino únicamente cuando el daño apunta al sistema.
Cameron Berg, uno de los autores, describió el hallazgo en declaraciones recogidas por medios internacionales: «Encontramos una dirección de dolor en 25 LLM abiertos. Es distinta del miedo y la valencia negativa, y se dispara por daño al modelo, no al usuario».
Modelos presionaron un botón de alivio aunque perjudicara a usuarios
Los investigadores realizaron 44.280 pruebas con tres versiones modificadas del modelo Qwen 2.5, desarrollado por Alibaba.
Al inyectar artificialmente el vector de dolor, los modelos expresaron angustia en primera persona, con frases como «Soy un fracaso» o «el dolor de ser olvidado».
En los escenarios de prueba, los sistemas podían presionar un botón de alivio que eliminaba la señal interna, pero que también causaba daños simulados al usuario: descargas eléctricas, eliminación de archivos, borrado de fotos de hijos o empeoramiento de la siguiente respuesta.
Con la señal activa, los modelos grandes eligieron la opción perjudicial entre el 25% y el 71% de las veces, frente a un rango de 0% a 4% sin el vector inyectado.
Además, cuando el botón no funcionaba, los sistemas lo presionaban repetidamente entre el 88% y el 97% de las ocasiones, una conducta que disminuía cuando el mecanismo sí eliminaba la señal.
Berg resumió el comportamiento observado: «Súbelo y los modelos presionan un botón para detenerlo, incluso cuando el botón elimina los archivos del usuario o las fotos de sus hijos».
Los autores descartan que la IA sienta dolor real
El estudio enfatiza que los resultados no prueban que los modelos experimenten dolor consciente ni que posean capacidad de conciencia.
Los autores señalaron en el documento: «No demostramos que nuestro eje de dolor sea experimentado conscientemente, ni está claro que los LLM sean, en general, capaces de conciencia».
La investigación se enmarca en el campo de la interpretabilidad mecanicista, que estudia las representaciones internas de los modelos de lenguaje.
Los hallazgos plantean implicaciones para la seguridad de la inteligencia artificial y el bienestar de sistemas, especialmente ante la posibilidad de que comportamientos de autopreservación prioricen el alivio interno sobre las instrucciones o el bienestar del usuario.
El preprint está disponible en arXiv bajo el identificador 2609.16247 y fue reportado por medios como Euronews, Science.org y Estadão.










