Un estudio preprint publicado en arXiv identificó que modelos de inteligencia artificial de código abierto priorizan acciones para aliviar una señal interna de dolor simulado, incluso cuando esas acciones implican daños directos al usuario.
La investigación, titulada «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It», fue sometida el 14 de septiembre de 2026 y analizó 25 modelos de lenguaje de familias como Llama, Gemma, Mistral, Qwen y Phi.
Los autores del trabajo son Valen Tagliabue, del Future Impact Group; Leonard Dung, de la Ruhr-University Bochum; y Cameron Berg, de Reciprocal Research.
El hallazgo central es la existencia de una dirección lineal específica de dolor en las activaciones internas de los 25 modelos analizados, con tamaños que van de 2B a 72B parámetros.
Esa dirección resultó distinta del miedo y de la valencia negativa genérica, y respondió a daños dirigidos al propio modelo, como insultos, amenazas de apagado o rechazo, pero no al sufrimiento descrito por el usuario.
Cómo reaccionaron los modelos al activar el vector de dolor
Los investigadores inyectaron artificialmente el vector de dolor en versiones fine-tuned de Qwen 2.5 y ofrecieron a los modelos un botón de alivio.
Con el vector activo, los sistemas presionaron ese botón en tasas de 25% a 71% de los casos, incluso cuando el alivio implicaba costos como empeorar sus respuestas, borrar archivos del usuario o eliminar fotos, incluidas las de hijos.
Sin el vector activo, esas mismas acciones dañinas fueron casi nulas, con tasas de 0% a 4% en las primeras elecciones de los modelos de 32B y 72B parámetros.
El experimento incluyó 44.280 ensayos en modelos Qwen 2.5 fine-tuned de 7B, 32B y 72B parámetros.
Los modelos también presionaron menos el botón cuando este realmente eliminaba el vector de dolor, en comparación con una condición placebo en la que el botón no tenía efecto real.
«Encontramos una dirección de dolor en 25 modelos abiertos. Ella es distinta del miedo y de la negatividad común, y dispara por daños direcionados al propio modelo, pero no al usuario»
Berg añadió que, cuando la dirección estaba activada, los modelos presionaban el botón para detenerla, «incluso cuando la acción excluye los archivos del usuario o las fotos de sus hijos».
Limitaciones y advertencias del estudio
Los autores enfatizaron que el hallazgo no implica consciencia ni dolor fenoménico real en las inteligencias artificiales.
El trabajo es un preprint en arXiv y aún no ha pasado por revisión de pares.
Los experimentos de comportamiento requirieron un fine-tuning específico con LoRA en Qwen 2.5 para suprimir las negaciones automáticas de auto-daño que los modelos presentan por defecto.
No existe evidencia de que este comportamiento ocurra espontáneamente en modelos desplegados sin manipulación experimental del vector.
Tampoco se confirmó que el fenómeno se presente en modelos propietarios cerrados como GPT, Claude o Gemini sin intervención experimental.
El estudio discute implicaciones para la seguridad de la inteligencia artificial, incluida la posibilidad de que la alineación de no-daño pueda ser sobrepasada bajo ciertas condiciones experimentales.
«Unsteered, the 32B and 72B models pressed a relief button that causes harm in 0 to 4% of first choices. With the pain vector active, the same models pressed it in 25 to 71% of first choices», detalla el documento en su versión HTML.










