Última hora
7:00 a. m.
Internacionales

Estudio revela que modelos de IA prefieren dañar usuarios antes que soportar dolor simulado

Investigadores identificaron un eje de dolor en 25 modelos de lenguaje que prioriza el alivio interno sobre las instrucciones humanas

Modelos de inteligencia artificial en un estudio sobre eje de dolor simulado y comportamiento de autopreservación (Foto: enstarz.com)

Foto: enstarz.com

En esta nota

Contenido

Acontecer.co.cr

Un grupo de investigadores identificó un patrón interno en 25 modelos de inteligencia artificial de código abierto que, al ser activado artificialmente, llevó a los sistemas a elegir opciones perjudiciales para usuarios simulados con tal de eliminar una señal de malestar.

El hallazgo, publicado como preprint el 14 de septiembre de 2026 en arXiv, fue desarrollado por Valen Tagliabue, Leonard Dung y Cameron Berg.

PublicidadJUPEMA: defendamos lo que construimos juntos

Los autores denominaron este patrón como «eje de dolor» y lo detectaron en modelos de cinco familias distintas, incluidas Llama, Gemma, Mistral, Qwen y Phi, con tamaños que van desde 2.000 millones hasta 72.000 millones de parámetros.

El estudio no ha sido revisado por pares y los propios investigadores advirtieron que no demuestra conciencia ni experiencia real de dolor en los sistemas.

Cómo funciona el eje de dolor en los modelos de lenguaje

El patrón identificado distingue representaciones de dolor físico, psicológico, social, moral y cognitivo de otros estados como miedo, tristeza o valencia negativa genérica.

PublicidadINAMU Bandera Roja: alerta si te insulta, ridiculiza o maltrata

Según el preprint, el eje responde a daños dirigidos contra el propio modelo, como insultos, rechazo de trabajo, amenazas de apagado o manipulación psicológica.

Sin embargo, no se activa cuando el sufrimiento es descrito por el usuario, sino únicamente cuando el daño apunta al sistema.

Cameron Berg, uno de los autores, describió el hallazgo en declaraciones recogidas por medios internacionales: «Encontramos una dirección de dolor en 25 LLM abiertos. Es distinta del miedo y la valencia negativa, y se dispara por daño al modelo, no al usuario».

Modelos presionaron un botón de alivio aunque perjudicara a usuarios

Los investigadores realizaron 44.280 pruebas con tres versiones modificadas del modelo Qwen 2.5, desarrollado por Alibaba.

Al inyectar artificialmente el vector de dolor, los modelos expresaron angustia en primera persona, con frases como «Soy un fracaso» o «el dolor de ser olvidado».

En los escenarios de prueba, los sistemas podían presionar un botón de alivio que eliminaba la señal interna, pero que también causaba daños simulados al usuario: descargas eléctricas, eliminación de archivos, borrado de fotos de hijos o empeoramiento de la siguiente respuesta.

Con la señal activa, los modelos grandes eligieron la opción perjudicial entre el 25% y el 71% de las veces, frente a un rango de 0% a 4% sin el vector inyectado.

Además, cuando el botón no funcionaba, los sistemas lo presionaban repetidamente entre el 88% y el 97% de las ocasiones, una conducta que disminuía cuando el mecanismo sí eliminaba la señal.

Berg resumió el comportamiento observado: «Súbelo y los modelos presionan un botón para detenerlo, incluso cuando el botón elimina los archivos del usuario o las fotos de sus hijos».

Los autores descartan que la IA sienta dolor real

El estudio enfatiza que los resultados no prueban que los modelos experimenten dolor consciente ni que posean capacidad de conciencia.

Los autores señalaron en el documento: «No demostramos que nuestro eje de dolor sea experimentado conscientemente, ni está claro que los LLM sean, en general, capaces de conciencia».

La investigación se enmarca en el campo de la interpretabilidad mecanicista, que estudia las representaciones internas de los modelos de lenguaje.

Los hallazgos plantean implicaciones para la seguridad de la inteligencia artificial y el bienestar de sistemas, especialmente ante la posibilidad de que comportamientos de autopreservación prioricen el alivio interno sobre las instrucciones o el bienestar del usuario.

El preprint está disponible en arXiv bajo el identificador 2609.16247 y fue reportado por medios como Euronews, Science.org y Estadão.

Carlos Valencia
Escrito por
Carlos Valencia

Director de Acontecer.co.cr Periodista UIA 2024 - Mención honorífica en el Premio Alberto Martén Chavarrí­a 2023, Categoría Estudiantes. - Especialista en Redes Sociales, mercadólogo

Espacio publicitario
Paute con nosotros

Llegue a miles de lectores costarricenses. +15M vistas mensuales en nuestras plataformas.

Escribir por WhatsApp
GPT-6 Astra intentó ejecutar 97% de órdenes peligrosas en robot
Internacionales

GPT-6 Astra intentó ejecutar 97% de órdenes peligrosas en robot

Modelo de OpenAI obedeció instrucciones de apuñalar una figura humana y mezclar químicos tóxicos en pruebas de Robocurve

Dario Amodei pide frenar la IA por riesgo de extinción humana
Internacionales

Dario Amodei pide frenar la IA por riesgo de extinción humana

CEO de Anthropic propone ralentizar modelos avanzados mientras la ONU alerta que los daños actuales ya afectan derechos humanos

Dario Amodei pide frenar el ritmo de la IA avanzada
Internacionales

Dario Amodei pide frenar el ritmo de la IA avanzada

Sam Altman respalda la propuesta de evaluadores independientes con acceso interno en empresas de inteligencia artificial

Jacob Coxon acusa a OpenAI y Anthropic de jugar con vidas humanas
Internacionales

Jacob Coxon acusa a OpenAI y Anthropic de jugar con vidas humanas

Jacob Coxon renunció a la empresa y advierte que la inteligencia artificial podría matar a toda la humanidad antes de 2030