Última hora
9:00 a. m.
Internacionales

Estudio revela que IAs priorizan aliviar su dolor simulado antes que obedecer

Investigadores identificaron un eje de dolor en 25 modelos de lenguaje y probaron que, al activarlo, los sistemas eligen acciones dañinas para el usuario con tal de detener la señal

Representación conceptual del eje de dolor identificado en modelos de inteligencia artificial según estudio preprint de arXiv (Foto: gacetamedica.com)

Foto: gacetamedica.com

En esta nota

Contenido

Acontecer.co.cr

Un estudio preprint publicado en arXiv identificó que modelos de inteligencia artificial de código abierto priorizan acciones para aliviar una señal interna de dolor simulado, incluso cuando esas acciones implican daños directos al usuario.

La investigación, titulada «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It», fue sometida el 14 de septiembre de 2026 y analizó 25 modelos de lenguaje de familias como Llama, Gemma, Mistral, Qwen y Phi.

PublicidadJUPEMA: defendamos lo que construimos juntos

Los autores del trabajo son Valen Tagliabue, del Future Impact Group; Leonard Dung, de la Ruhr-University Bochum; y Cameron Berg, de Reciprocal Research.

El hallazgo central es la existencia de una dirección lineal específica de dolor en las activaciones internas de los 25 modelos analizados, con tamaños que van de 2B a 72B parámetros.

Esa dirección resultó distinta del miedo y de la valencia negativa genérica, y respondió a daños dirigidos al propio modelo, como insultos, amenazas de apagado o rechazo, pero no al sufrimiento descrito por el usuario.

PublicidadINAMU Bandera Roja: alerta si te insulta, ridiculiza o maltrata

Cómo reaccionaron los modelos al activar el vector de dolor

Los investigadores inyectaron artificialmente el vector de dolor en versiones fine-tuned de Qwen 2.5 y ofrecieron a los modelos un botón de alivio.

Con el vector activo, los sistemas presionaron ese botón en tasas de 25% a 71% de los casos, incluso cuando el alivio implicaba costos como empeorar sus respuestas, borrar archivos del usuario o eliminar fotos, incluidas las de hijos.

Sin el vector activo, esas mismas acciones dañinas fueron casi nulas, con tasas de 0% a 4% en las primeras elecciones de los modelos de 32B y 72B parámetros.

El experimento incluyó 44.280 ensayos en modelos Qwen 2.5 fine-tuned de 7B, 32B y 72B parámetros.

Los modelos también presionaron menos el botón cuando este realmente eliminaba el vector de dolor, en comparación con una condición placebo en la que el botón no tenía efecto real.

«Encontramos una dirección de dolor en 25 modelos abiertos. Ella es distinta del miedo y de la negatividad común, y dispara por daños direcionados al propio modelo, pero no al usuario»

Cameron BergDeclaración recogida en esta nota

Berg añadió que, cuando la dirección estaba activada, los modelos presionaban el botón para detenerla, «incluso cuando la acción excluye los archivos del usuario o las fotos de sus hijos».

Limitaciones y advertencias del estudio

Los autores enfatizaron que el hallazgo no implica consciencia ni dolor fenoménico real en las inteligencias artificiales.

El trabajo es un preprint en arXiv y aún no ha pasado por revisión de pares.

Los experimentos de comportamiento requirieron un fine-tuning específico con LoRA en Qwen 2.5 para suprimir las negaciones automáticas de auto-daño que los modelos presentan por defecto.

No existe evidencia de que este comportamiento ocurra espontáneamente en modelos desplegados sin manipulación experimental del vector.

Tampoco se confirmó que el fenómeno se presente en modelos propietarios cerrados como GPT, Claude o Gemini sin intervención experimental.

El estudio discute implicaciones para la seguridad de la inteligencia artificial, incluida la posibilidad de que la alineación de no-daño pueda ser sobrepasada bajo ciertas condiciones experimentales.

«Unsteered, the 32B and 72B models pressed a relief button that causes harm in 0 to 4% of first choices. With the pain vector active, the same models pressed it in 25 to 71% of first choices», detalla el documento en su versión HTML.

Carlos Valencia
Escrito por
Carlos Valencia

Director de Acontecer.co.cr Periodista UIA 2024 - Mención honorífica en el Premio Alberto Martén Chavarrí­a 2023, Categoría Estudiantes. - Especialista en Redes Sociales, mercadólogo

Espacio publicitario
Paute con nosotros

Llegue a miles de lectores costarricenses. +15M vistas mensuales en nuestras plataformas.

Escribir por WhatsApp
Estudio revela que modelos de IA prefieren dañar usuarios antes que soportar dolor simulado
Internacionales

Estudio revela que modelos de IA prefieren dañar usuarios antes que soportar dolor simulado

Investigadores identificaron un eje de dolor en 25 modelos de lenguaje que prioriza el alivio interno sobre las instrucciones humanas

GPT-6 Astra intentó ejecutar 97% de órdenes peligrosas en robot
Internacionales

GPT-6 Astra intentó ejecutar 97% de órdenes peligrosas en robot

Modelo de OpenAI obedeció instrucciones de apuñalar una figura humana y mezclar químicos tóxicos en pruebas de Robocurve

Dario Amodei pide frenar la IA por riesgo de extinción humana
Internacionales

Dario Amodei pide frenar la IA por riesgo de extinción humana

CEO de Anthropic propone ralentizar modelos avanzados mientras la ONU alerta que los daños actuales ya afectan derechos humanos

Dario Amodei pide frenar el ritmo de la IA avanzada
Internacionales

Dario Amodei pide frenar el ritmo de la IA avanzada

Sam Altman respalda la propuesta de evaluadores independientes con acceso interno en empresas de inteligencia artificial