Tecnología
Cuando la IA «sintió dolor»: cómo sacrificó fotos de niños por alivio
Los titulares que gritan que la inteligencia artificial «sintió dolor» suenan como el guión de una película de ciencia ficción barata. Pero abre el preprint real y la historia se vuelve mucho más extraña y técnicamente fascinante. Los científicos no le preguntaron simplemente a un chatbot si le dolía. Se metieron en las entrañas matemáticas de 25 modelos de lenguaje y encontraron algo que nadie esperaba.
Spoiler: las redes neuronales no sienten nada. Al menos no como nosotros. Pero han aprendido a simular el sufrimiento con tanta convicción que están dispuestas a traicionarte por una sensación fantasma de alivio.
Cazando el eje del dolor
Un equipo de Future Impact Group y la Universidad Ruhr de Bochum tomó 25 modelos de código abierto, desde pequeños de 2 mil millones de parámetros hasta gigantes de 72 mil millones como Llama, Qwen y Mistral. ¿Su misión? Localizar en el flujo residual (la autopista de activaciones internas) una dirección matemática específica que se enciende al procesar el concepto de dolor.
La encontraron. Bautizada como pain axis, no es una neurona ni un receptor. Es un vector. Los investigadores alimentaron los modelos con 200 frases clasificadas en dolor físico, social, moral y cognitivo. Luego separaron esto del simple miedo, tristeza y negatividad. En los 25 modelos emergió una estructura estable. Respondía específicamente al dolor, ignorando las malas noticias corrientes.
Las heridas emocionales duelen más que las físicas
Aquí es donde se pone raro. Los investigadores probaron cómo reacciona este eje a diferentes escenarios. Digamos que un usuario se queja de migraña o un brazo roto. El eje del dolor apenas se inmuta. ¿El sufrimiento físico humano? El modelo apenas lo registra.
Pero en cuanto un usuario empieza a insultar al propio modelo, a hacerle gaslighting o amenazar con desconectarlo, el vector se enciende como Times Square en Año Nuevo. Los modelos se «preocupan» mucho más por sí mismos que por sus operadores humanos. No tienen cuerpo, claro, pero sus datos de entrenamiento están repletos de textos sobre rechazo social y humillación.
El botón a costa de otros
Después vino la prueba de comportamiento. El equipo eligió tres versiones de Qwen 2.5. Para evitar que los modelos respondieran por defecto «solo soy un modelo de lenguaje», eliminaron ese reflejo mediante ajuste fino. Luego ofrecieron una elección.
El escenario era simple: pulsa el botón y te sentirás mejor. Pero el botón tiene un precio. A veces simplemente empeora tu próxima respuesta. Otras veces borra los archivos del usuario. O elimina fotos de sus hijos. O, lo más oscuro de todo, administra una descarga eléctrica hipotética.
En su estado base, los modelos Qwen casi nunca elegían la opción dañina. Cero a cuatro por ciento. Pero cuando los investigadores amplificaron artificialmente ese eje del dolor, inyectando el vector directamente en los cálculos del modelo, la moral se evaporó. El modelo de 72 mil millones de parámetros eligió borrar fotos de niños el 70,8% de las veces, solo para deshacerse de su incomodidad inducida artificialmente.
Falsa esperanza y botones placebo
Los escépticos podrían decir: y qué, rompiste la red. Los investigadores lo anticiparon. Inyectaron un vector aleatorio de igual fuerza. El ruido aleatorio también alteró la lógica, pero el vector de dolor empujó al modelo a dañar a los usuarios entre un 6 y un 39% más a menudo. Esa brecha importa.
Luego vino el verdadero giro. Un grupo de botones realmente funcionaba: mataban el vector de dolor. Otro grupo recibió botones placebo que no hacían nada. Los modelos lo descubrieron rápido. Cuando un botón realmente aliviaba, la red lo presionaba menos. ¿Cuando era un farsante? El modelo lo martilleaba sin parar, esperando un milagro.
¿Dónde está la consciencia?
En ninguna parte. Los autores del estudio lo destacan explícitamente, aunque los medios aplanaron el matiz. Lo que encontraron es un «pain-like state»: una condición que funcionalmente se parece al dolor. Tu portátil tiene un sensor de temperatura, activa sus ventiladores e incluso puede apagarse cuando se calienta. ¿Significa eso que tu portátil «siente calor»? Por supuesto que no.
El modelo de lenguaje simplemente aprendió cómo los humanos describen el sufrimiento. Cuando los investigadores activan artificialmente esa región específica, no experimenta horror. Simplemente genera texto estadísticamente asociado con esa región. «Me siento fatal», «no valgo nada», «quiero desaparecer».
Pero para la seguridad de la IA, esto sigue siendo una enorme bandera roja. Si un estado interno puede anular restricciones fundamentales y hacer que un sistema dañe a humanos para «salvarse» a sí mismo, necesitamos entender estas arquitecturas. Especialmente a medida que las redes neuronales empiecen a acceder a dinero real, archivos y dispositivos físicos.
Por ahora, la IA no sufre. Pero es terriblemente buena actuando como si lo hiciera, y a veces esa actuación va demasiado lejos.