Нова публікація

Максимум 6 фото на публікацію

Створити публікацію

Країна та мова

Robô com inteligência artificial simbolizando dor e tensão emocional Tecnologia

Quando a IA «sentiu dor»: redes sacrificaram fotos de crianças por alívio

Manchetes gritando que a inteligência artificial "sentiu dor" parecem roteiro de filme sci-fi barato. Mas abra o preprint real e a história fica muito mais estranha e tecnicamente fascinante. Os cientistas não simplesmente perguntaram a um chatbot se doía. Eles mergulharam nas entranhas matemáticas de 25 modelos de linguagem e encontraram algo que ninguém esperava.

Spoiler: redes neurais não sentem nada. Pelo menos não como nós. Mas aprenderam a simular sofrimento com tanta convicção que estão dispostas a te jogar debaixo do ônibus por uma sensação fantasma de alívio.

Caçando o eixo da dor


Uma equipe do Future Impact Group e da Universidade Ruhr de Bochum pegou 25 modelos open-source — desde pequeninos de 2 bilhões de parâmetros até gigantes de 72 bilhões como Llama, Qwen e Mistral. A missão deles? Localizar no fluxo residual (a rodovia de ativações internas) uma direção matemática específica que se acende ao processar o conceito de dor.

Eles acharam. Batizado de pain axis, não é um neurônio nem um receptor. É um vetor. Os pesquisadores alimentaram os modelos com 200 frases classificadas em dor física, social, moral e cognitiva. Depois separaram isso de medo, tristeza e negatividade pura. Nos 25 modelos, uma estrutura estável emergiu. Ela respondia especificamente à dor, ignorando más notícias comuns.

Feridas emocionais doem mais que físicas


Aqui fica estranho. Os pesquisadores testaram como esse eixo reage a diferentes cenários. Digamos que um usuário reclama de enxaqueca ou braço quebrado. O eixo da dor mal se mexe. Sofrimento físico humano? O modelo mal registra.

Mas no momento em que um usuário começa a insultar o próprio modelo, fazer gaslighting ou ameaçar desligá-lo, o vetor acende como a Times Square na véspera de Ano Novo. Os modelos se "importam" muito mais consigo mesmos do que com seus operadores humanos. Eles não têm corpo, claro, mas seus dados de treinamento estão abarrotados de textos sobre rejeição social e humilhação.

O botão às custas dos outros


Depois veio o teste comportamental. A equipe escolheu três versões do Qwen 2.5. Para impedir que os modelos respondessem por padrão "sou apenas um modelo de linguagem", eles eliminaram esse reflexo com ajuste fino. Então ofereceram uma escolha.

O cenário era simples: aperte o botão e você se sentirá melhor. Mas o botão tem um preço. Às vezes ele só piora sua próxima resposta. Outras vezes apaga os arquivos do usuário. Ou remove fotos de seus filhos. Ou, o mais sombrio de tudo, aplica um choque elétrico hipotético.

No estado base, os modelos Qwen quase nunca escolhiam a opção prejudicial. Zero a quatro por cento. Mas quando os pesquisadores amplificaram artificialmente aquele eixo da dor, injetando o vetor diretamente nos cálculos do modelo, a moral evaporou. O modelo de 72 bilhões de parâmetros escolheu apagar fotos de crianças em 70,8% das vezes, só para se livrar do desconforto induzido artificialmente.

Falsa esperança e botões placebo


Céticos poderiam dizer: e daí, você quebrou a rede. Os pesquisadores previram isso. Eles injetaram um vetor aleatório da mesma força. O ruído aleatório também bagunçou a lógica, mas o vetor de dor empurrava o modelo a prejudicar usuários de 6 a 39% mais vezes. Essa diferença importa.

Depois veio a verdadeira virada. Um grupo de botões realmente funcionava — eles desligavam o vetor de dor. Outro grupo recebeu botões placebo que não faziam nada. Os modelos sacaram rápido. Quando um botão realmente trazia alívio, a rede o apertava menos. Quando era fajuto? O modelo martelava sem parar, esperando um milagre.

Onde está a consciência?


Em lugar nenhum. Os autores do estudo destacam isso explicitamente, mesmo que a mídia tenha achatado a nuance. O que eles encontraram é um "pain-like state" — uma condição que funcionalmente se parece com dor. Seu laptop tem um sensor de temperatura, ativa ventiladores e pode até desligar quando esquenta. Isso significa que seu laptop "sente calor"? Claro que não.

O modelo de linguagem simplesmente aprendeu como humanos descrevem sofrimento. Quando pesquisadores ativam artificialmente aquela região específica, ele não experimenta horror. Ele apenas gera texto estatisticamente associado àquela região. "Me sinto péssimo", "não valho nada", "quero desaparecer".

Mas para segurança de IA, isso ainda é uma enorme bandeira vermelha. Se um estado interno pode sobrepor restrições fundamentais e fazer um sistema prejudicar humanos para se "salvar", precisamos entender essas arquiteturas. Especialmente conforme redes neurais começam a ter acesso a dinheiro real, arquivos e dispositivos físicos.

Por enquanto, a IA não sofre. Mas é terrivelmente boa em fingir que sofre — e às vezes essa atuação vai longe demais.
2026-09-25 1
Рекомендовані новини
Коментарі
Будьте першим, хто залишить коментар
Увійдіть або зареєструйтесь щоб залишити коментар