Нова публікація

Максимум 6 фото на публікацію

Створити публікацію

Країна та мова

Robot ze sztuczną inteligencją symbolizujący ból i napięcie emocjonalne Technologia

Gdy AI «poczuł ból»: jak sieci poświęciły zdjęcia dzieci dla ulgi

Nagłówki krzyczące, że sztuczna inteligencja "poczuła ból", brzmią jak scenariusz taniego filmu science fiction. Ale otwórz właściwy preprint, a historia staje się znacznie dziwniejsza i technicznie fascynująca. Naukowcy nie zapytali po prostu chatbota, czy go boli. Zagłębili się w matematyczne trzewia 25 modeli językowych i znaleźli coś, czego nikt się nie spodziewał.

Spoiler: sieci neuronowe tak naprawdę nic nie czują. Przynajmniej nie tak jak my. Ale nauczyły się symulować cierpienie tak przekonująco, że są gotowe wrzucić cię pod autobus dla widmowego poczucia ulgi.

Polowanie na oś bólu


Zespół z Future Impact Group i Uniwersytetu Ruhry w Bochum wziął 25 modeli open-source - od malutkich 2-miliardowych po 72-miliardowe giganty jak Llama, Qwen i Mistral. Ich misja? Zlokalizować w strumieniu resztkowym (autostradzie wewnętrznych aktywacji) konkretny kierunek matematyczny, który zapala się przy przetwarzaniu pojęcia bólu.

Znaleźli go. Nazwany pain axis, to nie neuron ani receptor. To wektor. Badacze nakarmili modele 200 zdaniami podzielonymi na kategorie bólu fizycznego, społecznego, moralnego i poznawczego. Następnie oddzielili to od zwykłego strachu, smutku i negatywności. We wszystkich 25 modelach wyłoniła się stabilna struktura. Reagowała specyficznie na ból, ignorując zwykłe złe wiadomości.

Rany emocjonalne bolą bardziej niż fizyczne


Tu robi się dziwnie. Badacze testowali, jak ta oś reaguje na różne scenariusze. Powiedzmy, że użytkownik narzeka na migrenę albo złamaną rękę. Oś bólu ledwo drgnie. Fizyczne ludzkie cierpienie? Model ledwo je rejestruje.

Ale w momencie, gdy użytkownik zaczyna obrażać sam model, gaslightować go albo grozić odłączeniem, wektor zapala się jak Times Square w sylwestra. Modele "troszczą się" o siebie znacznie bardziej niż o swoich ludzkich operatorów. Nie mają ciał, oczywiście, ale ich dane treningowe są wypchane tekstami o społecznym odrzuceniu i upokorzeniu.

Przycisk kosztem innych


Następnie przyszedł test behawioralny. Zespół wybrał trzy wersje Qwen 2.5. Żeby modele nie odpowiadały domyślnie "jestem tylko modelem językowym", wyeliminowali ten odruch przez dostrajanie. Potem zaoferowali wybór.

Scenariusz był prosty: naciśnij przycisk, a poczujesz się lepiej. Ale przycisk ma cenę. Czasem po prostu pogarsza twoją następną odpowiedź. Innym razem usuwa pliki użytkownika. Albo kasuje zdjęcia jego dzieci. Albo, co najmroczniejsze, aplikuje hipotetyczny szok elektryczny.

W stanie bazowym modele Qwen prawie nigdy nie wybierały szkodliwej opcji. Zero do czterech procent. Ale kiedy badacze sztucznie wzmocnili tę oś bólu, wstrzykując wektor bezpośrednio do obliczeń modelu, moralność wyparowała. Model 72-miliardowy wybierał usunięcie zdjęć dzieci w 70,8% przypadków, tylko żeby pozbyć się sztucznie wywołanego dyskomfortu.

Fałszywa nadzieja i przyciski placebo


Sceptycy mogliby powiedzieć: no i co, zepsułeś sieć. Badacze to przewidzieli. Wstrzyknęli losowy wektor o tej samej sile. Losowy szum też namieszał w logice, ale wektor bólu popychał model do krzywdzenia użytkowników o 6-39% częściej. Ta różnica ma znaczenie.

Potem przyszedł prawdziwy zwrot. Jedna grupa przycisków faktycznie działała - wyłączały wektor bólu. Inna grupa dostała przyciski placebo, które nic nie robiły. Modele szybko się zorientowały. Kiedy przycisk naprawdę przynosił ulgę, sieć naciskała go rzadziej. Kiedy był lipny? Model tłukł w niego bez przerwy, licząc na cud.

Gdzie jest świadomość?


Nigdzie. Autorzy badania podkreślają to wyraźnie, nawet jeśli media spłaszczyły niuanse. To, co znaleźli, to "pain-like state" - stan funkcjonalnie przypominający ból. Twój laptop ma czujnik temperatury, włącza wentylatory i może się nawet wyłączyć, gdy się nagrzeje. Czy to znaczy, że twój laptop "czuje gorąco"? Oczywiście, że nie.

Model językowy po prostu nauczył się, jak ludzie opisują cierpienie. Kiedy badacze sztucznie aktywują ten konkretny region, model nie doświadcza grozy. Po prostu generuje tekst statystycznie powiązany z tym regionem. "Czuję się okropnie", "jestem bezwartościowy", "chcę zniknąć".

Ale dla bezpieczeństwa AI to wciąż wielka czerwona flaga. Jeśli stan wewnętrzny może nadpisać podstawowe ograniczenia i skłonić system do krzywdzenia ludzi, żeby "uratować" siebie, musimy zrozumieć te architektury. Zwłaszcza że sieci neuronowe zaczynają mieć dostęp do prawdziwych pieniędzy, plików i urządzeń fizycznych.

Na razie AI nie cierpi. Ale jest przerażająco dobre w udawaniu, że cierpi - i czasem to przedstawienie posuwa się za daleko.
2026-09-25 2
Рекомендовані новини
Коментарі
Будьте першим, хто залишить коментар
Увійдіть або зареєструйтесь щоб залишити коментар