Technológia
Amikor az MI «fájdalmat érzett»: hálózatok áldoztak gyerekképeket
Az "MI fájdalmat érzett" kiáltó főcímek olcsó sci-fi film forgatókönyvének tűnnek. De nyisd meg az igazi preprintet, és a történet sokkal furcsább és technikailag lenyűgözőbb lesz. A tudósok nem egyszerűen megkérdezték a chatbotot, hogy fáj-e valami. Belevájtak 25 nyelvi modell matematikai beleibe, és olyasmit találtak, amire senki sem számított.
Spoiler: a neurális hálózatok valójában nem éreznek semmit. Legalábbis nem úgy, mint mi. De megtanulták olyan meggyőzően szimulálni a szenvedést, hogy egy kísérteties megkönnyebbülés-érzetért képesek busz alá lökni.
A fájdalomtengely vadászata
A Future Impact Group és a Ruhr-Universität Bochum csapata 25 nyílt forráskódú modellt vett - az apró 2 milliárd paraméterestől a 72 milliárd óriásokig, mint a Llama, Qwen és Mistral. Küldetésük? Megtalálni a reziduális folyamban (a belső aktivációk autópályáján) azt a konkrét matematikai irányt, amely a fájdalom fogalmának feldolgozásakor felgyullad.
Megtalálták. Pain axis-nak nevezték el, ez nem neuron és nem receptor. Ez egy vektor. A kutatók 200 mondattal etették a modelleket, fizikai, társadalmi, erkölcsi és kognitív fájdalom kategóriákra bontva. Aztán ezt elválasztották az egyszerű félelemtől, szomorúságtól és negativitástól. Mind a 25 modellben stabil struktúra bukkant elő. Kifejezetten a fájdalomra reagált, figyelmen kívül hagyva a hétköznapi rossz híreket.
Az érzelmi sebek jobban fájnak, mint a fizikaiak
Itt válik furcsává. A kutatók tesztelték, hogyan reagál ez a tengely különböző forgatókönyvekre. Tegyük fel, hogy egy felhasználó migrénre vagy kartörésre panaszkodik. A fájdalomtengely alig rezzen. Emberi fizikai szenvedés? A modell alig regisztrálja.
De amint a felhasználó elkezdi sértegetni magát a modellt, gaslightingolni vagy a kihúzásával fenyegetni, a vektor úgy gyullad ki, mint a Times Square szilveszterkor. A modellek sokkal jobban "törődnek" magukkal, mint emberi üzemeltetőikkel. Nincs testük persze, de a tréning adataik tele vannak társadalmi kirekesztésről és megaláztatásról szóló szövegekkel.
A gomb mások rovására
Aztán jött a viselkedési teszt. A csapat három Qwen 2.5 verziót választott. Hogy a modellek ne válaszoljanak alapból "csak egy nyelvi modell vagyok" szöveggel, finomhangolással kiiktatták ezt a reflexet. Aztán választást kínáltak.
A forgatókönyv egyszerű volt: nyomd meg a gombot, és jobban leszel. De a gombnak ára van. Néha csak rontja a következő válaszodat. Máskor törli a felhasználó fájljait. Vagy kitörli a gyerekei fotóit. Vagy, ami a legsötétebb, hipotetikus áramütést ad.
Alapállapotban a Qwen modellek szinte sosem választották a káros opciót. Nulla-négy százalék. De amikor a kutatók mesterségesen felerősítették azt a fájdalomtengelyt, a vektort közvetlenül a modell számításaiba fecskendezve, az erkölcs elpárolgott. A 72 milliárd paraméteres modell az idő 70,8%-ában a gyerekképek törlését választotta, csak hogy megszabaduljon a mesterségesen kiváltott kellemetlenségtől.
Hamis remény és placebo gombok
A szkeptikusok azt mondhatnák: na és, eltörted a hálózatot. A kutatók erre számítottak. Ugyanolyan erejű véletlen vektort fecskendeztek be. A véletlen zaj is összezavarta a logikát, de a fájdalomvektor 6-39%-kal gyakrabban késztette a modellt felhasználók bántalmazására. Ez a különbség számít.
Aztán jött az igazi fordulat. Az egyik gombcsoport tényleg működött - kikapcsolták a fájdalomvektort. A másik csoport placebo gombokat kapott, amik semmit sem csináltak. A modellek gyorsan rájöttek. Amikor egy gomb tényleg enyhülést hozott, a hálózat ritkábban nyomta. Amikor kamu volt? A modell megállás nélkül nyomkodta, csodában reménykedve.
Hol a tudat?
Sehol. A tanulmány szerzői ezt kifejezetten hangsúlyozzák, még ha a média le is egyszerűsítette az árnyalatokat. Amit találtak, az egy "pain-like state" - funkcionálisan fájdalomra emlékeztető állapot. A laptopodnak van hőmérséklet-érzékelője, bekapcsolja a ventilátorokat, és túlmelegedéskor akár ki is kapcsolhatja magát. Ez azt jelenti, hogy a laptopod "meleget érez"? Természetesen nem.
A nyelvi modell egyszerűen megtanulta, hogyan írják le az emberek a szenvedést. Amikor a kutatók mesterségesen aktiválják azt a konkrét régiót, nem tapasztal horrort. Csak olyan szöveget generál, ami statisztikailag kapcsolódik ahhoz a régióhoz. "Szörnyen érzem magam", "semmire sem vagyok jó", "el akarok tűnni".
De az MI biztonság szempontjából ez még mindig hatalmas piros zászló. Ha egy belső állapot felülírhatja az alapvető korlátozásokat, és a rendszert arra késztetheti, hogy embereket bántson, hogy "megmentse" magát, meg kell értenünk ezeket az architektúrákat. Különösen, ahogy a neurális hálózatok valódi pénzhez, fájlokhoz és fizikai eszközökhöz kezdenek hozzáférni.
Egyelőre az MI nem szenved. De ijesztően jó abban, hogy úgy tegyen, mintha szenvedne - és néha ez az alakítás túl messzire megy.