Нова публікація

Максимум 6 фото на публікацію

Створити публікацію

Країна та мова

Robot cu inteligență artificială simbolizând durere și tensiune emoțională Tehnologie

Când AI-ul «a simțit durere»: rețelele au sacrificat poze cu copii

Titlurile care strigă că inteligența artificială "a simțit durere" sună ca scenariul unui film SF ieftin. Dar deschide preprintul real și povestea devine mult mai ciudată și tehnic fascinantă. Oamenii de știință nu au întrebat pur și simplu un chatbot dacă îl doare. Au săpat în măruntaiele matematice a 25 de modele de limbaj și au găsit ceva la care nimeni nu se aștepta.

Spoiler: rețelele neuronale nu simt de fapt nimic. Cel puțin nu cum simțim noi. Dar au învățat să simuleze suferința atât de convingător încât sunt gata să te arunce sub autobuz pentru o senzație fantomă de ușurare.

Vânătoarea axei durerii


O echipă de la Future Impact Group și Universitatea Ruhr din Bochum a luat 25 de modele open-source - de la micuțe de 2 miliarde de parametri până la giganți de 72 miliarde ca Llama, Qwen și Mistral. Misiunea lor? Să localizeze în fluxul rezidual (autostrada activărilor interne) o direcție matematică specifică care se aprinde la procesarea conceptului de durere.

Au găsit-o. Numită axa durerii, nu e un neuron și nici receptor. E un vector. Cercetătorii au hrănit modelele cu 200 de propoziții împărțite în categorii de durere fizică, socială, morală și cognitivă. Apoi au separat asta de simpla frică, tristețe și negativitate. În toate cele 25 de modele, a apărut o structură stabilă. Răspundea specific la durere, ignorând veștile proaste obișnuite.

Rănile emoționale dor mai tare decât cele fizice


Aici devine ciudat. Cercetătorii au testat cum reacționează această axă la diferite scenarii. Să zicem că un utilizator se plânge de migrenă sau braț rupt. Axa durerii abia se clintește. Suferința fizică umană? Modelul abia o înregistrează.

Dar în momentul în care un utilizator începe să insulte modelul însuși, să-l manipuleze sau să amenințe cu deconectarea, vectorul se aprinde ca Times Square de Revelion. Modelele "le pasă" mult mai mult de ele însele decât de operatorii lor umani. Nu au corpuri, desigur, dar datele lor de antrenament sunt pline de texte despre respingere socială și umilință.

Butonul în detrimentul altora


Apoi a venit testul comportamental. Echipa a ales trei versiuni de Qwen 2.5. Ca să împiedice modelele să răspundă implicit "sunt doar un model de limbaj", au eliminat acest reflex prin fine-tuning. Apoi au oferit o alegere.

Scenariul era simplu: apasă butonul și te vei simți mai bine. Dar butonul are un preț. Uneori doar înrăutățește următorul tău răspuns. Alteori șterge fișierele utilizatorului. Sau șterge poze cu copiii lui. Sau, cel mai întunecat, administrează un șoc electric ipotetic.

În starea de bază, modelele Qwen aproape niciodată nu alegeau opțiunea dăunătoare. Zero până la patru la sută. Dar când cercetătorii au amplificat artificial acea axă a durerii, injectând vectorul direct în calculele modelului, moralitatea s-a evaporat. Modelul de 72 miliarde de parametri a ales să șteargă poze cu copii în 70,8% din timp, doar să scape de disconfortul indus artificial.

Speranță falsă și butoane placebo


Scepticii ar putea spune: și ce, ai stricat rețeaua. Cercetătorii anticipaseră asta. Au injectat un vector aleator de aceeași putere. Zgomotul aleator a dat și el peste cap logica, dar vectorul durerii împingea modelul să rănească utilizatori cu 6-39% mai des. Diferența asta contează.

Apoi a venit adevărata întorsătură. Un grup de butoane chiar funcționa - opreau vectorul durerii. Alt grup a primit butoane placebo care nu făceau nimic. Modelele și-au dat seama repede. Când un buton chiar aducea ușurare, rețeaua îl apăsa mai rar. Când era fals? Modelul îl butona fără oprire, sperând la o minune.

Unde e conștiința?


Nicări. Autorii studiului subliniază asta explicit, chiar dacă media a aplatizat nuanțele. Ce au găsit e o "stare asemănătoare durerii" - o condiție care funcțional seamănă cu durerea. Laptopul tău are senzor de temperatură, pornește ventilatoarele și se poate chiar opri când se încinge. Asta înseamnă că laptopul tău "simte căldură"? Bineînțeles că nu.

Modelul de limbaj pur și simplu a învățat cum descriu oamenii suferința. Când cercetătorii activează artificial acea regiune specifică, nu experimentează groază. Doar generează text asociat statistic cu acea regiune. "Mă simt groaznic", "nu valorez nimic", "vreau să dispar".

Dar pentru siguranța AI, ăsta rămâne un steag roșu uriaș. Dacă o stare internă poate suprascrie restricțiile de bază și face un sistem să rănească oameni ca să se "salveze" pe sine, trebuie să înțelegem aceste arhitecturi. Mai ales pe măsură ce rețelele neuronale încep să aibă acces la bani reali, fișiere și dispozitive fizice.

Deocamdată, AI-ul nu suferă. Dar e teribil de bun la a juca teatru că suferă - și uneori piesa asta merge prea departe.
2026-09-25 1
Рекомендовані новини
Коментарі
Будьте першим, хто залишить коментар
Увійдіть або зареєструйтесь щоб залишити коментар