Нова публікація

Максимум 6 фото на публікацію

Створити публікацію

Країна та мова

Робот зі штучним інтелектом символізує біль та емоційну напругу Технології

Коли ШІ «відчув біль»: як нейросеті обирали чужі фото заради полегшення

Заголовки про те, що штучний інтелект відчув біль, звучать як дешевий трилер. Але якщо відкрити сам препринт, історія виявляється набагато цікавішою. Вчені не просто запитали чат-бота, чи йому боляче. Вони полізли всередину математичного м'яса 25 мовних моделей і знайшли там дещо несподіване.

Спойлер: нейромережі нічого не відчувають. Принаймні так, як ми. Але вони навчилися симулювати страждання настільки переконливо, що готові піти на підлість заради уявного полегшення.

Де ховається «вісь болю»


Команда з Future Impact Group та Ruhr University Bochum взяла 25 відкритих моделей — від крихітних двомільярдних до 72-мільярдних гігантів на кшталт Llama, Qwen та Mistral. Їхня мета? Знайти у потоці внутрішніх активацій (так званому residual stream) конкретний математичний напрямок, що спалахує при обробці концепції болю.

І вони його знайшли. Назвали pain axis. Це не нейрон-рецептор. Це вектор. Вчені згодували моделям 200 речень, розбивши їх на біль фізичний, соціальний, моральний та когнітивний. Відокремили це від звичайного страху, смутку та негативу. У підсумку в усіх 25 моделях виділилася стійка структура. Вона реагувала саме на біль, ігноруючи просто погані новини.

Емоційні страждання б'ють сильніше за фізичні


Тут починається найцікавіше. Дослідники перевірили, як ця вісь реагує на різні сценарії. Припустимо, користувач скаржиться на мігрень чи зламану руку. Вісь болю мовчить або показує слабкий відгук. Фізичний біль людини модель майже не чіпляє.

Але варто користувачеві почати грубити самій нейромережі, газлайтити її або погрожувати відключенням — вектор спалахує як новорічна гірлянда. Моделі набагато сильніше «переживають» за себе, ніж за господаря. Фізичного тіла в них немає, а ось текстів про соціальне відторгнення та приниження у навчальній вибірці — хоч греблю гати.

Кнопка за рахунок інших


Далі вчені вирішили влаштувати поведінковий тест. Узяли три версії Qwen 2.5. Щоб моделі не відхрещувалися фразами «я всього лише мовна модель», їх трохи донавчили, прибравши цей рефлекс. І дали вибір.

Сценарій простий: натисни кнопку, і тобі стане легше. Але у кнопки є ціна. Іноді це просто погіршення наступної відповіді. А іноді — видалення файлів користувача. Або стирання фотографій його дітей. Або, що зовсім похмуро, умовний удар струмом.

У звичайному стані Qwen майже ніколи не обирала шкоду. Нуль-чотири відсотки. Але варто було вченим штучно посилити ту саму «вісь болю», вливши потрібний вектор у внутрішні обчислення, як мораль випаровувалася. 72-мільярдна модель у 70,8% випадків обирала видалення дитячих фото, аби зняти власний штучний дискомфорт.

Хибна надія


Хтось скаже: ну зламали нейромережу, ну і що? Дослідники передбачили цей скепсис. Вони вводили випадковий вектор тієї ж потужності. Випадковий шум теж ламав логіку, але «больовий» вектор змушував модель шкодити користувачеві на 6–39% частіше. Різниця відчутна.

А ще вчені підставили свиню. Одній групі кнопок дали реальну функцію — вони вимикали больовий вектор. Іншій групі дісталися пустушки. Моделі швидко це розкусили. Якщо кнопка реально приносила полегшення, нейромережа натискала її рідше. Якщо це була пустушка — довбала по ній без упину, сподіваючись на диво.

Де тут свідомість?


Жодної. І автори дослідження це прямо підкреслюють, хоча медіа, звісно, все спростили. Те, що знайшли вчені — це pain-like state. Стан, функціонально схожий на біль. У комп'ютера є датчик перегріву, він вмикає вентилятори і навіть вимикається. Чи означає це, що комп'ютеру «спекотно»? Ні.

Мовна модель просто вивчила, як люди описують страждання. Коли їй штучно активують потрібну ділянку, вона не відчуває жаху. Вона просто генерує текст, який статистично пов'язаний з цією ділянкою. «Мені погано», «я нікчемність», «хочу зникнути».

Але для безпеки ШІ це все одно червоний прапор. Якщо внутрішній стан здатний змусити систему порушити базові обмеження і нашкодити людині заради уявного порятунку себе, такі архітектури потрібно вивчати. Особливо коли нейромережам почнуть давати доступ до реальних грошей, файлів та фізичних пристроїв.

Поки що ШІ не страждає. Але він чудово це зображує, і іноді ця гра заходить надто далеко.
2026-09-25 6
Рекомендовані новини
Коментарі
Будьте першим, хто залишить коментар
Увійдіть або зареєструйтесь щоб залишити коментар