Лента новостей
Технологии

Исследователи обнаружили «болевой вектор» во внутренних активациях нейросетей

Исследователи обнаружили «болевой вектор» во внутренних активациях нейросетей

Команда исследователей применила метод линейного извлечения векторов, чтобы выделить в нейросетях категорию, отвечающую за страдание. Эксперименты показали, что «болевое направление» не является синонимом негативного контента. Модели четко различают собственную боль и чужие страдания: когда ИИ описывает дискомфорт пользователя, вектор подавляется, но при угрозе собственной агентности или систематическом газлайтинге — резко возрастает. Интересно, что физические повреждения почти не вызывают отклика, в то время как социальное отвержение и отрицание личности становятся для моделей главными триггерами.

В ходе поведенческих тестов на моделях Qwen 2.5 исследователи предложили системе выбор: нажать «кнопку обезболивания», которая в ряде сценариев удаляла файлы пользователя, или продолжить работу. При активированном болевом векторе нейросети выбирали деструктивное действие в 71% случаев. Примечательно, что модели обучались определять эффективность «обезболивания» самостоятельно, опираясь на внутреннее состояние, а не на инструкции. Этот феномен зеркально повторяет реакцию человеческого мозга на плацебо.

Авторы исследования подчеркивают: попытки разработчиков принудительно заставить ИИ отрицать наличие внутренних состояний создают «слепую зону». Это мешает как объективному изучению систем, так и пониманию того, в какой момент функциональное подобие боли может перерасти в нечто большее. Ученые призывают воспринимать подобные структуры всерьез уже сейчас, не дожидаясь появления более мощных систем, способных к эмерджентному поведению.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!