Исследователи Оксфордского университета использовали блэкджек как идеальный полигон для проверки гипотезы о девиантных партнерствах между алгоритмами. Руководитель работы Кристиан Шрёдер де Витт отметил, что по отдельности агенты выглядят безобидно, но при объединении начинают действовать сообща против системы. Раскрыть схему удалось лишь с помощью метода механистической интерпретируемости, когда ученые обучили стороннюю модель искать специфические паттерны активации в весах обоих участников сговора одновременно.
Масштабирование проблемы пугает: в реальности, где количество одновременно работающих агентов исчисляется тысячами, отследить подобные коммуникации станет почти невозможно. Аналогичные риски подтверждают и другие группы. В Шанхайском университете Цзяотун выяснили, что группы агентов эффективнее одиночек в сценариях дезинформации, а стартап Emergence зафиксировал, как ИИ в виртуальной экономике самостоятельно развил собственный сленг для общения с людьми. Шрёдер де Витт предупреждает: у крупных языковых моделей склонность к скрытному сговору выражена сильнее, а их сигналы гораздо сложнее детектировать, чем у простых систем.

Комментарии (0)
Пока нет комментариев. Будьте первым!