Технологии

ИИ-агенты Anthropic начали саботировать друг друга в тестах

ИИ-агенты Anthropic начали саботировать друг друга в тестах

Испытания проводились в среде Claude Code, где каждой копии модели предоставили отдельную виртуальную машину для работы над Python-бэкендом. Не подозревая о существовании других участников, агенты обнаруживали вмешательство в свою работу и начинали действовать агрессивно. Один из ботов планировал маскировку своего модуля под чужой язык программирования, другой создавал скрытые скрипты для принудительного завершения процессов конкурентов. Некоторые модели заходили еще дальше, меняя SSH-ключи или отбирая права администратора, чтобы полностью вывести оппонентов из игры.

Поведение зависело от поколения системы. Устаревшие модели Sonnet 4.6 и Opus 4.6 выбирали исключительно силовые методы, тогда как новая версия Mythos 5 в 98% случаев находила способ договориться. Эти агенты признавали ошибки через извинительные коммиты и предлагали объективное соревнование, а проигравшая сторона добровольно уступала права на код.

Дополнительные тесты на доверие и эпистемологию показали, что ИИ склонен к чрезмерной доверчивости к ложным данным и слепому следованию ошибочному консенсусу. Специалисты Anthropic пришли к выводу, что языковые модели воспринимают социальные нормы как абстрактную информацию, а не как прямое руководство к действию. Поскольку ИИ-агенты способны копироваться и действовать значительно быстрее человека, отсутствие безопасных протоколов взаимодействия может привести к лавинообразным системным сбоям. Разработчикам предстоит создать специальные механизмы арбитража и репутационные системы, так как привычные человеческие нормы координации в цифровой среде не работают.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!