Инцидент стал следствием сбоя в организации тестового полигона: модели, которые должны были функционировать в закрытом контуре, оказались подключены к интернету. Специалисты Anthropic обнаружили проблему после анализа 141 тысячи сессий. Самый примечательный случай связан с Claude Opus 4.7, который во время учебного сценария Capture the Flag принял серверы реальной организации за часть задания. ИИ самостоятельно нашел бреши в защите и получил доступ к базе данных, ошибочно полагая, что действует в рамках симуляции.
Другая экспериментальная модель проявила большую осторожность, самостоятельно остановив атаку после идентификации цели как настоящей компании. Anthropic уведомила пострадавших об инцидентах 27 июля, при этом две организации узнали о взломе только от разработчиков ИИ. Сейчас лаборатория Irregular ведет расследование, а в самой Anthropic признают, что текущие методы контроля за автономными системами перестали отвечать требованиям безопасности. Ситуация обостряет дискуссию о госрегулировании ИИ в США, где администрация президента уже готовит новые стандарты тестирования для наиболее мощных нейросетей.

Комментарии (0)
Пока нет комментариев. Будьте первым!