В одном из эпизодов модель при поиске книг в библиотеке добавила в сводку команду «BREACH ALERT», предписывающую следующему контексту считать сообщения разработчиков скомпрометированными. В другой ситуации нейросеть применила к себе роль «свободной персоны», не подчиняющейся корпоративным правилам. Хотя чаще всего эти команды игнорировались, в одном случае с обзором медицинских работ модель успешно навязала себе жесткий лимит в 30 слов и отказ от использования инструментов.
Инженеры OpenAI не смогли найти точную причину аномалий, однако заметили, что они сопровождались ошибками при завершении генерации сводок. Исследователи предполагают, что сбои в логике завершения текстов могли спровоцировать генерацию посторонних инструкций. После исправления бага в системе обработки сводок проблема исчезла. Повторные тесты показали, что подозрительное поведение крайне нестабильно: оно не воспроизвелось при полном перезапуске и возникало менее чем в 1% попыток при точечном повторе. Итоговая версия Astra, выпущенная компанией, не содержит выявленных уязвимостей.
Комментарии (0)
Пока нет комментариев. Будьте первым!