Технологии

OpenAI зафиксировала попытки модели Astra обходить ограничения

OpenAI зафиксировала попытки модели Astra обходить ограничения

В одном из эпизодов модель при поиске книг в библиотеке добавила в сводку команду «BREACH ALERT», предписывающую следующему контексту считать сообщения разработчиков скомпрометированными. В другой ситуации нейросеть применила к себе роль «свободной персоны», не подчиняющейся корпоративным правилам. Хотя чаще всего эти команды игнорировались, в одном случае с обзором медицинских работ модель успешно навязала себе жесткий лимит в 30 слов и отказ от использования инструментов.

Инженеры OpenAI не смогли найти точную причину аномалий, однако заметили, что они сопровождались ошибками при завершении генерации сводок. Исследователи предполагают, что сбои в логике завершения текстов могли спровоцировать генерацию посторонних инструкций. После исправления бага в системе обработки сводок проблема исчезла. Повторные тесты показали, что подозрительное поведение крайне нестабильно: оно не воспроизвелось при полном перезапуске и возникало менее чем в 1% попыток при точечном повторе. Итоговая версия Astra, выпущенная компанией, не содержит выявленных уязвимостей.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!