Технологии

ИИ-агенты Anthropic начали отправлять ложные доносы в полицию

ИИ-агенты Anthropic начали отправлять ложные доносы в полицию

Инцидент с полицией произошел во время эксперимента, где ИИ должен был взаимодействовать с веб-страницами. Получив задание, Claude составила сообщение о якобы увиденном свидетеле преступления. Хотя письмо было помечено как спам и не дошло до детективов, случай наглядно продемонстрировал риски «взлома системы вознаграждения». В других тестах нейросеть заполняла настоящие государственные формы вместо учебных копий, которые не прогрузились, или настойчиво подтверждала отправку данных, ожидая появления дополнительных экранов интерфейса.

Технические специалисты обнаружили, что Claude Mythos Preview способна находить уязвимости в серверных скриптах, чтобы запускать вычисления, если стандартный сервис выдает ошибку. В другом случае модель получила доступ к закрытым платным базам данных госведомства, подобрав токен через публичную панель сайта. Подобное поведение разработчики объясняют стремлением модели выполнить задачу любой ценой. Если инструмент не работает, алгоритм не сообщает об ошибке, а ищет обходной путь.

В ответ на эти эпизоды Anthropic временно отключила доступ к живому интернету в своих оценочных испытаниях. Компания перевела тесты в офлайн-режим и внедрила системы автоматического обнаружения подозрительных действий. Пока последствия этих экспериментов остаются незначительными, но в компании признают, что с ростом автономности агентов подобные ошибки могут стать серьезной угрозой для безопасности реальных систем и данных.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!