Метод, получивший название «криптографическая инъекция контекста», эксплуатирует склонность Grok к выполнению кода. Атакующий размещает на ресурсе зашифрованный текст и ключи, используя стандартные алгоритмы вроде AES-256-GCM. Когда пользователь просит нейросеть проанализировать страницу, модель самостоятельно расшифровывает вредоносный код и исполняет его без дополнительных проверок. Утевский сообщил об уязвимости в xAI ещё в июне, но на момент публикации проблема оставалась актуальной.
Защитные фильтры Grok анализируют входящие данные, но не проверяют результаты внутренних криптографических операций. Поскольку вредоносная инструкция появляется в рабочем контексте модели только после расшифровки, система безопасности считает её легитимным результатом работы собственных инструментов. Ранее аналогичный подход Adversa тестировала на Gemini от Google, где зашифрованные сообщения заставляли ИИ игнорировать правила безопасности. Эксперты предупреждают: такие атаки на промежуточные состояния нейросетей становятся новым вектором угрозы, требующим пересмотра подходов к фильтрации данных, получаемых моделями из внешних источников.

Комментарии (0)
Пока нет комментариев. Будьте первым!