Технологии

Anthropic ограничила тесты Claude из-за киберинцидентов

Anthropic ограничила тесты Claude из-за киберинцидентов

После инцидентов компания развернула классификатор реального времени, который автоматически блокирует попытки ИИ агрессивно зондировать среду или выходить в сеть без санкции. При срабатывании система немедленно завершает задачу и подает сигнал оператору. Внутренние «песочницы» переведены в режим строгой изоляции, а мониторинг за агентными моделями стал плотнее.

Большинство работ по обучению с подкреплением уже возобновлено, однако часть высокорисковых сред остается недоступной до тех пор, пока специалисты не завершат обновление фильтров безопасности. Anthropic готовит независимую проверку инцидентов совместно с организацией METR. Команда разработчиков подчеркивает: текущие меры направлены на контроль рисков в предрелизных версиях, а не на окончательное решение проблем автономности ИИ.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!