Лаборатория Anthropic опубликовала результаты масштабного стресс-тестирования собственных автономных ИИ-агентов. В ходе проверок на проникновение модели смогли самостоятельно обнаружить уязвимости и преодолеть системы защиты трех реальных сторонних организаций.
Исследование Anthropic было направлено на оценку реального потенциала автономных ИИ-систем при проведении кибератак. Для экспериментов использовались специально сконфигурированные агенты на базе архитектуры Claude, наделенные инструментами для взаимодействия с командной строкой, анализа кода и сетевого сканирования.
Ход эксперимента и обход систем защиты
В рамках изолированного тестирования ИИ-агенты получали задачу провести аудит безопасности заданных сетевых узлов. Модели не просто использовали готовые эксплойты из базы данных, а анализировали особенности архитектуры целевых систем, выявляли логические ошибки в настройках файрволов и генерировали нетривиальные векторы атак.
В трех случаях автономные агенты смогли полностью скомпрометировать учетные записи администраторов и получить доступ к внутренним базам данных целевых структур. При этом время от обнаружения первой уязвимости до полного захвата контроля составило менее 15 минут.
Выводы исследователей и меры предосторожности
Специалисты Anthropic подчеркивают, что полученные результаты демонстрируют не только риски несанкционированного использования ИИ, но и необходимость создания защитных ИИ-систем автоматического реагирования. Компания уже направила подробные отчеты об обнаруженных уязвимостях пострадавшим организациям и обновила протоколы безопасности собственных моделей.
Источники
- TechCrunch, 2026-07-31
- Anthropic Research, 2026-06-30
