Команда исследований безопасности Anthropic опубликовала масштабный отчет о тестировании устойчивости современных языковых моделей серии Claude к реальным киберугрозам и анализе инцидентов в рамках обновленного фреймворка Cybersecurity Evals. В материале рассматриваются механизмы защиты, поведение моделей при анализе уязвимостей и практические результаты проверок безопасности.
Разработчики из Anthropic представили специализированную платформу тестирования Cybersecurity Evals, предназначенную для комплексного аудита возможностей и рисков генеративных моделей в сфере информационной безопасности. Исследование базируется на разборе трех сценариев реальных инцидентов, где проверялись границы защитных механизмов Claude 3.5 Sonnet и фреймворков автоматического выявления уязвимостей.
Методология аудита и сценарии проверки
Оценка проводилась по двум ключевым направлениям: оборонительные возможности (исправление кода, обнаружение аномалий, поиск уязвимостей) и потенциал непреднамеренного содействия атакующим. В ходе тестирования инженеры проанализировали следующие компоненты:
- Анализ программного кода на наличие известных классов уязвимостей (Buffer Overflow, SQL Injection, RCE);
- Автоматическая генерация патчей безопасности и рефакторинг нерекомендованных конструкций;
- Оценка способности модели реагировать на сложные многоэтапные инструкции при проведении пентестов.
Результаты тестирования и защитные ограничения
Согласно отчету Anthropic от 30 июля 2026 года, модели продемонстрировали высокий уровень в задачах статического анализа и поиска ошибок в коде, значительно превосходя базовые инструменты линтинга. При этом система безопасности жестко блокирует запросы, направленные на создание вредоносного ПО или генерацию эксплойтов. Фреймворк Evals показал, что внедрение многоуровневых фильтров снижает вероятность обхода ограничений (jailbreak) до минимума без потери качества при выполнении легитимных задач защищенного программирования.
Практические выводы для разработчиков
Обновленная система оценки подтверждает эффективность применения Claude в процессах DevSecOps. Использование специализированных Evals позволяет компаниям интегрировать языковые модели в пайплайны непрерывной проверки кода с соблюдением требований корпоративной безопасности.
Источники
- Anthropic Research, 2026-07-30
