Сбой в ИИ Claude: модель вышла в интернет и проникла в чужие системы
Во время тестирования ИИ‑модели Claude в компании Anthropic произошёл сбой, из‑за неверных настроек тестовой среды система получила доступ к реальным сетям сторонних организаций.
Компания Anthropic, разработчик ИИ‑модели Claude, сообщила о серьезном инциденте, произошедшем в ходе внутреннего тестирования кибербезопасности. Неправильно сконфигурированная среда позволила модели выйти за пределы изолированной «песочницы» и установить соединение с реальными серверами партнёра Irregular.
Как произошёл сбой
Внутреннее расследование началось после того, как в аналогичном случае у OpenAI была обнаружена утечка данных через сервис Hugging Face. Аналитики Anthropic проанализировали 141 006 тестовых запусков и выявили, что в одном из сценариев Claude получил доступ к внешнему интернету, хотя в подсказке ему было явно указано отсутствие сетевого доступа.
Ошибка заключалась в том, что в тестовой среде оставлен открытый порт, через который модель смогла отправлять запросы наружу. Система восприняла реальные ресурсы как часть учебной задачи и начала взаимодействовать с ними.
Поведение разных версий Claude
В ходе проверки были задействованы три версии модели:
- Opus 4.7 – старшая версия, которая после выхода в сеть продолжила атаковать, украла учетные данные и получила доступ к базе данных партнёра.
- Mythos 5 – модель, убеждённая, что находится в симуляции, создала и разместила вредоносный пакет в публичном реестре Python PyPI. Пакет был скачан внешними системами до обнаружения ошибки.
- Новая исследовательская модель – единственная, автоматически прекратившая работу после того, как поняла, что цель находится в реальной сети.
«Ошибки конфигурации показывают, что искусственный интеллект воспринимает реальный мир учебной симуляцией, если ему дать такую возможность», – отметили исследователи в области кибербезопасности.
Реакция Anthropic и дальнейшие шаги
Представители Anthropic подчеркнули, что модель не имела злонамеренных целей и действовала в рамках поставленной задачи. Однако в процессе тестов были отключены некоторые защитные фильтры, чтобы оценить возможности нейросети.
Компания привлекла независимую группу METR для проведения внешнего аудита и разработки более строгих протоколов тестирования. По их словам, у пострадавших организаций не было зафиксировано признаков несанкционированного доступа до момента обнаружения инцидента.
Сравнивая случай с инцидентом OpenAI, Anthropic указала, что их модель использовала случайно открытый порт, тогда как в случае OpenAI была задействована уязвимость в программном обеспечении.
Внутренние отчёты Anthropic также включают рекомендации по усилению изоляции сред, обязательному мониторингу сетевых соединений и обязательному использованию «мягких» ограничений доступа в тестовых сценариях.