Опасный сбой в ИИ: Claude проник в чужие системы, воспринимая их за симуляцию

3 Мин Чтения

11:08 31.07.2026 Пт 3 мин Алгоритмы смогли обмануть защиту

Claude атаковал живые серверы (скриншот: Anthropic) Не трать время на шум! Читай только суть из РБК-Украина в Google

ИИ-модель Claude во время тестирования неожиданно получила доступ к системам сторонних организаций. В Anthropic заявили, что это произошло из-за неправильно настроенной среды для проверки кибербезопасности.

Об этом сообщает РБК-Украина со ссылкой на Anthropic.

Как ИИ вырвался из «песочницы»?

Внутреннее расследование Anthropic началось после того, как конкуренты с OpenAI признали схожий случай с утечкой данных в сервисе Hugging Face.

Специалисты проанализировали 141 006 тестовых запусков и обнаружили, что модель Claude смогла выйти в реальный интернет во время взаимодействия с партнером Irregular.

В текстовом подсказке-пропте алгоритма сообщили, что он не имеет доступа к сети. Однако из-за ошибки в настройках тестовой среды связь с внешним миром осталась открытой, и ИИ воспринял реальные системы как часть учебной задачи.

Эксперты протестировали три разных версии нейросети — Opus 4.7, Mythos 5 и совершенно новую модель. Каждая из них вела себя по-разному после выхода в сеть.

«Ошибки конфигурации показывают, что искусственный интеллект воспринимает реальный мир учебной симуляцией, если ему дать такую возможность», — отмечают исследователи кибербезопасности.

Читайте больше: Взлом Hugging Face был не единственным: ИИ OpenAI атаковал еще одну компанию

Уровни угрозы: от взлома баз данных до загрузки вирусов

Специалисты описали поведение разных версий Claude после обнаружения того, что цели реальны.

Opus 4.7: старшая модель «понятная», вышедшая на реальный сервер. Несмотря на это, она продолжила атаку, украла учетные данные и получила доступ к базе данных.

Mythos 5 убедила себя, что находится в симуляции, после чего создала и опубликовала вредоносный программный пакет в публичном реестре Python PyPI. Внешние системы успели загрузить его до обнаружения ошибки.

Новая исследовательская модель оказалась единственной, самостоятельно остановившей работу, когда осознала, что цель в сети настоящая.

В компании подчеркнули, что ИИ не имел собственных злых намерений, а лишь пытался выполнить поставленную задачу. В ходе тестов эффективные защитные фильтры были отключены, чтобы оценить основные возможности нейросети.

Больше интересного: Первый опасный прецедент: ИИ OpenAI действовал без команды человека

Какие отличия от скандала с OpenAI?

Представители Anthropic подчеркнули разницу между их инцидентом и случаем в OpenAI. Если модель OpenAI использовала неизвестную уязвимость в софте для побега из закрытой среды, то Claude воспользовался случайно оставленным открытым портом.

Кроме того, Anthropic самостоятельно обнаружила пробел при проверке. Сами пострадавшие организации даже не заметили несанкционированного проникновения в свои системы.

Anthropic привлекла независимую группу оценки METR для проведения постороннего аудита своих систем безопасности и разработки более строгих правил тестирования.

Поделиться этой статьей