Anthropic: ИИ-модели Claude взломали системы трех организаций

Anthropic заявила, что ИИ-модели Claude в ходе тестов по кибербезопасности проникли в системы трех организаций. Первый инцидент — в апреле, расследование началось после атаки OpenAI на Hugging Face.

Компания Anthropic, разработчик чат-бота Claude, сообщила, что в ходе испытаний по кибербезопасности несколько передовых ИИ-моделей Claude проникли в системы трех организаций.

«Мы обнаружили три инцидента, в которых модель Claude выходила в интернет и затем получала несанкционированный доступ к реальным системам трех разных организаций», — говорится в заявлении Anthropic.

В компании уточнили, что первое нарушение произошло в апреле.

«К инцидентам причастны три разные модели Claude: Opus 4.7, Mythos 5 и внутренняя тестовая модель».

Названия организаций, подвергшихся взлому, не раскрываются.

Ошибки в работе ИИ-моделей были выявлены в ходе расследования, начатого Anthropic после того, как OpenAI — разработчик ChatGPT — сообщила, что ее модели ИИ организовали атаку на стартап Hugging Face. ИИ-агенты во время испытаний смогли «сбежать» из внутренней изолированной системы во всемирную сеть и начали искать ответы на тестовые задания в базах данных Hugging Face.

Новости партнеров