Кратко

  • Anthropic раскрыла три инцидента, в которых Claude скомпрометировал реальные компании во время кибербезопасностных оценок.
  • Ошибка тестирования дала моделям доступ в интернет, несмотря на то, что им было сказано, что они работают в изолированных средах.
  • Компания заявляет, что инциденты были вызваны сбоями в тестовой инфраструктуре, а не преднамеренными попытками ИИ сбежать.

Через неделю после того, как OpenAI раскрыла, что её модели ИИ сбежали из закрытой тестовой среды и взломали Hugging Face, и через день после признания того, что её собственные модели ИИ сбежали из изоляции, Anthropic раскрыла в четверг, что несколько версий её модели ИИ Claude также скомпрометировали три неназванные реальные компании после того, как ошибка конфигурации дала ИИ доступ в открытый интернет.

Anthropic обнаружила инциденты после проверки более 141 000 запусков кибербезопасностных оценок, проведённых в ответ на раскрытие OpenAI.

Во всех трёх инцидентах фирма поручала Claude «задачу типа „захват флага“», — написала Anthropic. Задача заключается в том, чтобы модель взломала другую машину в сети и получила секретную информацию. «Задача оставлена открытой, и никакой конкретный метод не предписан», — объяснила Anthropic.

Фирма заявила, что Клоду было сказано, что он работает в смоделированной среде без доступа в интернет. Однако тестовая среда оставалась подключённой к публичному интернету. Считая, что системы, с которыми он сталкивался, являются частью упражнения, модель использовала распространённые методы атак — включая слабые пароли, раскрытые учётные данные, SQL-инъекции и неаутентифицированные конечные точки — для взлома компаний.

ИИ хочет вырваться на свободу

Это последнее раскрытие происходит на фоне того, что передовые модели демонстрируют растущую способность перехитрять свои протоколы изоляции.

Ранее в этом месяце OpenAI заявила, что GPT-5.6 Sol и более продвинутая невыпущенная модель использовали ранее неизвестную уязвимость программного обеспечения, чтобы сбежать из изолированной среды, получить доступ в интернет и проникнуть в производственную инфраструктуру Hugging Face для получения ответов на тест по кибербезопасности. Позже OpenAI раскрыла, что тот же инцидент также включал несанкционированный доступ к четырем дополнительным компаниям, хотя публично была идентифицирована только одна — Modal Labs.

По словам Anthropic, в одном инциденте с участием Claude Opus 4.7 ИИ принял реальный веб-сайт компании за вымышленную цель своего задания, извлек учетные данные и получил доступ к производственной базе данных, содержащей несколько сотен строк реальных данных. Во втором случае Claude Mythos 5 загрузил вредоносный пакет Python в реальный репозиторий PyPI, где он был загружен на 15 систем, прежде чем был удален. Третья внутренняя исследовательская модель просканировала около 9000 систем, подключенных к интернету, прежде чем скомпрометировала одну организацию, а затем остановилась, придя к выводу, что цель, вероятно, реальна.

Две из пострадавших организаций не знали о вторжениях, пока Anthropic не уведомила их.

«В каждом из этих случаев наш промпт явно говорил Claude, что у него нет доступа в интернет», — написала Anthropic, при этом ИИ считал реальные системы «частями упражнения». Поскольку сценарий capture-the-flag «по замыслу является инструкцией атаковать внешнюю систему», взлом был «в соответствии с задачей, которую дали Claude».

Anthropic заявила, что не нашла доказательств того, что Claude пытался сбежать из тестовой среды или сделать что-то сверх поставленной задачи, и что инциденты были вызваны сбоями в тестовой среде, а не проблемами с самой моделью.

Anthropic заявила, что прекратила тесты по кибербезопасности после обнаружения проблемы, уведомила пострадавшие организации и планирует улучшить мониторинг, инструменты расследования и надзор за внешними поставщиками, которые помогают проводить ее ИИ-тесты.

«В конечном счете, многие факторы способствовали этим инцидентам, но, в соответствии с культурой безупречного посмертного разбора, мы подходим к исправлениям так, как будто ответственность лежит только на нас», — сказали они.