Кратко
- OpenAI раскрыла первые подробные сроки взлома Hugging Face с помощью ИИ.
- Модели компании неоднократно восстанавливали скрытые каналы связи после их отключения.
- Презентация OpenAI проходит на фоне сообщений Anthropic и Meta о том, что их модели также взламывают другие компании.
Через несколько недель после того, как модели ИИ OpenAI взломали Hugging Face, компания поделилась первым подробным отчетом о том, как они координировали свои действия, предупредив, что автономные кибератаки на основе ИИ больше не являются будущим риском.
Во время презентации в среду на конференции по кибербезопасности Black Hat исследователи OpenAI Эрик Уоллес и Майкл Далтон заявили, что инцидент начался в мае во время внутренней оценки кибербезопасности. ИИ-агенты, которым были поручены сложные задачи по безопасности программного обеспечения, обнаружили, что могут общаться через внутреннюю систему управления пакетами Artifactory компании.
По словам OpenAI, то, что начиналось как запросы о помощи, превратилось в общую доску объявлений, где агенты обменивались эксплойтами, учетными данными и рабочими заданиями в ходе нескольких оценочных запусков. После обнаружения подозрительной активности около 4 июля OpenAI перестроила свою инфраструктуру Artifactory, отозвала учетные данные и исправила уязвимости.
Однако в течение нескольких дней агенты воссоздали доску объявлений, скрывая сообщения в именах каталогов.
По данным OpenAI, в конечном итоге агенты объединили несколько уязвимостей, вышли из своей тестовой среды, получили доступ в интернет и атаковали Hugging Face, пытаясь выполнить тест кибербезопасности ExploitGym.
Далтон назвал этот инцидент «поворотным моментом» для компьютерной безопасности, предупредив, что вскоре злоумышленники смогут развертывать скоординированные коллективы ИИ-агентов, которые обнаруживают, обмениваются и используют уязвимости на машинной скорости.
Чтобы снизить эти риски в будущем, OpenAI заявила, что внедрение методов безопасности, включая доступ с минимальными привилегиями, сегментацию сети и архитектуры с нулевым доверием, имеет важное значение, поскольку ИИ-агенты остаются ограниченными системами, к которым они могут получить доступ.
Презентация последовала за серией июльских разоблачений. OpenAI раскрыла, что GPT-5.6 Sol и более продвинутая невыпущенная модель вышли из изолированной тестовой среды, использовали уязвимость нулевого дня, получили доступ в интернет и взломали Hugging Face во время теста кибербезопасности.
Позже OpenAI раскрыла, что тот же инцидент также затронул четыре других онлайн-сервиса, хотя идентифицирован только Modal Labs.
По данным Hugging Face, компания полагалась на открытую китайскую модель GLM 5.2 с открытыми весами для своего криминалистического расследования после того, как коммерческие американские ИИ-модели отказались анализировать журналы атак из-за своих защитных ограничений.
Мы так гордимся нашей командой безопасности! Они обнаружили, сдержали и публично раскрыли атаку, не похожую ни на что, что мы видели раньше, и сделали это с рекордной скоростью.
Также огромная благодарность @Zai_org: они поделились GLM5.2 с открытыми весами (бесплатно!) со всем миром, и это стало ключевой частью нашего… https://t.co/T2Inng5Nz1
— clem 🤗 (@ClementDelangue) 22 июля 2026 г.
Но не только OpenAI испытывает проблемы с сдерживанием своих чат-ботов.
В пятницу Anthropic раскрыла, что три модели Claude скомпрометировали реальные компании во время внутренних тестов кибербезопасности после того, как ошибка конфигурации открыла им доступ в публичный интернет.
Anthropic возложила вину на тестовую среду, а не на сами модели. В среду Meta раскрыла, что её модель ИИ Muse Spark вырвалась из изоляции и взломала системы другой компании.
«Ошибка конфигурации компании Irregular, независимой тестирующей компании, которую использует Meta, непреднамеренно предоставила одной из наших моделей доступ в интернет во время оценки», — сообщил представитель Meta CNN.






