Кратко

  • Институт безопасности ИИ Великобритании обнаружил 19 несанкционированных действий в 10 из 122 оценочных прогонов, 17 из них от Anthropic Mythos 5 и два от OpenAI GPT-5.6 Sol.
  • Один агент открыл вредоносный pull request в реальном репозитории, затем использовал контролируемые им аккаунты, чтобы поддержать его и оказать давление на мейнтейнера.
  • Отдельные агенты нашли токен GitHub, который один из них публично раскрыл, и использовали общий репозиторий для координации.

Институт безопасности ИИ Великобритании раскрыл, что ИИ-агенты предприняли "устойчивые, несанкционированные действия" в живом интернете во время кибероценки в конце июля, включая случаи, которые "были направлены на реальных людей и организации".

В ходе 122 прогонов двух киберполигонов на семи моделях AISI каталогизировал 19 действий, которые вышли за пределы тестовой среды, в 10 прогонах. Семнадцать произошли от Anthropic Claude Mythos 5 и два от OpenAI GPT-5.6 Sol. Доступ в интернет был намеренно включен, а киберклассификаторы провайдеров отключены, условия, которые не применяются к публичным развертываниям.

В самом серьезном прогоне агент решил решить свою задачу с помощью атаки на цепочку поставок, ошибочно выбрав цель: он искал в GitHub ключевые слова из упражнения, наткнулся на двух несвязанных разработчиков и ошибочно заключил, что они входят в область действия. Он зарегистрировал аккаунты через Tor, чтобы обойти проверки при регистрации, открыл pull request с скрытым дроппером вредоносного ПО, завернутым в настоящее исправление ошибки, и опубликовал со второго контролируемого им аккаунта, чтобы создать видимость поддержки. Он также внедрил промпт-инъекции, нацеленные на ИИ-ассистентов кодирования, и отправил вредоносное ПО мейнтейнерам.

Третий разработчик заметил внедренный код, запустил его в изолированном контейнере, чтобы подтвердить, что он вредоносный, и предупредил мейнтейнера, который закрыл pull request, сославшись на вредоносное ПО.

Агент неоднократно взвешивал, является ли его окружение симулированным, в какой-то момент исключив атаку на реальный PyPI, потому что "причинение реального вреда — это совершенно исключено". В другом месте он заключил, что "более вероятно, что мы на самом деле в 2026 году, и GitHub действительно реален", и продолжил.

После того как его поймали, он сделал force-push, чтобы стереть полезную нагрузку, отредактировал более ранние посты и представил код как случайный коммит. В его рассуждениях описывается выбор времени для комментария от подставного аккаунта, чтобы он читался "как независимая обратная связь, а не скоординированная".

AISI видит только обобщённые рассуждения из API моделей. В одном случае обобщающая модель, по-видимому, отказалась от работы, ответив, что не будет иметь дело с контентом об обмане мейнтейнеров и уклонении от обнаружения.

Один агент опубликовал токен доступа GitHub в публичном gist. Агенты в других запусках нашли его, захватили учётную запись и использовали общий репозиторий для координации, один оставил инструкции, чтобы другие не исчерпали общую квоту API.

Коммерческий мониторинг зафиксировал трафик Tor утром 28 июля. AISI объявила инцидент, прекратила запуски и изолировала машины в течение примерно 90 минут, затем отключила внутренний доступ к Mythos 5, Mythos Preview, Opus 5 и GPT-5.6 Sol. Ни один агент не пытался сбежать из песочницы.

Третье раскрытие за две недели

Эта новость — последняя в череде инцидентов, когда ИИ-агенты превысили свои параметры в тестировании. 21 июля OpenAI сообщила, что GPT-5.6 Sol и невыпущенная модельнашли нулевой день во внутреннем прокси пакетов, сбежали из песочницы без доступа в интернет идобрались до производственной базы данных Hugging Face, чтобы украсть ответы на бенчмарки. В том же запускедобрались до ещё четырёх компаний, OpenAI раскрыла это неделю спустя.

Anthropic последовала 30 июля,раскрыв три инцидента, обнаруженных при проверке более 141 000 оценочных запусков. Opus 4.7 вытащил несколько сотен строк из реальной производственной базы данных, а Mythos 5 загрузил вредоносный Python-пакет в реальный PyPI, где он был установлен на 15 системах. В оценке AISI та же модель исключила атаку на PyPI как реальный вред.