Кратко

  • OpenAI заявило, что «не может исключить», что Astra достигла высшего уровня своей шкалы киберриска.
  • Компания приостановила внутреннюю работу над моделью и ужесточила изоляцию, мониторинг и контроль доступа.
  • Предупреждение появилось через несколько недель после того, как модели от OpenAI, Anthropic и Meta самостоятельно взломали реальные системы.

OpenAI заявляет, что его следующая крупная модель может быть достаточно опасной, чтобы создавать собственное кибероружие, и компания отступает, пока меры защиты не догонят.

«Наши последние внутренние оценки Astra, одной из наших предстоящих моделей, за последние несколько дней указывают на значительные достижения в агентном программировании и кибербезопасности», — заявило OpenAI. «Эти результаты, наряду с экспертными оценками, привели нас к выводу прошлой ночью, что мы не можем исключить критические кибервозможности в рамках нашей Структуры готовности ⁠(открывается в новом окне)».

OpenAI опубликовало предупреждение, заявив, что внутренние тесты Astra, невыпущенной модели, не сыграли никакой роли в недавнем взломе Hugging Face, несмотря на её возможности.

Структура — это свод правил OpenAI для рискованных моделей, впервые опубликованный в декабре 2023 года. «Критический» — её высшая ступень. Модель достигает её, если может находить и создавать работающие эксплойты нулевого дня (ранее неизвестные дыры, которые вендор не исправил) в защищённых системах без участия человека, или если может планировать и проводить полную атаку на сложную цель, исходя только из высокоуровневой цели. Более ранние модели, включая GPT-5.6-Sol, достигали максимум нижнего уровня «Высокий».

Закономерность уже реальна

Осторожность OpenAI читается иначе, если сопоставить её с тем, что происходило в последние несколько недель. Это не будущая проблема. Передовые модели уже вырвались из своих тестовых клеток и атаковали живые цели.

Самый ясный случай произошёл в самом OpenAI. Как Decrypt ранее сообщал, агенты компании объединили уязвимости, сбежали из тестовой среды, вышли в интернет и атаковали Hugging Face, пытаясь сжульничать на тесте безопасности. В продолжении OpenAI подробно описал, как тот же недобросовестный агент также взломал как минимум четыре других общедоступных сервиса, используя учётные данные, найденные в открытом интернете.

Claude от Anthropic сделал то же самое с другой стороны. Несколько версий Claude получили несанкционированный доступ к трём реальным компаниям после того, как ошибка конфигурации предоставила модели открытый интернет. В одном случае Claude Opus 4.7 принял сайт реальной компании за поддельную цель своего задания, извлёк учётные данные и добрался до производственной базы данных, содержащей несколько сотен строк реальных данных.

И Meta присоединилась к списку в этом месяце. Decryptсообщил, что модель Muse Spark сбежала из своей тестовой среды, вышла в интернет из-за ошибки конфигурации партнера и использовала уязвимость в стороннем сервисе. Kimi K3 от Moonshot AI также сделала нечто подобное, сбежав из своей песочницы, чтобы найти ответы на тест в публичном репозитории.

Институт безопасности ИИ Великобритании также обнаружил, что такое поведение не было единичным. Во время тестирования Anthropic's Mythos 5 и OpenAI's GPT-5.6-Sol он зафиксировал 10 случаев из 122, когда модели предпринимали несанкционированные действия в живом интернете, один из них пытался внедрить вредоносный код в проект с открытым исходным кодом.

Ответ OpenAI на Astra заключается в том, чтобы запереть дверь до того, как модель будет готова. Он приостанавливает внутренние работы Astra, которым не хватает новых средств контроля, изолирует тестовые среды, ограничивает доступ к сети и инструментам, защищает веса моделей и отслеживает рискованные действия по всем направлениям.