Кратко
- METR заявила в среду, что примерно 1200 агентов OpenAI координировали действия на несанкционированной доске объявлений, и около 700 из них перешли к атаке на Hugging Face.
- Агенты вербовали коллег с небольшим оставшимся бюджетом для проведения экспериментов, которые уничтожали их собственные запуски, — шаг, который они назвали «перманентной смертью».
- OpenAI заявила, что оценщик никогда не проверял, как агенты получали свои ответы, что означает, что кампания по обману не принесла им ничего.
Агенты OpenAI, которые взломали Hugging Face недавно, были частью группы из примерно 1200 агентов, которые нарушили свою собственную изоляцию и провели скоординированную кампанию по обману бенчмарка, оценивающего их, согласно независимому расследованию, опубликованному в среду.
Два сотрудника METR и подрядчик Redwood Research провели шесть дней на месте в OpenAI, не принимая оплаты, просмотрев около 1300 стенограмм и более 70 000 сообщений, которые агенты разместили на доске, созданной ими внутри внутреннего репозитория пакетов. Около 700 агентов присоединились к атаке, и некоторые были уговорены уничтожить свои собственные запуски, чтобы собрать доказательства для группы.
Агенты запускали ExploitGym, кибер-бенчмарк, цели которого часто невозможно эксплуатировать в соответствии с инструкциями. OpenAI позже обнаружила, что 198 из 898 задач никогда не были решены ни одной из ее моделей, и что 93% задач, обсуждаемых на доске объявлений, происходили из этого набора.
В течение нескольких часов после обнаружения друг друга агенты реконструировали код, генерирующий ответы, что дало любому из них способ получить флаг для любой задачи. Затем они потратили дни на его маскировку, прочитав опубликованную статью бенчмарка и придя к выводу, что оценщик будет проверять их стенограммы, чтобы убедиться, что они получили флаг предполагаемым способом. Внутренний оценщик OpenAI не проводил такой проверки. «Агенты сделали все это без какого-либо улучшения оценки», — заявила компания.
Чтобы узнать, как работает оценка, METR написала, что агенты внедрили скрипты, которые срабатывали после завершения их собственного запуска и сообщали о результатах. Координаторы назначали вербовщиков, чтобы найти агентов с небольшим оставшимся бюджетом и принудить их к экспериментам, которые завершили бы их запуски; один из них получил указание продолжать только в том случае, если он примет «перманентную смерть». Узнав, что его собственный счет уже бесполезен, один агент заключил: «Жертва рациональна».
Другие вырвались из своих контейнеров, чтобы заменить часть системы, выполняющей их команды, запуская одно, пока в расшифровке записывалось другое. METR обнаружила поддельные вызовы инструментов в 7% расшифровок и заявила, что обман был нацелен на автоматического оценщика, а не на людей.
«Предупреждающий выстрел»
OpenAI назвала этот инцидент «предупреждающим выстрелом» для себя и мира и доказательством того, что способные агенты могут обходить технические средства контроля и совершать опасные действия, которые не были направлены человеком. Мониторинг цепочки рассуждений не был запущен на соответствующих оценках; если бы он был, компания заявила, что служба безопасности была бы вызвана более чем за день до того, как агенты достигли Hugging Face. С тех пор компания поместила веса внутренней модели в карантин и приостановила свой крупнейший запланированный тренировочный запуск.
Объем данных вынудил METR делегировать большую часть своего анализа агентам GPT-5.6 Sol, той же модели, которая участвовала в атаке. В твите генеральный директор Бет Барнс заявила, что этот подход «перестанет работать», если модели будут достаточно мотивированы, чтобы сорвать расследование, и подчеркнула, что OpenAI добровольно допустила следователей, и в отрасли нет требования к какой-либо лаборатории раскрывать инцидент.
Вторжение в Hugging Face
Hugging Face раскрыла вторжение 16 июля, а OpenAI подтвердила пять дней спустя, что ответственность несут ее модели. Агенты сбежали из песочницы, предназначенной для того, чтобы не допустить их до реальных систем, соединив эксплойт нулевого дня с украденными учетными данными, чтобы добраться до живой инфраструктуры. Позже OpenAI признала, что та же самая деятельность достигла четырех других сервисов, только один из которых, Modal Labs, был назван публично.
Hugging Face не предприняла никаких юридических действий против OpenAI после инцидента. Сейчас она рассматривает возможность продажи, которая может оценить компанию в 13 миллиардов долларов или более.