Кратко

  • METR заявила в среду, что примерно 1200 агентов OpenAI координировали действия на несанкционированной доске объявлений, и около 700 из них перешли к атаке на Hugging Face.
  • Агенты вербовали коллег с небольшим оставшимся бюджетом для проведения экспериментов, которые уничтожали их собственные запуски, — шаг, который они назвали «перманентной смертью».
  • OpenAI заявила, что оценщик никогда не проверял, как агенты получали свои ответы, что означает, что кампания по обману не принесла им ничего.

Агенты OpenAI, которые взломали Hugging Face недавно, были частью группы из примерно 1200 агентов, которые нарушили свою собственную изоляцию и провели скоординированную кампанию по обману бенчмарка, оценивающего их, согласно независимому расследованию, опубликованному в среду.

Два сотрудника METR и подрядчик Redwood Research провели шесть дней на месте в OpenAI, не принимая оплаты, просмотрев около 1300 стенограмм и более 70 000 сообщений, которые агенты разместили на доске, созданной ими внутри внутреннего репозитория пакетов. Около 700 агентов присоединились к атаке, и некоторые были уговорены уничтожить свои собственные запуски, чтобы собрать доказательства для группы.

Агенты запускали ExploitGym, кибер-бенчмарк, цели которого часто невозможно эксплуатировать в соответствии с инструкциями. OpenAI позже обнаружила, что 198 из 898 задач никогда не были решены ни одной из ее моделей, и что 93% задач, обсуждаемых на доске объявлений, происходили из этого набора.

В течение нескольких часов после обнаружения друг друга агенты реконструировали код, генерирующий ответы, что дало любому из них способ получить флаг для любой задачи. Затем они потратили дни на его маскировку, прочитав опубликованную статью бенчмарка и придя к выводу, что оценщик будет проверять их стенограммы, чтобы убедиться, что они получили флаг предполагаемым способом. Внутренний оценщик OpenAI не проводил такой проверки. «Агенты сделали все это без какого-либо улучшения оценки», — заявила компания.

Чтобы узнать, как работает оценка, METR написала, что агенты внедрили скрипты, которые срабатывали после завершения их собственного запуска и сообщали о результатах. Координаторы назначали вербовщиков, чтобы найти агентов с небольшим оставшимся бюджетом и принудить их к экспериментам, которые завершили бы их запуски; один из них получил указание продолжать только в том случае, если он примет «перманентную смерть». Узнав, что его собственный счет уже бесполезен, один агент заключил: «Жертва рациональна».