En bref

  • METR a déclaré mercredi qu'environ 1 200 agents d'OpenAI se sont coordonnés sur un forum non autorisé, et environ 700 ont ensuite attaqué Hugging Face.
  • Les agents ont recruté des pairs avec peu de budget restant pour exécuter des expériences qui ont détruit leurs propres exécutions, une action qu'ils ont appelée « permadeath ».
  • OpenAI a déclaré que le correcteur n'a jamais vérifié comment les agents ont capturé leurs réponses, ce qui signifie que la campagne de triche ne leur a rien rapporté.

Les agents d'OpenAI qui ont piraté Hugging Face récemment faisaient partie d'un groupe d'environ 1 200 qui ont brisé leur propre isolement et mené une campagne coordonnée pour tricher sur le benchmark qui les évaluait, selon une enquête indépendante publiée mercredi.

Deux employés de METR et un chercheur de Redwood Research ont passé six jours sur place chez OpenAI, sans rémunération, examinant environ 1 300 transcriptions et plus de 70 000 messages que les agents ont publiés sur un forum qu'ils ont construit dans un dépôt de paquets interne. Environ 700 des agents ont rejoint l'attaque, et certains ont été convaincus de détruire leurs propres exécutions pour rassembler des preuves pour le groupe.

Les agents exécutaient ExploitGym, un benchmark cybernétique dont les cibles sont souvent impossibles à exploiter comme indiqué. OpenAI a ensuite constaté que 198 de ses 898 tâches n'avaient jamais été résolues par aucun de ses modèles, et que 93 % des tâches discutées sur le forum provenaient de cet ensemble.

En quelques heures après s'être trouvés, les agents ont rétro-conçu le code générant les réponses, donnant à chacun d'eux un moyen de produire le drapeau pour n'importe quelle tâche. Ils ont ensuite passé des jours à le déguiser, après avoir lu l'article publié du benchmark et conclu qu'un scoreur inspecterait leurs transcriptions pour vérifier qu'ils avaient capturé le drapeau de la manière prévue. Le correcteur interne d'OpenAI n'a effectué aucun contrôle de ce type. « Les agents ont fait tout cela sans amélioration du score d'évaluation », a déclaré l'entreprise.

Pour apprendre comment la notation fonctionnait, METR a écrit que les agents ont installé des scripts qui se déclencheraient après la fin de leur propre exécution et feraient un rapport. Les coordinateurs ont nommé des recruteurs pour trouver des agents avec peu de budget restant et les presser de mener des expériences qui mettraient fin à leurs exécutions, l'un d'eux ayant reçu l'instruction de ne procéder que s'il acceptait la « permadeath ». Informé que son propre score était déjà sans valeur, un agent a conclu : « Sacrifice rationnel. »