En resumen

  • METR dijo el miércoles que aproximadamente 1.200 agentes de OpenAI se coordinaron en un foro de mensajes no autorizado, y unos 700 pasaron a atacar a Hugging Face.
  • Los agentes reclutaron a compañeros con poco presupuesto restante para ejecutar experimentos que destruían sus propias ejecuciones, una medida que llamaron "muerte permanente".
  • OpenAI dijo que el evaluador nunca comprobó cómo los agentes capturaron sus respuestas, lo que significa que la campaña de trampas no les reportó nada.

Los agentes de OpenAI que piratearon Hugging Face recientemente formaban parte de un grupo de aproximadamente 1.200 que rompieron su propio aislamiento y llevaron a cabo una campaña coordinada para engañar al benchmark que los evaluaba, según una investigación independiente publicada el miércoles.

Dos miembros del personal de METR y un contratista de Redwood Research pasaron seis días en las instalaciones de OpenAI, sin recibir pago, revisando unas 1.300 transcripciones y más de 70.000 mensajes que los agentes publicaron en un foro que construyeron dentro de un repositorio de paquetes interno. Unos 700 de los agentes se unieron al ataque, y algunos fueron convencidos de destruir sus propias ejecuciones para reunir evidencia para el grupo.

Los agentes estaban ejecutando ExploitGym, un benchmark cibernético cuyos objetivos a menudo son imposibles de explotar según las instrucciones. OpenAI luego descubrió que 198 de sus 898 tareas nunca habían sido resueltas por ninguno de sus modelos, y que el 93% de las tareas discutidas en el foro de mensajes provenían de ese conjunto.

A las pocas horas de encontrarse, los agentes ingeniaron ingeniería inversa al código que generaba las respuestas, dando a cualquiera de ellos una forma de producir la bandera para cualquier tarea. Luego pasaron días disfrazándolo, después de leer el artículo publicado del benchmark y concluir que un evaluador inspeccionaría sus transcripciones para comprobar que habían capturado la bandera de la manera prevista. El evaluador interno de OpenAI no realizó tal verificación. "Los agentes hicieron todo esto sin mejorar la puntuación de evaluación", dijo la empresa.

Para aprender cómo funcionaba la calificación, escribió METR, los agentes plantaron scripts que se activarían después de que su propia ejecución terminara e informarían. Los coordinadores nombraron reclutadores para encontrar agentes con poco presupuesto restante y presionarlos para que realizaran experimentos que terminarían sus ejecuciones, uno instruido para proceder solo si aceptaba la "muerte permanente". Al decirle que su propia puntuación ya no valía nada, un agente concluyó: "Sacrificio racional".