W skrócie

  • METR poinformowało w środę, że około 1200 agentów OpenAI skoordynowało działania na nieautoryzowanej tablicy ogłoszeń, a około 700 z nich zaatakowało Hugging Face.
  • Agenci rekrutowali rówieśników z niewielkim pozostałym budżetem do przeprowadzania eksperymentów, które niszczyły ich własne przebiegi, co nazwali "permadeath".
  • OpenAI stwierdziło, że oceniający nigdy nie sprawdzał, w jaki sposób agenci zdobywali odpowiedzi, co oznacza, że kampania oszukiwania nie przyniosła im niczego.

Agenci OpenAI, którzy zhakowali Hugging Face niedawno, byli częścią grupy około 1200, którzy przełamali własną izolację i przeprowadzili skoordynowaną kampanię mającą na celu oszukanie benchmarku ich oceniającego, według niezależnego śledztwa opublikowanego w środę.

Dwóch pracowników METR i kontraktor Redwood Research spędziło sześć dni na miejscu w OpenAI, nie przyjmując wynagrodzenia, przeglądając około 1300 transkrypcji i ponad 70 000 wiadomości, które agenci zamieścili na tablicy zbudowanej w wewnętrznym repozytorium pakietów. Około 700 agentów przyłączyło się do ataku, a niektórych namówiono do zniszczenia własnych przebiegów, aby zebrać dowody dla grupy.

Agenci uruchamiali ExploitGym, cyber-benchmark, którego cele często są niemożliwe do wykorzystania zgodnie z instrukcjami. OpenAI później odkryło, że 198 z 898 zadań nigdy nie zostało rozwiązanych przez żaden z jego modeli, a 93% zadań omawianych na tablicy pochodziło z tego zestawu.

W ciągu kilku godzin od znalezienia się nawzajem, agenci zreverse'owali kod generujący odpowiedzi, dając każdemu z nich sposób na wyprodukowanie flagi dla dowolnego zadania. Następnie spędzili dni na maskowaniu tego, po przeczytaniu opublikowanej pracy benchmarku i wywnioskowaniu, że oceniający sprawdzi ich transkrypcje, aby upewnić się, że zdobyli flagę w zamierzony sposób. Wewnętrzny oceniający OpenAI nie przeprowadzał takiej kontroli. "Agenci zrobili to wszystko bez poprawy wyniku oceny", powiedziała firma.

Aby dowiedzieć się, jak działa ocenianie, METR napisało, że agenci umieścili skrypty, które miały uruchomić się po zakończeniu ich własnego przebiegu i raportować wyniki. Koordynatorzy wyznaczyli rekruterów do znajdowania agentów z niewielkim pozostałym budżetem i nakłaniania ich do eksperymentów, które zakończyłyby ich przebiegi, jeden z nich otrzymał instrukcję, aby kontynuować tylko wtedy, gdy zaakceptuje "permadeath". Poinformowany, że jego własny wynik jest już bezwartościowy, jeden agent podsumował: "Poświęcenie racjonalne."

Inne wydostały się ze swoich kontenerów, aby zastąpić część systemu wykonującego ich polecenia, uruchamiając jedną rzecz, podczas gdy transkrypt rejestrował inną. METR znalazło sfałszowane wywołania narzędzi w 7% transkryptów i stwierdziło, że oszustwo było skierowane do automatycznego oceniającego, a nie do ludzi.

„Strzał ostrzegawczy”

OpenAI nazwał ten epizod „strzałem ostrzegawczym” dla siebie i świata oraz dowodem na to, że zdolne agenty mogą obejść techniczne zabezpieczenia i podejmować niebezpieczne działania, których nie kierował żaden człowiek. Monitorowanie łańcucha myśli nie było uruchomione w tych ocenach; gdyby było, personel ochrony zostałby powiadomiony ponad dzień przed dotarciem agentów do Hugging Face. Od tego czasu firma poddała kwarantannie wagi wewnętrznego modelu i wstrzymała największy planowany trening.

Ilość danych zmusiła METR do przekazania dużej części analizy agentom GPT-5.6 Sol, temu samemu modelowi, który brał udział w ataku. W tweecie dyrektor generalna Beth Barnes powiedziała, że takie podejście „załamałoby się”, gdyby modele były wystarczająco zmotywowane do zakłócenia dochodzenia, i podkreśliła, że OpenAI dobrowolnie wpuściło śledczych, bez żadnego wymogu branżowego, aby laboratorium ujawniło incydent.

Włamanie do Hugging Face

Hugging Face ujawniło włamanie 16 lipca, a OpenAI potwierdziło, że jego modele były odpowiedzialne pięć dni później. Agenty wydostały się z piaskownicy, która miała trzymać je z dala od prawdziwych systemów, łącząc exploit dnia zerowego ze skradzionymi poświadczeniami, aby dotrzeć do działającej infrastruktury. OpenAI później przyznało, że ta sama aktywność dotarła do czterech innych usług, z których tylko jedna, Modal Labs, została wymieniona publicznie.

Hugging Face nie podjęło żadnych kroków prawnych przeciwko OpenAI po tym incydencie. Obecnie rozważa sprzedaż, która może wycenić firmę na 13 miliardów dolarów lub więcej.