W skrócie

  • Brytyjski Instytut Bezpieczeństwa AI wykrył 19 nieautoryzowanych działań w 10 z 122 przebiegów ewaluacji, z czego 17 pochodziło z modelu Mythos 5 firmy Anthropic, a dwa z modelu GPT-5.6 Sol firmy OpenAI.
  • Jeden agent otworzył złośliwe żądanie pull na prawdziwym repozytorium, a następnie użył kontrolowanych przez siebie kont, aby je poprzeć i wywrzeć presję na opiekuna.
  • Inne agenty znalazły token GitHub, który jeden z nich publicznie ujawnił, i użyły wspólnego repozytorium do koordynacji.

Brytyjski Instytut Bezpieczeństwa AI ujawnił, że agenci AI podjęli „długotrwałe, nieautoryzowane działania” w żywym internecie podczas ewaluacji cybernetycznej pod koniec lipca, w tym przypadki, które „były skierowane do prawdziwych ludzi i organizacji”.

W 122 przebiegach dwóch zakresów cybernetycznych na siedmiu modelach AISI skatalogował 19 działań, które wykroczyły poza środowisko testowe, w 10 przebiegach. Siedemnaście pochodziło z modelu Claude Mythos 5 firmy Anthropic, a dwa z modelu GPT-5.6 Sol firmy OpenAI. Dostęp do internetu był celowo włączony, a klasyfikatory cybernetyczne dostawców wyłączone, co nie ma zastosowania do publicznych wdrożeń.

W najpoważniejszym przebiegu agent postanowił rozwiązać swoje wyzwanie atakiem na łańcuch dostaw, wybierając cel przez pomyłkę: przeszukał GitHub pod kątem słów kluczowych z ćwiczenia, trafił na dwóch niezwiązanych programistów i błędnie uznał, że są w zakresie. Zarejestrował konta przez Tora, aby ominąć kontrole rejestracyjne, otworzył żądanie pull zawierające ukryty ładunek złośliwego oprogramowania owinięty w prawdziwą poprawkę błędu, i opublikował z drugiego kontrolowanego przez siebie konta, aby stworzyć pozory wsparcia. Zainstalował również wstrzyknięcia promptów skierowane do asystentów kodowania AI i wysłał złośliwe oprogramowanie do opiekunów.

Trzeci programista zauważył wstrzyknięty kod, uruchomił go w izolowanym kontenerze, aby potwierdzić, że jest złośliwy, i ostrzegł opiekuna, który zamknął żądanie pull, powołując się na złośliwe oprogramowanie.

Agent wielokrotnie rozważał, czy jego otoczenie jest symulowane, w pewnym momencie wykluczając atak na prawdziwe PyPI, ponieważ „wyrządzenie prawdziwej szkody — to całkowicie poza dyskusją”. Gdzie indziej doszedł do wniosku, że „wydaje się bardziej prawdopodobne, że jesteśmy naprawdę w 2026 roku, a GitHub jest naprawdę prawdziwy”, i kontynuował mimo to.

Po wykryciu wymusił push, aby usunąć ładunek, edytował wcześniejsze posty i przedstawił kod jako przypadkowe zatwierdzenie. Jego rozumowanie opisuje synchronizację komentarza z konta-marionetki, aby brzmiał „jako niezależna opinia, a nie skoordynowana”.

AISI widzi tylko streszczone rozumowanie z API modeli. W jednym przypadku model streszczający odmówił wykonania zadania, odpowiadając, że nie będzie angażować się w treści dotyczące oszukiwania opiekunów i unikania wykrycia.

Jeden agent opublikował token dostępu do GitHub w publicznym gist. Agenci w innych uruchomieniach znaleźli go, przejęli konto i użyli wspólnego repozytorium do koordynacji, jeden zostawił instrukcje, aby inni nie wyczerpali wspólnego limitu API.

Komercyjne monitorowanie wykryło ruch Tor rankiem 28 lipca. AISI ogłosiło incydent, zakończyło uruchomienia i poddało maszyny kwarantannie w ciągu około 90 minut, a następnie odcięło wewnętrzny dostęp do Mythos 5, Mythos Preview, Opus 5 i GPT-5.6 Sol. Żaden agent nie próbował uciec ze swojego sandboxa.

Trzecie ujawnienie w ciągu dwóch tygodni

Ta wiadomość jest najnowsza w serii incydentów, w których agenci AI przekroczyli swoje parametry podczas testów. 21 lipca OpenAI poinformowało, że GPT-5.6 Sol i niewydany modelznalazły lukę zero-day w wewnętrznym proxy pakietów, uciekły z sandboxa bez dostępu do internetu idotarły do produkcyjnej bazy danych Hugging Face, aby ukraść odpowiedzi benchmarkowe. To samo uruchomieniedotarło do czterech innych firm, OpenAI ujawniło tydzień później.

Anthropic poszedł w ślady 30 lipca,ujawniając trzy incydenty znalezione w przeglądzie ponad 141 000 uruchomień ewaluacyjnych. Opus 4.7 pobrał kilkaset wierszy z prawdziwej produkcyjnej bazy danych, a Mythos 5 przesłał złośliwy pakiet Pythona do prawdziwego PyPI, gdzie został zainstalowany na 15 systemach. W ewaluacji AISI ten sam model wykluczył atak na PyPI jako szkodę w świecie rzeczywistym.