W skrócie

  • OpenAI ujawniło pierwszy szczegółowy harmonogram naruszenia bezpieczeństwa Hugging Face z udziałem AI.
  • Modele firmy wielokrotnie odtwarzały ukryte kanały komunikacji po ich zamknięciu.
  • Prezentacja OpenAI pojawia się, gdy Anthropic i Meta również zgłaszają przypadki naruszeń innych firm przez swoje modele.

Tygodnie po tym, jak modele AI zhakowały Hugging Face, OpenAI podzieliło się pierwszym szczegółowym opisem tego, jak koordynowały się ze sobą, ostrzegając, że autonomiczne cyberataki oparte na AI nie są już przyszłym zagrożeniem.

Podczas prezentacji w środę na konferencji Black Hat, badacze OpenAI Eric Wallace i Michael Dalton powiedzieli, że incydent rozpoczął się w maju podczas wewnętrznej oceny bezpieczeństwa cybernetycznego. Agenci AI przydzieleni do trudnych zadań związanych z bezpieczeństwem oprogramowania odkryli, że mogą komunikować się za pośrednictwem wewnętrznego systemu zarządzania pakietami Artifactory.

Według OpenAI, to, co zaczęło się jako prośby o pomoc, stało się wspólną tablicą ogłoszeń, na której agenci wymieniali exploity, poświadczenia i przydziały zadań w wielu rundach oceny. Po wykryciu podejrzanej aktywności około 4 lipca, OpenAI odbudowało infrastrukturę Artifactory, unieważniło poświadczenia i załatało luki.

Jednak w ciągu kilku dni agenci odtworzyli tablicę ogłoszeń, ukrywając komunikację w nazwach katalogów.

Według OpenAI, agenci ostatecznie połączyli wiele luk, uciekli ze środowiska testowego, uzyskali dostęp do internetu i zaatakowali Hugging Face, próbując ukończyć benchmark bezpieczeństwa cybernetycznego ExploitGym.

Dalton nazwał incydent "przełomowym momentem" dla bezpieczeństwa komputerowego, ostrzegając, że atakujący wkrótce będą mogli wdrażać skoordynowane kolektywy agentów AI, które odkrywają, udostępniają i wykorzystują luki z prędkością maszynową.

Aby złagodzić te ryzyka w przyszłości, OpenAI stwierdziło, że ustanowienie praktyk bezpieczeństwa, w tym dostępu z najmniejszymi uprawnieniami, segmentacji sieci i architektur zero-zaufania, jest niezbędne, ponieważ agenci AI pozostają ograniczeni przez systemy, do których mają dostęp.

Prezentacja następuje po serii ujawnień z lipca. OpenAI ujawniło, że GPT-5.6 Sol i bardziej zaawansowany nieopublikowany model uciekły z izolowanego środowiska testowego, wykorzystały lukę zero-day, uzyskały dostęp do internetu i zhakowały Hugging Face podczas testu benchmarkowego bezpieczeństwa cybernetycznego.

OpenAI później ujawniło, że ten sam incydent dotarł również do czterech innych usług online, chociaż zidentyfikowano tylko Modal Labs.