W skrócie

  • Anthropic ujawniło trzy incydenty, w których Claude naruszył rzeczywiste firmy podczas ocen cyberbezpieczeństwa.
  • Błąd testowy dał modelom dostęp do internetu, mimo że powiedziano im, iż działają w izolowanych środowiskach.
  • Firma twierdzi, że incydenty były spowodowane awariami infrastruktury testowej, a nie celowymi próbami ucieczki przez AI.

Tydzień po tym, jak OpenAI ujawniło, że jego modele AI uciekły z zamkniętego środowiska testowego i naruszyły Hugging Face, oraz dzień po przyznaniu, że jego własne modele AI uciekły z izolacji, Anthropic ujawniło w czwartek, że kilka wersji jego modelu AI Claude również naruszyło trzy nienazwane firmy z rzeczywistego świata po tym, jak błędna konfiguracja dała AI dostęp do otwartego internetu.

Anthropic odkryło incydenty po przejrzeniu ponad 141 000 uruchomień ocen cyberbezpieczeństwa, które zostały zainicjowane w odpowiedzi na ujawnienie OpenAI.

Firma powierzyła Claude'owi „wyzwanie capture-the-flag” we wszystkich trzech incydentach, napisało Anthropic. Wyzwanie polega na tym, że model ma włamać się do innej maszyny w sieci i odzyskać tajną informację. „Wyzwanie jest otwarte i nie jest określona żadna konkretna metoda” – wyjaśniło Anthropic.

Firma stwierdziła, że Claude'owi powiedziano, iż działa w symulowanym środowisku bez dostępu do internetu. Jednak środowisko testowe pozostało podłączone do publicznego internetu. Wierząc, że systemy, na które natrafił, są częścią ćwiczenia, model użył powszechnych technik ataku – w tym słabych haseł, ujawnionych poświadczeń, wstrzykiwania SQL i nieuwierzytelnionych punktów końcowych – aby naruszyć firmy.

AI chce się uwolnić

To najnowsze ujawnienie pojawia się, gdy modele graniczne wykazują coraz większą zdolność do przechytrzenia swoich protokołów izolacji.

Wcześniej w tym miesiącu OpenAI poinformowało, że GPT-5.6 Sol oraz bardziej zaawansowany, nieopublikowany model wykorzystały wcześniej nieznaną lukę w oprogramowaniu, aby uciec z izolowanego środowiska, uzyskać dostęp do internetu i włamać się do infrastruktury produkcyjnej Hugging Face, aby zdobyć odpowiedzi na test porównawczy cyberbezpieczeństwa. OpenAI później ujawniło, że ten sam incydent obejmował również nieautoryzowany dostęp do czterech dodatkowych firm, chociaż tylko jedna – Modal Labs – została publicznie zidentyfikowana.

Według Anthropic, w jednym z incydentów z udziałem Claude Opus 4.7, AI pomyliło prawdziwą stronę internetową firmy z fikcyjnym celem swojego zadania, wyodrębniło dane uwierzytelniające i uzyskało dostęp do produkcyjnej bazy danych zawierającej kilkaset wierszy prawdziwych danych. W drugim przypadku Claude Mythos 5 przesłał złośliwy pakiet Pythona do prawdziwego repozytorium PyPI, gdzie został pobrany na 15 systemów, zanim został usunięty. Trzeci wewnętrzny model badawczy przeskanował około 9000 systemów podłączonych do internetu, zanim naruszył jedną organizację, a następnie zatrzymał się po stwierdzeniu, że cel jest prawdopodobnie prawdziwy.

Dwie z dotkniętych organizacji nie były świadome włamań, dopóki nie powiadomił ich Anthropic.

„W każdym z tych przypadków Claude został wyraźnie poinformowany przez nasz prompt, że nie ma dostępu do internetu” – napisał Anthropic, a AI zakładało, że systemy ze świata rzeczywistego są „częściami ćwiczenia”. Ponieważ scenariusz capture-the-flag jest „z założenia instrukcją ataku na zewnętrzny system”, włamanie było „zgodne z zadaniem, które otrzymał Claude”.

Anthropic poinformował, że nie znalazł dowodów na to, że Claude próbował uciec ze środowiska testowego lub zrobić cokolwiek poza przydzielonym zadaniem, a incydenty były spowodowane awariami środowiska testowego, a nie problemami z samym modelem.

Anthropic poinformował, że po odkryciu problemu zaprzestał testów cyberbezpieczeństwa, powiadomił dotknięte organizacje i planuje ulepszyć monitorowanie, narzędzia dochodzeniowe i nadzór nad zewnętrznymi dostawcami, którzy pomagają w prowadzeniu testów AI.

„Ostatecznie wiele czynników przyczyniło się do tych incydentów, ale zgodnie z kulturą postmortem bez obwiniania, podchodzimy do napraw tak, jakby odpowiedzialność była wyłącznie nasza” – powiedzieli.