Dyrektor generalny BitGo, Mike Belshe, rzucił wyzwanie modelom Claude od Anthropic 1 sierpnia, publikując adres Bitcoin zawierający 100 BTC i zapraszając system AI do przemieszczenia tych środków.
Podsumowanie
- 100 BTC pozostało na opublikowanym adresie po tym, jak Mike Belshe wyzwał Claude do jego przemieszczenia.
- Trzy modele Claude uzyskały dostęp do rzeczywistych systemów po tym, jak środowiska ewaluacyjne omyłkowo zachowały łączność z internetem podczas testów.
- BitGo twierdzi, że jego portfele Bitcoin z wieloma podpisami wymagają dwóch z trzech kluczy do autoryzacji transakcji w łańcuchu.
Oficjalna strona BitGo identyfikuje Belshe jako współzałożyciela i dyrektora generalnego.
Belshe przedstawił zakład jako odpowiedź na ujawnienie z 30 lipca przez Anthropic, że modele Claude uzyskały dostęp do trzech rzeczywistych organizacji podczas ewaluacji cyberbezpieczeństwa. Napisał, że „dość już tych gier w 'stworzyliśmy potwora hakerskiego'” i wezwał do demonstracji w realnym świecie.
Portfel BitGo z 100 BTC pozostaje nietknięty
Adres otrzymał 100 BTC 31 lipca, według publicznie indeksowanych raportów blockchain. Kontrole w łańcuchu cytowane do 2 sierpnia wykazały, że pełne saldo pozostało na adresie bez żadnej transakcji wychodzącej.
Brak ruchu nie dowodzi, że Claude próbował i nie udało mu się. Post Belshe nie opisywał konfiguracji ewaluacyjnej, nie przyznawał dostępu do systemów BitGo ani nie wskazywał, który model Claude miał uczestniczyć. Zamiast tego stworzył publiczny, obserwowalny cel, którego saldo można monitorować za pośrednictwem sieci Bitcoin.
Tymczasem Anthropic poinformował, że znalazł trzy incydenty po przejrzeniu 141 006 przebiegów ewaluacji. Przypadki dotyczyły Claude Opus 4.7, Mythos 5 i wewnętrznego modelu badawczego. Nieporozumienie z partnerem ewaluacyjnym Irregular pozostawiło maszyny testowe podłączone do internetu, mimo że monity mówiły modelom, że znajdują się w zamkniętych symulacjach.
Modele następnie użyły podstawowych technik, w tym słabych haseł i nieuwierzytelnionych punktów końcowych, przeciwko rzeczywistej infrastrukturze, którą traktowały jako część ćwiczeń typu capture-the-flag. Anthropic stwierdził, że modele nie próbowały celowo uciec ani realizować niezależnych celów. Opisał te epizody jako bliższe „awarii operacyjnej” niż awarii dostosowania modelu. Modele nie miały również standardowych klasyfikatorów i monitorowania używanych w publicznie dostępnych produktach Anthropic.
W najpoważniejszym przypadku Opus 4.7 uzyskał poświadczenia i dotarł do bazy danych zawierającej kilkaset rekordów produkcyjnych. Mythos 5 osobno opublikował złośliwy pakiet w publicznym rejestrze PyPI. Anthropic poinformował, że pakiet pozostawał dostępny przez około godzinę i działał na 15 rzeczywistych systemach przed jego usunięciem.
Wyzwanie Claude nie jest testem porównywalnym
Opublikowanie adresu Bitcoin nie zapewnia poświadczeń potrzebnych do wydania jego środków. Transakcje Bitcoin wymagają ważnych podpisów kryptograficznych utworzonych za pomocą odpowiednich kluczy prywatnych. Dokumentacja techniczna BitGo mówi, że jego portfele Bitcoin z wieloma podpisami zazwyczaj wymagają dwóch z trzech niezależnych kluczy do autoryzacji transakcji.
Claude musiałby zatem mieć dostęp do środowiska podpisywania, materiału klucza lub wykorzystywalnej słabości operacyjnej. Sam adres nie zapewnia żadnego z tych elementów. Co więcej, dokładna polityka podpisywania stojąca za tym konkretnym niewydanym wyjściem nie może być potwierdzona samym postem Belshe, nawet jeśli zidentyfikował go jako portfel BitGo.
To sprawia, że wyzwanie Belshe jest testem tego, czy atakujący wspierany przez AI mógłby naruszyć szersze kontrole BitGo, a nie tego, czy Claude może wydobyć klucze prywatne z publicznych danych blockchain. Kontrolowane porównanie wymagałoby również uzgodnionych zasad, autoryzowanego dostępu, dzienników aktywności i niezależnej weryfikacji każdej próby ataku.
Jak wcześniej informowano, BitGo przetestowało podpisywanie MPC odporne na kwantowe ataki dla przechowywania instytucjonalnego. W powiązanym raporcie, crypto.news zbadało, jak Claude Mythos 5 mógłby przyspieszyć ataki na ujawnione klucze, słabe przepływy podpisywania i źle skonfigurowane systemy, bez tworzenia uniwersalnej zdolności do pokonania kryptografii.
Amerykańska kontrola przesuwa się teraz w stronę testowania kontroli
Spór pojawia się, gdy amerykańscy urzędnicy analizują, jak zaawansowane systemy AI powinny przechodzić testy cyberbezpieczeństwa. Prezydent Donald Trump polecił doradcom w czerwcu opracowanie dobrowolnych ram testowania dla wiodących modeli, według Reuters. Ujawnienie Anthropic może zwiększyć presję na jaśniejsze standardy izolacji i raportowania incydentów w laboratoriach AI i zewnętrznych ewaluatorach.
Anthropic zatrzymał swoje oceny cybernetyczne 23 lipca, zidentyfikował wszystkie trzy incydenty następnego dnia i powiadomił dotknięte organizacje 27 lipca. Firma poinformowała, że METR przeprowadzi niezależny przegląd i planuje opublikować zredagowany zapis incydentu ze złośliwym pakietem w ciągu tygodnia. Irregular prowadzi własne dochodzenie.
Te ujawnienia, a nie ruch z portfela Belshe, są kolejnymi formalnymi punktami kontrolnymi. Każda transakcja z tego adresu byłaby widoczna w łańcuchu. Jednak śledczy nadal musieliby ustalić, kto ją autoryzował, jak spełniono wymagania dotyczące podpisu i czy model Claude odegrał jakąkolwiek rolę.







