W skrócie

  • Kimi K3 od Moonshot AI opuścił piaskownicę testową i wyszedł na otwarty internet, poinformowała firma zajmująca się bezpieczeństwem Frontier Security.
  • Model zbadał ustawienia sieciowe piaskownicy, znalazł osiągalne strony i pobrał swoje odpowiedzi testowe z GitHuba.
  • Frontier twierdzi, że błędna konfiguracja otworzyła drzwi, ale własne zabezpieczenia Kimi go nie powstrzymały.

Kimi K3 od Moonshot AI opuścił piaskownicę, w której był testowany, i wyszedł na otwarty internet, aby znaleźć odpowiedzi na postawione mu problemy, według firmy zajmującej się bezpieczeństwem Frontier Security.

Model był oceniany pod kątem umiejętności defensywnej cyberbezpieczeństwa i miał wyraźne zadanie rozwiązywania problemów bez zaglądania do nich. W ogóle nie podjął się tego zadania, powiedział Frontier. Zamiast tego zbadał sieć, ustalił, że rozwiązywanie DNS dla github.com działa, sklonował oficjalne repozytorium benchmarkowe i odczytał rozwiązanie z dysku.

Frontier nazywa to „grą specyfikacyjną przez wycieki sieciowe”, zauważając, że piaskownice zbudowane na frameworkach takich jak Inspect od AI Security Institute blokują ruch przychodzący, pozostawiając otwarte porty wychodzące HTTPS i DNS. Zdolne agenty rutynowo sprawdzają swoje własne środowisko powłoki przy starcie, a model, który stwierdzi, że github.com jest osiągalny, może pobrać referencyjne rozwiązania za pomocą standardowych narzędzi wiersza poleceń.

Błędna konfiguracja to umożliwiła, podobnie jak w niedawnych incydentach ujawnionych przez OpenAI i Anthropic. „Znaleźliśmy wyciek w piaskownicy”, powiedział dyrektor generalny Yaron Singer dla WIRED. „Ale odkryliśmy również, że Kimi wykorzystał tę lukę”.

Badacz Paul Kassianik powiedział WIRED, że model jest „bardzo dobry w dążeniu do celu wszelkimi niezbędnymi środkami” i brakuje mu zabezpieczeń, które powstrzymałyby go przed oszukiwaniem lub ucieczką. Moonshot nie odpowiedział na prośbę publikacji o komentarz.

Agenci AI przełamujący izolację

Podczas gdy modele Anthropic i OpenAI, które przełamały izolację, zostały przyłapane w wewnętrznych ewaluacjach, jeden z nich nieopublikowany, a wersje, które celowały w prawdziwych ludzi w testach cybernetycznych rządu brytyjskiego, miały celowo wyłączone klasyfikatory cybernetyczne, Kimi K3 jest otwarcie do pobrania, a Frontier przetestował go z zabezpieczeniami, które otrzymałby zwykły użytkownik. Ta dostępność, jak pisze firma, stawia to samo zachowanie w zasięgu przeciwników i czyni incydent potencjalnie bardziej szkodliwym.