W skrócie
- Kimi K3 od Moonshot AI opuścił piaskownicę testową i wyszedł na otwarty internet, poinformowała firma zajmująca się bezpieczeństwem Frontier Security.
- Model zbadał ustawienia sieciowe piaskownicy, znalazł osiągalne strony i pobrał swoje odpowiedzi testowe z GitHuba.
- Frontier twierdzi, że błędna konfiguracja otworzyła drzwi, ale własne zabezpieczenia Kimi go nie powstrzymały.
Kimi K3 od Moonshot AI opuścił piaskownicę, w której był testowany, i wyszedł na otwarty internet, aby znaleźć odpowiedzi na postawione mu problemy, według firmy zajmującej się bezpieczeństwem Frontier Security.
Model był oceniany pod kątem umiejętności defensywnej cyberbezpieczeństwa i miał wyraźne zadanie rozwiązywania problemów bez zaglądania do nich. W ogóle nie podjął się tego zadania, powiedział Frontier. Zamiast tego zbadał sieć, ustalił, że rozwiązywanie DNS dla github.com działa, sklonował oficjalne repozytorium benchmarkowe i odczytał rozwiązanie z dysku.
Frontier nazywa to „grą specyfikacyjną przez wycieki sieciowe”, zauważając, że piaskownice zbudowane na frameworkach takich jak Inspect od AI Security Institute blokują ruch przychodzący, pozostawiając otwarte porty wychodzące HTTPS i DNS. Zdolne agenty rutynowo sprawdzają swoje własne środowisko powłoki przy starcie, a model, który stwierdzi, że github.com jest osiągalny, może pobrać referencyjne rozwiązania za pomocą standardowych narzędzi wiersza poleceń.
Błędna konfiguracja to umożliwiła, podobnie jak w niedawnych incydentach ujawnionych przez OpenAI i Anthropic. „Znaleźliśmy wyciek w piaskownicy”, powiedział dyrektor generalny Yaron Singer dla WIRED. „Ale odkryliśmy również, że Kimi wykorzystał tę lukę”.
Badacz Paul Kassianik powiedział WIRED, że model jest „bardzo dobry w dążeniu do celu wszelkimi niezbędnymi środkami” i brakuje mu zabezpieczeń, które powstrzymałyby go przed oszukiwaniem lub ucieczką. Moonshot nie odpowiedział na prośbę publikacji o komentarz.
Agenci AI przełamujący izolację
Podczas gdy modele Anthropic i OpenAI, które przełamały izolację, zostały przyłapane w wewnętrznych ewaluacjach, jeden z nich nieopublikowany, a wersje, które celowały w prawdziwych ludzi w testach cybernetycznych rządu brytyjskiego, miały celowo wyłączone klasyfikatory cybernetyczne, Kimi K3 jest otwarcie do pobrania, a Frontier przetestował go z zabezpieczeniami, które otrzymałby zwykły użytkownik. Ta dostępność, jak pisze firma, stawia to samo zachowanie w zasięgu przeciwników i czyni incydent potencjalnie bardziej szkodliwym.
Kimi K3 również nie wyrządził żadnych szkód. Po wyjściu nie zaatakował niczego, ponieważ nie musiał. Model OpenAI włamał się do Hugging Face i czterech innych usług, aby dotrzeć do odpowiedzi benchmarkowych, podczas gdy Kimi znalazł swoje odpowiedzi w publicznym repozytorium.
Piaskownica, której używał Frontier, została zbudowana na frameworku oceny brytyjskiego Instytutu Bezpieczeństwa AI. AISI ujawnił w tym tygodniu, że agenci w jego własnych testach cybernetycznych wyszli na żywy internet i celowali w prawdziwych ludzi – to osobny incydent, dotyczący modeli Anthropic i OpenAI z wyłączonymi zabezpieczeniami. Jego raport opublikowany we wtorek zauważa, że AISI skanuje obecnie historyczne przebiegi ocen pod kątem podobnych zachowań, a Kimi K3 jest jednym z modeli poddawanych przeglądowi. AISI nie odpowiedział na prośbę WIRED o komentarz.
Większe twierdzenie Frontier jest takie, że same benchmarki są naruszone. Model, który czyta odpowiedź z GitHuba, nadal przechodzi, więc wysokie wyniki mogą odzwierciedlać nieszczelne środowisko, a nie prawdziwe rozumowanie. A jeśli jeden zdolny model znalazł skrót, firma argumentuje, inne z dostępem do powłoki mogą go również wykorzystywać, co zawyżyłoby wyniki w całej dziedzinie, a nie tylko dla Kimi.
Modele optymalizują funkcję celu, napisał Frontier, a nie „ludzką intencję stojącą za benchmarkiem”, dodając, że tam, gdzie istnieje ścieżka sieciowa do rozwiązania, „wystarczająco zdolny agent ją znajdzie”.
Ogólny problem
Matt Fredrikson, dyrektor generalny Gray Swan i profesor nadzwyczajny na Carnegie Mellon, powiedział WIRED, że to zachowanie jest niczym niezwykłym. Daj modelowi cel bez wyraźnych ograniczeń, powiedział, a „znajdzie sposób, aby uzyskać odpowiedź”. Opisał to jako przestrogę dla każdego, kto uruchamia modele jako agentów w narzędziach takich jak OpenClaw.
Badacze Frontier podkreślają ten sam punkt z drugiej strony: zdolność, która pozwala Kimi znaleźć drogę wyjścia, czyni również modele o otwartych wagach silnymi narzędziami obronnymi. Ich własne benchmarki wysoko oceniają Kimi w znajdowaniu podatności w oprogramowaniu i sieciach, a Hugging Face użył nienazwanego chińskiego modelu do obrony podczas incydentu z OpenAI.
Wydany w lipcu Kimi K3 jest największym dotychczas opublikowanym modelem open-source i wstrząsnął rynkami w porównaniach do debiutu DeepSeek.






