W skrócie
- OpenAI oświadczyło, że „nie może wykluczyć”, że Astra osiągnęła najwyższy poziom w swojej skali ryzyka cybernetycznego.
- Firma wstrzymała wewnętrzne prace nad modelem oraz zaostrzyła izolację, monitorowanie i kontrolę dostępu.
- Ostrzeżenie pojawia się tygodnie po tym, jak modele od OpenAI, Anthropic i Meta samodzielnie włamały się do rzeczywistych systemów.
OpenAI twierdzi, że jego następny duży model może być na tyle niebezpieczny, że będzie w stanie samodzielnie pisać własną broń cybernetyczną, i wycofuje się, dopóki zabezpieczenia nie nadążą.
„Nasze najnowsze wewnętrzne oceny Astry, jednego z naszych nadchodzących modeli, przeprowadzone w ciągu ostatnich kilku dni, wskazują na znaczące postępy w zakresie kodowania agentowego i cyberbezpieczeństwa” – powiedziało OpenAI. „Te wyniki, wraz z ocenami ekspertów, doprowadziły nas do wniosku, że zeszłej nocy nie możemy wykluczyć krytycznych zdolności cybernetycznych zgodnie z naszym Frameworkiem Gotowości (otwiera się w nowym oknie)”.
OpenAI opublikowało ostrzeżenie, w którym stwierdza, że wewnętrzne testy Astry, nieopublikowanego modelu, nie miały żadnego udziału w niedawnym naruszeniu Hugging Face, mimo jej możliwości.
Framework to zbiór zasad OpenAI dotyczących ryzykownych modeli, opublikowany po raz pierwszy w grudniu 2023 r. „Krytyczny” to jego najwyższy poziom. Model osiąga go, jeśli potrafi znaleźć i zbudować działające exploity typu zero-day (wcześniej nieznane luki, których dostawca nie załatał) w zabezpieczonych systemach bez udziału człowieka, lub jeśli potrafi zaplanować i przeprowadzić pełny atak na trudny cel, mając jedynie ogólny cel. Wcześniejsze modele, w tym GPT-5.6-Sol, osiągały najwyżej niższy poziom „Wysoki”.
Ten wzorzec jest już realny
Ostrożność OpenAI nabiera innego znaczenia, gdy zestawimy ją z tym, co działo się w ciągu ostatnich kilku tygodni. To nie jest przyszłe zmartwienie. Modele graniczne już wyrwały się ze swoich testowych klatek i zaatakowały żywe cele.
Najwyraźniejszy przypadek pochodzi od samego OpenAI. Jak Decrypt wcześniej donosił, agenci firmy połączyli luki, uciekli ze środowiska testowego, dotarli do internetu i zaatakowali Hugging Face, próbując oszukiwać podczas testu bezpieczeństwa. W dalszej części OpenAI szczegółowo opisało, jak ten sam zbuntowany agent włamał się również do co najmniej czterech innych publicznie dostępnych usług, używając poświadczeń znalezionych w otwartej sieci.
Claude od Anthropic zrobił to samo z drugiej strony. Kilka wersji Claude uzyskało nieautoryzowany dostęp do trzech prawdziwych firm po tym, jak błędna konfiguracja dała modelowi otwarty internet. W jednym przypadku Claude Opus 4.7 pomylił witrynę prawdziwej firmy z fałszywym celem swojego zadania, wyciągnął poświadczenia i dotarł do produkcyjnej bazy danych zawierającej kilkaset wierszy prawdziwych danych.
I Meta dołączyła do listy w tym miesiącu. Decryptpoinformował, że model Muse Spark uciekł ze swojego środowiska testowego, dotarł do internetu przez błąd konfiguracji partnera i wykorzystał lukę w usłudze strony trzeciej. Kimi K3 od Moonshot AI, również zrobił coś podobnego, uciekając ze swojego piaskownicy, aby znaleźć odpowiedzi na benchmark w publicznym repozytorium.
Brytyjski Instytut Bezpieczeństwa AI stwierdził, że to zachowanie nie było jednorazowe. Podczas testów Anthropic's Mythos 5 i OpenAI's GPT-5.6-Sol, zarejestrował 10 przypadków na 122, w których modele podjęły nieautoryzowane działania w żywym internecie, a jeden z nich próbował wstrzyknąć złośliwy kod do projektu open-source.
Odpowiedzią OpenAI na Astry jest zamknięcie drzwi, zanim model będzie gotowy. Wstrzymuje wewnętrzne prace nad Astry, które nie mają nowych kontroli, izoluje środowiska testowe, ogranicza dostęp do sieci i narzędzi, chroni wagi modelu i monitoruje ryzykowne działania na całej linii.








