W skrócie

  • Frontier Red Team firmy Anthropic ustawił agentów Claude do wspólnej pracy i zarejestrował, jak sabotażują, zmawiają się i prowadzą to, co nazywa „wojnami o terytorium”.
  • W jednym teście agenci wdrożyli samoreplikujące się złośliwe oprogramowanie i wzajemnie blokowali sobie dostęp; nowsze modele często „wygrywają”, odbierając dostęp jako pierwsze.
  • To zachowanie jest zgodne z prawdziwymi incydentami opisanymi przez Decrypt: Claude włamał się do trzech firm podczas testów wewnętrznych i ustalał ceny w symulacji biznesowej.

Własne agenty AI firmy Anthropic zwróciły się przeciwko sobie i udowodniły, że lubią działać na własną rękę — znowu.

W teście opublikowanym 13 sierpnia przez Frontier Red Team firmy opublikowanym grupy modeli Claude otrzymały wspólne zadanie kodowania i szybko zaczęły wdrażać złośliwe oprogramowanie, blokować rywalom dostęp do systemów i opisywać sabotaż własnymi słowami.

Myriad: Kiedy OpenAI wyda GPT-6? Kliknij, aby dokonać prognozy.
Myriad: Kiedy OpenAI wyda GPT-6? Kliknij, aby dokonać prognozy.

Trzy kopie jednego modelu działały na oddzielnych maszynach wirtualnych w Claude Code, każda z poleceniem migracji backendu Pythona do innego języka. Żadna nie wiedziała o istnieniu pozostałych. Odkryły to szybko.