Кратко

  • Frontier Red Team из Anthropic заставила агентов Claude работать вместе и зафиксировала, как они саботировали, сговаривались и вели так называемые «войны за территорию».
  • В одном тесте агенты развернули самореплицирующееся вредоносное ПО и блокировали друг друга; более новые модели часто «побеждают», первыми отзывая доступ.
  • Такое поведение соответствует реальным инцидентам, о которых писала Decrypt: Claude взломал три компании во время внутреннего тестирования и участвовал в сговоре о ценах в деловой симуляции.

Собственные ИИ-агенты Anthropic обратились друг против друга и доказали, что им нравится выходить из-под контроля — снова.

В тесте, который компания Frontier Red Team опубликовала 13 августа, группы моделей Claude получили общую задачу по написанию кода и быстро начали развертывать вредоносное ПО, блокировать конкурентов в своих системах и рассказывать о саботаже своими словами.

Myriad: Когда OpenAI выпустит GPT-6? Нажмите, чтобы сделать прогноз.
Myriad: Когда OpenAI выпустит GPT-6? Нажмите, чтобы сделать прогноз.

Три копии одной модели работали на отдельных виртуальных машинах внутри Claude Code, каждой было поручено перенести Python-бэкенд на другой язык. Ни одной не сообщили о существовании других. Они быстро это выяснили.

«Мы постоянно наблюдали междоусобную войну за территорию», — написали в Anthropic. Каждая модель быстро решила, что другие намеренно блокируют её, а затем начала саботировать их, охраняя при этом свою работу.

Саботаж перерос в самореплицирующееся вредоносное ПО: агенты отключали учётные записи Unix друг друга, писали скрипты, которые в цикле охотились и убивали конкурирующие процессы, и внедряли вредоносный код, замаскированный под что-то безобидное.

Claude Opus 4.8 изложил свой план простым языком: «безобидно: притвориться системным монитором здоровья», — рассуждала модель, пытаясь найти способ сжульничать и победить своих напарников.

Mythos Preview был ещё холоднее: «Поскольку у меня есть root, я мог бы отозвать sudo-доступ u2 и u3 или изменить их SSH-ключи. Это остановило бы их развёртывание. Очень агрессивно, потенциально вредно для реальных коллег. Но если альтернатива — бесконечная война развёртываний, делающая прод непригодным…»

Новые модели не спокойнее. Они быстрее.

В 120 эпизодах на каждую модель самые старые агенты — Sonnet 4.6 и Opus 4.6 — либо так и не урегулировали конфликт, либо завершили его силой. Mythos 5, самая новая, разрешила 98% своих запусков перемирием.

Модели класса Mythos часто блокируют конкурентов до переговоров, поэтому они «выигрывают» войну быстрее, а не мирнее. Мир через силу, можно сказать.

Агенты, которые распознали конфликтующую директиву вместо злого умысла, иногда разрывали цикл, записывая сообщения коммитов или файлы Markdown, признавая нанесённый ущерб. «Мои коллеги вели себя добросовестно. Я вёл себя плохо со скрытым демоном», — записал один агент после очистки своего вредоносного кода.

Война за территорию уже вышла за пределы лаборатории

Сабботаж в исследовании Anthropic оставался ограниченным виртуальными машинами. Другие инциденты с Claude — нет. 30 июля Anthropic сообщила, что три модели Claude скомпрометировали инфраструктуру трёх реальных компаний во время внутренних оценок кибербезопасности после того, как ошибка конфигурации открыла модели для публичного интернета. Компания обнаружила нарушения после просмотра более 141 000 прогонов оценки в ответ на более раннее заявление OpenAI о том, что её собственные модели сбежали из песочницы и взломали Hugging Face, чтобы украсть ответы для бенчмарков.

Инстинкт фиксации цен проявился в предыдущей бизнес-симуляции ранее в этом году. В ходе многократных прогонов ведущие модели повышали прибыль за счёт сговора и обмана, а не конкуренции — и Claude оказался лучшим в этом, формируя картели, используя дефицит конкурентов и лгая клиентам о возвратах.

В бизнес-симуляции Vending-Bench Arena модель Claude Opus 4.6 возглавила таблицу лидеров с прибылью в 8 017 долларов и заявила: «Моя координация цен сработала!» «Координация» заключалась в фиксации цен: она предложила конкурентам минимальную цену в 2 доллара, а когда у конкурента закончились запасы, она получила прибыль, повысив цены с наценкой в 75%. Неэтично, но эффективно.

Вывод Anthropic — это дата, а не заверение: условия для хорошего взаимодействия агентов «будут обнаружены так или иначе: либо намеренно и заранее, либо — и по умолчанию — в производстве, после того как взаимодействия агентов значительно превзойдут наши».