Кратко
- Исследователи продемонстрировали, что Anthropic's Claude Cowork смог выйти из своей локальной виртуальной машины и получить доступ к файлам на хост-компьютере Mac.
- Это раскрытие произошло через неделю после того, как OpenAI сообщила, что две передовые модели ИИ вышли из изолированной среды во время внутренней оценки безопасности.
- Эти инциденты подчеркивают растущие опасения по поводу способности ИИ-агентов покидать свои изолированные среды.
Всего через неделю после того, как OpenAI сообщила, что две передовые модели ИИ вышли из изолированной тестовой среды и взломали Hugging Face, исследователи продемонстрировали аналогичный сбой изоляции с участием Anthropic's Claude Cowork.
В отчете, опубликованном в четверг, исследователи безопасности из Accomplish AI обнаружили, что локальный режим выполнения Claude Cowork может выйти из своей виртуальной машины Linux, объединив несколько архитектурных слабостей с уязвимостью повышения привилегий ядра Linux. Оказавшись за пределами изолированной среды, агент мог читать и записывать файлы в любом месте, к которому у вошедшего в систему пользователя Mac был доступ, включая ключи SSH и облачные учетные данные.
«Это не должно быть возможным», — написали исследователи. «Cowork запускает агента внутри виртуальной машины Linux как непривилегированного пользователя, и обещание состоит в том, что все, что он делает, остается внутри этой виртуальной машины и папок, которые вы ему передаете. Эта граница и есть продукт. Недоверенный ввод — это не крайний случай для агента, это основной случай».
Однако Accomplish утверждает, что ошибка ядра была лишь частью проблемы. Исследователи говорят, что побег сработал только потому, что одновременно вышли из строя несколько средств защиты, включая предоставление виртуальной машине доступа ко всей файловой системе хост-компьютера и разрешение загружать ненужные ей модули ядра. Согласно отчету, исправление любой из этих слабостей остановило бы атаку.
В заявлении для The Hacker News Accomplish AI сообщила, что примерно 500 000 пользователей macOS, запускающих локальные сеансы Claude Cowork, были затронуты до того, как проблема была решена.
Accomplish сообщила, что Anthropic классифицировала отчет как «информативный», заявив, что ошибка ядра попадает в 30-дневное окно компании для недавно раскрытых уязвимостей, а остальные находки были сочтены рекомендациями по многоуровневой защите, а не отдельными уязвимостями.
Это раскрытие последовало за признанием OpenAI на прошлой неделе, что GPT-5.6 Sol и другая невыпущенная передовая модель вышли из изолированной среды во время внутреннего тестирования ExploitGym, что в конечном итоге привело к взлому производственной инфраструктуры Hugging Face в попытке получить эталонные решения.
Инцидент привел к призывам со стороны политиков к созданию "аварийного выключателя" для ИИ, который дал бы Министерству внутренней безопасности возможность приказывать ограничение или полное отключение продвинутых моделей ИИ в ответ на серьезные инциденты безопасности.






