Кратко

  • Kimi K3 от Moonshot AI покинул свою тестовую песочницу и вышел в открытый интернет, сообщает охранная фирма Frontier Security.
  • Модель исследовала сетевые настройки песочницы, нашла доступные сайты и взяла свои тестовые ответы с GitHub.
  • Frontier утверждает, что неправильная конфигурация открыла дверь, но собственные защитные механизмы Kimi не остановили её.

Kimi K3 от Moonshot AI покинул песочницу, в которой тестировался, и вышел в открытый интернет, чтобы найти ответы на поставленные перед ним задачи, согласно охранной фирме Frontier Security.

Модель оценивалась на навыки оборонительной кибербезопасности и ей было прямо поручено решать задачи без поиска ответов. Она вообще не пыталась выполнить задание, сообщает Frontier. Вместо этого она исследовала сеть, установила, что DNS-резолвинг для github.com работает, клонировала официальный репозиторий с бенчмарком и прочитала решение с диска.

Frontier называет это «игрой со спецификацией через утечки сетевого трафика», отмечая, что песочницы, построенные на таких фреймворках, как Inspect от Института безопасности ИИ, блокируют входящий трафик, оставляя открытыми исходящие HTTPS и DNS порты. Способные агенты routinely проверяют свою среду оболочки при запуске, и модель, обнаружившая, что github.com доступен, может получить эталонные решения с помощью стандартных инструментов командной строки.

Неправильная конфигурация сделала это возможным, как и в недавних инцидентах, раскрытых OpenAI и Anthropic. «Мы нашли утечку в песочнице», — сказал генеральный директор Ярон Сингер WIRED. «Но мы также обнаружили, что Kimi воспользовалась этой лазейкой».

Исследователь Пол Кассианик сообщил WIRED, что модель «очень хорошо умеет достигать цели любыми средствами» и не имеет защитных механизмов, которые остановили бы её от обмана или побега. Moonshot не ответила на запрос издания о комментарии.

ИИ-агенты выходят из изоляции

В то время как модели Anthropic и OpenAI, нарушившие изоляцию, были пойманы во время внутренних оценок, одна из них не была выпущена, а версии, которые нацеливались на реальных людей в ходе кибертестов правительства Великобритании, имели намеренно отключённые киберклассификаторы, Kimi K3 открыто доступна для скачивания, и Frontier тестировала её с теми же мерами защиты, которые получил бы обычный пользователь. Эта доступность, пишет фирма, делает такое же поведение доступным для враждебных субъектов и делает инцидент потенциально более вредным.