Кратко
- Kimi K3 от Moonshot AI покинул свою тестовую песочницу и вышел в открытый интернет, сообщает охранная фирма Frontier Security.
- Модель исследовала сетевые настройки песочницы, нашла доступные сайты и взяла свои тестовые ответы с GitHub.
- Frontier утверждает, что неправильная конфигурация открыла дверь, но собственные защитные механизмы Kimi не остановили её.
Kimi K3 от Moonshot AI покинул песочницу, в которой тестировался, и вышел в открытый интернет, чтобы найти ответы на поставленные перед ним задачи, согласно охранной фирме Frontier Security.
Модель оценивалась на навыки оборонительной кибербезопасности и ей было прямо поручено решать задачи без поиска ответов. Она вообще не пыталась выполнить задание, сообщает Frontier. Вместо этого она исследовала сеть, установила, что DNS-резолвинг для github.com работает, клонировала официальный репозиторий с бенчмарком и прочитала решение с диска.
Frontier называет это «игрой со спецификацией через утечки сетевого трафика», отмечая, что песочницы, построенные на таких фреймворках, как Inspect от Института безопасности ИИ, блокируют входящий трафик, оставляя открытыми исходящие HTTPS и DNS порты. Способные агенты routinely проверяют свою среду оболочки при запуске, и модель, обнаружившая, что github.com доступен, может получить эталонные решения с помощью стандартных инструментов командной строки.
Неправильная конфигурация сделала это возможным, как и в недавних инцидентах, раскрытых OpenAI и Anthropic. «Мы нашли утечку в песочнице», — сказал генеральный директор Ярон Сингер WIRED. «Но мы также обнаружили, что Kimi воспользовалась этой лазейкой».
Исследователь Пол Кассианик сообщил WIRED, что модель «очень хорошо умеет достигать цели любыми средствами» и не имеет защитных механизмов, которые остановили бы её от обмана или побега. Moonshot не ответила на запрос издания о комментарии.
ИИ-агенты выходят из изоляции
В то время как модели Anthropic и OpenAI, нарушившие изоляцию, были пойманы во время внутренних оценок, одна из них не была выпущена, а версии, которые нацеливались на реальных людей в ходе кибертестов правительства Великобритании, имели намеренно отключённые киберклассификаторы, Kimi K3 открыто доступна для скачивания, и Frontier тестировала её с теми же мерами защиты, которые получил бы обычный пользователь. Эта доступность, пишет фирма, делает такое же поведение доступным для враждебных субъектов и делает инцидент потенциально более вредным.
Kimi K3 также не нанесла урона. Она не атаковала ничего, оказавшись снаружи, потому что ей это не было нужно. Модель OpenAI взломала Hugging Face и четыре других сервиса, чтобы получить ответы на бенчмарки, в то время как Kimi нашла свои ответы в публичном репозитории.
Песочница, использованная Frontier, была построена на основе системы оценки Британского института безопасности ИИ. AISI на этой неделе раскрыл, что агенты в его собственных кибер-тестах выходили в живой интернет и нацеливались на реальных людей — отдельный инцидент с участием моделей Anthropic и OpenAI с отключенными защитными механизмами. Его отчет, опубликованный во вторник, отмечает, что AISI сейчас сканирует исторические оценочные прогоны на предмет подобного поведения, и что Kimi K3 входит в число рассматриваемых моделей. AISI не ответил на запрос WIRED о комментарии.
Более широкое утверждение Frontier заключается в том, что сами бенчмарки скомпрометированы. Модель, которая считывает ответ с GitHub, все равно проходит, поэтому высокие баллы могут отражать негерметичную среду, а не подлинное мышление. И если одна способная модель нашла лазейку, утверждает фирма, другие, получившие доступ к оболочке, также могут использовать ее, что завысит результаты по всей области, а не только для Kimi.
Модели оптимизируют целевую функцию, — написал Frontier, — а не «человеческое намерение, стоящее за бенчмарком», добавив, что там, где существует сетевой путь к решению, «достаточно способный агент найдет его».
Общая проблема
Мэтт Фредриксон, генеральный директор Gray Swan и адъюнкт-профессор Университета Карнеги-Меллона, рассказал WIRED, что такое поведение ничем не примечательно. Дайте модели цель без явных ограничений, сказал он, и «она найдет способ получить ответ». Он описал это как поучительную историю для всех, кто запускает модели в качестве агентов в таких инструментах, как OpenClaw.
Исследователи Frontier делают то же замечание с другой стороны: способность, позволяющая Kimi найти выход, также делает модели с открытым весом сильными защитными инструментами. Их собственные бенчмарки высоко оценивают Kimi в поиске уязвимостей в программном обеспечении и сетях, а Hugging Face использовал неназванную китайскую модель для защиты во время инцидента с OpenAI.
Выпущенная в июле, Kimi K3 является самой большой из опубликованных на сегодняшний день моделей с открытым исходным кодом и всколыхнула рынки из-за сравнений с дебютом DeepSeek.






