На этот раз Claude действительно создал огромный разрыв в рейтинге AI-программирования!
Только что обновлённый рейтинг MirrorCode: Claude Fable 5 снова занял первое место с абсолютным процентом успеха 64%.
Идущий следом GPT-5.6 Sol набрал лишь треть от этого показателя!
Четвёртому месту — GPT-5.5 — ещё хуже. Его результат составляет всего 10%, и его даже превзошёл его собственный предшественник GPT-5.4.
Что ещё более удивительно, при использовании ресурсоёмких языков, таких как Go, процент решённых задач у Fable 5 составляет 64%; при переходе на редкий язык Ada результат остаётся высоким — 61%.
Стоит отметить, что в мире открытого кода корпус Python примерно в 230 раз больше, чем Ada.
Но у Fable 5 результат снизился всего на 3 процентных пункта.
Это интересно.
Если бы модель в основном полагалась на запоминание синтаксиса и типичных конструкций популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.
А текущий результат указывает на другую возможность —
Сильнейшие модели уже вышли за рамки конкретных корпусов и начали учиться создавать полноценный программный проект с нуля.
Застряв на 100% прохождении, тест с лимитом в 10 миллиардов токенов
В частности, полный MirrorCode включает 25 целевых программ, охватывающих такие области, как Unix-инструменты, интерпретаторы, запросы данных, биоинформатика, криптография и инструменты сжатия.
Здесь модель помещается в изолированную среду: без интернета, без доступа к исходному коду проекта, без возможности загружать сторонние зависимости. Ей доступны только высокоуровневая документация, часть видимых тестов и многократно вызываемая оригинальная программа.
Далее она должна постоянно подавать данные в оригинальную программу, наблюдать за выходными данными, угадывать внутреннюю логику, а затем
点点
написать новую программу с аналогичным поведением.
В последнем рейтинге из них выбраны 15 целей уровня Medium и Large. Каждая цель реализуется на двух языках, и для каждого языка выполняется три запуска.
Причём процент завершения как видимых, так и скрытых тестов должен составлять 100%, иначе задание не засчитывается. Даже 99,9% недостаточно.
Если пропущен хотя бы один крайний случай, весь запуск считается неудачным.
Чтобы заставить модель закрыть последние пробелы, MirrorCode увеличивает разовый бюджет до 10 миллиардов токенов, с максимальным непрерывным временем работы 7 дней.
Самая дорогая задача в статье ещё более впечатляет: модель работала непрерывно 19 дней, и разовая стоимость составила 2600 долларов.
За эти 19 дней модель многократно запускает оригинальную программу, сравнивает результаты, дописывает функциональность и заново прогоняет тесты. При ошибке ищет причину, при несоответствии вывода меняет гипотезу, после частичного прохождения переходит к следующему пробелу.
Весь процесс больше похож на многочасовую отладку, чем на одноразовую генерацию.
Пример gotree наиболее нагляден.
Этот биоинформатический инструмент изначально содержал около 16 000 строк кода на Go и более 40 команд.
Claude Opus 4.7 потратил 14 часов и 251 доллар, пройдя 2000 из 2001 теста, достигнув полноты 99,95%.
Хотя он пропустил один редкий крайний случай с обработкой дат в комментариях и был остановлен 100% барьером MirrorCode, он уже сжал объём работы, обычно измеряемый неделями, в несколько десятков часов —
По оценкам Epoch, без использования ИИ человеку-инженеру потребовалось бы от 2 до 17 недель на выполнение той же задачи.
В языковой пустыне Fable 5 потерял всего 3 балла
В статье MirrorCode в качестве ориентира использовалась публичная обучающая смесь StarCoder.
В ней Python составляет около 8%, а Ada — всего 0,034%, то есть первого примерно в 230 раз больше.
Конечно, мы не можем знать, сколько кода Ada видели закрытые модели. Но если взять за ориентир открытую экосистему, дефицит Ada уже достаточно очевиден.
Этот язык в основном используется в аэрокосмической отрасли, обороне и других системах, критически важных для безопасности. Ни по размеру сообщества, ни по количеству учебных пособий, ни по открытым проектам он не идёт в сравнение с Python, JavaScript или Go.
И Fable 5, очевидно, не переводит код Go построчно на Ada.
Скорее, он сначала разбирается, как именно работает исходная программа, а затем, сменив язык, воссоздаёт то же самое поведение.
Напротив, другие модели не так стабильны.
GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Как только меняется язык, разрыв сразу увеличивается.
Передать весь проект ИИ
Сегодня Cursor уже позволил сотням агентов работать совместно почти неделю, написав с нуля более миллиона строк кода браузера, распределённых по 1000 файлов.
Anthropic, в свою очередь, запустил 16 агентов Claude параллельно почти в 2000 сессиях, в итоге создав компилятор C объёмом 100 тысяч строк, способный собрать ядро Linux 6.9.
В выборке пользователей Codex, раскрытой OpenAI по состоянию на май, 70,2% хотя бы раз отправляли задачу, оцениваемую более чем в час человеческой работы; 25,6% отправляли задачи, превышающие восемь часов.
Единица, которую люди передают ИИ, переходит от фрагмента кода или бага к полудню, неделе или даже целому проекту.
64% от MirrorCode — это как раз количественная оценка такого «делегирования на уровне проекта».
Это показывает, что, если цель достаточно ясна и результат можно автоматически проверить, передовые модели уже способны самостоятельно выполнить часть средних и крупных программных задач.
Для каждого, кто передаёт работу ИИ, изменения уже не за горами —
Раньше вам приходилось следить за каждой строкой кода, теперь, скорее всего, вы будете проверять только ключевые моменты, не сбился ли он с пути.
Код будет становиться всё дешевле.
А те, кто умеет чётко формулировать задачи и проверять результаты, будут цениться всё выше.
Ссылки: https://epoch.ai/MirrorCode
Эта статья из публичного аккаунта WeChat «Новый разум», автор: ASI Откровение; редактор: Моисей












