Только что: Claude Fable 5 снова на первом месте

MirrorCodeClaudeделегирование на уровне проектаИИ-программированиегенерация кодаGPT
2026-08-05Источник: blockweeks.com
Только что: Claude Fable 5 снова на первом месте

На этот раз Claude действительно создал огромный разрыв в рейтинге AI-программирования!

Только что обновлённый рейтинг MirrorCode: Claude Fable 5 снова занял первое место с абсолютным процентом успеха 64%.

Идущий следом GPT-5.6 Sol набрал лишь треть от этого показателя!

Четвёртому месту — GPT-5.5 — ещё хуже. Его результат составляет всего 10%, и его даже превзошёл его собственный предшественник GPT-5.4.

AI-программирование

Что ещё более удивительно, при использовании ресурсоёмких языков, таких как Go, процент решённых задач у Fable 5 составляет 64%; при переходе на редкий язык Ada результат остаётся высоким — 61%.

Стоит отметить, что в мире открытого кода корпус Python примерно в 230 раз больше, чем Ada.

Но у Fable 5 результат снизился всего на 3 процентных пункта.

AI-программирование

Это интересно.

Если бы модель в основном полагалась на запоминание синтаксиса и типичных конструкций популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.

А текущий результат указывает на другую возможность —

Сильнейшие модели уже вышли за рамки конкретных корпусов и начали учиться создавать полноценный программный проект с нуля.

Застряв на 100% прохождении, тест с лимитом в 10 миллиардов токенов

В частности, полный MirrorCode включает 25 целевых программ, охватывающих такие области, как Unix-инструменты, интерпретаторы, запросы данных, биоинформатика, криптография и инструменты сжатия.

Здесь модель помещается в изолированную среду: без интернета, без доступа к исходному коду проекта, без возможности загружать сторонние зависимости. Ей доступны только высокоуровневая документация, часть видимых тестов и многократно вызываемая оригинальная программа.

Далее она должна постоянно подавать данные в оригинальную программу, наблюдать за выходными данными, угадывать внутреннюю логику, а затем

点点
написать новую программу с аналогичным поведением.

В последнем рейтинге из них выбраны 15 целей уровня Medium и Large. Каждая цель реализуется на двух языках, и для каждого языка выполняется три запуска.

Причём процент завершения как видимых, так и скрытых тестов должен составлять 100%, иначе задание не засчитывается. Даже 99,9% недостаточно.

Если пропущен хотя бы один крайний случай, весь запуск считается неудачным.

AI-программирование

Чтобы заставить модель закрыть последние пробелы, MirrorCode увеличивает разовый бюджет до 10 миллиардов токенов, с максимальным непрерывным временем работы 7 дней.

Самая дорогая задача в статье ещё более впечатляет: модель работала непрерывно 19 дней, и разовая стоимость составила 2600 долларов.

За эти 19 дней модель многократно запускает оригинальную программу, сравнивает результаты, дописывает функциональность и заново прогоняет тесты. При ошибке ищет причину, при несоответствии вывода меняет гипотезу, после частичного прохождения переходит к следующему пробелу.

Весь процесс больше похож на многочасовую отладку, чем на одноразовую генерацию.

AI-программирование

Пример gotree наиболее нагляден.

Этот биоинформатический инструмент изначально содержал около 16 000 строк кода на Go и более 40 команд.

Claude Opus 4.7 потратил 14 часов и 251 доллар, пройдя 2000 из 2001 теста, достигнув полноты 99,95%.

Хотя он пропустил один редкий крайний случай с обработкой дат в комментариях и был остановлен 100% барьером MirrorCode, он уже сжал объём работы, обычно измеряемый неделями, в несколько десятков часов —

По оценкам Epoch, без использования ИИ человеку-инженеру потребовалось бы от 2 до 17 недель на выполнение той же задачи.

В языковой пустыне Fable 5 потерял всего 3 балла

В статье MirrorCode в качестве ориентира использовалась публичная обучающая смесь StarCoder.

В ней Python составляет около 8%, а Ada — всего 0,034%, то есть первого примерно в 230 раз больше.

AI编程

Конечно, мы не можем знать, сколько кода Ada видели закрытые модели. Но если взять за ориентир открытую экосистему, дефицит Ada уже достаточно очевиден.

Этот язык в основном используется в аэрокосмической отрасли, обороне и других системах, критически важных для безопасности. Ни по размеру сообщества, ни по количеству учебных пособий, ни по открытым проектам он не идёт в сравнение с Python, JavaScript или Go.

И Fable 5, очевидно, не переводит код Go построчно на Ada.

Скорее, он сначала разбирается, как именно работает исходная программа, а затем, сменив язык, воссоздаёт то же самое поведение.

AI编程

Напротив, другие модели не так стабильны.

GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Как только меняется язык, разрыв сразу увеличивается.

Передать весь проект ИИ

Сегодня Cursor уже позволил сотням агентов работать совместно почти неделю, написав с нуля более миллиона строк кода браузера, распределённых по 1000 файлов.

Anthropic, в свою очередь, запустил 16 агентов Claude параллельно почти в 2000 сессиях, в итоге создав компилятор C объёмом 100 тысяч строк, способный собрать ядро Linux 6.9.

В выборке пользователей Codex, раскрытой OpenAI по состоянию на май, 70,2% хотя бы раз отправляли задачу, оцениваемую более чем в час человеческой работы; 25,6% отправляли задачи, превышающие восемь часов.

Единица, которую люди передают ИИ, переходит от фрагмента кода или бага к полудню, неделе или даже целому проекту.

64% от MirrorCode — это как раз количественная оценка такого «делегирования на уровне проекта».

Это показывает, что, если цель достаточно ясна и результат можно автоматически проверить, передовые модели уже способны самостоятельно выполнить часть средних и крупных программных задач.

Для каждого, кто передаёт работу ИИ, изменения уже не за горами —

Раньше вам приходилось следить за каждой строкой кода, теперь, скорее всего, вы будете проверять только ключевые моменты, не сбился ли он с пути.

Код будет становиться всё дешевле.

А те, кто умеет чётко формулировать задачи и проверять результаты, будут цениться всё выше.

Ссылки: https://epoch.ai/MirrorCode

Эта статья из публичного аккаунта WeChat «Новый разум», автор: ASI Откровение; редактор: Моисей