Claude Fable 5 znów na szczycie

MirrorCodeClaudezlecenia na poziomie projektuprogramowanie AIgenerowanie koduGPT
2026-08-05Źródło: blockweeks.com
Claude Fable 5 znów na szczycie

Tym razem Claude naprawdę zrobił przepaść w rankingu programowania AI!

Właśnie na zaktualizowanym rankingu MirrorCode, Claude Fable 5 ponownie zajął pierwsze miejsce z absolutnym wskaźnikiem sukcesu 64%.

Tuż za nim GPT-5.6 Sol, którego wynik to tylko jedna trzecia wyniku lidera!

Jeszcze gorzej ma się czwarty GPT-5.5. Nie tylko osiągnął zaledwie 10%, ale został też zdominowany przez swojego poprzednika GPT-5.4.

AI编程

Co bardziej zaskakujące, przy użyciu języków o wysokich zasobach, takich jak Go, wskaźnik rozwiązania Fable 5 wynosi 64%; po zmianie na mniej popularny język Ada, wynik nadal wynosi aż 61%.

Warto wiedzieć, że w świecie open source, korpus języka Python jest około 230 razy większy niż Ady.

Ale w przypadku Fable 5 wynik spadł tylko o 3 punkty procentowe.

AI编程

To jest interesujące.

Gdyby model polegał głównie na zapamiętywaniu składni popularnych języków i typowych wzorców, to po zmianie na Adę wynik powinien spaść.

A obecny wynik wskazuje na inną możliwość –

Najsilniejsze modele uwolniły się od wpływu konkretnych korpusów i zaczęły uczyć się, jak od zera budować kompletny projekt oprogramowania.

Zablokowane na 100% przejścia, test graniczny z 10 miliardami tokenów

Konkretnie, pełny MirrorCode zawiera 25 programów docelowych, obejmujących narzędzia Unix, interpretery, zapytania danych, bioinformatykę, kryptografię i narzędzia kompresji.

Tutaj model jest umieszczany w izolowanym środowisku, bez internetu, bez dostępu do kodu źródłowego oryginalnego projektu i bez możliwości pobierania zależności stron trzecich. Może uzyskać tylko dokumentację wysokiego poziomu, część widocznych testów oraz oryginalny program, który można wielokrotnie wywoływać.

Następnie musi wielokrotnie wprowadzać dane do oryginalnego programu, obserwować wyniki, zgadywać wewnętrzną logikę, a następnie krok po kroku pisać nowy program o identycznym zachowaniu.

Najnowszy ranking wybiera z niego 15 celów Medium i Large. Każdy cel jest implementowany w dwóch językach, a każdy język uruchamiany jest trzykrotnie.

Co więcej, wskaźnik ukończenia widocznych i ukrytych testów musi wynosić 100%, aby zaliczyć; 99,9% nie wystarczy.

Jeśli brakuje choć jednego przypadku brzegowego, całe uruchomienie jest nadal liczone jako porażka.

AI编程

Aby zmusić model do uzupełnienia ostatnich luk, MirrorCode zwiększa pojedynczy budżet do 10 miliardów tokenów, z maksymalnym czasem ciągłego działania 7 dni.

Najdroższe zadanie w artykule jest jeszcze bardziej ekstremalne: model działał nieprzerwanie przez 19 dni, a koszt pojedynczego uruchomienia wyniósł 2600 dolarów.

W ciągu tych 19 dni model wielokrotnie uruchamia oryginalny program, porównuje wyniki, uzupełnia funkcje, a następnie ponownie uruchamia testy. W przypadku błędu szuka przyczyny, w przypadku niezgodności wyników zmienia hipotezy, a po częściowym sukcesie przechodzi do następnej luki.

Cały proces bardziej przypomina wielodniowe debugowanie niż jednorazowe generowanie.

AI编程

Przykład gotree jest najbardziej obrazowy.

To narzędzie bioinformatyczne pierwotnie miało około 16 000 linii kodu Go i ponad 40 poleceń.

Claude Opus 4.7 spędził 14 godzin i 251 dolarów, przechodząc 2000 z 2001 testów, osiągając kompletność 99,95%.

Chociaż pominął jeden mało popularny przypadek brzegowy dotyczący komentarzy dat, co zatrzymało go na progu 100% w MirrorCode, to jednak skompresował pracę, która normalnie zajęłaby tygodnie, do kilkunastu godzin –

Epoch szacuje, że bez użycia AI ludzki inżynier potrzebowałby co najmniej 2 do 17 tygodni na wykonanie tego samego zadania.

Na pustyni korpusów, Fable 5 stracił tylko 3 punkty

Artykuł o MirrorCode używał publicznej mieszanki treningowej StarCoder jako punktu odniesienia.

W niej Python stanowi około 8%, a Ada tylko 0,034%, czyli pierwszy jest około 230 razy większy od drugiego.

AI编程

Oczywiście nie możemy wiedzieć, ile kodu Ada widziały modele zamknięte. Ale biorąc pod uwagę publiczny ekosystem jako punkt odniesienia, rzadkość Ady jest już wystarczająco oczywista.

Język ten występuje głównie w przemyśle lotniczym, obronnym i innych systemach krytycznych dla bezpieczeństwa. Niezależnie od wielkości społeczności, liczby tutoriali czy projektów open source, nie może się równać z Pythonem, JavaScriptem czy Go.

A Fable 5 najwyraźniej nie tłumaczy kodu Go zdanie po zdaniu na Adę.

To bardziej jak najpierw zrozumieć, jak działa oryginalny program, a potem zmienić język i odtworzyć to samo zachowanie.

AI编程

W porównaniu z tym inne modele nie są już tak stabilne.

GPT-5.6 Sol spadł z 24% do 19%, GPT-5.4 z 21% do 12%, a GPT-5.5 z 17% do 5%. Gdy tylko zmienisz język, różnica natychmiast się powiększa.

Powierzenie całego projektu AI

Obecnie Cursor pozwolił setkom agentów współpracować przez prawie tydzień, pisząc od zera ponad milion linii kodu przeglądarki rozłożonych na 1000 plików.

Anthropic z kolei uruchomił 16 agentów Claude równolegle w prawie 2000 sesjach, ostatecznie budując kompilator C o 100 000 liniach, który potrafi skompilować jądro Linux 6.9.

W próbce użytkowników Codex osobistych ujawnionej przez OpenAI do maja, 70,2% przesłało co najmniej raz zadanie szacowane na ponad godzinę pracy ludzkiej; 25,6% przesłało zadania trwające ponad osiem godzin.

Jednostka, którą ludzie powierzają AI, zmienia się z fragmentu kodu, błędu, na popołudnie, tydzień, a nawet cały projekt.

64% MirrorCode to właśnie kwantyfikacja tego „delegowania na poziomie projektu”.

Pokazuje, że dopóki cel jest wystarczająco jasny, a wyniki mogą być automatycznie weryfikowane, najnowocześniejsze modele mogą już samodzielnie ukończyć część średnich i dużych projektów oprogramowania.

Dla każdego, kto powierza pracę AI, zmiana jest już na wyciągnięcie ręki —

Kiedyś musiałeś patrzeć, jak pisze każdy fragment kodu; teraz prawdopodobnie będziesz sprawdzać tylko w kluczowych momentach, czy nie zboczył z kursu.

Kod będzie coraz tańszy.

A ci, którzy potrafią jasno wyjaśnić problem i zweryfikować wyniki, będą coraz bardziej wartościowi.

Referencje: https://epoch.ai/MirrorCode

Ten artykuł pochodzi z publicznego konta WeChat „Xin Zhi Yuan”, autor: ASI Apokalipsa; redakcja: Mojżesz