Diesmal hat Claude die AI-Programmier-Rangliste wirklich gesprengt!
Gerade eben auf der aktualisierten MirrorCode-Rangliste hat Claude Fable 5 mit einer absoluten Erfolgsquote von 64% erneut den ersten Platz erreicht.
Der direkt dahinter folgende GPT-5.6 Sol hat nur ein Drittel dieser Punktzahl!
Der auf Platz vier liegende GPT-5.5 ist noch schlimmer dran. Nicht nur, dass seine Punktzahl nur 10% beträgt, er wird sogar von seinem eigenen Vorgänger GPT-5.4 am Boden zerstört.
Noch überraschender ist, dass Fable 5 bei ressourcenintensiven Sprachen wie Go eine Lösungsrate von 64% erreicht; bei der seltenen Sprache Ada liegt das Ergebnis immer noch bei hohen 61%.
Man sollte wissen, dass in der Open-Source-Welt der Python-Korpus etwa 230-mal so groß ist wie der von Ada.
Aber bei Fable 5 sinkt das Ergebnis nur um 3 Prozentpunkte.
Das ist interessant.
Wenn das Modell hauptsächlich auf dem Auswendiglernen von Syntax und gängigen Schreibweisen beliebter Sprachen basiert, dann sollte die Leistung bei Ada eigentlich sinken.
Das jetzige Ergebnis deutet jedoch auf eine andere Möglichkeit hin –
Das stärkste Modell hat sich von der Anziehungskraft spezifischer Korpora gelöst und beginnt zu lernen, wie man ein vollständiges Softwareprojekt von Grund auf aufbaut.
An der 100%-Durchgangslinie gescheitert, 10-Milliarden-Token-Extremtest
Konkret enthält das vollständige MirrorCode 25 Zielprogramme, die Bereiche wie Unix-Tools, Interpreter, Datenabfragen, Bioinformatik, Kryptographie und Komprimierungswerkzeuge abdecken.
Hier wird das Modell in eine isolierte Umgebung versetzt, ohne Internet, ohne Zugriff auf den Quellcode des ursprünglichen Projekts und ohne Herunterladen von Drittanbieter-Abhängigkeiten. Es erhält nur die High-Level-Dokumentation, einen Teil der sichtbaren Tests und ein Originalprogramm, das wiederholt aufgerufen werden kann.
Als Nächstes muss es kontinuierlich Daten in das Originalprogramm eingeben, die Ausgabe beobachten, um die interne Logik zu erraten, und dann ein neues Programm mit identischem Verhalten schreiben.
Die neueste Rangliste wählt daraus 15 Medium- und Large-Ziele aus. Jedes Ziel wird mit zwei Implementierungssprachen getestet, wobei jede Sprache dreimal ausgeführt wird.
Außerdem muss die Abschlussquote sowohl bei sichtbaren als auch bei versteckten Tests 100% betragen, um zu bestehen; 99,9% reichen nicht.
Wenn nur ein Randfall übersehen wird, wird der gesamte Lauf immer noch als Fehlschlag gewertet.
Um das Modell zu zwingen, auch die letzten Lücken zu schließen, erhöht MirrorCode das Einzelbudget auf 10 Milliarden Token und erlaubt eine maximale Laufzeit von 7 Tagen am Stück.
Die teuerste Aufgabe in der Arbeit ist noch extremer: Das Modell lief 19 Tage lang ununterbrochen, mit einem einzigen Kostenpunkt von 2600 US-Dollar.
Während dieser 19 Tage führt das Modell wiederholt das Originalprogramm aus, vergleicht die Ergebnisse, ergänzt Funktionen und führt die Tests erneut aus. Bei Fehlern sucht es nach der Ursache, bei abweichenden Ausgaben wechselt es die Hypothese, und wenn ein Teil bestanden ist, verfolgt es die nächste Lücke.
Der gesamte Prozess ähnelt eher einem mehrtägigen Debugging als einer einmaligen Generierung.
Das Beispiel gotree ist am anschaulichsten.
Dieses Bioinformatik-Tool hatte ursprünglich etwa 16.000 Zeilen Go-Code und über 40 Befehle.
Claude Opus 4.7 benötigte 14 Stunden und 251 US-Dollar, bestand 2000 von 2001 Tests und erreichte einen Abschlussgrad von 99,95%.
Obwohl es einen seltenen Randfall bei der Verarbeitung von Datumskommentaren übersah und von MirrorCodes 100%-Durchgangslinie gestoppt wurde, hat es den ursprünglich in Wochen berechneten Arbeitsaufwand auf etwa ein Dutzend Stunden komprimiert –
Epoch schätzt, dass menschliche Ingenieure ohne KI mindestens 2 bis 17 Wochen benötigen würden, um dieselbe Aufgabe zu bewältigen.
In der Korpuswüste verlor Fable 5 nur 3 Punkte
Die MirrorCode-Arbeit verwendete die öffentliche Trainingsmischung von StarCoder als Referenz.
Dabei macht Python etwa 8% aus, Ada nur 0,034%, wobei ersteres etwa 230-mal so groß ist wie letzteres.
Natürlich können wir nicht wissen, wie viel Ada-Code das Closed-Source-Modell gesehen hat. Aber wenn man das öffentliche Ökosystem als Referenz nimmt, ist die Seltenheit von Ada bereits offensichtlich.
Diese Sprache kommt hauptsächlich in der Luft- und Raumfahrt, der Verteidigung und anderen sicherheitskritischen Systemen vor. Weder die Größe der Community, die Anzahl der Tutorials noch die Open-Source-Projekte können mit Python, JavaScript oder Go mithalten.
Und Fable 5 übersetzt offensichtlich nicht Go-Code Satz für Satz in Ada.
Es ähnelt eher dem Ansatz, zuerst zu verstehen, wie das ursprüngliche Programm funktioniert, und dann in einer anderen Sprache dasselbe Verhalten neu zu erstellen.
Im Vergleich dazu sind andere Modelle nicht so stabil.
GPT-5.6 Sol fiel von 24% auf 19%, GPT-5.4 von 21% auf 12%, und GPT-5.5 sogar von 17% auf 5%. Sobald die Sprache gewechselt wird, wird der Unterschied sofort vergrößert.
Das gesamte Projekt der KI übergeben
Heutzutage hat Cursor bereits Hunderte von Agenten fast eine Woche lang zusammenarbeiten lassen, um von Grund auf über 1 Million Zeilen Browser-Code zu schreiben, die auf 1000 Dateien verteilt sind.
Anthropic ließ 16 Claude-Agenten parallel fast 2000 Sitzungen laufen und baute schließlich einen C-Compiler mit 100.000 Zeilen, der den Linux-6.9-Kernel kompilieren kann.
In den von OpenAI bis Mai offengelegten Stichproben von Codex-Nutzern haben 70,2% mindestens einmal eine Aufgabe eingereicht, die voraussichtlich mehr als eine Stunde menschlicher Arbeit erfordert; 25,6% haben Aufgaben eingereicht, die mehr als acht Stunden erfordern.
Die Einheit, die Menschen der KI übergeben, wechselt von einem Codeabschnitt oder einem Bug zu einem Nachmittag, einer Woche oder sogar einem gesamten Projekt.
Die 64% von MirrorCode sind genau eine Quantifizierung dieser "Projekt-Delegation".
Es zeigt, dass moderne Modelle bereits in der Lage sind, einen Teil mittelgroßer bis großer Software eigenständig zu erledigen, solange das Ziel klar genug ist und die Ergebnisse automatisch verifiziert werden können.
Für jeden, der seine Arbeit der KI übergibt, ist die Veränderung bereits in greifbarer Nähe –
Früher mussten Sie jede Codezeile überwachen, jetzt werden Sie wahrscheinlich nur noch an kritischen Punkten prüfen, ob es vom Kurs abgekommen ist.
Code wird immer billiger.
Und diejenigen, die Probleme klar formulieren und Ergebnisse verifizieren können, werden immer wertvoller.
Referenzen: https://epoch.ai/MirrorCode
Dieser Artikel stammt vom WeChat-Konto "新智元", Autor: ASI启示录; Redakteur: 摩西












