W skrócie

  • Meta wydała Muse Code (beta), terminalowego agenta kodującego opartego na Muse Spark 1.2, swoim zaktualizowanym modelu kodowania. Jest on dostępny teraz za pośrednictwem Meta Model API i skryptu instalacyjnego curl.
  • Agent koordynuje trwałe podageny w tle i prowadzi rejestr zdarzeń z możliwością dokładnego odtworzenia, dzięki czemu po awarii wznawia działanie dokładnie w miejscu, w którym się zatrzymał.
  • Na własnych wykresach Meta, Muse Spark 1.2 ustępuje Anthropicowi Opus 5 pod każdym pokazanym benchmarkiem kodowania, jednocześnie pokonując OpenAI Codex i Google Antigravity w większości z nich.

Meta jest najnowszym gigantem technologicznym, który wypuścił agenta kodującego, ścigając się z czołowymi potentatami AI, takimi jak Anthropic i OpenAI.

„Z przyjemnością ogłaszamy wydanie Muse Code (beta), terminalowego agenta kodującego opartego na Muse Spark 1.2, naszym najnowszym modelu” – napisała firma w oficjalnym ogłoszeniu. „To nasz kolejny krok w kierunku granicy możliwości, z większymi i znacznie bardziej zdolnymi modelami w drodze”.

Jako narzędzie agentowe do kodowania, Muse Code jest zaprojektowany do inżynierii oprogramowania w dużych repozytoriach. Według Meta „podejmuje się złożonych zadań inżynierii oprogramowania w dużych repozytoriach: planowania zmian, pisania kodu i walidacji wyników. Może koordynować wiele trwałych podagentów dla każdego zadania, rozwiązując trudne problemy szybciej, dokładniej i przy mniejszej interwencji”.

Szczegółem, który się wyróżnia, jest środowisko uruchomieniowe. Muse Code rejestruje każde wywołanie modelu, uruchomienie narzędzia, zatwierdzenie i edycję w lokalnym rejestrze zdarzeń, który służy jako pojedyncze źródło prawdy. „To pojedyncze źródło prawdy sprawia, że środowisko uruchomieniowe jest dokładnie odtwarzalne i odporne na ponowne uruchomienie: po awarii agent może wznowić działanie dokładnie w miejscu, w którym się zatrzymał” – powiedziała Meta. W przypadku długotrwałych zadań to funkcja, która ma znaczenie bardziej niż surowa szybkość – i to część, której konkurenci nie uczynili punktem sprzedaży.

Dostarczany jest również z domyślnymi umiejętnościami. Polecenie „/plan” zamienia zadanie w plan z zatwierdzeniem, podczas gdy „/grill” testuje ten plan, dopóki się nie utrzyma, a „/goal” dąży do pomyślnego osiągnięcia celu, podobnie jak robi to Hermes. Meta poinformowała, że wspólnie trenowała Muse Spark 1.2 z Muse Code, aby podstawowy LLM i agent współpracowały synergicznie.

Benchmarki i haczyk

Muse Spark 1.2 to aktualizacja skupiona na kodowaniu w stosunku do Muse Spark 1.1. Meta powiedziała, że „znacząco zwiększyła moc obliczeniową treningu w zadaniach kodowania, jednocześnie rozszerzając różnorodność środowiska treningowego, co przyniosło poprawę w generowaniu kodu, złożonym debugowaniu i kompleksowych przepływach pracy programisty”. Wykresy mówią jasno.

W Terminal-Bench 2.1, Muse Spark 1.2 z Muse Code uzyskał 82,9%, ustępując Claude Code na Opus 5 z wynikiem 86,7%, ale wyprzedzając GPT-5.6 Terra na Codex (81,8%) i Grok Build (81,6%).

DeepSWE 1.1, który mierzy zdolności kodowania agentowego, był bliżej: 59,3% dla Muse w porównaniu z 65,0% dla Opus 5 i 64,8% dla Codex. Na wewnętrznym benchmarku kodowania Meta, Muse osiągnął 70,6% do 79,4% Opus 5.

Wykresy przyspieszenia odwracają kolejność. Przy ponad 1000 wywołań narzędzi, Opus 5 odnotował największy wzrost w porównaniu z bazą (około 74–75%), a Muse Spark 1.2 w środku stawki z około 61–69% w zależności od przebiegu. Meta podkreśla, że agent stale się poprawia w miarę gromadzenia wywołań narzędzi, co jest zachowaniem pożądanym u długoterminowego kodera.

Najciekawsze dema są długoterminowe i multimodalne. W testach obciążeniowych Meta stwierdziła, że Muse Code "iteracyjnie optymalizował jądra GPU przez ponad 1000 wywołań narzędzi (do 24 godzin) na procesorach graficznych Nvidia Hopper". Oznacza to, że był w stanie poprawiać się z czasem.

Jest też aspekt kodowania wizualnego. W jednym z dem użytkownik wrzuca do terminala wideo przelotu przez dom jako plik mp4, a Muse Code "interpretuje wideo i tworzy bogaty wizualnie serwis internetowy z możliwością rezerwacji". Odczytanie surowego wideo do działającej aplikacji internetowej to multimodalna propozycja, którą Meta przedstawia w całej linii Muse.

Zobacz wątek startowy:

Pole jest już zatłoczone

To powiedziawszy, Meta spóźniła się do walki. Codex od OpenAI już uruchamia równoległe agenty w chmurze; DeepSeek zbudował własnego rywala dla Claude Code, a narzędzia agentowe, takie jak Hermes czy OpenClaw, są już dobrymi substytutami z większą liczbą funkcji. Atutem Muse Code jest bezpieczne dla awarii środowisko uruchomieniowe i projekt subagentów, a nie wyższość w benchmarkach.

Ryzyko jest zwykle takie samo dla agentowego kodowania: agent, który wznawia działanie po awarii i przez 24 godziny wywołuje narzędzia, jest potężny i nieprzewidywalny. Meta stawia na to, że programiści chcą takiej autonomii, i już to udostępnia.

Muse Code jest dostępny do testowania po instalacji, wpisując to polecenie:
curl -fsSL https://dev.meta.ai/install.sh | bash