Ox Alpha, darmowy "model stealth", wystartował 20 sierpnia na OpenRouter, OpenCode, Cline i portalu+ Nous Research.
Wiralowe twierdzenie, że Ox Alpha pokonuje Claude Fable 5 i GPT-5.6 Sol na DeepSWE, pochodziło z próbki 10 zadań; dwa osobne pełne przebiegi 113 zadań osiągnęły około 63%, mniej więcej na poziomie GPT-5.6 Sol.
Google, Xiaomi, DeepSeek i Microsoft MAI były wymieniane jako model za tym stojący; ale najpopularniejsza teoria wskazuje na rodzinę GLM-5.3 od Zhipu AI.
Entuzjaści AI są bardzo podekscytowani modelem AI o nazwie Ox Alpha, który pojawił się na OpenRouter 20 sierpnia bez podanej nazwy firmy.
Wpis opisuje go jako "model rozumowania zaprojektowany do kodowania, ciągłej pracy agentowej i obciążeń produkcyjnych", zbudowany przez zewnętrznego dostawcę, który zdecydował się pozostać anonimowy podczas podglądu.
Co więcej, tajemniczy model AI już przewyższa Claude Fable 5 od Anthropic i GPT-5.6 Sol od OpenAI w imponujących benchmarkach kodowania.
DeepSWE—benchmark, który ocenia, jak często agent kodujący poprawnie rozwiązuje prawdziwe problemy z GitHuba za pierwszym podejściem, mierzony jako procent zadań zaliczonych spośród 113 zadań pochodzących z 91 repozytoriów—pokazuje, że Ox Alpha jest konkurencyjny wobec najlepszych modeli.
Deweloper Ben Davis przeprowadził wstępną próbę na 10 zadaniach i uzyskał dla Ox Alpha 80% za pierwszym przejściem, wyprzedzając Claude Fable 5 z 65% i GPT-5.6 Sol z 52%. Ta liczba stała się wiralowa w ciągu jednego dnia, a jej wersje wciąż krążą, jakby Ox Alpha miał wyraźną przewagę nad oboma modelami.
Przepuściłem to przez 10 zadań na DeepSWE (więc w rzeczywistym wyniku może być ogromna wariancja, to podzbiór), ale uch...
gpt-5.6-sol: 52% fable: 65% cokolwiek to jest: 80% (było blisko na "x", więc faktycznie ponad 80%)
Od 22 sierpnia Ox Alpha nadal nie miał wpisu na Artificial Analysis ani LMSys Arena.
Model jest darmowy w użyciu, czyta do około 1 miliona tokenów w jednym oknie kontekstowym i przyjmuje tekst, obraz i wideo jako dane wejściowe, zwracając tekst. Obsługuje również wywoływanie narzędzi i funkcji, chociaż jego wyjście JSON nie jest wymuszane schematem—to realna luka dla deweloperów budujących agentów, którzy oczekują ustrukturyzowanych odpowiedzi.
OpenCode powiedział, że jego trasa może obsłużyć 100 bilionów tokenów dziennie; Nous Research, oferujący model za darmo przez swój własny portal, twierdził, że ma pojemność na 1 biliard. Tokeny to podstawowa jednostka informacji, którą model może przetworzyć, a taka przepustowość stawia go na równi z najczęściej używanymi i najbardziej wydajnymi modelami na rynku.
Takie liczby łatwo prowadzą do wniosku, że model jest tak dobry, że spodziewają się dużego użycia, a dostawca ma wystarczającą infrastrukturę, aby obsłużyć obciążenie.
Ox Alpha (model stealth) jest darmowy przez następny tydzień
- 1M kontekstu - Multimodalny - Zero retencji danych
Hojne limity szybkości, prawie nieograniczone użycie
Mamy pojemność na 100T tokenów dziennie, zobaczmy, co potraficie
Dyrektor generalny Stripe, Patrick Collison, którego firma zgodziła się 19 sierpnia na przejęcie OpenRouter, nazwał Ox Alpha „bardzo imponującym” w poście na X. Ta pojedyncza linia od znanego dyrektora technicznego pomogła wypchnąć model do szerszej rozmowy w ciągu kilku godzin od premiery.
Nikt nie zgłosił się, aby się do niego przyznać. Analityk AI Andrew Curran opublikował w piątek, że ludzie „wydają się mniej pewni czegokolwiek” co do tego, skąd pochodzi Ox Alpha.
W miarę jak model zyskiwał na popularności, gra w zgadywanie szybko się podzieliła. Deweloperzy wymieniali niewydaną rodzinę MAI Microsoftu, linię MiMo Xiaomi, DeepSeek, Qwen Alibaby, a nawet Gemini Google – wystarczająco wiele osób wskazało na Gemini, że jeden deweloper zażartował, że Google używa ukrytego modelu rywala jako marketingu dla własnego. Większość tych kandydatów nie przetrwała kontaktu z dowodami.
MiMo v2.5 Xiaomi akceptuje wejście audio, co jest główną funkcją, którą Ox Alpha całkowicie odrzuca. DeepSeek nigdy nie udostępnił możliwości wideo i zamiast uruchamiać ukryte podglądy, publikuje otwarte wagi. Google i Qwen używają całkowicie różnych tokenizerów i enkoderów wideo, więc trudno ustalić solidny związek z tymi modelami.
To, co pozostaje, wskazuje na rodzinę modeli Zhipu AI. Niezależne pobieranie odcisków palców dopasowało tokenizer Ox Alpha do GLM-5.3 w każdym znormalizowanym teście, a jego wydatki na tokeny wideo do GLM-5V-Turbo dokładnie w czterech oddzielnych klipach, a także dzieli charakterystyczne błędy GLM i zachowanie polegające na odrzucaniu audio.
Tokenizer Ox Alpha jest identyczny jeden do jednego z tokenizerem GLM. Żaden inny tokenizer laboratorium nie przekracza 4/11, jeśli chodzi o podobieństwo tokenizera.https://t.co/3K25G4U2hX (h/t: @sushsrinivasan)
Jednak jeden szczegół komplikuje czyste dopasowanie. GLM-5.3 zadebiutował 14 sierpnia jako model tekstowy, sześć dni przed pojawieniem się Ox Alpha z pełnym wsparciem wideo. Jeśli odciski palców się zgadzają, Ox Alpha jest bardziej prawdopodobnie niewydaną multimodalną aktualizacją tej linii niż identyczną kopią—coś, co analitycy zaczęli nazywać GLM-5.3 Flash.
Zhipu AI nie powiedział publicznie nic na temat Ox Alpha.
Czym właściwie jest model stealth
Model stealth to system AI klasy frontier wydany bez przypisania za pośrednictwem platformy routującej, takiej jak OpenRouter, pozwalający laboratorium zbierać dane z rzeczywistego użytkowania przed zobowiązaniem się do publicznej premiery.
Ten wzorzec stał się rutynowy dla chińskich laboratoriów. Własny Pony Alpha Zhipu AI został zdemaskowany jako GLM-5 w ciągu pięciu dni w lutym, Xiaomi Hunter Alpha okazał się MiMo-V2-Pro w marcu, a Meituan pozwolił swojemu Owl Alpha działać anonimowo przez dwa miesiące, zanim potwierdził, że to LongCat-2.0 w czerwcu.
Ox Alpha jest teraz dostępny na OpenRouter pod identyfikatorem modelu stealth/ox-alpha, oraz przez OpenCode, Cline i Nous Portal, wszystkie darmowe do zapytań. Notatka startowa OpenCode określiła darmowe okno na około tydzień od debiutu 20 sierpnia, co daje prawdopodobny termin około 27 sierpnia—po czym, jeśli wzorzec z ostatnich czterech anonimowych modeli się utrzyma, ktoś w końcu może nadać mu nazwę.