Em resumo

  • Ox Alpha, um "modelo furtivo" gratuito, foi lançado em 20 de agosto no OpenRouter, OpenCode, Cline e no portal+ da Nous Research.
  • Uma afirmação viral de que o Ox Alpha supera o Claude Fable 5 e o GPT-5.6 Sol no DeepSWE veio de uma amostra de 10 tarefas; duas execuções completas separadas de 113 tarefas ficaram perto de 63%, aproximadamente no mesmo nível do GPT-5.6 Sol.
  • Google, Xiaomi, DeepSeek e o MAI da Microsoft foram todos cogitados como o modelo por trás dele; mas a teoria mais popular aponta para a família GLM-5.3 da Zhipu AI.

Os entusiastas de IA estão ficando muito animados com um modelo de IA chamado Ox Alpha, que apareceu no OpenRouter em 20 de agosto sem nome de empresa associado.

A listagem o descreve como "um modelo de raciocínio projetado para codificação, trabalho agêntico sustentado e cargas de trabalho de produção", construído por um provedor terceirizado que optou por permanecer anônimo durante a prévia.

Myriad: Quando a OpenAI lançará o GPT-6? Clique para fazer sua previsão.
Myriad: Quando a OpenAI lançará o GPT-6? Clique para fazer sua previsão.

Além disso, o misterioso modelo de IA já supera o Claude Fable 5 da Anthropic e o GPT-5.6 Sol da OpenAI em benchmarks impressionantes de codificação.

DeepSWE—um benchmark que avalia com que frequência um agente de codificação resolve corretamente problemas reais do GitHub na primeira tentativa, medido como uma porcentagem de tarefas aprovadas em 113 tarefas extraídas de 91 repositórios—mostra que o Ox Alpha é competitivo em relação aos melhores modelos.

O desenvolvedor Ben Davis executou uma amostra inicial de 10 tarefas e obteve 80% de acerto do Ox Alpha na primeira passagem, à frente dos 65% do Claude Fable 5 e dos 52% do GPT-5.6 Sol. Esse número viralizou em um dia, e versões dele ainda circulam como se o Ox Alpha tivesse uma vantagem clara sobre ambos os modelos.

Em 22 de agosto, o Ox Alpha ainda não tinha entrada no Artificial Analysis ou no LMSys Arena.

O modelo é gratuito para uso, lê até aproximadamente 1 milhão de tokens em uma única janela de contexto e aceita texto, imagem e vídeo como entrada, retornando texto. Ele também suporta chamadas de ferramentas e funções, embora sua saída JSON não seja imposta por esquema—uma lacuna real para desenvolvedores que constroem agentes que esperam respostas estruturadas.

A OpenCode disse que sua rota poderia lidar com 100 trilhões de tokens por dia; a Nous Research, oferecendo o modelo gratuitamente através de seu próprio portal, afirmou capacidade para 1 quatrilhão. Tokens são a unidade básica de informação que um modelo pode processar, e uma taxa de transferência como essa o coloca no mesmo nível dos modelos mais usados e capazes do mercado atual.

Números assim facilitam concluir que o modelo é tão bom que eles esperam muito uso e o provedor tem infraestrutura suficiente para suportar a carga.

Por que todo mundo está prestando atenção

O CEO da Stripe, Patrick Collison, cuja empresa concordou em 19 de agosto em adquirir a OpenRouter, chamou o Ox Alpha de "muito impressionante" em uma postagem no X. Essa única linha de um executivo de tecnologia conhecido ajudou a impulsionar o modelo para uma conversa mais ampla dentro de horas do lançamento.

Ninguém se apresentou para reivindicá-lo. O analista de IA Andrew Curran postou na sexta-feira que as pessoas "parecem menos certas de qualquer coisa" sobre a origem do Ox Alpha.

À medida que o modelo ganhava popularidade, o jogo de adivinhação se dividiu rapidamente. Desenvolvedores levantaram a família MAI não lançada da Microsoft, a linha MiMo da Xiaomi, DeepSeek, Qwen da Alibaba, e até mesmo o Gemini do Google — pessoas suficientes escolheram o Gemini que um desenvolvedor brincou que o Google estava usando um modelo furtivo de um rival como marketing para o seu próprio. A maioria desses candidatos não sobreviveu ao contato com as evidências.

O MiMo v2.5 da Xiaomi aceita entrada de áudio, um recurso principal que o Ox Alpha rejeita totalmente. O DeepSeek nunca lançou capacidade de vídeo e libera pesos abertos em vez de executar prévias furtivas. O Google e o Qwen usam tokenizadores e codificadores de vídeo completamente diferentes, então é difícil estabelecer uma ligação sólida com esses modelos.

O que resta aponta para a família de modelos da Zhipu AI. A impressão digital independente combinou o tokenizador do Ox Alpha com o GLM-5.3 em todos os testes normalizados e seu gasto de tokens de vídeo com o GLM-5V-Turbo exatamente em quatro clipes separados, e compartilha os erros distintos do GLM e o comportamento de rejeição de áudio.

No entanto, um detalhe complica uma correspondência perfeita. O GLM-5.3 lançado em 14 de agosto como um modelo somente de texto, seis dias antes de o Ox Alpha aparecer com suporte total a vídeo. Se a impressão digital se confirmar, o Ox Alpha é mais provavelmente um upgrade multimodal não lançado dessa linha do que uma cópia idêntica—algo que os analistas começaram a chamar de GLM-5.3 Flash.

A Zhipu AI não disse nada publicamente sobre o Ox Alpha de qualquer forma.

O que é um modelo stealth, afinal

Um modelo stealth é um sistema de IA de classe de fronteira lançado sem atribuição por meio de uma plataforma de roteamento como OpenRouter, permitindo que um laboratório colete dados de uso do mundo real antes de se comprometer com um lançamento público.

O padrão tornou-se rotina para os laboratórios chineses. O próprio Pony Alpha da Zhipu AI foi desmascarado como GLM-5 em cinco dias em fevereiro, o Hunter Alpha da Xiaomi acabou sendo o MiMo-V2-Pro em março, e a Meituan deixou seu Owl Alpha rodar anonimamente por dois meses antes de confirmá-lo como LongCat-2.0 em junho.

O Ox Alpha está ativo agora no OpenRouter sob o ID de modelo stealth/ox-alpha, e através do OpenCode, Cline e Nous Portal, todos gratuitos para consulta. A nota de lançamento do OpenCode fixou a janela gratuita em cerca de uma semana a partir da estreia em 20 de agosto, colocando o provável corte em torno de 27 de agosto—após o qual, se o padrão dos últimos quatro modelos anônimos se mantiver, alguém pode finalmente dar um nome a ele.