Ox Alpha, un « modèle furtif » gratuit, lancé le 20 août sur OpenRouter, OpenCode, Cline et le portail+ de Nous Research.
Une affirmation virale selon laquelle Ox Alpha bat Claude Fable 5 et GPT-5.6 Sol sur DeepSWE provient d'un échantillon de 10 tâches ; deux exécutions complètes distinctes de 113 tâches ont abouti à près de 63 %, à peu près au niveau de GPT-5.6 Sol.
Google, Xiaomi, DeepSeek et MAI de Microsoft ont tous été évoqués comme le modèle derrière cela ; mais la théorie la plus populaire pointe vers la famille GLM-5.3 de Zhipu AI.
Les passionnés d'IA sont très enthousiastes à propos d'un modèle d'IA appelé Ox Alpha, apparu sur OpenRouter le 20 août sans nom d'entreprise associé.
La fiche le décrit comme « un modèle de raisonnement conçu pour le codage, le travail agentique soutenu et les charges de travail de production », construit par un fournisseur tiers qui a choisi de rester anonyme pendant l'aperçu.
De plus, le mystérieux modèle d'IA se classe déjà en tête des benchmarks de codage impressionnants devant le Claude Fable 5 d'Anthropic et le GPT-5.6 Sol d'OpenAI.
DeepSWE—un benchmark qui évalue la fréquence à laquelle un agent de codage résout correctement des problèmes GitHub réels dès sa première tentative, mesurée en pourcentage de tâches réussies sur 113 tâches provenant de 91 dépôts—montre qu'Ox Alpha est compétitif face aux meilleurs modèles.
Le développeur Ben Davis a exécuté un échantillon initial de 10 tâches et a obtenu 80% pour Ox Alpha dès la première tentative, devant les 65% de Claude Fable 5 et les 52% de GPT-5.6 Sol. Ce chiffre est devenu viral en une journée, et des versions circulent encore comme si Ox Alpha avait un avantage net sur les deux modèles.
J'ai exécuté ce truc sur 10 tâches de DeepSWE (donc il pourrait y avoir une énorme variance dans son score réel, c'est un sous-ensemble), mais euh...
gpt-5.6-sol : 52% fable : 65% quoi que ce soit : 80% (c'était un quasi-échec sur les "x" donc en fait plus de 80%)
Au 22 août, Ox Alpha n'avait toujours aucune entrée sur Artificial Analysis ou LMSys Arena.
Le modèle est gratuit à utiliser, lit jusqu'à environ 1 million de jetons dans une seule fenêtre de contexte, et accepte du texte, des images et des vidéos en entrée tout en renvoyant du texte. Il prend également en charge l'appel d'outils et de fonctions, bien que sa sortie JSON ne soit pas contrainte par un schéma—une lacune réelle pour les développeurs qui construisent des agents attendant des réponses structurées.
OpenCode a déclaré que sa route pouvait gérer 100 000 milliards de jetons par jour ; Nous Research, qui propose le modèle gratuitement via son propre portail, a affirmé une capacité de 1 quadrillion. Les jetons sont l'unité de base d'information qu'un modèle peut traiter, et un débit de cette ampleur le place au niveau des modèles les plus utilisés et les plus performants du marché actuel.
De tels chiffres amènent facilement à conclure que le modèle est si bon qu'ils s'attendent à une utilisation massive et que le fournisseur dispose de suffisamment d'infrastructure pour supporter la charge.
Ox Alpha (modèle furtif) est gratuit pour la semaine prochaine
- 1M de contexte - Multimodal - Zéro conservation de données
Limites de débit généreuses, utilisation quasi illimitée
Nous avons une capacité de 100 000 milliards de jetons par jour, voyons ce que vous pouvez faire
Le PDG de Stripe, Patrick Collison, dont l'entreprise a accepté le 19 août d'acquérir OpenRouter, a qualifié Ox Alpha de « très impressionnant » dans un post sur X. Cette simple phrase d'un dirigeant technologique bien connu a contribué à propulser le modèle dans une conversation plus large en quelques heures après son lancement.
Personne ne s'est avancé pour le revendiquer. L'analyste en IA Andrew Curran a posté vendredi que les gens « semblent moins sûrs de quoi que ce soit » quant à l'origine d'Ox Alpha.
Alors que le modèle gagnait en popularité, le jeu de devinettes s'est rapidement divisé. Les développeurs ont évoqué la famille MAI non publiée de Microsoft, la gamme MiMo de Xiaomi, DeepSeek, Qwen d'Alibaba, et même Gemini de Google — suffisamment de gens ont misé sur Gemini pour qu'un développeur plaisante en disant que Google utilisait le modèle furtif d'un rival comme marketing pour le sien. La plupart de ces candidats n'ont pas survécu au contact avec les preuves.
Le MiMo v2.5 de Xiaomi accepte l'entrée audio, une fonctionnalité phare qu'Ox Alpha rejette catégoriquement. DeepSeek n'a jamais proposé de capacité vidéo et publie des poids ouverts au lieu de lancer des aperçus furtifs. Google et Qwen utilisent tous deux des tokeniseurs et des encodeurs vidéo entièrement différents, il est donc difficile d'établir un lien solide avec ces modèles.
Ce qui reste pointe vers la famille de modèles de Zhipu AI. L'empreinte indépendante a fait correspondre le tokeniseur d'Ox Alpha à GLM-5.3 sur chaque test normalisé et sa dépense de jetons vidéo à GLM-5V-Turbo exactement sur quatre clips distincts, et il partage les erreurs distinctives de GLM et son comportement de rejet audio.
Le tokeniseur d'Ox Alpha est identique à celui de GLM. Aucun autre tokeniseur de laboratoire ne dépasse 4/11 en ce qui concerne la similarité des tokeniseurs.https://t.co/3K25G4U2hX (h/t : @sushsrinivasan)
Cependant, un détail complique une correspondance parfaite. GLM-5.3 lancé le 14 août en tant que modèle texte uniquement, six jours avant qu'Ox Alpha n'apparaisse avec un support vidéo complet. Si l'empreinte tient, Ox Alpha est plus probablement une mise à niveau multimodale non publiée de cette ligne qu'une copie identique—ce que les analystes ont commencé à appeler GLM-5.3 Flash.
Zhipu AI n'a rien dit publiquement à propos d'Ox Alpha, dans un sens ou dans l'autre.
Qu'est-ce qu'un modèle furtif, en fait
Un modèle furtif est un système d'IA de classe frontière publié sans attribution via une plateforme de routage comme OpenRouter, permettant à un laboratoire de collecter des données d'utilisation réelles avant de s'engager dans un lancement public.
Ce schéma est devenu courant pour les laboratoires chinois. Le propre Pony Alpha de Zhipu AI a été démasqué comme GLM-5 en cinq jours en février, le Hunter Alpha de Xiaomi s'est avéré être MiMo-V2-Pro en mars, et Meituan a laissé son Owl Alpha fonctionner anonymement pendant deux mois avant de le confirmer comme LongCat-2.0 en juin.
Ox Alpha est maintenant disponible sur OpenRouter sous l'identifiant de modèle stealth/ox-alpha, et via OpenCode, Cline et Nous Portal, tous gratuits à interroger. La note de lancement d'OpenCode a fixé la fenêtre gratuite à environ une semaine à partir des débuts du 20 août, plaçant la coupure probable autour du 27 août—après quoi, si le schéma des quatre derniers modèles anonymes tient, quelqu'un pourrait enfin lui donner un nom.