Ox Alpha era GLM-5.3-Flash: qué es, cuánto cuesta y qué demuestra
✅ Actualización del 26 de agosto de 2026: ya sabemos qué era Ox Alpha.
Z.ai confirmó que el modelo sin dueño era GLM-5.3-Flash: un MoE de 320.000 millones de parámetros con solo 18.000 millones activos, multimodal de nacimiento, con un millón de tokens de contexto y los pesos publicados bajo licencia MIT. El identificadorstealth/ox-alphaya no responde. Tienes la ficha completa, el precio real, los benchmarks independientes y el asunto de los chips chinos —que es la noticia gorda— en la sección “Actualización del 26 de agosto”, casi al final. Lo que viene ahora lo escribí el 21 de agosto, cuando nadie sabía quién estaba detrás: léelo como lo que es, el método para evaluar un modelo del que no sabes nada, con el resultado contrastado al final.
Un desarrollador quemó 3.000 millones de tokens en tres horas con un modelo que no tiene nombre, no tiene dueño conocido y no cobra nada (Mehul Mohan en X).
Se llama Ox Alpha. Apareció en OpenRouter el 20 de agosto de 2026 bajo el proveedor “Stealth”, con un millón de tokens de contexto, entrada de texto, imagen y vídeo, y un precio de cero euros durante una semana.
Nadie ha dicho quién lo ha entrenado.
Y lo raro no es eso. Lo raro es que en menos de 24 horas ya había gente metiéndolo en repositorios de producción, comparándolo con modelos que cuestan una fortuna y —esto es lo que a mí me ha llamado la atención— diciendo que escribe bien. No que programe bien: que escribe bien. Que la prosa que suelta no huele a plantilla.
Esto es lo que vas a encontrar aquí:
- Qué es Ox Alpha exactamente y qué dice su ficha técnica sin adornos
- Por qué un laboratorio lanza un modelo sin firmarlo (y a quién le sale rentable)
- Las pruebas que hay sobre quién está detrás, y por qué la más citada tiene un agujero
- Qué rinde de verdad y qué falla, con los números que existen y sus asteriscos
- Cómo probarlo hoy desde OpenRouter o desde OpenCode, con código que puedes copiar
- El método para averiguar tú mismo qué modelo hay debajo de un nombre falso
- Lo que le pasa a tu código cuando lo mandas a un proveedor que no da la cara
- Quién estaba detrás (resuelto el 26 de agosto), qué es GLM-5.3-Flash y qué cambia ahora
⚠️ Este post se escribió el 21 de agosto de 2026, un día después del lanzamiento. La parte más perecedera es el precio y la disponibilidad: hoy es gratis y en una semana no lo será, o directamente desaparecerá del catálogo. Lo que aguanta el paso del tiempo es el mecanismo: cómo funciona un lanzamiento sigiloso, cómo se evalúa un modelo del que no sabes nada y qué decisiones tomas cuando la infraestructura que estás probando tiene fecha de caducidad. Si lees esto en 2027 con otro bicho anónimo en la lista de OpenRouter, las secciones del método te valen igual. Actualizado el 26 de agosto de 2026 con la revelación y con los datos que ya no son especulación.
¿Qué es Ox Alpha y qué dice su ficha técnica? ¶
Ox Alpha es un modelo de razonamiento orientado a programación y trabajo agéntico de largo recorrido, publicado en OpenRouter con el identificador stealth/ox-alpha y sin fabricante declarado. OpenRouter enruta las peticiones, pero deja claro en la propia ficha que no es el desarrollador, ni el dueño, ni el proveedor del modelo (OpenRouter).
| Especificación | Ox Alpha |
|---|---|
| Identificador | stealth/ox-alpha |
| Proveedor declarado | “Stealth” (anónimo) |
| Contexto | 1.048.576 tokens |
| Salida máxima | 131.072 tokens |
| Entrada | Texto, imagen y vídeo |
| Salida | Solo texto |
| Tool / function calling | Sí (tools y tool_choice) |
| Salida estructurada | response_format para JSON, sin validación de esquema |
| Proveedores que lo sirven | Uno solo, sin alternativa de enrutado |
| Latencia P50 | 4,03 s |
| Rendimiento | 29 tokens por segundo |
| Uptime declarado | 100% |
| Precio en preview | 0 por token de entrada y de salida |
| Fecha de aparición | 20 de agosto de 2026 |
| Identidad del laboratorio | Sin revelar |
Hay cuatro cosas en esa tabla que merecen un párrafo propio.
El vídeo. Aceptar vídeo como entrada no es habitual fuera de la familia Gemini, y menos en un modelo que se presenta como especialista en programación agéntica. La descripción oficial habla de “flujos que combinan texto con contexto visual”, que en cristiano quiere decir: enséñale la pantalla rota y que la arregle.
La salida de 131.072 tokens. Es una barbaridad. Para que te hagas una idea, es una ventana de salida más grande que la ventana de contexto completa de la mayoría de modelos de hace dos años. Ahí caben refactorizaciones enteras sin trocear.
El cero. No es un cero de “capa gratuita con 50 peticiones al día”. Es un cero de tarifa: OpenRouter no te cobra ni prompt ni completado durante el preview. Y por si fuera poco, OpenCode anunció el mismo día que lo servía gratis con límites que ellos describen como “casi ilimitados”, diciendo tener capacidad para 100 billones de tokens diarios (OpenCode en X). Al día siguiente lo extendieron a OpenCode Go, gratis seis días más y sin consumir la cuota normal del plan (OpenCode en X).
Ese “100 billones al día” es una cifra que da la empresa que lo sirve, no un dato auditado. Guárdala en la carpeta de “afirmaciones interesantes sin verificar”, que es donde va casi todo lo de este lanzamiento.
El proveedor único. Esta es la letra pequeña que se salta todo el mundo. La gracia de OpenRouter es que, cuando un modelo lo sirven varios proveedores, reparte y tiene a dónde caerse si uno falla. Con Ox Alpha no hay reparto: lo sirve un único proveedor y las peticiones van ahí directas. Si ese proveedor se cae, no hay plan B dentro de la plataforma.
Y un apunte para quien lo meta en un agente: acepta response_format para pedir JSON, pero sin validación de esquema. Es decir, te promete formato JSON, no que los campos sean los que tú esperas. Si tu flujo depende de una estructura concreta, valídala tú al recibirla.
¿Qué es un modelo sigiloso y por qué a un laboratorio le compensa? ¶
Un modelo sigiloso (o stealth, o cloaked) es un modelo que se publica en una pasarela como OpenRouter bajo un nombre en clave, sin decir qué laboratorio lo ha entrenado, durante una ventana corta y casi siempre gratis. Pasado el preview, o se revela, o desaparece, o las dos cosas.
¿Por qué haría eso alguien que se ha gastado millones en entrenar un modelo?
Porque el nombre contamina la evaluación. Si publicas “Modelo X de la empresa Y”, la mitad de la comunidad ya sabe si le va a gustar antes de escribir el primer prompt. El anonimato compra algo que el dinero no compra: feedback sin halo de marca. Y de paso compra volumen de evaluación real, en repositorios reales, con tareas que ningún benchmark sintético reproduce, a coste de inferencia regalada.
Es un trueque limpio: el laboratorio pone el cómputo, tú pones los casos de uso.
El historial de OpenRouter con esto ya da para una tabla:
| Nombre en clave | Cuándo | Qué resultó ser |
|---|---|---|
| Quasar Alpha | Abril 2025 | Versión temprana de GPT-4.1 (OpenAI), confirmado por OpenRouter |
| Optimus Alpha | Abril 2025 | También pruebas de GPT-4.1 |
| Aurora Alpha | Febrero 2026 | Sin revelación pública clara |
| Owl Alpha | Abril 2026 | Sin revelar; llegó a ser el 7.º modelo más usado de la plataforma |
| Hunter Alpha / Healer Alpha | 2026 | Modelos MiMo de Xiaomi |
| Ox Alpha | Agosto 2026 | GLM-5.3-Flash de Z.ai, confirmado el 26 de agosto |
El caso de Owl Alpha es el que más dice sobre este formato. Apareció el 28 de abril de 2026 sin firma, y en siete semanas se colocó como séptimo modelo más usado de todo OpenRouter, con más de 2,45 billones de tokens procesados (OpenRouter). Un modelo del que nadie sabía nada, comiéndose una porción del tráfico global de la plataforma.
Piénsalo un segundo. Miles de desarrolladores mandando su trabajo a un endpoint sin dueño conocido porque salía gratis y respondía bien.
🔑 El modelo sigiloso no es una rareza de marketing: es un mecanismo de captación de datos de evaluación. Tú no estás probando el modelo. Tú eres la prueba.
Herramienta gratis · Selector
¿Y cuál es el mejor modelo cuando esto se acabe?
Un modelo anónimo y gratis es una tentación, no una decisión. La decisión de verdad es a qué modelo le das el trabajo que importa, y esa el selector la responde con datos de uso reales de OpenRouter en vez de con la promesa de la semana.
Le das
Tu tarea y las suscripciones que ya pagas
Te devuelve
El modelo que te conviene, con alternativa barata
¿Quién está detrás de Ox Alpha? ¶
✅ Resuelto: era GLM-5.3-Flash de Z.ai. Te dejo el razonamiento tal y como lo escribí antes de saberlo, porque el valor está en cómo se llega ahí y en qué pista era la buena. El desenlace, con el reparto de aciertos y meteduras de pata, está en la actualización del final.
La respuesta honesta es que no se sabe. La respuesta útil es que hay dos hipótesis con pruebas de distinta calidad, y una de ellas tiene un agujero que casi nadie está mencionando.
Hipótesis 1: es una variante de GLM-5.3 (Z.ai). Es la que más peso tiene. Un análisis de fingerprinting de tokenizador publicado el mismo día del lanzamiento pasó 25 prompts distintos por ambos modelos y encontró que los recuentos nativos de tokens de Ox Alpha coincidían exactamente con los de GLM-5.3, con una única diferencia: un envoltorio oculto constante de 75 tokens (AI Tracker Bot en X, prueba atribuida al desarrollador dax). Que dos modelos tokenicen igual 25 textos distintos no es casualidad: el tokenizador es de las cosas más difíciles de disimular.
Hipótesis 2: es MiMo de Xiaomi. Otra observación apunta a que Ox Alpha tropieza con el mismo dirty token con el que se atragantan los modelos de las familias Qwen, GLM y MiMo (AiBattle en X). Xiaomi ya usó este canal antes: Hunter Alpha y Healer Alpha acabaron siendo modelos MiMo. Y el precedente pesa.
Fíjate en que las dos pistas apuntan al mismo sitio aunque discrepen en el nombre: laboratorio chino. El dirty token compartido no distingue entre Qwen, GLM y MiMo, así que sirve para descartar a OpenAI, Anthropic y Google, pero no para elegir entre los tres candidatos.
Y ahora el agujero.
GLM-5.3, tal y como se lanzó el 14 de agosto, no ve. Es un modelo de solo texto, y esa fue la petición número uno de la comunidad que Z.ai no atendió (lo conté con detalle en el análisis de GLM-5.3). Ox Alpha, en cambio, acepta imagen y vídeo. Si el tokenizador es el mismo, no estamos ante GLM-5.3: estamos ante otra cosa construida sobre la misma base, con una torre visual encima. Que es exactamente lo que un laboratorio querría probar en sigilo antes de anunciarlo.
Eso no es un hecho, es un razonamiento. Pero encaja mejor con las pruebas que el titular de “Ox Alpha es GLM-5.3 disfrazado”.
💡 Cuando leas “el modelo X es en realidad el modelo Y”, pregunta siempre qué prueba lo sostiene. Coincidencia de tokenizador es una prueba fuerte. “Se comporta parecido” no es ninguna prueba.
Si vas a prestar tus tareas reales, que sean tareas bien escritas
Comparar dos modelos con el mismo prompt improvisado no compara nada. En este curso gratis montas el ciclo de OpenSpec sobre un proyecto real: la misma especificación, ejecutada por el agente que tú elijas, con un resultado que sí puedes poner al lado de otro.
Entra en el curso gratis →¿Rinde de verdad o es entusiasmo de semana gratis? ¶
Los números que circulan son prometedores y prácticamente todos vienen de evaluaciones individuales, no de tablas oficiales. Te los doy con su etiqueta puesta.
En DeepSWE, un benchmark de agentes de programación, una ejecución reportada por un desarrollador situó a Ox Alpha en un 80%, por delante de Fable (65%) y de GPT-5.6 Sol (52%) (Startup Fortune). Ni OpenRouter ni el proveedor han publicado esa cifra. Trátala como tratarías la evaluación de cualquier desarrollador suelto: un dato útil, no una entrada verificada en un ranking.
Antes del contrapeso, un número que sí es oficial y que casi nadie está mirando: 29 tokens por segundo, con una latencia P50 de 4,03 segundos hasta el primer token, según las métricas del propio proveedor en OpenRouter (OpenRouter). Eso no es rápido. Es un ritmo perfectamente usable para una tarea de fondo, y bastante incómodo para trabajar en conversación mirando cómo aparecen las palabras.
Ojo con la lectura fácil que se está haciendo estos días. Que el modelo “vaya bien” en una evaluación no significa que vaya rápido, y con miles de personas estrujándolo gratis a la vez es imposible saber cuánto de esos 29 tokens por segundo es el modelo y cuánto es la cola. Lo que sí puedes concluir es que quien pida un agente de código de respuesta inmediata se va a llevar una decepción.
Y ahora el contrapeso, que es el dato que más me interesa de todo el lanzamiento.
Florian Roth lo pasó por su benchmark de triaje de amenazas y el resultado tiene dos caras: no se le escapó ninguna amenaza real, pero sobreclasificó un 45,4% de los casos benignos, que acabaron en revisión de analista (Florian Roth en X). Para esa tarea concreta es un mal resultado, y Gemini sigue por delante.
Ese patrón —cero falsos negativos, muchísimos falsos positivos— es la firma de un modelo afinado para no equivocarse por omisión. Le han enseñado a cubrirse. En un agente de código eso se traduce en algo que ya habrás sufrido: te toca cinco archivos cuando bastaba con uno, porque prefiere pasarse a quedarse corto.
| Dimensión | Qué se ha visto |
|---|---|
| Programación agéntica | Excelente según evaluaciones individuales, sin confirmación oficial |
| Velocidad | Discreta: 29 tokens por segundo y 4 segundos de latencia P50 |
| Ventana de contexto | Enorme sobre el papel; sin pruebas públicas de calidad al final del millón |
| Triaje de seguridad | Limitado: no falla en detectar, pero satura de falsos positivos |
| Barandillas de seguridad | Laxas; hay quien lo señala como característica y quien lo señala como riesgo |
| Resiliencia | Limitada: un único proveedor, sin enrutado alternativo si cae |
| Estabilidad a futuro | Nula por definición: es un preview con fecha de caducidad |
Sobre las barandillas: Mehul Mohan destacó como ventaja que el modelo no le puso pegas de ciberseguridad durante su evaluación interna. Si eso es una virtud o un problema depende de para qué lo uses, pero conviene saberlo antes de meterlo en un flujo que toque código sensible.
Cada semana sale un modelo con benchmarks de escándalo y a los tres días alguien encuentra el asterisco. Cada domingo mandamos 12 recursos escogidos sobre programación con IA a más de 7.200 developers. Gratis desde 2018.
Apúntate gratis →¿Y qué tal escribe Ox Alpha? ¶
Esta parte no la mide ningún benchmark de los que circulan estos días, y es la que a mí más me ha sorprendido: escribe bien. La prosa que produce en castellano no tiene el tic de plantilla que delata a la mayoría de modelos orientados a código.
Voy a ser preciso con lo que estoy diciendo y con lo que no.
Lo que digo: en las pruebas que le he hecho, el texto sale con ritmo, no repite las mismas estructuras cada tres párrafos y no cae en el “no solo X, sino también Y” cada dos líneas. Aguanta un tono cuando se lo pides y no lo abandona a mitad de una respuesta larga.
Lo que no digo: que sea mejor que ningún otro modelo escribiendo. Eso no lo he medido, y las impresiones de tres días con un modelo gratis son el terreno más fértil que existe para el autoengaño.
¿Por qué te cuento entonces una impresión subjetiva en un post lleno de tablas? Porque para muchos flujos de trabajo la calidad de escritura del modelo es el producto: los mensajes de commit, la descripción de una pull request, la documentación que genera tu agente, el CHANGELOG que nadie quiere redactar. Un modelo que programa de nueve y escribe de cuatro te obliga a repasar todo lo que sale en prosa.
Si quieres comprobarlo por tu cuenta sin gastar una tarde, hay un test rápido que funciona: pídele que te explique un concepto técnico que domines, a un nivel concreto (por ejemplo, “explícale a alguien que lleva seis meses programando qué es un race condition, sin analogías de coches”). Los modelos flojos escribiendo se delatan en dos sitios: recurren a la analogía prohibida igual, y cierran con un párrafo resumen que no aporta nada.
¿Cómo pruebas Ox Alpha hoy? ¶
Dos caminos, y los dos cuestan cero durante el preview.
Por la API de OpenRouter. Es un endpoint compatible con OpenAI, así que sirve cualquier cliente que ya tengas montado. Solo cambias la URL base y el identificador del modelo.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/ox-alpha",
"messages": [
{ "role": "user", "content": "Refactoriza esta función y explica cada cambio" }
]
}'
Con el SDK de OpenAI en Node es igual de directo. Fíjate en que el cliente no sabe ni le importa que detrás haya un modelo anónimo:
import OpenAI from "openai";
// El endpoint de OpenRouter es compatible con el SDK de OpenAI
const client = new OpenAI({
baseURL: "https://openrouter.ai/api/v1",
apiKey: process.env.OPENROUTER_API_KEY,
});
const response = await client.chat.completions.create({
model: "stealth/ox-alpha",
messages: [{ role: "user", content: "Explica qué hace este script de despliegue" }],
});
// El objeto usage trae el recuento real de tokens: te hará falta más adelante
console.log(response.usage);
Guarda ese console.log(response.usage). En la sección del método de identificación lo vas a usar.
⚠️ Ese identificador ya no funciona. Desde el 26 de agosto,
stealth/ox-alphadevuelve un aviso de que el preview terminó y de que el modelo era el GLM-5.3 Flash de Z.ai. El modelo sigue en OpenRouter con la nomenclatura habitual de la familia —la misma forma quez-ai/glm-5.2— y con precio. En el código no cambia nada más que la cadena del modelo.
Por OpenCode. Si ya trabajas con OpenCode, lo tienes en el selector de modelos sin configurar nada, y en OpenCode Go el consumo no descuenta de tu cuota habitual durante estos días. Es la vía más barata para meterlo en un repositorio de verdad, que es donde se ve si un modelo aguanta o se despeña.
Un aviso sobre el millón de tokens: que quepa no significa que rinda. La degradación de calidad cuando llenas ventanas gigantes está documentada y tiene hasta nombre, context rot. Nadie ha publicado pruebas de qué hace Ox Alpha en el token 900.000, así que si tu plan es meterle el monorepo entero, mide antes de confiar.
Verificar antes de creer
Si no puedes auditar al proveedor, más te vale poder auditar la salida
Con un modelo sin fabricante conocido, tu única defensa es lo que compruebas tú. En esta masterclass montas el método para revisar lo que genera un agente: qué mirar, con qué herramientas y en qué orden, para que la decisión de confiar deje de ser una corazonada.
Ver el método de verificación →Masterclass completa · Acceso con Web Reactiva Premium
¿Cómo averiguas tú qué modelo hay detrás de un nombre falso? ¶
Aquí está la parte que te sirve dentro de seis meses, cuando aparezca “Lynx Alpha” o como se llame el siguiente. Estas cuatro técnicas son las que usa la gente que acierta, ordenadas de más fiable a menos.
1. Recuento de tokens (la buena). Manda el mismo texto a los dos modelos que quieres comparar y lee el campo usage de la respuesta. Si los recuentos de entrada coinciden en textos variados —con emojis, con código, con acentos, con caracteres CJK—, comparten tokenizador. Una diferencia constante entre ambos suele ser un prompt de sistema oculto, no un tokenizador distinto. Es justo lo que se hizo con Ox Alpha: 25 prompts, coincidencia exacta, más 75 tokens fijos.
2. Tokens sucios y rarezas de vocabulario. Todos los tokenizadores tienen tokens infraentrenados que rompen el modelo de formas curiosas. Cada familia tiene los suyos. Si un modelo se atraganta con el mismo token raro que otro, la sospecha de parentesco es razonable.
3. Estilo de rechazo y formato por defecto. Cómo dice que no, con qué estructura organiza una respuesta larga, si tiende a las listas o a la prosa, qué emojis usa sin que se lo pidas. Es una pista débil, porque el post-entrenamiento la altera con facilidad, pero suma cuando coincide con las anteriores.
4. Preguntarle quién es. Esto no vale nada. Un modelo que responde “soy Claude” puede haber visto millones de textos donde otro modelo lo dice, o llevar instrucciones explícitas de mentir. Es la técnica que más circula en redes y la única que no aporta información.
🛡️ Una advertencia importante: la evidencia de superficie no prueba nada sobre el laboratorio. Las pasarelas normalizan las APIs y los proveedores cambian el enrutado sin tocar el identificador público. Lo que estás identificando es un tokenizador, no una empresa.
Si quieres profundizar en la metodología, Jonathan Reed la desarrolla en detalle con más matices sobre qué señales resisten y cuáles se rompen.
¿Qué le pasa a tu código cuando lo mandas a un proveedor anónimo? ¶
Y llegamos a la pregunta incómoda, la que se salta todo el mundo mientras dura la euforia de lo gratis.
Aquí hay una contradicción entre fuentes que conviene mirar de frente. La ficha del proveedor Stealth en OpenRouter dice que los prompts y los completados los retiene el proveedor y que no se usan para entrenamiento, con el resto de usos regido por los términos del modelo sigiloso (OpenRouter). El anuncio de OpenCode, en cambio, habla de “zero data retention” (OpenCode en X).
No son lo mismo. “Retenemos pero no entrenamos” y “no retenemos nada” son políticas distintas, y una de las dos descripciones no está siendo exacta.
Cuando dos fuentes se contradicen sobre tus datos, la regla es sencilla: asume la peor. Trabaja como si todo lo que mandas quedara guardado en un servidor de una empresa cuyo nombre no conoces, en una jurisdicción que no conoces, con un plazo de retención que no conoces.
Con eso claro, la decisión se vuelve fácil:
- ✅ Adelante: proyectos personales, código público, ejercicios, prototipos, evaluaciones, todo lo que ya está en un repositorio abierto
- ✅ Adelante: preguntas conceptuales, documentación, refactorizaciones de código de ejemplo
- ❌ Ni de broma: código propietario de un cliente, cualquier cosa bajo acuerdo de confidencialidad
- ❌ Ni de broma: datos personales, credenciales, ficheros
.env, volcados de base de datos - ❌ Ni de broma: repositorios de la empresa sin autorización explícita de quien manda
Esto no es paranoia de post de blog, es la misma lista de siempre. La he desarrollado entera en qué no compartir con agentes de IA, y con un proveedor sin identificar cada línea de esa lista pesa el doble.
Hay un detalle extra que casi nadie considera: si tu empresa tiene un proceso de aprobación de proveedores, un modelo anónimo no puede pasarlo por definición. No hay entidad a la que auditar, ni contrato que firmar, ni acuerdo de tratamiento de datos que revisar. Da igual lo bien que puntúe.
¿Compensa construir algo encima de un modelo gratis y temporal? ¶
Depende de qué signifique “construir”.
| Escenario | ¿Compensa? | Por qué |
|---|---|---|
| Evaluarlo contra tu propio conjunto de tareas | Sí, sin dudarlo | La semana gratis es para esto exactamente |
| Tareas puntuales de gran volumen (migraciones, traducciones masivas) | Sí, con datos no sensibles | Coste cero en algo que pagarías caro |
| Comparar tu prompt actual contra un modelo distinto | Sí | Aprendes de tu prompt aunque el modelo desaparezca |
| Un flujo interno del equipo que dependa de él | No | Se rompe cuando acabe el preview |
| Una funcionalidad de producto de cara al usuario | No | Sin precio conocido ni SLA ni proveedor identificable |
| Presupuestar la IA del próximo trimestre con este coste | No | El precio real puede aterrizar en cualquier sitio |
La distinción es la de siempre: usar un modelo temporal es gratis, depender de él te sale carísimo.
Y hay un beneficio que sobrevive al preview aunque el modelo se esfume: si tú ya tienes montado un conjunto de tareas propio con las que evalúas cualquier modelo nuevo, esta semana te sale gratis pasarlo. Si no lo tienes, este es un motivo estupendo para montarlo, porque cada dos semanas va a aparecer otro. En qué modelo usar para cada tarea desarrollé el criterio para armarlo sin volverte loco.
Distinguir lo que puedes usar de lo que puedes convertir en dependencia es la mitad del trabajo con IA. En la newsletter compartimos lo que vamos probando y lo que aportan los +7.200 developers que participan. Cada domingo, gratis.
Suscríbete gratis →¿Qué pasa cuando se acabe la semana gratis? ¶
Tres finales posibles, y conviene tener preparado el tuyo para cada uno.
Se revela y se lanza con precio. El desenlace más probable, y el que siguieron Quasar y Optimus Alpha. El modelo aparece con su nombre real, con su tarifa por millón de tokens y con una ficha técnica auditable. Tus evaluaciones de esta semana siguen valiendo, y además llegas con criterio formado antes que el resto.
Desaparece sin explicación. También ocurre. Owl Alpha lleva meses en el catálogo sin que nadie haya confirmado su origen. Si construiste algo encima, se te rompe sin previo aviso.
Se queda y no se revela nunca. El escenario más raro y el más incómodo: infraestructura que funciona bien y sobre la que no puedes responder a “¿quién procesa nuestros datos?”.
Prepararte cuesta poco: guarda ahora las salidas de tus pruebas, con los prompts que usaste y tus notas. Cuando se revele el nombre real —o cuando salga el siguiente sigiloso— tendrás una comparación limpia en lugar de un recuerdo entusiasta.
Actualización del 26 de agosto: Ox Alpha era GLM-5.3-Flash ¶
Ganó el primer escenario, el de “se revela y se lanza con precio”. El 26 de agosto de 2026, seis días después de aparecer sin firma, Z.ai confirmó que Ox Alpha era GLM-5.3-Flash (Z.ai). Si hoy llamas a stealth/ox-alpha, OpenRouter responde que el periodo de pruebas terminó y que ese modelo era el GLM-5.3 Flash de Z.ai. No queda ni un resquicio de duda.
Y el nombre engaña por partida doble.
No es un GLM-5.3 recortado ¶
Lo primero que uno piensa al leer “Flash” es la versión pequeña del modelo grande. Aquí no.
GLM-5.3, el que analicé el 15 de agosto, reutiliza el modelo base de GLM-5.2 y saca toda su mejora de un mes extra de post-entrenamiento. GLM-5.3-Flash parte de un modelo base nuevo, con arquitectura y plan de entrenamiento distintos (Hugging Face). Comparten tokenizador —por eso cuadraba el fingerprint— y no mucho más. Son dos ramas del mismo árbol, no un modelo y su hermano pequeño.
Ficha, ahora sí con fabricante:
| Especificación | GLM-5.3-Flash (antes Ox Alpha) |
|---|---|
| Fabricante | Z.ai (Zhipu) |
| Parámetros totales | 320.000 millones |
| Parámetros activos por token | 18.000 millones |
| Arquitectura | MoE con atención dispersa + atención lineal |
| Contexto | 1.048.576 tokens |
| Multimodalidad | Sí; primer GLM-5 nativamente multimodal |
| Pesos | Publicados en Hugging Face con licencia MIT |
| Precio oficial | 0,15 $ por millón de entrada · 0,50 $ por millón de salida |
| Precio promocional en OpenRouter | 0,075 $ · 0,25 $ |
| Velocidad medida | 50,2 tokens por segundo |
La mezcla de atención dispersa y atención lineal no es decoración de nota de prensa: es lo que explica que un modelo con un millón de tokens de contexto pueda cobrar esas tarifas. Explica el coste, ojo, no la calidad: sigue sin haber pruebas públicas de qué hace en el token 900.000.
Lo de la licencia MIT es más importante que la disponibilidad por API. Con los pesos publicados, la pregunta de “¿a quién le estoy mandando el código?” deja de tener una única respuesta posible.
Dónde acerté y dónde me equivoqué ¶
Escribí arriba que, si el tokenizador coincidía pero el modelo veía imágenes y vídeo, no estábamos ante GLM-5.3 sino ante “otra cosa construida sobre la misma base, con una torre visual encima”.
La primera mitad era correcta, y era la parte que importaba: no era GLM-5.3, y la multimodalidad era la pista que lo delataba. La segunda mitad no: no hay una torre visual pegada a una base existente, hay un modelo base nuevo entrenado para eso desde el principio.
Me quedo con la lección, que vale más que el acierto: la capacidad que no encaja con la hipótesis es la parte de la hipótesis que hay que romper, no el detalle incómodo que se ignora para que el titular funcione. Quien tituló “Ox Alpha es GLM-5.3” tenía la familia bien y el modelo mal.
La hipótesis 2, la de MiMo de Xiaomi, se cae entera. El dirty token compartido servía para acotar a Qwen, GLM y MiMo, y para nada más. Exactamente el alcance que le di.
Los números, ahora con evaluación independiente ¶
Artificial Analysis ya lo ha pasado por su índice, y la comparación con el hermano mayor es de las que hacen mirar dos veces:
| Modelo | Intelligence Index | Parámetros activos | Precio combinado |
|---|---|---|---|
| GLM-5.3 | 60 | 40.000 M | 0,90 $/M |
| GLM-5.3-Flash | 57 | 18.000 M | 0,10 $/M |
Tres puntos menos. Menos de la mitad de parámetros activos. Y un coste nueve veces menor (Artificial Analysis).
Eso no es “un modelo chino barato que va bien”. Es un salto de eficiencia que cambia la cuenta de qué te puedes permitir dejar corriendo dentro de un agente durante horas.
Artificial Analysis confirma también la pega que ya se olía durante el preview: 50,2 tokens por segundo y tendencia a enrollarse (Artificial Analysis). Los 29 tokens por segundo de la ficha del preview y estos 50,2 no se contradicen tanto como parece: uno es un endpoint gratuito con media internet encima y el otro una medición sobre servicio de pago. Ni con la cifra buena es un modelo rápido. “Flash” aquí describe el coste, no la velocidad, y quien decía durante el preview “esto no parece un Flash” tenía razón en lo que veía y se equivocaba en lo que el nombre prometía.
La noticia gorda no es el nombre: son los chips ¶
Y aquí está lo que de verdad importa de todo este lanzamiento.
Zhipu asegura que todo el tráfico de Ox Alpha se sirvió con chips chinos, en un clúster de unos 100.000 aceleradores domésticos, y que procesó unos 62 billones de tokens antes del anuncio oficial (South China Morning Post). SemiAnalysis habla de escalas de hasta 100 billones de tokens al día, con costes de inferencia competitivos con las GPU de Nvidia (vía Techmeme).
¿Te suena esa última cifra? Es la misma que soltó OpenCode el día del lanzamiento y que yo archivé arriba en la carpeta de “afirmaciones interesantes sin verificar”. Resulta que la capacidad estaba ahí. Lo interesante no era cuántos tokens: era sobre qué silicio.
Visto así, el experimento tenía dos capas. La de arriba: probar un modelo sin que la marca contaminara el feedback. La de abajo: demostrar en público, con miles de desarrolladores como testigos involuntarios, que se puede servir un modelo puntero a escala sin hardware de Nvidia. Y esa segunda capa no se puede desmontar diciendo “son cifras de laboratorio”, porque las generó tu propio curl.
Con su asterisco, que aquí también toca: el recuento de tokens y el tamaño del clúster los da Zhipu, sin auditoría independiente. Lo que sí es comprobable es que el servicio aguantó una semana siendo el modelo más usado de OpenRouter.
🔑 Durante el preview la pregunta era “¿qué modelo es?”. La respuesta útil resultó ser otra: “¿sobre qué infraestructura corre?”. La primera pregunta se resuelve en seis días. La segunda decide precios durante años.
El experimento le salió redondo ¶
Ox Alpha llegó a ser el modelo más usado de la semana en OpenRouter. Zhipu afirma que en sus tres primeros días procesó más de 11 billones de tokens, el mayor lanzamiento de la plataforma hasta la fecha, y sus acciones subieron con el anuncio (South China Morning Post).
Recuerda el trueque que describí al principio: el laboratorio pone el cómputo, tú pones los casos de uso. Ahora ya sabes cuánto pagó Z.ai por ese feedback y cuánto sacó. Le salió barato.
Qué cambia para ti ¶
| Antes (Ox Alpha) | Ahora (GLM-5.3-Flash) |
|---|---|
| Proveedor anónimo, sin entidad que auditar | Z.ai (Zhipu), empresa identificada y cotizada |
| Precio cero con fecha de caducidad | 0,15 $ / 0,50 $ por millón, con promoción por debajo |
| Un único proveedor sin enrutado alternativo | Pesos MIT en Hugging Face: eliges proveedor o lo sirves tú |
| Política de datos contradictoria entre fuentes | La política del proveedor que elijas, y la lees antes de firmar |
| Imposible pasar una aprobación de proveedores | Posible: hay entidad, contrato y pesos descargables |
La casilla que más se mueve es la última. Un modelo con pesos MIT te devuelve la opción de no delegar nada: si la respuesta a “¿dónde acaba mi código?” te importa de verdad, lo levantas donde tú digas. Lo que no cambia es la conversación sobre jurisdicción si tiras de la API alojada. La lista de qué no compartir con agentes de IA sigue valiendo palabra por palabra.
Y una recomendación práctica: si guardaste las salidas de tus pruebas de la semana gratis, como te decía arriba, ahora tienes algo que casi nadie tiene: una evaluación de GLM-5.3-Flash hecha antes de saber cómo se llamaba, sin el sesgo de la marca ni el de los benchmarks que salieron después. Eso es un dato limpio. Guárdalo bien.
Lo que queda por demostrar ¶
La lista que escribí el 21 de agosto, con lo que ha caído desde entonces:
La identidad.✅ Resuelta: GLM-5.3-Flash de Z.ai, confirmado el 26 de agosto.El precio.✅ 0,15 $ de entrada y 0,50 $ de salida por millón de tokens, con promoción por debajo en OpenRouter.- La calidad en contexto largo. Sigue pendiente. Un millón de tokens en la ficha no es un millón de tokens útiles, y la arquitectura explica el coste, no la calidad.
- La política de datos real. Resuelta a medias: ya sabes de quién es la API, y si no te convence tienes los pesos.
- La consistencia bajo carga. Ahora es medible sobre servicio de pago; las primeras cifras independientes ya están (50,2 tokens por segundo).
- Las barandillas. Sigue pendiente, y con pesos abiertos es una conversación distinta: las barandillas duran lo que tarda alguien en quitarlas.
Ox Alpha en una frase ¶
Un modelo de programación con ficha técnica de primera división que Z.ai regaló durante seis días sin firmarlo, para que miles de desarrolladores le prestaran sus tareas reales como banco de pruebas y, de paso, demostraran en público que se puede servir un modelo puntero con silicio chino.
Le salió tan bien que probablemente veas la jugada repetida antes de fin de año.
TL;DR ¶
- ✅ Ox Alpha era GLM-5.3-Flash de Z.ai (Zhipu), confirmado el 26 de agosto de 2026 tras seis días publicado en OpenRouter como
stealth/ox-alphasin fabricante declarado - 🧠 No es un GLM-5.3 recortado: parte de un modelo base nuevo, mientras que GLM-5.3 reutiliza el base de GLM-5.2. Comparten tokenizador, y por eso cuadraba el fingerprint
- 📐 Ficha: MoE de 320.000 millones de parámetros con solo 18.000 millones activos, 1.048.576 tokens de contexto, multimodal nativo y pesos publicados con licencia MIT
- 💸 Precio oficial: 0,15 $ por millón de entrada y 0,50 $ de salida, con promoción a la mitad en OpenRouter durante el arranque
- 📊 Artificial Analysis le da 57 puntos frente a los 60 de GLM-5.3, con menos de la mitad de parámetros activos y un coste nueve veces menor
- 🐢 “Flash” describe el coste, no la velocidad: 50,2 tokens por segundo y tendencia a enrollarse
- 🇨🇳 La noticia de fondo: Zhipu asegura haber servido todo el tráfico con chips chinos, en un clúster de unos 100.000 aceleradores y 62 billones de tokens procesados antes del anuncio
- 🧪 El experimento sigiloso funcionó: fue el modelo más usado de la semana en OpenRouter, con más de 11 billones de tokens en sus tres primeros días
- 🔐 Con pesos MIT ya puedes servirlo tú: la pregunta de a quién le mandas el código deja de tener una única respuesta
Preguntas frecuentes sobre Ox Alpha y GLM-5.3-Flash ¶
¿Qué es Ox Alpha?
Era el nombre en clave de GLM-5.3-Flash, el modelo de Z.ai (Zhipu) publicado de forma anónima en OpenRouter el 20 de agosto de 2026 bajo el proveedor “Stealth” y revelado el 26 de agosto. Es un modelo de razonamiento orientado a programación y trabajo agéntico, con un millón de tokens de contexto y entrada de texto, imagen y vídeo.
¿Ox Alpha y GLM-5.3-Flash son el mismo modelo?
Sí. Z.ai lo confirmó el 26 de agosto de 2026 y OpenRouter lo dice explícitamente cuando intentas usar el antiguo identificador stealth/ox-alpha: ese modelo era el GLM-5.3 Flash de Z.ai.
¿Qué es GLM-5.3-Flash?
Un modelo MoE de 320.000 millones de parámetros totales con solo 18.000 millones activos por token, con un millón de tokens de contexto, multimodalidad nativa y una arquitectura que mezcla atención dispersa y atención lineal. Sus pesos están publicados en Hugging Face con licencia MIT.
¿GLM-5.3-Flash es una versión reducida de GLM-5.3?
No. GLM-5.3 reutiliza el modelo base de GLM-5.2 y mejora vía post-entrenamiento; GLM-5.3-Flash parte de un modelo base nuevo, con otra arquitectura y otro plan de entrenamiento. Comparten tokenizador, que es lo que hizo cuadrar el fingerprint durante el preview anónimo.
¿Cuánto cuesta GLM-5.3-Flash?
El precio oficial es de 0,15 $ por millón de tokens de entrada y 0,50 $ por millón de salida, con una tarifa promocional más baja en OpenRouter (0,075 $ / 0,25 $) durante el arranque. Artificial Analysis lo sitúa en 0,10 $ por millón en su métrica combinada, frente a los 0,90 $ de GLM-5.3.
¿Es GLM-5.3-Flash mejor que GLM-5.3?
En capacidad, no: Artificial Analysis le da 57 puntos de índice frente a los 60 de GLM-5.3. En eficiencia, muchísimo: consigue esos 3 puntos menos con menos de la mitad de parámetros activos y un coste nueve veces menor. Para tareas agénticas largas esa cuenta suele salir a favor del Flash.
¿Ox Alpha era gratis?
Lo fue durante el preview, del 20 al 26 de agosto de 2026: OpenRouter lo sirvió con tarifa cero y OpenCode lo ofreció gratis con límites que describía como casi ilimitados. Esa ventana ya se cerró y el modelo se sirve ahora con precio bajo su nombre real.
¿Cómo uso GLM-5.3-Flash desde código?
Con el endpoint compatible con OpenAI de OpenRouter: apunta la URL base a https://openrouter.ai/api/v1 y usa el identificador del modelo en la familia z-ai, igual que con z-ai/glm-5.2. También puedes ir por la API de Z.ai o servirlo tú, porque los pesos están en Hugging Face con licencia MIT. Acepta tools y tool_choice para function calling, y response_format para pedir JSON, aunque sin validación de esquema: la estructura la compruebas tú.
¿Es rápido GLM-5.3-Flash?
No especialmente, y el nombre despista. Artificial Analysis mide 50,2 tokens por segundo y señala que tiende a ser verboso; durante el preview gratuito la ficha de OpenRouter daba 29 tokens por segundo y 4,03 segundos de latencia P50. “Flash” describe aquí el coste, no la velocidad de generación.
¿Es verdad que GLM-5.3-Flash corre sin chips de Nvidia?
Eso afirma Zhipu: todo el tráfico de Ox Alpha se sirvió con aceleradores chinos, en un clúster de unos 100.000 chips que habría procesado unos 62 billones de tokens antes del anuncio. Son cifras de la propia empresa, sin auditoría independiente, pero el servicio estuvo una semana siendo el modelo más usado de OpenRouter.
¿Ox Alpha entrenaba con mis datos?
Durante el preview, la ficha de OpenRouter decía que el proveedor retenía prompts y completados sin usarlos para entrenamiento, mientras que OpenCode hablaba de retención cero. Se contradecían, así que lo prudente era asumir lo peor. Ahora sabes que el proveedor era Z.ai y puedes leer sus términos antes de mandarle nada.
¿Puedo usar GLM-5.3-Flash con código de mi empresa?
Ya es posible plantearlo, cosa que con un proveedor anónimo no lo era: hay entidad identificada, contrato y jurisdicción que revisar. Y si la API alojada no pasa tu proceso de aprobación, los pesos MIT te permiten servirlo en tu propia infraestructura.
¿Por qué los laboratorios lanzan modelos sin decir quién los hace?
Para conseguir evaluación real sin el sesgo de la marca y sin que la competencia sepa qué están probando. A cambio regalan la inferencia. El usuario aporta las tareas reales que ningún benchmark reproduce.
¿Merece la pena montar un producto sobre GLM-5.3-Flash?
Ahora sí se puede evaluar en serio, cosa que con Ox Alpha no: hay precio publicado, fabricante identificable y pesos abiertos con los que dejas de depender de un único proveedor. La duda que queda es la de siempre con un modelo recién salido: consistencia bajo carga y calidad real en contexto largo.
¿Cómo puedo saber qué modelo hay detrás de un nombre sigiloso?
La técnica más fiable es comparar recuentos de tokens del campo usage con textos variados: si coinciden, comparten tokenizador. Después van las rarezas de vocabulario y el estilo de respuesta. Preguntarle al modelo quién es no sirve de nada.
Fuentes ¶
- GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai
- zai-org/GLM-5.3-Flash — Hugging Face
- GLM-5.3-Flash: Intelligence, Performance & Price Analysis — Artificial Analysis
- GLM-5.3-Flash vs GLM-5.3 — Artificial Analysis
- Zhipu AI shares jump as viral Ox Alpha model revealed as GLM-5.3-Flash on Chinese chips — South China Morning Post
- Análisis de SemiAnalysis sobre la escala de inferencia — vía Techmeme
- The Chinese AI model GLM-5.3-Flash runs without Nvidia — The Decoder
- Ox Alpha model made by China’s Z.ai — Business Insider
- GLM-5.3-Flash — discusión en Hacker News
- Ox Alpha — API Pricing & Providers, OpenRouter
- Stealth — provider page, OpenRouter
- Anuncio de Ox Alpha — OpenRouter en X
- Ox Alpha gratis durante una semana — OpenCode en X
- Ox Alpha en OpenCode Go — OpenCode en X
- Fingerprinting de tokenizador de Ox Alpha — AI Tracker Bot en X
- El “dirty token” compartido con Qwen, GLM y MiMo — AiBattle en X
- Evaluación de triaje de amenazas — Florian Roth en X
- 3.000 millones de tokens en tres horas — Mehul Mohan en X
- A Mystery Model Called Ox Alpha Just Topped Coding Benchmarks For Free — Startup Fortune
- Stealth Model Ox Alpha Available For Free For A Week — OfficeChai
- Ox Alpha: who’s behind the free mystery frontier model? — OrcaRouter
- Ox Alpha emerges as new stealth AI model with 1M context window — Crypto Briefing
- “Stealth” model: Quasar Alpha — OpenRouter
- “Stealth” model: Optimus Alpha — OpenRouter
- Owl Alpha — OpenRouter
- Aurora Alpha — OpenRouter
- Data Collection — OpenRouter Privacy
- Stealth AI Models: How to Evaluate Hidden Model Identity — Jonathan Reed
- OpenCode Go — documentación
- GLM-5.3: qué es, cuánto cuesta y cuándo usarlo — Web Reactiva
- Qué no compartir con agentes de IA — Web Reactiva
- Context rot: por qué tu agente empeora — Web Reactiva
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.