GLM-5.3: qué es, cuánto cuesta y cuándo usarlo
GLM-5.3 es el modelo de programación de Z.ai (Zhipu) lanzado el 14 de agosto de 2026, y lo raro es que por dentro no hay un modelo nuevo. Corre sobre exactamente el mismo modelo base de 743.000 millones de parámetros que ya usaba GLM-5.2. Sin reentrenar. Sin arquitectura nueva. Sin más parámetros.
Toda la mejora —y Z.ai habla de un 50% mejor en su benchmark interno de agentes de código— sale de un mes adicional de post-entrenamiento.
Esa frase, si la lees rápido, parece una nota al pie técnica. No lo es. Es la noticia.
Durante tres años la receta para que un modelo fuera mejor programando ha sido la misma: más parámetros, más datos, más pre-entrenamiento, más factura. GLM-5.3 dice que puedes coger el cerebro que ya tenías, meterlo en entornos de ingeniería mucho más largos y realistas, y sacarle un salto que parece de generación nueva. Y de paso le salió una capacidad que nadie había pedido: encontrar vulnerabilidades de seguridad tan bien que la propia Z.ai ha retrasado la publicación de los pesos.
Esto es lo que vas a encontrar aquí:
- Qué lleva GLM-5.3 por dentro y qué cambia frente a GLM-5.2
- Por qué un modelo sin reentrenar puede mejorar tanto (la parte que de verdad importa a largo plazo)
- Los benchmarks oficiales, con los asteriscos puestos donde toca
- La historia de ciberseguridad: qué es real y qué es titular fácil
- Dónde puedes usarlo hoy, cuánto cuesta y por qué se come la cuota
- Qué dicen los primeros que lo han estrujado, y qué falta por comprobar
⚠️ Este post se escribió el 15 de agosto de 2026, un día después del lanzamiento. Las cifras de disponibilidad y precio son las más volátiles de todo el análisis: a esa fecha no hay pesos publicados, no hay tarifa por token en la API general y no está en OpenRouter. Lo que sí aguanta el paso del tiempo es la parte de cómo se ha entrenado, que es donde está la lección. Si lees esto meses después, salta directo a la sección de post-entrenamiento y a la de “cómo seguir un lanzamiento sin comerte el hype”.
¿Qué es GLM-5.3 y qué cambia respecto a GLM-5.2? ¶
GLM-5.3 es el modelo insignia de Z.ai para programación agéntica y tareas de largo recorrido. Comparte base con su predecesor y cambia todo lo que hay encima de esa base.
| Especificación | GLM-5.3 |
|---|---|
| Modelo base | El mismo de GLM-5.2 (~743B, MoE, ~40B activos) |
| Contexto | 1M de tokens (sufijo glm-5.3[1m]) |
| Salida máxima | 128K tokens |
| Entrada | Solo texto |
| Niveles de esfuerzo | high y max |
| Tool / function calling | Sí |
| MCP | Sí |
| Salida estructurada | Sí |
| Caché de contexto | Sí |
Tres cosas que conviene fijar antes de seguir.
Sigue sin ver. GLM-5.3 es solo texto, igual que GLM-5.2. Si tu flujo consiste en pasarle capturas al agente para que arregle la UI, este modelo no es tu modelo: la línea multimodal de Z.ai es otra (los GLM-5V). Era la petición número uno de la comunidad tras la 5.2 y sigue sin llegar.
El millón de tokens no es automático. Hay que pedirlo con el sufijo [1m] en el identificador del modelo, igual que en la generación anterior. Si no lo pones, te quedas en la ventana estándar y te preguntarás por qué se te olvidan archivos.
Los niveles de razonamiento se han simplificado a dos. high produce cadenas de pensamiento más ligeras y con menos latencia por token; max activa el razonamiento profundo para lo agéntico duro. Si vienes de GLM-5.2, esto ya te sonará: la trampa clásica es dejar max por defecto y descubrir a fin de mes que el modelo razonaba como si le pagaran por palabra.
La diferencia de fondo con la 5.2 no está en la ficha técnica. Está en lo que le han enseñado a hacer.
Z.ai entrena a su modelo en el ciclo completo; tú se lo tienes que dar con una spec
El post-entrenamiento de GLM-5.3 va de recorrer identificar → analizar → implementar → verificar → entregar. Ese bucle no aparece solo en tu repo: se lo das tú. En este curso gratis lo montas entero con OpenSpec sobre un proyecto real, para que el agente deje de improvisar a mitad de tarea.
Entra en el curso gratis →¿Por qué un modelo sin reentrenar puede mejorar un 50% programando? ¶
Porque el cuello de botella ya no está solo en el modelo. Está en qué le pones a hacer mientras aprende.
Z.ai explica que escaló tres cosas del sistema de post-entrenamiento que ya tenía montado para GLM-5.2: más entornos ejecutables, tareas de largo recorrido más variadas y más cómputo dedicado al aprendizaje por refuerzo dentro de esos entornos. Nada de eso toca el pre-entrenamiento.
El detalle interesante es cómo son esas tareas. Ya no son problemas pequeños de programación tipo “implementa esta función”. El modelo tiene que recorrer el ciclo entero:
identificar el problema → analizarlo → implementar → verificar → entregar
Según Z.ai, algunas tareas de entrenamiento equivalen a varios días de trabajo de un ingeniero senior e implican clústeres reales, almacenamiento, documentación interna y repositorios de código de verdad. Otras trabajan sobre decenas de miles de líneas, cientos de archivos y sistemas interdependientes, donde el agente tiene que implementar, probar, detectar que se ha equivocado, corregirse y seguir hasta producir algo entregable.
Ese es el cambio conceptual. No están enseñando al modelo a escribir código. Le están enseñando a operar dentro de un trabajo de ingeniería que dura horas y no se resuelve de un tirón.
Nathan Lambert, en su análisis en Interconnects, lee el lanzamiento en esa misma clave y añade dos matices que merecen quedarse:
- No es una historia de destilación. El argumento de “los laboratorios chinos simplemente copian a los americanos” no explica esto. Puedes extraer trazas de razonamiento de otro modelo, pero no puedes copiar la infraestructura de entornos de RL, la mezcla de tareas y el saber hacer necesario para entrenar a esa escala.
- GLM-5.3 probablemente es más estrecho que Fable 5 o GPT-5.6 Sol. Está muy optimizado para código y agentes, y es solo texto. Eso permite dedicar muchísimo más post-entrenamiento a un conjunto concreto de capacidades. Es una ventaja de foco, no de superioridad general.
🔑 Si solo te llevas una idea de este post: el siguiente salto en agentes de programación puede venir más de mejorar los entornos de entrenamiento y los bucles de trabajo que de construir otro modelo base gigantesco. Eso conecta directamente con el spec driven development, con el harness que envuelve al modelo y con los agentes de largo recorrido.
Y sí, conviene el escepticismo de rigor: Lambert considera que los resultados publicados son probablemente reales, pero también que Z.ai optimiza agresivamente alrededor de benchmarks públicos, como hacen en mayor o menor medida todos los laboratorios.
¿Qué dicen los benchmarks de GLM-5.3? ¶
Los números oficiales son llamativos, sobre todo en las evaluaciones de tareas largas. Estos son los que ha publicado Z.ai, comparados con GLM-5.2:
| Benchmark | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4,6 | 28,3 |
| DeepSWE v1.1 | 46,2 | 66,9 |
| SWE-Marathon v1.1 | 19,4 | 42,5 |
| Agent’s Last Exam | 23,8 | 28,5 |
| GDPval-AA v2 (Elo) | — | 1.769 |
| HLE con herramientas | — | 62,5% |
| AutomationBench | — | 48,2 |
El 4,6 → 28,3 en Terminal-Bench 3.0 es el que se ha llevado los titulares, y Z.ai lo presenta como la mejor puntuación de cualquier modelo de pesos abiertos en esa prueba. Antes de emocionarte, dos asteriscos importantes.
Asterisco uno: no compares versiones de benchmark. Terminal-Bench 3.0 es sustancialmente más duro que la 2.1. Poner el 28,3 de GLM-5.3 al lado del ~88-92% que Fable 5 o GPT-5.6 Sol sacan en Terminal-Bench 2.1 no mide nada. Son escalas distintas. Es un error que vas a ver repetido en medio internet estos días.
Asterisco dos: el benchmark que más se cita es privado. Z.ai reporta que en su Code Bench interno, GLM-5.3 en esfuerzo high saca 31,4% gastando unos 50.000 tokens de salida por tarea, frente al 29,5% de Claude Opus 4.8 gastando unos 120.000. Suena espectacular: más acierto con el 40% de los tokens. Pero es un benchmark que nadie fuera de Z.ai puede volver a ejecutar. Y en ese mismo tablero, Fable 5 sigue por delante con un 39,5% a esfuerzo máximo.
Lo que sí me parece señal fuerte, y no ruido, es el cambio en eficiencia de tokens. La crítica principal a GLM-5.2 era que gastaba muchísimo razonando. En GLM-5.3, la media de salida a esfuerzo máximo baja de unos 96.000 a unos 75.000 tokens por tarea: cerca de un 22% menos, subiendo el resultado. Es raro ver las dos cosas a la vez, y es exactamente lo que esperarías de un post-entrenamiento centrado en terminar trabajos, no en pensar bonito.
💡 Cuando compares modelos, mide coste por tarea completada, no coste por millón de tokens. Un modelo barato que necesita el triple de tokens y dos vueltas más sale más caro que uno caro que acierta a la primera. GLM-5.2 era el ejemplo de manual de esa trampa; GLM-5.3 parece corregirla en parte.
Cada dos semanas hay modelo nuevo, benchmark nuevo y titular nuevo. Cada domingo seleccionamos 12 recursos para que no tengas que perseguirlos tú. Ya somos +6.700 developers.
Quiero esa dinamita 🧨¿Es verdad que GLM-5.3 encuentra vulnerabilidades mejor que los modelos cerrados? ¶
En encontrarlas, los datos publicados dicen que sí, por poco. En explotarlas, no. Y esa distinción es la que se pierde en el titular.
Empecemos por lo que reporta Z.ai:
| Prueba | GLM-5.3 | Referencia |
|---|---|---|
| CyberGym (descubrimiento) | 84,5% | Mythos 5: 83,8% · GPT-5.6 Sol: 83,6% |
| ExploitBench (explotación) | 54,4% | Mythos 5: 78,0% · GPT-5.6 Sol: 76,5% |
| ExploitBench (GLM-5.2) | 24,4% | — |
| ExploitGym, presupuesto de 2h | 105 tareas | Mythos 5: 181 |
| ExploitGym, presupuesto de 6h | 130 tareas | Mythos 5: 247 |
Léelo así: GLM-5.3 es muy bueno en el tramo revisar código → descubrir vulnerabilidad → verificarla, y bastante menos competitivo en el tramo vulnerabilidad → exploit funcional → operación ofensiva completa. Duplicar el resultado de la 5.2 en ExploitBench (24,4 → 54,4) es un salto enorme, pero sigue a 24 puntos de Mythos 5.
Lo que a mí me parece más significativo que cualquier benchmark es el registro público de divulgación que Z.ai ha abierto en cvd.z.ai. Ahí no hay una puntuación: hay trabajo hecho. Desde GLM-5.2, la compañía dice haber encontrado con sus modelos, en colaboración con equipos de seguridad y universidades:
- 2.436 vulnerabilidades en 269 proyectos de código abierto
- 1.097 clasificadas como críticas o altas (107 críticas, 990 altas)
- 1.286 medias y 53 bajas
- Solo 53 CVEs publicados; 2.383 siguen bajo embargo mientras avanza la divulgación coordinada
- Fallos introducidos entre 1981 y 2026, incluyendo Linux, WebKit y FreeBSD
Eso ya no es un benchmark. Es un pipeline de descubrimiento y divulgación responsable funcionando. Y de propina, el caso que más ruido ha hecho: el investigador de seguridad Joshua Saxe señaló que el modelo detectó una vulnerabilidad seria en el editor Cursor, un riesgo de arquitectura Rust/Electron que permitía escritura arbitraria de archivos.
🛡️ Que un modelo abierto encuentre bugs de hace cuarenta años en proyectos que todo el mundo usa es una noticia estupenda para quien defiende, y una noticia incómoda para todos los demás. Si te interesa este terreno, tenemos el análisis de GPT-5.4-Cyber frente a Claude Mythos y una recopilación de skills de ciberseguridad para agentes que encaja justo aquí.
¿Por qué Z.ai retrasa los pesos abiertos de GLM-5.3? ¶
Justo por lo anterior. Y es un cambio de guion importante.
GLM-5.2 publicó sus pesos con licencia MIT en Hugging Face a los pocos días del lanzamiento. GLM-5.3 rompió ese patrón desde el minuto uno: Z.ai anunció que publicaría los pesos unas dos semanas después —lo que apunta a finales de agosto de 2026— una vez terminadas la evaluación y el endurecimiento de seguridad.
El plan que ha descrito la compañía es escalonado:
- Socios de seguridad seleccionados evalúan el modelo en entornos controlados.
- Acceso más amplio y disponibilidad de API.
- Publicación de los pesos completos.
Además, las funciones de ciberseguridad más sensibles quedan detrás de un programa de “trusted access” para usuarios verificados. La frase con la que Z.ai lo justifica resume la postura: “la apertura responsable no significa tratar cada capacidad como inofensiva”.
Puedes leerlo de dos formas, y las dos son legítimas. La generosa: un laboratorio abierto tomándose en serio el riesgo de soltar un buscador de vulnerabilidades de nivel frontera. La cínica: un modelo que se anuncia como abierto y que el día del lanzamiento no lo es, con un margen cómodo para acaparar titulares antes de que nadie pueda verificar nada.
Lo que sí es un hecho comprobable: mientras no haya pesos, no hay verificación independiente posible. Ni cuantizaciones, ni ejecuciones locales, ni benchmarks de terceros sobre repositorios sucios de verdad. Y esa es exactamente la parte que separa un lanzamiento interesante de un modelo que puedes meter en tu stack. Si el matiz entre “pesos abiertos” y “open source” te baila, lo desmenuzamos en qué son los modelos de pesos abiertos.
Verificar antes de creer
Un modelo que encuentra 2.436 bugs también inventa hallazgos con total aplomo
La misma capacidad que descubre una vulnerabilidad de 1981 te suelta un falso positivo perfectamente argumentado. En esta masterclass montas el método para verificar lo que genera un agente: qué comprobar, con qué herramientas y en qué orden, para que la revisión no dependa de tu intuición a las once de la noche.
Ver el método de verificación →Masterclass completa · Acceso con Web Reactiva Premium
¿Dónde puedes usar GLM-5.3 hoy y cuánto cuesta? ¶
A 15 de agosto de 2026, el acceso es más estrecho de lo que sugiere el anuncio. Este es el mapa:
| Dónde | Estado |
|---|---|
| GLM Coding Plan | Disponible en Lite, Pro y Max |
| ZCode | Disponible (agente propio de Z.ai) |
| Claude Code | Vía Coding Plan, apuntando el endpoint a Z.ai |
| Codex CLI | Soportado oficialmente por Z.ai con endpoint compatible |
| OpenCode Go | Disponible junto a GLM-5.2, Kimi K3 y compañía |
| API general por token | Sin tarifa publicada todavía |
| OpenRouter | No aparece; el catálogo sigue en GLM-5, 5.1, 5.2 y Turbo |
| Pesos en Hugging Face | Pendientes (~finales de agosto) |
El Coding Plan arranca en 18 dólares al mes en su nivel Lite, con Pro y Max por encima (las cifras exactas de esos dos niveles bailan según promoción, así que mira la página de suscripción antes de hacer cuentas). Y hay un detalle que conviene saber: en el Coding Plan, las peticiones dirigidas a GLM-5.2 o GLM-5.1 se redirigen automáticamente a GLM-5.3. No es opcional.
Sobre el consumo, aquí está la letra pequeña que el anuncio no destaca. Los multiplicadores de cuota publicados para GLM-5.3 son:
- Entrada: 6,9×
- Entrada cacheada: 1,7×
- Salida: 24×
El cálculo de crédito es (entrada × 6,9 + cacheada × 1,7 + salida × 24) / 10.000. Traducido a algo útil: la salida cuesta unas 3,5 veces lo que la entrada fresca, y reutilizar contexto cacheado es 14 veces más barato que enviarlo de nuevo. Si trabajas con agentes de largo recorrido, el cache hit rate deja de ser una métrica de fontanería y pasa a ser tu partida presupuestaria principal.
Ese multiplicador de 24× en salida explica lo que ya se está viendo fuera. En OpenCode Go, las estimaciones publicadas dan alrededor de 220 peticiones cada 5 horas con GLM-5.3, frente a unas 880 con GLM-5.2: aproximadamente 4× más presupuesto consumido por el mismo plan. Es la queja que más se repite estos días en los foros de OpenCode, y es coherente con los números.
⚠️ GLM-5.3 gasta menos tokens por tarea que GLM-5.2, pero cada token cuesta más cuota. Las dos cosas son ciertas a la vez y tiran en direcciones opuestas. Antes de migrar tu flujo entero, haz una semana de prueba midiendo tareas completadas por plan, no tokens.
Como referencia para cuando publiquen la tarifa por token: GLM-5.2 cuesta 1,40$ de entrada y 4,40$ de salida por millón, con la entrada cacheada a 0,26$. La tabla oficial de precios de Z.ai todavía termina ahí.
¿Qué dice la comunidad técnica en las primeras horas? ¶
Poco y con entusiasmo, que es exactamente lo que hay que esperar cuando un modelo lleva un día fuera y solo lo pueden tocar los suscriptores de un plan. Aun así, hay cuatro señales que merecen atención.
Un benchmark de creador que lo pone primero ¶
AICodeKing, que tuvo acceso anticipado, publicó el resultado de su KingBench 3: 73 sobre 80, un 91,25%, la puntuación más alta que ha registrado en esa prueba, por delante de Fable 5, Qwen 3.8 Max, Opus 4.8 y Opus 5.
El asterisco es enorme y hay que decirlo: KingBench no es SWE-bench ni Terminal-Bench. Es la batería personal de un creador que mezcla código, interfaces, simulaciones 3D, razonamiento y tareas agénticas. Lo valioso no es la cifra, es que responde a la pregunta correcta: ¿los números de Z.ai se sostienen en tareas que no ha diseñado Z.ai? Una primera señal dice que sí. Una primera señal no es evidencia.
Tim Dettmers, midiendo velocidad real ¶
Tim Dettmers —conocido por su trabajo en cuantización y creador de bitsandbytes— reportó cifras concretas probándolo: prefill de alrededor de 1.000 tokens/s y salida de unos 60 tokens/s, con una valoración que resume bien el cambio de carácter del modelo: “muy preciso y conciso”.
Viniendo de quien viene, esa descripción es interesante. “Conciso” es justo el adjetivo que nadie usó nunca con GLM-5.2.
Hacker News: sorpresa y escepticismo, a partes iguales ¶
El hilo del lanzamiento gira alrededor de tres cosas. La primera, sorpresa genuina de que un mismo modelo base dé un salto así solo con post-entrenamiento, y ganas de comprobarlo en repositorios reales y desordenados cuando salgan los pesos. La segunda, gente que ya usaba GLM-5.2 y lo consideraba cerca de Opus 4.8 para ciertos trabajos, con la expectativa de que la 5.3 cierre buena parte de esa distancia. Y la tercera, el escepticismo razonable de siempre: las comparaciones que elige Z.ai no siempre incluyen los modelos cerrados más fuertes disponibles.
También se está discutiendo mucho el papel del caché. Alguien del plan Max publicó estadísticas tras varias sesiones agénticas en paralelo: 58,46 millones de tokens procesados, de los cuales 56,91 millones fueron cacheados, un 97,9% de aciertos de caché, consumiendo cerca del 20% de su límite de 5 horas. Es anecdótico, pero encaja con la estrategia: cargas de trabajo enormes sostenidas por caché.
r/LocalLLaMA: todos mirando el mismo sitio ¶
En el mundo local la conversación es una sola: los pesos. Hay interés por cuantizarlo y ver hasta dónde se puede llevar en hardware asequible, pero mientras no se publiquen, todo son especulaciones. La discusión gira en torno a si un modelo de esta relación capacidad/tamaño puede ser el mejor candidato para ejecución local seria. Sin pesos, no hay respuesta.
¿Puedes ejecutar GLM-5.3 en local? ¶
Hoy no, porque no hay pesos. Cuando los haya, la respuesta corta será: sí sobre el papel, y “local” seguirá significando “en una sala con máquinas serias”.
Sirve como referencia lo que la comunidad ya consiguió con GLM-5.2, que comparte tamaño exacto:
- En un clúster de 8× NVIDIA DGX Spark se reportaron 48 tokens/s de decodificación en flujo único, apoyándose en speculative decoding y la capa MTP.
- En 2× DGX Spark con una cuantización agresiva de 1 bit y 256K de contexto, alrededor de 8 tokens/s.
- Hay configuraciones documentadas con versiones podadas y cuantizadas repartidas entre tres nodos con vLLM y paralelismo de pipeline.
Un modelo de 743B en BF16 ronda 1,5 TB. Ninguna cuantización doméstica te salva de esa realidad: puedes bajarlo a cientos de gigas, pero cientos de gigas siguen siendo cientos de gigas. Para equipos con presupuesto de GPU, es viable. Para tu portátil, no.
🔑 Cuando salgan los pesos, la pregunta útil no será “¿cabe?”, sino “¿cuánta calidad pierde la cuantización que sí me cabe?”. Esa cifra casi nunca aparece en los anuncios, y es la que decide si vale la pena.
Los lanzamientos se olvidan; los métodos se quedan. Cada domingo mandamos 12 recursos escogidos sobre programación con IA a más de 6.700 developers. Gratis desde 2018.
Quiero esa dinamita 🧨¿GLM-5.3 frente a Kimi K3, Opus 5 y los cerrados? ¶
Aquí va el mapa para decidir, con la advertencia de que la fila de GLM-5.3 tiene huecos precisamente porque el modelo todavía no está del todo disponible.
| Modelo | Pesos | Contexto | Visión | Precio por token | Dónde brilla |
|---|---|---|---|---|---|
| GLM-5.3 | Prometidos (~fin ago.) | 1M | No | Sin publicar | Agentes de largo recorrido, descubrimiento de vulnerabilidades |
| GLM-5.2 | Sí (MIT) | 1M | No | 1,40$ / 4,40$ | La alternativa disponible hoy con pesos y precio conocido |
| Kimi K3 | Sí | 1M | Sí | Salida ~15$ | Generalista fuerte, frontend generativo |
| Opus 5 | No | 1M | Sí | 5$ / 25$ | Planificación, repos que no controlas, migraciones grandes |
| Fable 5 | No | 1M | Sí | 10$ / 50$ | El trabajo más ambicioso y la autonomía de días |
| GPT-5.6 Sol | No | — | Sí | — | El mejor generalista de código según las pruebas cruzadas |
La lectura honesta: GLM-5.3 no compite en capacidad absoluta, compite en coste, control y despliegue. Si el modelo te lo dieran gratis con la mejor puntuación del mundo pero no pudieras desplegarlo donde quieres, la conversación sería otra. El argumento de Z.ai es que puedes tener el 80-90% del resultado con pesos que un día podrás bajarte y ejecutar donde te dé la gana.
Ese argumento vale exactamente lo que valgan los pesos cuando lleguen.
Si necesitas decidir hoy con lo que hay disponible de verdad, tenemos el mapa completo por perfil en los mejores modelos de IA para código y el análisis de Opus 5 frente a Fable 5 para el lado cerrado.
¿Cuándo compensa GLM-5.3 y cuándo no? ¶
Te lo pongo en forma de decisión, no de tabla.
Tiene sentido probarlo si:
- Ya pagas el GLM Coding Plan. Ahí no hay debate: lo tienes, la 5.2 redirige a la 5.3 y la eficiencia por tarea ha mejorado.
- Tu trabajo son tareas largas y multiarchivo donde el modelo tiene que sostener el contexto durante horas.
- Quieres una segunda opinión barata sobre código: revisión, búsqueda de fallos, auditoría de un módulo que no controlas.
- Estás montando un flujo de spec driven development y necesitas un runner de implementación que no se despiste.
Todavía no compensa si:
- Necesitas visión. No ve, y punto.
- Necesitas pesos hoy para desplegar on-premise. No los hay.
- Necesitas una tarifa por token predecible para un producto. No está publicada.
- Tu criterio de compra son benchmarks independientes verificables. Faltan.
Y una prueba concreta para no decidir por intuición. Coge cinco tareas de tu repo de verdad y pásaselas al modelo que usas ahora y a GLM-5.3:
- Una feature que toque al menos cuatro archivos.
- Un bug viejo con reproducción incómoda.
- Una migración pequeña con tests que tienen que pasar de verdad al ejecutarlos.
- Una revisión de seguridad de un módulo que nadie ha mirado en un año.
- Una tarea larga con contexto de producto real, de esas que necesitan tres o cuatro vueltas.
Mide cuatro cosas: vueltas necesarias, tests rotos, cuota consumida y cuánta basura convincente deja por el camino. La cuarta es la que no sale en ningún benchmark y la que más caro te sale.
¿Cómo seguir un lanzamiento así sin comerte el hype? ¶
Esta sección es la que sigue sirviendo cuando GLM-5.3 sea historia y estemos hablando de la 5.4, de la 6 o de lo que toque. Los lanzamientos de modelos siguen todos el mismo guion, y hay un orden sensato para consumirlos:
- La ficha oficial primero, pero como declaración de intenciones. Te dice qué han optimizado, no qué has conseguido tú.
- Separa lo verificable de lo autoproclamado. Un benchmark público que puedes volver a ejecutar y uno privado del propio laboratorio no pesan igual, aunque salgan en la misma tabla.
- Desconfía de las comparaciones entre versiones distintas de un benchmark. Terminal-Bench 2.1 y 3.0 no son la misma prueba. Este error contamina la mitad de las comparativas que vas a leer.
- Espera a la disponibilidad real. “Anunciado” no es “disponible”. “Pesos prometidos” no es “pesos publicados”. Entre esas dos cosas puede haber semanas o no haber nada nunca.
- La señal de calidad llega con los terceros. Cuando aparecen cuantizaciones, evaluaciones independientes y quejas concretas de gente usándolo en repos sucios, es cuando por fin sabes algo.
- Tu repo es el único benchmark que importa. Las cinco tareas de la sección anterior te dicen más que cualquier tabla.
Aplicado a GLM-5.3, mi orden de vigilancia sería: pesos publicados → cuantizaciones funcionando → benchmarks independientes sobre repositorios reales → tarifa por token → aparición en OpenRouter y agregadores. Hasta que no se cumplan los dos primeros, lo que tenemos son resultados de Z.ai y un puñado de experiencias con el Coding Plan.
Lo que queda por demostrar ¶
GLM-5.3 llega con una tesis fuerte y unos cuantos agujeros. Los agujeros, ordenados por importancia:
- No hay pesos. Sin ellos, “modelo abierto” es una promesa con fecha, no un hecho.
- El benchmark que mejor le sale es privado. El Z.ai Code Bench no lo puede reproducir nadie.
- No hay precio por token. Solo suscripción, y con multiplicadores de cuota agresivos.
- Sigue sin ver. Todo lo que sea UI guiada por capturas queda fuera.
- La ventaja en ciberseguridad es asimétrica. Excelente descubriendo, claramente por detrás explotando.
- Es un modelo estrecho. Muy bueno en lo suyo, no un generalista al nivel de los grandes cerrados.
Y la tesis, que es lo que a mí me hace guardar este lanzamiento en la carpeta de “esto importa”: han sacado un salto de generación cambiando cómo entrenan, no qué entrenan. Si eso se confirma con evaluación independiente, el mensaje para toda la industria es que el margen de mejora en agentes de programación está en los entornos, los bucles de trabajo y la verificación, no solo en el tamaño del modelo.
Que es, casualmente, lo mismo que llevamos tiempo diciendo sobre tu propio flujo de trabajo. El modelo importa. El método importa más.
GLM-5.3 en una frase ¶
Un modelo de programación excelente sobre el papel, con una historia de post-entrenamiento que puede ser más importante que el propio modelo, y que el día de su lanzamiento todavía no es abierto ni verificable.
TL;DR ¶
- 🧠 GLM-5.3 usa el mismo modelo base de 743B que GLM-5.2: todo el salto viene de un mes más de post-entrenamiento en entornos ejecutables de largo recorrido.
- 📈 Terminal-Bench 3.0 pasa de 4,6 a 28,3 y DeepSWE v1.1 de 46,2 a 66,9, con un 22% menos de tokens de salida por tarea a esfuerzo máximo.
- 🛡️ En CyberGym saca 84,5%, por delante de Mythos 5 y GPT-5.6 Sol, pero en explotación real se queda en 54,4% frente al 78% de Mythos 5.
- 🔒 Z.ai retrasa los pesos unas dos semanas por el endurecimiento de seguridad, y reserva las capacidades cyber más sensibles a un programa de acceso verificado.
- 💸 Hoy solo se usa vía GLM Coding Plan (desde 18$/mes), ZCode, Claude Code, Codex y OpenCode Go, con un multiplicador de cuota de 24× en salida que se come el plan cuatro veces más rápido que la 5.2.
Preguntas frecuentes sobre GLM-5.3 ¶
¿Qué es GLM-5.3? ¶
GLM-5.3 es el modelo insignia de Z.ai (Zhipu) para programación y trabajo agéntico, lanzado el 14 de agosto de 2026. Usa el mismo modelo base de unos 743.000 millones de parámetros que GLM-5.2, con arquitectura MoE y unos 40.000 millones de parámetros activos por token. Tiene 1 millón de tokens de contexto, 128K de salida máxima y es solo texto.
¿En qué se diferencia GLM-5.3 de GLM-5.2? ¶
En que no hay modelo nuevo. GLM-5.3 no reentrena el modelo base ni cambia la arquitectura: todo el avance procede de un mes adicional de post-entrenamiento con más entornos ejecutables, tareas de largo recorrido más variadas y más cómputo de aprendizaje por refuerzo. Z.ai reporta una mejora de alrededor del 50% en su benchmark interno de agentes de código.
¿Cuánto cuesta GLM-5.3? ¶
A 15 de agosto de 2026 no hay tarifa por token publicada. Se accede a través del GLM Coding Plan, que arranca en 18 dólares al mes en su nivel Lite, con niveles Pro y Max por encima. Los multiplicadores de cuota publicados son 6,9× para la entrada, 1,7× para la entrada cacheada y 24× para la salida.
¿GLM-5.3 es open source? ¶
No, y a día de hoy ni siquiera es de pesos abiertos. Z.ai ha prometido publicar los pesos completos unas dos semanas después del lanzamiento, hacia finales de agosto de 2026, tras completar la evaluación y el endurecimiento de seguridad. GLM-5.2 sí publicó sus pesos con licencia MIT a los pocos días de salir, así que esto es una ruptura del patrón anterior.
¿Por qué Z.ai ha retrasado los pesos de GLM-5.3? ¶
Por sus capacidades de ciberseguridad. Durante el post-entrenamiento en entornos largos, el modelo desarrolló razonamiento sobre cadenas de exploits que Z.ai dice no haber buscado. La compañía ha optado por un lanzamiento escalonado —primero socios de seguridad en entornos controlados, luego acceso amplio y API, y al final los pesos— y reserva las funciones cyber más sensibles a un programa de “trusted access” para usuarios verificados.
¿Cuáles son los benchmarks de GLM-5.3? ¶
Los oficiales publicados por Z.ai son: Terminal-Bench 3.0 de 4,6 a 28,3, DeepSWE v1.1 de 46,2 a 66,9, SWE-Marathon v1.1 de 19,4 a 42,5, Agent’s Last Exam de 23,8 a 28,5, GDPval-AA v2 en 1.769 Elo, Humanity’s Last Exam con herramientas en 62,5% y AutomationBench en 48,2. Ojo: Terminal-Bench 3.0 es mucho más dura que la 2.1, así que no se pueden comparar puntuaciones entre versiones.
¿GLM-5.3 es mejor que Claude Opus 4.8 o Fable 5? ¶
En el benchmark interno de Z.ai, GLM-5.3 en esfuerzo high saca 31,4% frente al 29,5% de Opus 4.8, y gastando unos 50.000 tokens de salida por tarea frente a 120.000. Pero Fable 5 sigue por delante con 39,5% a esfuerzo máximo, y ese benchmark es privado. Lo prudente es decir que GLM-5.3 empieza a ser competitivo en flujos agénticos concretos de software, siendo un modelo mucho más especializado y sin visión.
¿GLM-5.3 tiene visión o entiende imágenes? ¶
No. GLM-5.3 es solo texto, igual que GLM-5.2. Para flujos que dependen de capturas de pantalla, revisión visual de UI o entrada de imagen necesitas otro modelo: la línea multimodal de Z.ai es la familia GLM-5V, y entre los cerrados prácticamente todos los grandes tienen visión.
¿Puedo usar GLM-5.3 con Claude Code, Codex u OpenCode? ¶
Sí a los tres, con matices. Con el GLM Coding Plan puedes apuntar Claude Code al endpoint de Z.ai, y la compañía ha publicado instrucciones oficiales para usarlo desde Codex CLI con un endpoint compatible. OpenCode Go ya lo incluye en su catálogo, aunque consume alrededor de cuatro veces más presupuesto del plan que GLM-5.2.
¿Se puede ejecutar GLM-5.3 en local? ¶
Todavía no, porque no hay pesos publicados. Cuando los haya, hablamos de un modelo de 743B que en BF16 ronda 1,5 TB: con GLM-5.2, que comparte tamaño, la comunidad reportó unos 48 tokens/s en un clúster de 8 DGX Spark y unos 8 tokens/s con cuantización de 1 bit en dos nodos. Es viable para equipos con presupuesto de GPU, no para un portátil.
Fuentes ¶
- GLM-5.3 Overview — Z.AI Developer Document
- GLM-5.3: Frontier Coding with Emergent Cyber Capabilities — Z.ai Blog
- Preparing GLM-5.3 for Open Release: A Responsible Path to Cyber Defense — Z.ai
- Security Disclosure Ledger — cvd.z.ai
- GLM Coding Plan / Devpack Overview — Z.AI Developer Document
- Usar el GLM Coding Plan con Codex — Z.AI Developer Document
- Z.ai Ships GLM-5.3 Without Retraining the Base Model — MarkTechPost
- China’s Z.ai says new model nears Anthropic’s Mythos 5 in cyber-defence tests — Reuters
- China’s Z.ai holds GLM-5.3 release over hacking risks — Axios
- GLM-5.3 is here with advanced cyber capabilities — VentureBeat
- Z.ai debuts GLM-5.3 with long-horizon coding, cybersecurity upgrades — SiliconANGLE
- China’s Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model — Decrypt
- GLM-5.3: How Chinese labs keep stride with the frontier — Interconnects (Nathan Lambert)
- GLM-5.3 Just Launched: Specs, Benchmarks, API & How to Use It — Kingy AI
- GLM-5.3 Benchmark vs GPT-5.6 Sol, Claude Fable 5 & Gemini 3.1 Pro — Eden AI
- GLM-5.3: Frontier coding with emergent cyber capabilities — Hacker News
- OpenCode Go — documentación de modelos y límites
- GLM-5.2: por qué probarlo antes que Kimi K2.7 o MiniMax M3 — Web Reactiva
- Qué son los modelos de pesos abiertos — Web Reactiva
- Claude Opus 5 vs Fable 5 — Web Reactiva
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.