+250 skills, dinamita para tu productividad 🧨Explorar →

Mistral Large 4: precio, benchmarks y si sirve para programar

Tabla de contenidos

Mistral ha presentado hoy, 6 de octubre de 2026, Mistral Large 4. Oficiosamente ML4. Oficialmente, según su propio anuncio, «le Chonk»: el gordo.

Y el mote le va. Es un MoE de en torno a un billón de parámetros con unos 50.000 millones activos por token, entrada de texto e imagen, y un salto grande: en el índice de Artificial Analysis, Mistral pasa de 9 puntos con Large 3 a 38 con Large 4.

Con Large 3, el argumento para elegir Mistral era su origen europeo y su licencia Apache 2.0. Con 9 puntos en ese índice, el rendimiento no entraba en la cuenta. Con Large 4 vuelve a la conversación. La pregunta es para qué conversación: ¿la de “qué modelo meto en mi agente de programación” o la de “qué modelo uso para revisar seguridad”?

Esto es lo que vas a encontrar aquí:

  • Qué es Large 4, qué lleva dentro y por qué las fuentes no se ponen de acuerdo con el tamaño ni con el contexto
  • Cuánto cuesta por token, cuánto cuesta por tarea y cuánto dura el descuento de lanzamiento
  • Qué dicen las mediciones independientes (Artificial Analysis y Vals AI) frente a las cifras de Mistral
  • Por qué destaca en ciberseguridad y por qué eso no lo convierte en buen agente de programación
  • Lo que cuentan Simon Willison, Hacker News, Reddit y varios blogs, y cuándo compensa probarlo

Un aviso antes de empezar. El modelo está en preview por API y los pesos todavía no se pueden descargar. Voy a separar tres tipos de información y a etiquetarlas siempre:

  • 🧪 Medición independiente: Artificial Analysis, Vals AI y pruebas de terceros con método publicado.
  • 🏭 Cifra de Mistral: lo que publica el fabricante en su anuncio y su documentación.
  • 💬 Opinión: lo que dicen developers y blogs. Útil, pero no es una prueba controlada.

¿Qué es Mistral Large 4 y por qué le llaman Le Chonk?

Mistral Large 4 es el nuevo modelo insignia de Mistral AI: un Mixture-of-Experts multimodal con entrada de texto e imagen y salida de texto, híbrido de instrucciones y razonamiento, lanzado el 6 de octubre de 2026 como preview pública en la API. Mistral lo ha entrenado desde cero en su propio clúster de 3.800 GPU NVIDIA Grace Blackwell, con datos en más de 160 idiomas.

El apodo sale del propio anuncio: “Unofficially ML4, very officially: le Chonk”. Que una empresa francesa llame “el gordo” a su modelo dice bastante del tono del lanzamiento.

La ficha técnica tiene un problema: cada fuente da un número distinto. Esta es la tabla con todas:

Dato Anuncio de Mistral 🏭 Documentación de Mistral 🏭 Artificial Analysis 🧪 Vals AI 🧪
Parámetros totales 1 billón 1,05 billones 1 billón —
Parámetros activos 52.000 millones 52.000 millones 49.000 millones —
Codificador de visión — 1.600 millones — —
Contexto No lo dice 1M tokens 512k (artículo) / 524k (ficha) 512k
Salida máxima — No la dice — 256k
Entrada Texto e imagen Texto e imagen Texto e imagen, hasta 100 imágenes por petición Texto e imagen
Razonamiento Híbrido — Variante con razonamiento Probado en high

Fuentes: anuncio de Mistral, ficha del modelo en docs.mistral.ai, artículo y ficha de Artificial Analysis, ficha de Vals AI.

Dos discrepancias que conviene tener claras:

  1. 52.000 o 49.000 millones de activos. Mistral dice 52.000; Artificial Analysis y Simon Willison hablan de 49.000. Circula la explicación de que los 52.000 incluyen embeddings y capas de salida, pero no he encontrado ninguna página de Hugging Face ni de Mistral que lo diga: la organización de Mistral en Hugging Face todavía no tiene ningún checkpoint de Large 4. Mi lectura es que se trata de una forma distinta de contar, pero queda sin confirmar.
  2. 1M o 512k de contexto. La documentación oficial pone un millón de tokens. Artificial Analysis y Vals miden o publican 512k-524k. Es posible que la preview sirva menos contexto del que el modelo admite, pero ninguna fuente lo explica. Si tu caso depende de contextos enormes, pruébalo antes de dar por buena la cifra de la documentación.

⚠️ Lo que no cambia según la fuente: es un modelo grande. Un billón de parámetros totales significa que, cuando lleguen los pesos, para servirlo en local vas a necesitar memoria para el billón entero, aunque cada token solo active unos 50.000 millones.

¿Para qué te sirve Mistral Large 4? La respuesta corta

Si tienes prisa: pruébalo en revisión de seguridad y en tareas bien delimitadas que puedas comprobar. No lo pongas todavía como agente principal de programación.

Esa es la lectura que sale de cruzar todo lo publicado en el primer día:

  • 🧪 En ciberseguridad está en la parte alta: 50 en el Cyber Index de Artificial Analysis y un 82 % en CyberGym-E2E-AA.
  • 🧪 En inteligencia general (38 puntos) empata con GPT-6 Luna y queda un punto por detrás de DeepSeek V4.1 Flash, dos modelos bastante más baratos por tarea.
  • 🧪 En tareas agénticas de programación, las pruebas independientes lo dejan en zona media: puesto 21 de 45 en Terminal-Bench 4.0 según Vals y un 52,5 % en una batería de ocho tareas con OpenCode.

Está claro que Mistral ha dado un salto. Menos claro está cuánto te cuesta cada entrega que aceptas sin tocar, y eso es lo que decide si un modelo sirve para trabajar con agentes.

Herramienta gratis · Selector

¿Le Chonk o el que ya usas?

La respuesta corta vale para el caso general. Si me dices qué estás programando hoy y qué suscripciones pagas, te digo qué modelo te encaja y cuál es la alternativa barata.

Le das

Tu tarea y las suscripciones que ya pagas

Te devuelve

El modelo que te conviene, con alternativa barata

¿Cuál uso yo?

¿Cuánto cuesta Mistral Large 4?

Mistral Large 4 cuesta 1,36 dólares por millón de tokens de entrada y 4,18 por millón de salida, con la entrada en caché a 0,14 dólares. Durante el lanzamiento hay un 50 % de descuento: 0,68 $ de entrada, 2,09 $ de salida y 0,07 $ de caché.

Concepto (por millón de tokens) Tarifa normal Con descuento de lanzamiento
Entrada 1,36 $ 0,68 $
Entrada en caché 0,14 $ 0,07 $
Salida 4,18 $ 2,09 $

Fuente: ficha del modelo en docs.mistral.ai (precios rebajados con el original tachado) y artículo de Artificial Analysis.

¿Cuánto dura el descuento? Aquí hay que leer con cuidado:

  • 🏭 El anuncio de Mistral da el precio normal y no menciona ninguna promoción.
  • 🏭 La documentación muestra los precios rebajados con el original tachado, sin fecha de fin.
  • 🧪 Artificial Analysis dice que el descuento del 50 % se aplica durante las dos primeras semanas.

Si cuentas dos semanas desde el 6 de octubre, el descuento acabaría hacia el 20 de octubre. Ese cálculo es mío: Mistral no ha publicado una fecha. Si vas a hacer pruebas grandes, hazlas ya.

El precio por token engaña: mira el coste por tarea

Por token, Large 4 cuesta menos que los modelos de frontera de Anthropic u OpenAI. El problema aparece cuando miras cuánto gasta para resolver algo.

Artificial Analysis calcula el coste medio por tarea de su Intelligence Index:

Modelo Intelligence Index 🧪 Coste por tarea 🧪
Mistral Large 4 (tarifa normal) 38 1,13 $
Mistral Large 4 (con descuento) 38 0,57 $
DeepSeek V4.1 Flash (max) 39 0,27 $
GLM-5.3-Flash — 0,25 $

Fuente: artículo de Artificial Analysis sobre Mistral Large 4. El artículo no da el Intelligence Index de GLM-5.3-Flash.

Ojo si comparas con cifras de otros posts: Artificial Analysis cambia de versión su índice y las puntuaciones se mueven. En agosto recogimos 57 puntos para GLM-5.3-Flash; Thorsten Meyer, citando la versión 4.3.2, le da 41,8. Compara siempre dentro de la misma versión.

Incluso con el descuento, Large 4 cuesta más del doble por tarea que DeepSeek V4.1 Flash, que saca un punto más. Con la tarifa normal, más de cuatro veces. Artificial Analysis lo resume así: “más de 4 veces el coste por tarea de modelos de pesos abiertos con una inteligencia similar”.

¿De dónde sale esa diferencia? De la verbosidad. Para completar el Intelligence Index, Large 4 generó 200 millones de tokens de salida, frente a una mediana de 81 millones en modelos comparables. Dos veces y media más. Pagas poco por cada token, pero pagas muchos.

🔑 Si solo te llevas un dato de este apartado: compara modelos por coste por tarea resuelta, no por precio del millón de tokens. En Large 4 la diferencia entre una cosa y otra es enorme.

Si quieres situar a GLM-5.3-Flash, el rival barato de la tabla, tienes su ficha completa en el post de Ox Alpha, el modelo anónimo de OpenRouter que acabó siendo de Z.ai.

Curso gratis · paso a paso

Un modelo verboso cuesta menos si la tarea llega bien cerrada

Large 4 rinde mejor con tareas acotadas. En la lección 4 escribes la proposal y la spec que dejan claro qué hay que hacer antes de que el agente gaste un solo token en código.

Entra en el curso gratis →

¿Cuánto ha mejorado frente a Mistral Large 3?

Mucho. Large 3 sacaba 9 puntos en Artificial Analysis y Large 4 saca 38, según recoge Simon Willison. Cuatro veces más puntos de un modelo al siguiente.

Dato Mistral Large 3 Mistral Large 4
Lanzamiento Diciembre de 2025 (checkpoint 2512) 6 de octubre de 2026 (preview)
Parámetros totales / activos 675.000 / 41.000 millones ~1 billón / 49.000-52.000 millones
Contexto 256k 1M según Mistral (512k-524k según terceros)
Visión Codificador de 2.500 millones Codificador de 1.600 millones
Licencia Apache 2.0 Sin anunciar
Pesos Publicados en Hugging Face Prometidos para finales de octubre
Índice de Artificial Analysis 9 38
GDP.pdf (Artificial Analysis) — 19 % (+18 puntos frente a Large 3)

Fuentes: ficha de Mistral Large 3 en Hugging Face, docs.mistral.ai, Simon Willison y Artificial Analysis. La fecha de Large 3 la deduzco del nombre del checkpoint.

Dos matices. El primero: Artificial Analysis actualiza su índice de vez en cuando, y no he podido confirmar que el 9 de Large 3 y el 38 de Large 4 salgan de la misma versión. Aun así, la distancia es tan grande que el orden de magnitud no cambia.

El segundo pesa más para quien usaba Large 3 por la licencia: Large 3 se publicó con Apache 2.0 y de Large 4 no sabemos nada. Mistral no menciona la licencia en el anuncio ni en la documentación. Hasta que no salgan los pesos con su fichero de licencia, no asumas que vas a poder hacer con Large 4 lo mismo que con Large 3.

En el GDP.pdf, una prueba de Artificial Analysis sobre trabajo con documentos, el 19 % de Large 4 supone 18 puntos más que Large 3. Empata con MiMo-V2.6-Pro (19 %) y queda por detrás de Kimi K3 (22 %).

Cada semana sale un modelo que promete más que el anterior. Cada domingo te cuento qué estamos aprendiendo al usarlos en proyectos reales, junto a 12 recursos seleccionados. Gratis, ya somos +7.200 developers.

Quiero esa dinamita 🧨

¿Qué dicen las mediciones independientes de Mistral Large 4?

Artificial Analysis lo sitúa en 38 puntos de su Intelligence Index: empatado con GPT-6 Luna (38), un punto por detrás de DeepSeek V4.1 Flash (39) y muy por encima de la mediana de modelos comparables (26). En su ficha ocupa el puesto 64 de 225 modelos.

Estos son todos los datos de Artificial Analysis 🧪:

Métrica Mistral Large 4 Comparación
Intelligence Index 38 GPT-6 Luna (max) 38 · DeepSeek V4.1 Flash (max) 39
Cyber Index 50 GLM-5.3-Flash 50 · MiMo-V2.6-Pro 56
CyberGym-E2E-AA 82 % MiMo-V2.6-Pro 79 % · GPT-6 Luna (max) 78 %
GDP.pdf 19 % MiMo-V2.6-Pro 19 % · Kimi K3 22 %
Tokens de salida para el índice 200 M Mediana: 81 M
Velocidad de salida (API de Mistral) 116 tokens/s —
Tiempo hasta el primer token 1,46 s —
Coste por tarea 1,13 $ (0,57 $ con descuento) GLM-5.3-Flash 0,25 $ · DeepSeek V4.1 Flash 0,27 $

Fuentes: artículo “Mistral Large 4” y ficha del modelo en Artificial Analysis.

Para ubicar a sus vecinos de tabla: GPT-6 Luna es el modelo pequeño de OpenAI a 0,10 $ / 0,50 $ por millón. Que el insignia de Mistral empate con el modelo barato de OpenAI dice dónde está la frontera hoy.

Hay un dato que no cuadra del todo con el mensaje del lanzamiento: Artificial Analysis clasifica de momento a Large 4 como modelo propietario. Tiene lógica, porque lo único que existe es una preview servida por Mistral. Cuando publiquen los pesos, esa etiqueta debería cambiar.

💡 116 tokens por segundo es una buena velocidad para un modelo de este tamaño. Pero si genera dos veces y media más tokens que la mediana, parte de esa velocidad se va en escribir más, no en terminar antes.

¿Es Mistral Large 4 bueno en ciberseguridad?

Sí, y es donde más destaca. En el Cyber Index de Artificial Analysis saca 50 puntos, empatado con GLM-5.3-Flash, por detrás de MiMo-V2.6-Pro (56) y por delante de Kimi K3 y DeepSeek V4.1 Flash. En CyberGym-E2E-AA, una prueba de reproducir y parchear vulnerabilidades de principio a fin, llega al 82 %, por encima de MiMo-V2.6-Pro (79 %) y GPT-6 Luna (78 %).

Mistral va más lejos en su anuncio 🏭:

  • 82 % en la prueba de reproducir y parchear vulnerabilidades, “la puntuación más alta de cualquier modelo”.
  • 93 % de los 40 retos de Cybench.
  • Según Mistral, Claude Opus 5.5 y GPT-6 Astra sacan casi cero en esa misma prueba porque se niegan a hacer la tarea.
  • En seguridad del propio modelo, resiste el 93,3 % de los ataques del benchmark B3 de Lakera y tiene una tasa de rechazo en ciber “más alta que todos los modelos open source probados”.

Ojo con el tercer punto. Que un modelo cerrado saque cero porque rechaza la tarea no significa que no sepa hacerla: significa que sus salvaguardas la bloquean. Para un equipo de seguridad que necesita reproducir un exploit en su propio código, en la práctica es lo mismo. Pero no es una comparación de capacidad.

Y aquí está la paradoja del lanzamiento. Hace unos días Google presentó Gemini 4 Argon y lo dejó solo para defensores de ciberseguridad. GLM-5.3 retrasó sus pesos por lo bien que encontraba vulnerabilidades. Mistral hace lo contrario: abre la preview a todo el mundo, cuenta que ha hecho red-teaming “con líderes de ciberseguridad, socios verificados y autoridades estatales” y promete los pesos para final de mes.

🛡️ Si vas a probarlo en seguridad, hazlo sobre tu propio código y en un entorno aislado. Y si quieres darle método a un agente que audita, en las 754 skills de ciberseguridad para Claude Code, OpenCode y Codex tienes desde análisis de malware hasta pentest autorizado listo para cargar.

En Hacker News 💬, prodigycorp lo resumía así: es “fuerte en benchmarks de ciberseguridad (mejor que todos los modelos chinos), así que es un buen modelo defensor”.

¿Programa bien Mistral Large 4? Lo que dice Mistral

Según Mistral 🏭, Large 4 saca un 61,7 % en DeepSWE v1.1, un 59,4 % en SWE-Atlas-QnA y un 28,3 % en Terminal-Bench 4, con un Coding Agent Index combinado del 49,8 %, por delante de DeepSeek V4 Pro y Qwen3.8 Max.

Un detalle de procedencia: el texto del anuncio no dice quién midió esas cifras. Los nombres de los ficheros de las gráficas apuntan a Artificial Analysis, pero la ficha pública de Artificial Analysis no muestra esas tres puntuaciones. Así que las trato como cifras publicadas por Mistral.

La otra prueba de programación del anuncio es una evaluación a ciegas con Surge AI: personas que puntúan la calidad del código de 1 a 5 sin saber qué modelo lo ha escrito.

Modelo Puntuación Surge AI (1-5) 🏭
Claude Opus 5 4,22
Mistral Large 4 (preview) 3,74
GLM-5.3 3,60
Kimi K3 3,59
GLM-5.2 3,40

Fuente: anuncio de Mistral Large 4.

Segundo de cinco, por detrás de Claude Opus 5 y por delante de los dos GLM y de Kimi K3. Buen resultado.

Pero ojo: que alguien valore bien el código que escribe un modelo no es lo mismo que el modelo termine una tarea con herramientas. En una evaluación a ciegas, el evaluador mira el resultado. En una tarea agéntica, el modelo tiene que leer el repo, decidir qué tocar, ejecutar comandos, interpretar errores y no perderse en el camino. Son habilidades distintas, y las pruebas de la siguiente sección miden la segunda.

Fíjate también en la selección de rivales: Opus 5 es el único modelo occidental de frontera de la tabla, y no aparecen Opus 5.5 ni Fable 5.1. Es lo normal en un anuncio, pero conviene saberlo.

¿Qué dice Vals AI y por qué no cuadra Terminal-Bench?

Vals AI coloca a Large 4 en el puesto 33 de 45 de su índice general, con un 48,05 %. Destaca en el benchmark legal de Harvey y queda en la parte baja en demostraciones matemáticas y migración de código.

Benchmark de Vals AI 🧪 Resultado Posición
Vals Index 48,05 % 33 de 45
Vibe Code Bench v1.1 78,40 % 26 de 110
Code Migration 30,56 % 38 de 74
Terminal-Bench 4.0 22,73 % 21 de 45
ProofBench v1.1 10,00 % 43 de 48
Harvey’s Legal Agent Benchmark 15,83 % 6 de 76
Finance Agent (v2) 54,68 % 22 de 76
IOI 45,28 % 29 de 42

Fuente: ficha de Mistral Large 4 en Vals AI, con razonamiento en high y Mistral como proveedor.

Lo más llamativo para un developer es la fila de Terminal-Bench 4.0: Vals mide un 22,73 % y Mistral publica un 28,3 %. ¿Quién miente? Probablemente nadie. Un benchmark agéntico depende del harness, las herramientas disponibles, el límite de pasos, el tiempo y el nivel de razonamiento. Si no igualas configuración, herramientas y protocolo, no son mediciones equivalentes. Lo que sí te dice la diferencia es que la cifra del anuncio es el techo que consiguió Mistral en sus condiciones.

Vals pone además una cifra que conviene apuntar: 13,78 dólares de coste por test en su índice. No es comparable con el coste por tarea de Artificial Analysis (metodologías distintas), pero va en la misma dirección: no es un modelo barato de ejecutar.

⚠️ El sexto puesto de 76 en el benchmark legal de Harvey cuadra con lo que Mistral dice de finanzas y derecho. Si tu trabajo pasa por documentos y contratos, ahí tienes un caso de uso más sólido que el de agente de programación.

¿Qué pasa cuando lo pones a trabajar como agente?

Las primeras pruebas prácticas dicen que Large 4 planifica bien y escribe código útil, pero falla en entregar: archivos que no crea, preguntas sin responder y bucles que gastan tokens.

La batería de ocho tareas con OpenCode

La prueba más detallada hasta ahora es un benchmark en vídeo con la batería KingBench 3 que circula como prueba de AICodeKing, resumido por escrito en el blog de Elma 🧪. No he podido cargar el vídeo, y Elma no nombra al autor, así que los detalles salen de su resumen.

El método: ocho tareas, cada una en una carpeta nueva, ejecutadas con OpenCode y OpenRouter. Una tarea solo puntúa si el entregable existe, se renderiza y hace lo que se pidió. Resultado: 42 de 80 en el primer intento, un 52,5 %.

Tarea Primer intento
Simulación de ascensor (tres cabinas) 9/10
Mesa plegable en Three.js 8,5/10
Panda en SVG 8/10
Juego de arco y flechas 6/10
Fine-tune local de Gemma 2B + app de datos de pandas 10/10
Estuche de lentillas en 3D 0: terminó sin crear el archivo pedido
Problema de conteo (respuesta correcta: 20.460) 0: no dio respuesta final
Reloj de pulsera en 3D Falla: página en blanco por un import map con rutas de módulos inexistentes

Fuente: Elma, “Mistral Large 4 coding benchmark”.

Dos apuntes sobre esa tabla. El reloj, reparado después con un mensaje de error preciso, llegó a un 6/10, pero las reparaciones van aparte de la puntuación inicial, y me parece lo correcto: arreglar algo cuando le das el error exacto es menos autónomo que hacerlo bien a la primera. Y un detalle de cuentas: las notas que publica Elma suman 41,5, no 42, porque no detalla la nota del primer intento del reloj. Medio punto no cambia la lectura.

Lo que sí la cambia es el patrón de los fallos. Los tres gordos tienen algo en común: el modelo no cierra. Termina sin crear el archivo, no da una respuesta final o no comprueba que la página carga. Las tareas que sí entrega, en cambio, las entrega bien.

Dos días en un proyecto Python + Rust + QML

En r/MistralAI 💬, un usuario contaba dos días de uso en un proyecto con Python, Rust y QML. No he podido abrir el hilo para contrastar las citas, así que lo resumo con esa cautela:

  • A favor: buena planificación, buen seguimiento de instrucciones y código útil.
  • En contra: bucles de revisión que gastan tokens y un bug de QML que no consiguió resolver.
  • Su conclusión: no lo considera equivalente a Opus 5.5, pero le satisface en tareas acotadas y con supervisión.

Una de las respuestas del hilo iba al grano: ¿compensa, habiendo alternativas más baratas? Es una experiencia concreta, no una prueba controlada, pero encaja con lo que miden Artificial Analysis (verbosidad) y Elma (fallos de cierre).

Si quieres entender por qué el mismo modelo rinde distinto según el entorno, en qué es un AI harness tienes el andamiaje que rodea al modelo: herramientas, bucle, permisos y verificación. Con Large 4 ese andamiaje pesa todavía más, porque es quien tiene que pillar el archivo que no se creó.

El flujo completo, con prompts

Si el modelo no cierra la tarea, que la cierre tu flujo

Verás un flujo de 7 fases en el que el agente tiene que romper su propio código y firmar lo que entrega antes de la PR. Con un modelo que a veces se olvida del archivo, esas dos fases son las que te ahorran el susto.

Abrir la guía →

Incluye la chuleta completa de prompts + repo con la PR terminada

¿Qué dice la comunidad de Mistral Large 4?

El tono general es de alegría por ver a Mistral otra vez competitivo, con dudas sobre el coste y sobre cuánto prueban las demos.

Simon Willison 💬

Willison celebra que Mistral vuelva a ser competitivo: Large 3 “sacaba 9 en AA” y Large 4 saca 38, “una mejora enorme”. Su frase de resumen: “no es un modelo de la clase de Fable, pero me alegra ver a Mistral sacar un modelo que vuelve a estar, quizá, a unos 6 meses de la frontera”. Lo de los seis meses es una estimación suya, no una métrica.

Hizo su prueba de siempre, el pelícano en bicicleta en SVG, y el resultado le gustó: “La bolsa es estupenda, el cuadro de la bici tiene el tamaño correcto, tiene los pies en los pedales”. En Hacker News añadía que es “sin duda el mejor que he visto de cualquier modelo de Mistral”.

El dato técnico más útil de su post: la API solo ofrece dos niveles de razonamiento, none y high. Y en su prueba, high generó 2.717 tokens de salida frente a 3.275 de none. Menos tokens pensando más. Es una sola prueba, pero sugiere que el modo sin razonamiento no siempre es el barato.

Hacker News 💬

El hilo del anuncio pasó de 2.000 puntos y 1.200 comentarios. Lo más relevante:

  • A favor: prodigycorp lo ve como “buen modelo defensor” por sus resultados en ciber, y bluerooibos destaca la velocidad: comparado con el modo instantáneo de ChatGPT, las respuestas le parecen rápidas y buenas.
  • Críticas a las gráficas: oh_no cuestiona qué competidores aparecen en una de las gráficas del anuncio y sostiene que una puntuación de terceros está mal reflejada. Es la acusación de un comentarista, no un error demostrado.
  • Dudas sobre la demo visual: dotancohen ve los dos pelícanos tan parecidos que sospecha que el modelo se ha afinado para esa prueba. moomin le responde que alguien lo comprobó y no encontró pruebas, y AlexCoventry zanja que el benchmark del pelícano “ya está saturado”.

Me quedo con esa última idea: una demo visual bonita te dice poco de si el modelo va a cerrar una tarea de tu backlog.

Los blogs 💬

Thorsten Meyer firma la crítica más dura. Su tesis: el problema del precio pesa más que el de la inteligencia, porque “cuesta más de cuatro veces por tarea que modelos abiertos chinos que puntúan más alto”. Y en agentes, los errores se multiplican paso a paso: “tolerable en un chat, fatal en una ejecución de dos horas”. Recomienda usarlo solo si estás obligado (defensa, finanzas reguladas, datos sanitarios) y no elegirlo para trabajo agéntico largo. Dos matices: el propio artículo declara que se escribió con asistencia de IA, y su recomendación va más allá de lo que demuestra un índice agregado. Lo de las alucinaciones en agentes sale de sus pruebas, no de una medición publicada.

Omid Saffari propone un enfoque práctico: probarlo en los casos difíciles, no en toda la carga, y juzgarlo por el coste del trabajo aceptado, no por el precio del token. Es una revisión de documentación y precios, no una evaluación propia de rendimiento. Lo dice él mismo.

En X no he encontrado publicaciones que pueda verificar, así que no cito ninguna.

Las primeras impresiones de un modelo cambian en una semana. En la newsletter te cuento cada domingo cómo estamos adoptando la IA en el día a día del desarrollo, con lo que funciona y lo que no, y con lo que aportan los suscriptores. +7.200 developers, gratis desde 2018.

Apúntate gratis →

¿Dónde puedes usar Mistral Large 4 hoy y cuándo llegan los pesos?

Hoy solo por API, en preview pública, a través de Mistral Studio (la consola de Mistral) y de OpenRouter. Los pesos llegarán, según Mistral, “a finales de mes”.

Canal Estado a 6 de octubre Fuente
API de Mistral (Mistral Studio) ✅ Preview pública Anuncio y documentación
Identificador en la documentación mistral-large-4-0 URL de la ficha en docs.mistral.ai
OpenRouter ✅ mistralai/mistral-large-4-0 Página del modelo en OpenRouter
Vibe (antes Le Chat) Sin confirmar El anuncio no lo menciona
Azure, Bedrock, Vertex Sin confirmar El anuncio no nombra ninguna nube
Nube privada u on-premise Cuando salgan los pesos Anuncio
Pesos en Hugging Face ❌ Aún no Organización mistralai en Hugging Face

Mistral sirve la preview desde su propia infraestructura en Europa y habla de un despliegue europeo que opera de punta a punta. Para quien necesita que los datos no salgan de la UE, ese es un argumento de peso, y va en la línea de lo que recomienda Thorsten Meyer a sectores regulados (lo tienes más arriba, en la sección de la comunidad).

Sobre la fecha de los pesos:

  • 🏭 Mistral: “publicaremos los pesos a finales de mes”.
  • Otras fuentes hablan del 27 o del 31 de octubre, pero ninguna de las dos fechas aparece en una página oficial que yo haya podido consultar. Hoy la organización de Mistral en Hugging Face solo dice que “se publicarán nuevos checkpoints”.

¿Y la licencia? Sin anunciar. Large 3 salió con Apache 2.0, pero eso no garantiza nada para Large 4. Hasta que no veas el fichero de licencia junto a los pesos, no lo des por abierto para uso comercial.

⚠️ Cuando salgan los pesos, recuerda el tamaño: un billón de parámetros no cabe en tu portátil. Para la mayoría, “pesos abiertos” va a significar poder elegir proveedor o desplegarlo en una nube propia, no ejecutarlo en casa.

¿Cuándo compensa Mistral Large 4 y cuándo no?

Compensa en revisión de seguridad, en trabajo con documentos legales o financieros y cuando necesitas un proveedor europeo. No compensa todavía como agente principal de programación, sobre todo si pagas por tarea.

Situación ¿Large 4? Por qué
Revisar seguridad de tu propio código ✅ Pruébalo 50 en Cyber Index y 82 % en CyberGym-E2E-AA; según Mistral, no rechaza la tarea de reproducir y parchear
Documentos legales y financieros ✅ Pruébalo Sexto de 76 en el benchmark legal de Harvey
Necesitas proveedor y datos en Europa ✅ Buena opción Preview servida en infraestructura europea de Mistral
Tareas de código acotadas y supervisadas 🟡 Con cuidado Planifica bien y escribe código útil, pero gasta muchos tokens
Agente autónomo de programación en tareas largas ❌ Todavía no 52,5 % en la batería de OpenCode, fallos de cierre y bucles de revisión
Volumen alto con presupuesto ajustado ❌ Mira otros GLM-5.3-Flash y DeepSeek V4.1 Flash cuestan menos de la mitad por tarea
Necesitas pesos abiertos con licencia clara hoy ❌ Espera Ni pesos ni licencia publicados

Para todo lo que queda en amarillo o rojo, la alternativa depende de lo que ya uses. Si quieres un mapa más amplio, el comparativo de los mejores modelos para programar repasa los rivales uno a uno.

¿Cómo probar Mistral Large 4 sin quemar presupuesto?

Elige cinco o diez tareas reales que ya hayas resuelto, ejecútalas con Large 4 y con tu modelo actual, y compara el coste de cada entrega aceptada. Es la métrica que no aparece en ningún benchmark publicado.

Lo que necesitas medir por cada tarea:

  1. ¿La completa a la primera? Sin que tú le digas el error.
  2. ¿Cuántas rondas de reparación necesita? Y cuántos tokens gasta en ellas.
  3. ¿Cuánto cuesta la tarea entera? Contando todo lo que factura la API, no solo la respuesta final.
  4. ¿La aceptarías tal cual en una PR? Si no, esa tarea no cuenta como entrega.

Con esos cuatro datos, la cuenta es sencilla:

# Coste por entrega aceptada: lo que importa al comparar modelos
def cost_per_accepted(tasks: list[dict]) -> float:
    """tasks: [{'cost_usd': 0.42, 'accepted': True}, ...]"""
    total_cost = sum(t["cost_usd"] for t in tasks)          # todo lo facturado, incluidas reparaciones
    accepted = sum(1 for t in tasks if t["accepted"])        # solo lo que mergearías sin tocar
    return total_cost / accepted if accepted else float("inf")

Si Large 4 completa 5 de 10 tareas y gasta 6 dólares, su coste por entrega es 1,20 $. Si tu modelo actual completa 8 de 10 con 4 dólares, sale a 0,50 $. Por mucho que el token sea más barato, la cuenta la decide la tasa de acierto.

Tres consejos más para la prueba:

  • Hazla durante el descuento. Si Artificial Analysis acierta con las dos semanas, se acaba hacia el 20 de octubre.
  • Prueba none y high. La prueba de Willison sugiere que high no siempre gasta más.
  • Dale tareas cerradas. Large 4 rinde mejor cuando sabe exactamente qué tiene que entregar. Si escribir esa definición te cuesta, empezar por una spec antes de programar te ahorra tokens con cualquier modelo.

La lectura que me llevo

Si quito el ruido del lanzamiento, me quedo con cinco ideas:

  1. Mistral da un salto de verdad. De 9 a 38 en Artificial Analysis, entrenado en un clúster propio y con pesos prometidos.
  2. Donde más destaca es en ciberseguridad, con un 82 % en CyberGym-E2E-AA y 50 en el Cyber Index, y en trabajo legal.
  3. Por token es barato; por tarea, no. Gasta 200 millones de tokens de salida donde la mediana gasta 81, y cuesta más de cuatro veces por tarea que rivales abiertos de inteligencia parecida.
  4. Como agente de programación autónomo sigue flojo: buen código cuando lo valoran personas, fallos de cierre cuando tiene que entregar solo.
  5. Faltan piezas clave: licencia, fecha exacta de los pesos y un contexto que coincida entre fuentes.

Mistral vuelve a estar en la carrera. Ahora tiene que demostrar cuántas tareas termina bien y a qué precio por entrega.

¿Qué tarea de tu backlog le darías hoy a Le Chonk para ver si cierra?

TL;DR

  • 🚀 Mistral Large 4 («le Chonk») sale el 6 de octubre de 2026 en preview por API: MoE multimodal de ~1 billón de parámetros, 49.000-52.000 millones activos según la fuente, y pesos prometidos para finales de octubre sin licencia anunciada.
  • 💰 Cuesta 1,36 $ / 4,18 $ por millón (entrada / salida), con un 50 % de descuento las dos primeras semanas según Artificial Analysis. Por tarea sale a 1,13 $ (0,57 $ con descuento), más de cuatro veces lo que GLM-5.3-Flash o DeepSeek V4.1 Flash.
  • 📈 En Artificial Analysis pasa de 9 (Large 3) a 38, empatado con GPT-6 Luna, aunque genera 200 millones de tokens donde la mediana gasta 81.
  • 🛡️ Destaca en ciberseguridad: 50 en el Cyber Index y 82 % en CyberGym-E2E-AA. También en derecho: sexto de 76 en el benchmark de Harvey.
  • 🎯 Como agente de programación, zona media: 22,73 % en Terminal-Bench 4.0 según Vals (Mistral dice 28,3 %) y 52,5 % en una batería de ocho tareas con OpenCode. Pruébalo en seguridad y tareas acotadas, y mide el coste por entrega aceptada.

Preguntas frecuentes sobre Mistral Large 4

¿Qué es Mistral Large 4?

Es el modelo insignia de Mistral AI, presentado el 6 de octubre de 2026 como preview pública por API. Es un Mixture-of-Experts multimodal (texto e imagen de entrada, texto de salida) de en torno a un billón de parámetros, híbrido de instrucciones y razonamiento, entrenado desde cero en un clúster propio de 3.800 GPU Grace Blackwell. Mistral lo llama «le Chonk».

¿Cuánto cuesta Mistral Large 4?

La tarifa normal es de 1,36 dólares por millón de tokens de entrada, 4,18 por millón de salida y 0,14 por millón de entrada en caché. Durante el lanzamiento hay un 50 % de descuento (0,68 $, 2,09 $ y 0,07 $). Artificial Analysis dice que dura las dos primeras semanas; Mistral no ha publicado fecha de fin.

¿Cuánto contexto tiene Mistral Large 4?

La documentación de Mistral indica un millón de tokens. Artificial Analysis publica 512.000 en su artículo y 524.000 en su ficha, y Vals AI pone 512.000 con 256.000 de salida máxima. Si tu caso depende de contextos muy largos, compruébalo con tus propios prompts.

¿Mistral Large 4 es open source?

Todavía no se puede descargar. Mistral promete los pesos para finales de octubre de 2026, pero no ha anunciado la licencia. Large 3 salió con Apache 2.0, aunque eso no garantiza que Large 4 use la misma. Artificial Analysis lo clasifica de momento como propietario.

¿Cuántos parámetros tiene Mistral Large 4?

El anuncio habla de un billón de parámetros totales y 52.000 millones activos; la documentación precisa 1,05 billones más un codificador de visión de 1.600 millones. Artificial Analysis y Simon Willison citan 49.000 millones activos. Ninguna fuente oficial explica la diferencia entre 49.000 y 52.000.

¿Mistral Large 4 es mejor que Mistral Large 3?

Sí, con mucha diferencia. Large 3 sacaba 9 puntos en el índice de Artificial Analysis y Large 4 saca 38. En GDP.pdf, una prueba de trabajo con documentos, mejora 18 puntos hasta el 19 %. A cambio, Large 3 tiene pesos publicados con Apache 2.0 y Large 4, de momento, no.

¿Sirve Mistral Large 4 para programar con agentes?

Para tareas acotadas y supervisadas, sí. Como agente autónomo, las pruebas independientes lo dejan en zona media: 22,73 % en Terminal-Bench 4.0 según Vals (puesto 21 de 45) y 52,5 % en una batería de ocho tareas con OpenCode, con fallos como terminar sin crear el archivo pedido.

¿Por qué Mistral dice 28,3 % en Terminal-Bench y Vals mide 22,73 %?

Porque no son mediciones equivalentes. Un benchmark agéntico depende del harness, las herramientas, el límite de pasos y el nivel de razonamiento. Mistral no explica en su anuncio quién midió su cifra ni con qué configuración, así que la diferencia indica que el 28,3 % es el resultado en sus condiciones.

¿Es bueno Mistral Large 4 en ciberseguridad?

Es su punto fuerte. Saca 50 en el Cyber Index de Artificial Analysis, empatado con GLM-5.3-Flash y por detrás de MiMo-V2.6-Pro (56), y un 82 % en CyberGym-E2E-AA, por encima de GPT-6 Luna (78 %). Mistral añade un 93 % en Cybench y dice que Opus 5.5 y GPT-6 Astra sacan casi cero en su prueba de parcheo porque rechazan la tarea.

¿Dónde puedo usar Mistral Large 4?

En la API de Mistral (Mistral Studio), donde la documentación lo identifica como mistral-large-4-0, y en OpenRouter como mistralai/mistral-large-4-0. El anuncio no confirma su llegada a Vibe (antes Le Chat) ni a nubes como Azure, Bedrock o Vertex. Cuando salgan los pesos, Mistral dice que podrá desplegarse en nube privada u on-premise.

Fuentes

🧨 Última oprtunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter

Imagen de Daniel Primo
Claude, IA de Anthropic

Escrito con la ayuda de la IA generativa de Claude, fuentes fidedignas y con un human in the loop:
Dani Primo.

CEO en pantuflas de Web Reactiva. Programador y formador en tecnologías que cambian el mundo y a las personas. Activo en linkedin, en substack y canal @webreactiva en telegram

12 recursos para developers cada domingo en tu bandeja de entrada

Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.