Kimi K3: qué es, cuánto cuesta y si es open source
(actualizado )
Kimi K3 —también escrito Kimi 3 o K3 a secas— es el modelo de IA generalista de la china Moonshot AI, sucesor de la familia K2. Viene con músculo: 2,8 billones de parámetros, una ventana de contexto de 1.048.576 tokens (un millón redondo) y una orientación descarada a software engineering, trabajo agéntico y frontend generativo. Sus pesos se pueden descargar desde el 26 de julio de 2026 y su API cuesta 15 dólares por millón de tokens de salida.
Si vienes de la familia K2, la diferencia salta a la vista. Esta vez no es una variante especializada en código, es el modelo grande que muchos esperaban.
Y desde que se publicó, el ruido no ha parado: Bloomberg, CNBC, Forbes, VentureBeat, Fortune y Tom’s Hardware lo cubrieron en cuestión de horas, todos con el mismo titular de fondo: China se acerca a la primera línea. Once días después llegó lo que de verdad importaba: los pesos. Y con ellos, por fin, números que no salen de la propia Moonshot.
La pregunta que te interesa no es «¿existe?», sino «¿para qué me sirve a mí y cuándo compensa usarlo?». A eso vamos. Esto es lo que vas a encontrar:
- Qué trae K3 por dentro y qué capacidades expone la API.
- Para qué tipo de trabajo pinta bien (spoiler: frontend generativo y tareas largas).
- Qué significa de verdad que los pesos estén publicados (y por qué no vas a ejecutarlo en tu portátil).
- Su carácter más marcado: razonaba siempre a tope… y eso ya ha cambiado.
- Cuánto cuesta y por qué ya no es «el chino barato».
- Qué dicen benchmarks, foros y fuentes chinas, y cómo leerlos sin tragártelos enteros.
- Qué modelo usaría yo para cada tipo de tarea.
Vamos al lío.
🔑 Resumen en una frase: Kimi K3 es un modelo frontier con un punto fuerte clarísimo en programación visual, repositorios grandes y agentes. Compite de tú a tú con lo mejor en varios frentes, y en otros todavía tiene que demostrar que aguanta el ritmo de GPT-5.6 Sol o Fable 5.
🔄 Qué ha cambiado desde que publiqué esto (27 jul 2026): los pesos ya están fuera, publicados el 26 de julio por la noche, un día antes de lo prometido, junto con el informe técnico. Con ellos han caído cuatro piezas más. Una, la licencia no es un MIT de manual, sino un documento propio con puertas comerciales. Dos, el modelo pesa 594 GB en MXFP4 y no lo vas a mover en tu máquina ni de broma. Tres, ya hay evaluación independiente: Artificial Analysis lo sitúa en 57 de índice, empatado con Opus 4.8 y por detrás de Fable 5, y destapa un dato que Moonshot no enseñaba. Y cuatro, los modos de razonamiento low y high ya aterrizaron el 18 de julio, así que el defecto más comentado del lanzamiento duró exactamente dos días. Todo integrado abajo.
Un modelo así de potente rinde mejor con método
Antes de soltar a K3 sobre tu repo, dale un plan. En este curso recorres un ciclo completo de Spec Driven Development con OpenSpec sobre un proyecto real y en modo asistido: lo ves funcionar entero antes de coger tú el volante.
Entra en el curso gratis →¿Qué es Kimi K3 y qué lleva por dentro? ¶
La documentación pública de K3 se centra en cómo integrarlo, así que empecemos por lo que la API y el blog técnico dejan claro.
K3 usa una arquitectura basada en Kimi Delta Attention, un mecanismo híbrido de atención lineal, acompañado de Attention Residuals. Trae comprensión visual nativa, acepta texto, imágenes y vídeo, y mantiene el modo de razonamiento activado siempre. Moonshot lo posiciona sin rodeos para tres cosas: ingeniería de software, knowledge work y razonamiento profundo.
Hasta el informe técnico, Moonshot era parca con la letra pequeña de la arquitectura. Ahora los huecos están rellenos: K3 escala la dispersión del MoE hasta activar 16 de 896 expertos (en torno al 1,8% del total) con un marco que llaman Stable LatentMoE, y eso, junto a KDA y a los Attention Residuals, da un salto de 2,5× en eficiencia de escalado frente a Kimi K2. El detalle más goloso del informe: Quantile Balancing deriva el reparto entre expertos de los cuantiles del propio router, así que se quitan de encima un hiperparámetro de balanceo especialmente quisquilloso. Y Per-Head Muon optimiza cada cabeza de atención por separado. Todo eso, dice Moonshot, con un 25% de ganancia en eficiencia de entrenamiento por menos de un 2% de cómputo extra: justo el tipo de truco que necesitas cuando entrenas un modelo de 2,8 billones de parámetros con acceso limitado a GPUs.
La cuantización tampoco es un apaño de última hora. K3 aplica quantization-aware training desde la fase de SFT, con pesos MXFP4 y activaciones MXFP8. La diferencia con cuantizar después de entrenar no es cosmética: el modelo aprende a compensar el error de cuantización mientras entrena, así que la degradación es mucho menor. MXFP4 lo soportan de forma nativa las Blackwell de NVIDIA y las MI400 de AMD.
Y aquí está la novedad grande: los pesos ya están publicados. Moonshot los soltó el 26 de julio por la noche, un día antes de la fecha prometida, en huggingface.co/moonshotai/Kimi-K3, con safetensors reales, LICENSE, model card y el k3_tech_report.pdf completo. Ese mismo movimiento de abrir pesos ya lo vimos con GLM-5, el open-weights de Z.ai que quiso sentarse en la mesa de los grandes.
Lo que sigue faltando, y conviene decirlo sin adornos, es lo que separa «pesos abiertos» de «código abierto»: no hay datos de entrenamiento ni pipeline de entrenamiento. Puedes descargar y ejecutar el modelo; no puedes reconstruirlo. Si esa distinción te suena a matiz de puristas, en qué son de verdad los modelos de pesos abiertos desmenuzo por qué te afecta a la licencia, a la auditoría y a lo que puedes meter en producción.
Si vienes de las versiones anteriores, ya conoces el terreno. Lo conté cuando salió Kimi K2.5, el modelo open source que quería sentarse en la mesa de los grandes, y volví sobre la familia con Kimi K2.7 Code y cómo usarlo con tus agentes. K3 es el siguiente eslabón de esa cadena, y el que por fin apunta a generalista de primera línea.
¿Para qué sirve Kimi K3? ¶
Quitemos la lupa de la ficha técnica y miremos qué puede hacer. La API describe capacidades muy concretas, y varias son de las que cambian tu día a día.
Programación agéntica ¶
Aquí es donde Moonshot apunta con más fuerza. K3 está preparado para navegar por repositorios grandes, generar y modificar código, y depurar apoyándose en errores, logs y resultados de tests. También para encadenar herramientas en cadenas largas y sostener ejecuciones agénticas con historiales que no caben en un modelo pequeño.
Se integra con Codex, Claude Code, OpenCode, Cline, RooCode, OpenClaw y Hermes Agent. Y ahora hay una vía de primera parte: Kimi Code, el CLI propio de Moonshot, donde eliges el modelo con el comando /model. En OpenCode el flujo es tan simple como autenticar Moonshot AI y elegir el modelo:
# Autenticas el proveedor y seleccionas el modelo en OpenCode
opencode auth login moonshot
opencode --model kimi-k3
Como la API es compatible con el formato de OpenAI, también sirve en cualquier herramienta que te deje cambiar el endpoint y el identificador del modelo. Ese detalle, que parece menor, es lo que decide si un modelo se adopta o se queda en la estantería.
Para que veas hasta dónde estira Moonshot el argumento agéntico, dos demos que ha publicado con el lanzamiento. En una, K3 diseñó un chip de inferencia para un nano model de su propia arquitectura en una única ejecución autónoma de 48 horas, con herramientas EDA de código abierto: cerró timing a 100 MHz en 4 mm² y sostuvo más de 8.700 tokens por segundo de decodificación simulada. En otra, reprodujo relaciones universales de astrofísica computacional en unas dos horas, revisando más de 20 papers y generando más de 3.000 líneas de Python. Impresionan. Y también son demos de la propia casa, así que las guardo en el cajón de «señales prometedoras», no en el de «hechos verificados».
Tool calling que va en serio ¶
K3 trae lo que esperas de un modelo pensado para agentes: function calling, tool_choice="required", múltiples llamadas de herramientas y bucles de herramienta → resultado → nuevo razonamiento.
Pero hay una función que me parece la más interesante de todas: la carga dinámica de herramientas durante la conversación. En vez de mandarle al modelo cientos de definiciones en cada mensaje (con lo que eso engorda el contexto y la factura), puedes introducir la definición de una herramienta justo cuando hace falta.
💡 La carga dinámica de herramientas es de esas cosas que no salen en los titulares pero cambian el trabajo real. Un agente que solo conoce las herramientas que necesita en cada momento es más barato y más fácil de razonar. Menos ruido en el contexto, menos alucinaciones de «me invento una herramienta que no existe».
Un contexto enorme… con asterisco ¶
El millón de tokens permite meter dentro repositorios completos, documentación técnica extensa, historiales largos de ejecución, logs, especificaciones y bases de conocimiento enteras. La caché de contexto es automática: si mantienes intacto el prefijo largo, Moonshot lo reutiliza y te cobra la tarifa reducida de caché.
Suena de maravilla. Pero cuidado con confundir el tamaño de la caja con lo que cabe usable dentro.
Tener un millón de tokens no demuestra que el modelo use bien el millón de tokens. Lo que de verdad importa son las pruebas de needle-in-a-haystack, recuperación múltiple, seguimiento de dependencias y edición consistente de repos gigantes. Un modelo puede tragarse un codebase entero y aun así perder el hilo en el minuto 40.
Aquí sí hay un dato nuevo que apunta en buena dirección: Moonshot afirma que en BrowseComp, con la ventana de un millón de tokens y sin ninguna gestión de contexto, K3 alcanza un 90,4. Es una señal de que sabe estirar el contexto largo en tareas de navegación e investigación. Aun así, sigue siendo cifra de la casa, así que este es un punto para medir tú mismo con tu propio repo antes de fiarte.
Multimodalidad y salidas estructuradas ¶
K3 acepta imágenes en base64 y vídeos subidos a través de su sistema de archivos. Con eso puede interpretar interfaces, reproducir diseños, analizar capturas y diagramas, y convertir una demostración visual en código funcional. La pega práctica: la entrada visual de la API no acepta URLs públicas, hay que pasar por base64 o referencias ms://.
En salidas cubre lo esperable y algo más: JSON Schema con strict: true, JSON Mode, Partial Mode para obligarlo a continuar desde un prefijo, respuestas en streaming y separación entre reasoning_content y la respuesta final. Puede generar hasta 131.072 tokens de salida por defecto, y el máximo configurable llega a 1.048.576. Una barbaridad.
Los modelos con enfoque agéntico salen casi cada semana y cuesta seguirles el ritmo. Cada domingo comparto con +6.700 developers lo que voy aprendiendo sobre IA aplicada al desarrollo. Gratis, desde 2018.
Quiero esa dinamita 🧨¿Kimi K3 es open source? ¶
Menos de lo que suena en el titular, y más de lo que parece a primera vista. Vamos por partes, porque aquí hay tres cosas distintas mezcladas: la licencia, el hardware y la confianza.
La licencia no es un MIT de manual ¶
Toda la prensa previa daba por hecho un «Modified MIT», el mismo de la serie K2. Lo que ha salido es un documento propio: Hugging Face lo lista como other / kimi-k3, no como un MIT estándar de SPDX. Es MIT-like, sí, y permite uso comercial. Pero trae puerta: si superas los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingresos anuales, necesitas un acuerdo aparte con Moonshot.
Traducción para el 99,9% de nosotros: puedes usarlo en tu producto sin pedir permiso. Traducción para quien monte un servicio de inferencia encima: léete la licencia entera antes de facturar.
⚠️ Open-weight no es open-source. K3 no cumple la definición de la OSI, porque faltan los datos y el pipeline de entrenamiento. Es una distinción que suena a purismo hasta que la necesitas: no puedes auditar con qué se entrenó, ni reproducirlo, ni saber qué contaminación de benchmarks arrastra. Puedes ejecutarlo y punto. Que ya es bastante, pero no es lo mismo.
¿Qué hardware necesitas para ejecutar Kimi K3 en local? ¶
Aquí es donde el sueño se pega con la realidad. La descarga nativa en MXFP4 son 594 GB, y eso es la versión ya comprimida. Todo eso hay que meterlo en memoria de acelerador, no en tu disco duro.
- Una RTX 4090 no lo mueve. Un Mac Studio tampoco. Ni cuantizado.
- A precisión completa hablas de en torno a 1,4 TB de VRAM, es decir, unos 64 aceleradores (8 nodos de 8× H100) con paralelismo de tensores entre nodos.
- El camino real de servido es vLLM o SGLang, no Ollama en tu portátil.
- Together AI y Modal ofrecieron hosting desde el día cero, y las recuantizaciones de la comunidad en BF16 y GGUF empezaron a aparecer a los pocos días.
Dicho de otra forma: los pesos abiertos de K3 no son para ti como individuo, son para tu empresa si tiene infraestructura. Es un proyecto de servidor, no un ollama pull.
En r/LocalLLaMA el chiste se escribió solo: el modelo que todo el mundo celebra es el que casi nadie puede ejecutar.
Lo que sí te llevas tú, aunque no lo ejecutes ¶
Tres cosas, y ninguna es menor.
La primera, soberanía del dato para quien la necesite. Si trabajas en un sector donde mandar código a una API china es directamente un no, ahora existe la vía de ejecutarlo dentro de tu perímetro. Antes no.
La segunda, una salida al cuello de botella. Moonshot tuvo que pausar las nuevas suscripciones el 19 de julio, apenas 48 horas después del lanzamiento, porque la demanda se comió su capacidad de GPU. Fueron reabriendo por tandas controladas. Con los pesos fuera, quien tenga hierro deja de depender de que a Moonshot le sobren tarjetas.
La tercera, y la que más me interesa: verificación. Los cofundadores confirmaron en un AMA en r/LocalLLaMA que la cuantización publicada es exactamente la misma que sirve la API. Así que lo que mides en tu clúster es lo que te da el endpoint. Eso convierte por fin las cifras de Moonshot en algo contrastable, y a eso vamos en un momento.
¿Por qué Kimi K3 razona siempre al máximo? ¶
Que piensa a tope por defecto. Eso no ha cambiado. Lo que sí ha cambiado, y es la mejor noticia de estas dos semanas, es que ya puedes bajarle la marcha.
En el lanzamiento K3 admitía un único valor de esfuerzo de razonamiento: max, y nada más. El 18 de julio, dos días después del estreno, Moonshot añadió los tiers que faltaban. Hoy la documentación mapea tres:
# Ya hay tres niveles. max sigue siendo el valor por defecto.
response = client.chat.completions.create(
model="kimi-k3",
messages=messages,
reasoning_effort="low", # low | high | max
)
Que el defecto siga siendo max no es un detalle menor: si no tocas nada, K3 razona al máximo con cada llamada, por trivial que sea. La diferencia es que ahora ese comportamiento es una decisión tuya y no una imposición.
Piénsalo como un coche al que le acaban de instalar las marchas cortas. Sigue arrancando en la larga si no haces nada, pero ya puedes aparcar sin sufrir.
Lo que Moonshot sigue sin dejarte tocar: fija temperature=1.0, top_p=0.95, n=1 y los penalties. Ahí no hay perilla que girar.
Las consecuencias de dejarlo en max son reales, y conviene tenerlas en la cabeza porque es lo que vas a tener por omisión:
- Puede tardar de más en preguntas sencillas.
- Puede gastar un montón de tokens solo en razonar.
- No es el modo ideal para pequeñas ediciones rápidas.
- El precio nominal engaña si necesita cinco veces más razonamiento que otro modelo.
- Artificial Analysis midió generación más lenta que la mediana y un consumo de tokens de salida alto.
⚠️ Ojo con la factura del razonamiento. En Hacker News, un experimento de generación de un SVG consumió 13.241 tokens de razonamiento y 16.658 tokens de salida total para una entrada de solo 95 tokens, con un coste de unos 0,25 dólares. Es un ejemplo aislado, sí. Pero apunta al riesgo práctico más claro de K3: que el «pienso siempre al máximo» te salga caro sin verlo venir.
💡 Consejo directo: pon
reasoning_effort="low"como tu valor por defecto en el cliente y súbelo solo cuando la tarea lo pida. Es una línea de código que puede dividir tu factura, y en este modelo el defecto no juega a tu favor.
¿Cuánto cuesta Kimi K3? ¶
Depende de con qué lo compares, y la respuesta corta es: ya no es barato.
Estos son los precios oficiales de la API:
| Concepto | Precio por millón de tokens |
|---|---|
| Entrada con cache hit | 0,30 dólares |
| Entrada sin caché | 3 dólares |
| Salida | 15 dólares |
No estamos ante el típico modelo chino ultraeconómico. Ese precio está mucho más cerca de los modelos frontier occidentales que del de sus propios hermanos.
Ahora bien, la caché ayuda más de lo que parece sobre el papel. Moonshot dice que su infraestructura Mooncake mantiene una tasa de acierto de caché por encima del 90% en cargas de código, con lo que el coste real de entrada baja alrededor de 4×. Si trabajas sobre el mismo repo durante horas, casi todo tu contexto se reutiliza, y la tarifa que de verdad pagas se parece más a la de caché que a la nominal.
Para situarte en el mapa de precios: K3 cobra 15 dólares por millón de salida, frente a los 4,40 de GLM-5.2 de Z.ai o los 0,87 de DeepSeek V4, según recopiló Fortune. Sigue siendo bastante más caro que otros abiertos. Pero también más barato que el modelo occidental de referencia: Fable ronda los 50 dólares por el mismo millón de salida.
Y aquí viene la trampa mental. Un modelo a 15 dólares que resuelve la tarea con 10.000 tokens internos puede salirte más barato que uno «económico» que necesita 50.000. La comparación real no está en el precio por token, sino en cuántos tokens de razonamiento quema K3 para cerrar tu tarea concreta. Con reasoning_effort ya disponible, ese número por fin lo controlas tú. Con el defecto en max, tiende a ser alto.
¿Y autohospedarlo sale más barato? Solo si tu volumen es enorme. Alquilar 64 aceleradores para servir el modelo tiene un suelo de coste que no bajas por mucho que el peso sea gratis: pagas hierro, red y personas que lo mantengan. Los pesos abiertos no son la opción económica, son la opción de control. Si lo que buscas es ahorrar, la API con caché sigue ganando por goleada.
¿Qué dicen los benchmarks de Kimi K3? ¶
Buenos números, y por primera vez con contraste externo de verdad. Que es justo lo que faltaba.
Lo primero, el titular que corre por todas partes: en la Frontend Code Arena, una arena de terceros con pruebas a ciegas entre desarrolladores, K3 aparece primero con 1.679 puntos, por delante de Fable 5 (1.631) y de GPT-5.6 Sol (1.618). Y no es un salto cualquiera: sube desde el puesto 18 que ocupaba Kimi K2.6, encabeza 6 de los 7 dominios de frontend y solo cede el primer puesto en Gaming, donde Fable 5 le gana. Es la primera vez que un modelo de pesos abiertos lidera esa tabla.
Moonshot, por su parte, ha publicado una tabla de benchmarks bastante más completa que en el primer día: DeepSWE, Terminal-Bench 2.1, FrontierSWE, SWE Marathon, Program Bench, PostTrain Bench y varios más, apoyados en leaderboards públicos. El relato que sostiene es coherente: K3 queda por detrás de Fable 5 y GPT-5.6 Sol en rendimiento general, pero por delante del resto, incluidos Opus 4.8 y GPT-5.5, en código y agentes.
Qué dice la evaluación independiente ¶
Y ahora la parte nueva. Artificial Analysis, que hasta que salieron los pesos etiquetaba a K3 como modelo propietario, ya lo ha medido con su propio harness. Sus números:
| Medida | Resultado independiente |
|---|---|
| Intelligence Index | 57 — empatado con Opus 4.8 y GPT-5.5, por detrás de Fable 5 (60) y GPT-5.6 Sol |
| Coding Agent Index | 57 — a la altura de GPT-5.6 |
| SWE-bench Verified | 76,8% — en el rango de los mejores modelos cerrados |
| Terminal-Bench 2.1 | 85% (Moonshot reportaba 88,3% con KimiCode) |
Fíjate en esa última fila, porque es la lección más útil del lanzamiento entero. El mismo modelo, el mismo benchmark, 3,3 puntos de diferencia. Lo único que cambia es el harness. Cuando compares modelos por benchmarks, esa cifra es el margen de error que deberías asumir siempre.
El veredicto de Artificial Analysis es más matizado que el titular: K3 está cerca de la frontera, sí, pero también consume muchos tokens de salida, genera más lento que la mediana y cuesta lo que cuesta un modelo premium.
El dato que no sale en los gráficos de Moonshot ¶
Aquí está la sorpresa desagradable. Artificial Analysis midió que K3 mejora en precisión factual frente a K2.6 (del 33% al 46%), pero que su tasa de alucinación sube del 39% a alrededor del 51%. Es decir: acierta más preguntas en términos absolutos, y a la vez se inventa con aplomo más respuestas cuando no sabe.
Para situarlo, Fable 5 marca un 54,9% en esa misma métrica, así que K3 no es un caso aislado ni un desastre. Pero es un número que no aparece en ninguna de las tablas publicadas por Moonshot, y eso, en un modelo que vas a soltar sobre tareas largas y autónomas, importa. Un agente que trabaja seis horas seguidas y alucina con seguridad es un problema distinto al de un chatbot que se equivoca en una respuesta.
⚠️ La regla no cambia con los pesos fuera: un benchmark propio nunca ha venido sin maquillaje. Lo que sí ha cambiado es que ahora tienes con qué contrastarlo. Y en cuanto lo contrastas aparecen las dos cosas de siempre: los números se mantienen razonablemente bien, pero lo que la casa no enseñaba (alucinación, velocidad, tokens quemados) es justo lo que peor sale en la foto.
Sigue habiendo terreno sin verificar. Los benchmarks internos que Moonshot usa para presumir (Knowledge Work Bench, Kimi Code Bench 2.0, DECK-Bench, PerceptionBench) no se pueden auditar desde fuera, porque los conjuntos de pruebas no son públicos. Tener los pesos te deja reproducir el servido, no inventarte el examen.
Mi lectura: hay pruebas convincentes e independientes de que K3 es excepcional en frontend generativo y prototipos visuales, y de que en código y agentes juega en el rango de Opus 4.8. Lo que ningún benchmark de este tipo demuestra es que sea el mejor modelo para mantener un backend, resolver issues reales o ejecutar una migración delicada. Ahí sigues necesitando probarlo tú, con tu repo.
Opiniones sobre Kimi K3: qué se dice en foros y fuentes chinas ¶
Las opiniones están divididas, que suele ser buena señal de que hay algo real debajo del ruido.
Del lado positivo, la comunidad destaca un salto claro en diseño visual respecto a generaciones anteriores, buen gusto en interfaces, resultados ambiciosos en Three.js y SVG, y que conserva la buena escritura creativa de la serie K2. Muchos lo sienten cercano a la primera línea de modelos cerrados. Ayuda que la familia Kimi ya tenga kilómetros de producción en Occidente: Fortune recuerda que Cursor tiró de Kimi para construir Composer 2 y que DoorDash delega parte del trabajo en Kimi K2.6.
Del lado crítico, se repiten las mismas quejas: lentitud, razonamiento demasiado largo, repetición de ideas, timeouts y precio elevado.
La valoración más sensata que he leído en Reddit viene a decir esto: más rápido que Claude en algunos casos, menos preciso en otros, probablemente cercano a GPT-5.5, pero todavía no al nivel de GPT-5.6 o Fable. Su rasgo diferencial más evidente es la calidad visual.
En medios y comunidades chinas dominan las demos de frontend: clones jugables de Minecraft, juegos 3D en un único HTML, simuladores históricos, escenas con cámara, físicas, estado y controles. La comparación que más se repite es que Fable produce algo más limpio, estable y rápido, mientras que K3 genera resultados más complejos, espectaculares y visualmente arriesgados.
En V2EX el tono es más escéptico. Algunos desarrolladores interpretan la campaña como marketing muy bien orquestado, y las preguntas sobre experiencia real con repos grandes todavía reúnen pocas respuestas sólidas. Lo cual confirma algo importante: hay más demo espectacular que kilómetros reales con repositorios de producción. A esa cautela se le suma otra que conviene tener presente: parte de la prensa recuerda que Anthropic acusó en febrero a Moonshot de entrenar por destilación con millones de intercambios de Claude, una acusación que la propia Moonshot no ha aceptado. No prueba nada sobre la calidad de K3, y los pesos publicados tampoco la resuelven: sin datos de entrenamiento, esa pregunta se queda exactamente donde estaba.
Con los pesos ya fuera, en r/LocalLLaMA la conversación ha girado a un sitio previsible. La celebración es genuina, pero el chiste recurrente es que 2,8 billones de parámetros son un modelo que nadie de ese subreddit puede ejecutar en casa. Y lo que más se valora ahí no es que gane a Fable 5, sino dos cosas mucho más terrenales: el precio y la ausencia de restricciones. Para bastante gente, ese es el argumento real de la familia Kimi.
Separar la demo espectacular del kilómetro real con repos de producción es justo lo que ponemos en común cada domingo entre +6.700 developers, compartiendo experiencias con IA en nuestro trabajo. Gratis, cada semana.
Suscríbete gratis →Kimi K3 vs Opus 4.8 vs Kimi K2.7 Code ¶
Te dejo una tabla con mi lectura cualitativa. No son notas de examen, son impresiones para orientarte cuando toca elegir modelo.
| Criterio | Kimi K3 | Kimi K2.7 Code | Opus 4.8 |
|---|---|---|---|
| Frontend generativo (SVG, Three.js) | Excelente | Bueno | Bueno |
| Interpretar capturas/vídeo y reproducir | Excelente | Limitado | Bueno |
| Coste y latencia en tareas pequeñas | Limitado (mejora con low) | Excelente | Bueno |
| Control sobre razonamiento | Bueno (low/high/max, defecto max) | Bueno | Excelente |
| Contexto para repos grandes | Excelente (1M) | Bueno (256K) | Bueno |
| Madurez y transparencia (docs, pesos) | Excelente (pesos + informe publicados) | Bueno | Bueno |
| Fiabilidad factual | Limitado (alucinación al alza) | Bueno | Bueno |
Fíjate en las dos últimas filas, que son las que se han movido esta semana. La de transparencia sube: K3 es hoy el único de los tres que puedes descargar, auditar por dentro y ejecutar en tu propio hierro. La de fiabilidad baja, y es nueva, porque hasta que no hubo medición independiente no sabíamos que la alucinación había subido.
Ese es el intercambio que te propone K3: más transparencia y más control a cambio de vigilar más lo que escribe.
Cuando está en juego tu producción
Cómo verificar lo que K3 escribe antes de fiarte de ello
Verás métodos reales para revisar y verificar lo que genera un agente: skills, pruebas en navegador con Playwright, casos Gherkin y adversarial review entre modelos. Justo la red que este post te pide poner tú.
Ver el método entero →Masterclass Web Reactiva Premium · métodos en directo
Mi valoración para desarrollo de software ¶
Voy a mojarme.
Dónde K3 parece especialmente fuerte:
- Crear prototipos de frontend completos.
- Three.js, Canvas, SVG y experiencias interactivas.
- Interpretar una captura o un vídeo y reproducirlo.
- Trabajar con repositorios o documentación muy grandes.
- Investigar y ejecutar tareas largas apoyándose en herramientas.
- Entregar cosas completas, no fragmentos sueltos de código.
Dónde todavía no confiaría a ciegas:
- Migraciones delicadas de producción.
- Refactors extensos sin tests que te cubran las espaldas.
- Resolución autónoma de issues reales durante muchas horas.
- Cambios arquitectónicos donde importe mucho no inventarse cosas.
- Tareas pequeñas y frecuentes donde el coste y la latencia manden.
A esa segunda lista le añado ahora una que no estaba: tareas donde la exactitud factual manda. Con una alucinación medida en torno al 51%, K3 no es el modelo al que le preguntas datos y te los crees sin comprobar.
Y no me lo invento yo: el propio Moonshot publica una sección de limitaciones que conviene leer antes de enchufarlo a nada serio. Resumo las tres que más te van a afectar:
- Sensibilidad al historial de razonamiento. K3 se entrenó preservando su propio thinking. Si cambias a K3 en mitad de una sesión abierta con otro modelo, o el harness no le devuelve todo ese historial, la calidad se vuelve inestable. Moonshot recomienda usar un harness compatible, como Kimi Code, y no hacer el cambio a media faena.
- Exceso de iniciativa. Como está entrenado para tareas largas y difíciles, ante una instrucción ambigua tiende a decidir por su cuenta. Si necesitas que se ciña a límites claros, ponle restricciones explícitas en el system prompt o en tu
AGENTS.md. - Brecha de experiencia de uso. La propia Moonshot admite que, siendo muy competitivo, K3 tiene un hueco perceptible frente a Fable 5 y GPT-5.6 Sol en la experiencia general.
🛡️ Si vas a meter K3 en algo serio, ponle tests antes. La combinación de «razona al máximo por defecto» y una tasa de alucinación al alza significa que la red la pones tú. Un test suite verde es la diferencia entre un ayudante brillante y un becario con acceso a producción y prisa.
¿Qué modelo elegiría yo para cada tarea? ¶
Para el trabajo de todos los días con OpenCode o Claude Code, seguiría tirando de K2.7 Code como modelo económico y rápido. Y reservaría K3 para lo que de verdad justifica su coste y su ritmo:
- Repositorios grandes donde el millón de tokens marca la diferencia.
- Planificación complicada que necesita razonamiento profundo.
- Debugging difícil que se te resiste con otros modelos.
- Implementaciones de frontend visual, que es donde más destaca.
- Tareas que K2.7 no consigue cerrar por sí solo.
Y una recomendación práctica que sale directamente de las novedades de esta semana: si vas a probarlo por API, empieza en reasoning_effort="low". Súbelo cuando la tarea se atragante, no antes. El defecto en max está pensado para lucirse en benchmarks, no para tu factura.
Piensa en K3 como el motor grande que enciendes cuando la tarea lo pide, no como el modelo que dejas en marcha para cada microedición.
Veredicto ¶
Kimi K3 es un salto grande y juega en la liga de los modelos frontier. Con los pesos publicados y la evaluación independiente encima de la mesa, ya no hace falta creerse a Moonshot: los números aguantan bastante bien el contraste. Para frontend generativo y prototipos visuales, es de lo más impresionante que vas a poder tocar.
Ahora bien, el relato de «modelo abierto que se merienda a Fable» sigue corriendo por delante de lo que sostienen los datos. Y conviene tenerlo presente:
- Lidera de forma independiente en frontend, pero en el índice general de Artificial Analysis empata con Opus 4.8 y queda por detrás de Fable 5.
- Ya puedes bajarle el razonamiento con low y high, pero el defecto sigue siendo max.
- El precio no es de modelo económico, aunque la caché al 90% lo abarata mucho en la práctica.
- Los pesos son abiertos, no libres: licencia propia con puertas comerciales, sin datos ni pipeline de entrenamiento.
- Y ejecutarlo tú requiere infraestructura de empresa, no una GPU buena.
- Su alucinación ha subido respecto a la generación anterior, y eso Moonshot no lo enseñaba.
🔑 Mi estimación, ya con pesos: K3 es el mejor modelo de pesos abiertos que existe hoy, compite de tú a tú con Opus 4.8 en código y agentes, gana con claridad en frontend generativo, y sigue por debajo de Fable 5 y GPT-5.6 Sol en capacidad general y en fiabilidad. Que sea descargable no lo hace mejor de lo que mide: lo hace verificable, que es otra cosa, y en el fondo más valiosa.
Así que la jugada es sencilla: úsalo donde brilla, mídelo donde dudas y no lo dejes tocar tu producción sin tests delante. Con esa regla ya juegas con ventaja frente a la mayoría, que anda pegando prompts en caliente y cruzando los dedos.
¿Por dónde vas a empezar a probarlo: un prototipo de frontend, un repo grande que se te haya atragantado con otros modelos, o directamente montándolo en vuestro propio hierro ahora que se puede?
Preguntas frecuentes sobre Kimi K3 ¶
¿Qué es Kimi K3?
Kimi K3 es el modelo generalista de la china Moonshot AI, sucesor de la familia K2. Cuenta con 2,8 billones de parámetros, una ventana de contexto de un millón de tokens y una orientación clara a programación, trabajo agéntico y frontend generativo.
¿Ya están publicados los pesos de Kimi K3?
Sí. Moonshot publicó los pesos el 26 de julio de 2026 por la noche, un día antes de la fecha anunciada, en el repositorio moonshotai/Kimi-K3 de Hugging Face, junto con el informe técnico en PDF, la licencia y la model card. La descarga nativa en MXFP4 ocupa unos 594 GB.
¿Qué licencia tienen los pesos de Kimi K3?
Una licencia propia que Hugging Face lista como other / kimi-k3. Es de estilo MIT y permite uso comercial, pero incluye una puerta: por encima de 100 millones de usuarios activos mensuales o 20 millones de dólares de ingresos anuales hace falta un acuerdo aparte con Moonshot. No es open source según la OSI, porque no se publican ni los datos ni el pipeline de entrenamiento.
¿Se puede ejecutar Kimi K3 en local?
En un equipo personal, no. Ni una RTX 4090 ni un Mac Studio mueven el modelo, ni siquiera cuantizado. A precisión completa hablamos de en torno a 1,4 TB de VRAM, es decir, unos 64 aceleradores (8 nodos de 8× H100) con paralelismo entre nodos, servidos con vLLM o SGLang. Los pesos abiertos de K3 son para organizaciones con infraestructura, no para escritorio.
¿La versión autohospedada de Kimi K3 rinde igual que la API?
Según confirmaron los cofundadores de Moonshot en un AMA en r/LocalLLaMA, la cuantización publicada es exactamente la misma que sirve la API, así que la calidad de inferencia debería ser idéntica. Además, K3 aplica quantization-aware training desde la fase de SFT, no cuantización posterior, lo que reduce mucho la degradación.
¿Cuántos parámetros tiene Kimi K3 y cuántos activa?
Kimi K3 tiene 2,8 billones de parámetros totales. Según el blog técnico, usa un MoE que activa 16 de sus 896 expertos por token (en torno al 1,8% del total) mediante un marco llamado Stable LatentMoE, con una mejora aproximada de 2,5× en eficiencia de escalado respecto a Kimi K2.
¿Cuál es la ventana de contexto de Kimi K3?
Kimi K3 admite una ventana de contexto de 1.048.576 tokens, es decir, un millón. Moonshot afirma un 90,4 en BrowseComp usando todo ese contexto sin gestión adicional, aunque conviene medir en tu propio repositorio si lo aprovecha bien en recuperación múltiple o edición de codebases grandes.
¿Kimi K3 alucina mucho?
Más que su predecesor. Artificial Analysis midió que la precisión factual sube del 33% de K2.6 al 46% en K3, pero que la tasa de alucinación pasa del 39% a alrededor del 51%. Como referencia, Fable 5 marca 54,9% en esa misma métrica. Es un dato que no aparece en las tablas publicadas por Moonshot y que conviene tener en cuenta en tareas agénticas largas.
¿Cuánto cuesta la API de Kimi K3?
La API oficial cuesta 0,30 dólares por millón de tokens de entrada con caché, 3 dólares por millón de entrada sin caché y 15 dólares por millón de salida. Es un precio de modelo frontier, aunque la caché, que supera el 90% de acierto en cargas de código, reduce el coste real de entrada alrededor de 4×.
¿Se puede usar Kimi K3 gratis?
Los pesos sí: se descargan sin coste desde el repositorio moonshotai/Kimi-K3 de Hugging Face. Ejecutarlos es otra historia, porque hacen falta unos 64 aceleradores para servir el modelo, así que «gratis» solo lo es el fichero, no la factura de hierro. La API oficial es de pago desde el primer token: 0,30 dólares por millón de entrada con caché, 3 sin caché y 15 de salida.
¿Se puede usar Kimi K3 con Claude Code y OpenCode?
Sí. Kimi K3 se integra con Codex, Claude Code, OpenCode, Cline, RooCode, OpenClaw y Hermes Agent, además del CLI propio Kimi Code. En OpenCode basta con autenticar Moonshot AI y seleccionar el modelo kimi-k3, y al ser compatible con el formato de OpenAI también funciona en herramientas que permitan cambiar el endpoint.
¿Por qué Kimi K3 es lento en tareas sencillas?
Porque su valor por defecto de reasoning_effort es max, así que piensa al máximo aunque la pregunta sea trivial. Desde el 18 de julio también admite los modos low y high, de modo que la solución es explícita: fija reasoning_effort="low" en tu cliente y súbelo solo cuando la tarea lo pida.
¿Kimi K3 es mejor que Opus 4.8 o Fable 5?
Depende de la tarea. En la arena independiente Frontend Code Arena queda primero con 1.679 puntos, por delante de Fable 5 (1.631) y GPT-5.6 Sol (1.618). En el Intelligence Index de Artificial Analysis marca 57, empatado con Opus 4.8 y GPT-5.5 y por detrás de Fable 5 (60). En SWE-bench Verified alcanza un 76,8%, en el rango de los mejores modelos cerrados. Resumiendo: gana en frontend, empata con Opus 4.8 en general y sigue por debajo de Fable 5.
¿En qué destaca Kimi K3 frente a otros modelos?
Su punto más fuerte, según demos, foros y la arena de frontend, es el frontend generativo: Three.js, SVG, Canvas y experiencias interactivas, además de interpretar capturas y vídeo para reproducir interfaces. Ahí es donde se ve una diferencia clara respecto a versiones anteriores.
¿Debería usar Kimi K3 en producción?
Para producción delicada, lo prudente es reservarlo para prototipos, frontend visual y repos grandes, siempre con tests que cubran los casos críticos. Conviene además tener en cuenta sus limitaciones oficiales (sensibilidad al historial de razonamiento, exceso de iniciativa ante instrucciones ambiguas y una brecha de experiencia frente a Fable 5 y GPT-5.6 Sol) y la subida de su tasa de alucinación medida por evaluadores independientes.
Fuentes ¶
- Moonshot AI, “Kimi K3: Open Frontier Intelligence”
- Hugging Face, “moonshotai/Kimi-K3” (pesos, licencia e informe técnico)
- Kimi API Platform, “Kimi K3 Quickstart”
- Kimi API Platform, “Using Kimi Models in OpenCode”
- OpenRouter, “Kimi K3 — API Pricing & Providers”
- Arena.ai, anuncio del primer puesto de Kimi K3 en Frontend Code Arena
- Tom’s Hardware, “China’s 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena”
- Quartz, “China’s Moonshot AI is releasing its record-setting open-weight model for free download”
- Nathan Lambert (Interconnects), “Kimi K3: The open-weights escalation”
- Kili Technology, “Kimi K3’s benchmarks and hallucinations”
- Northflank, “Kimi K3: benchmarks, pricing, hardware requirements, and self-hosting”
- The New Stack, “Moonshot launched Kimi K3. Then demand shut down subscriptions in 48 hours”
- Caixin Global, “Kimi K3 demand surge forces Moonshot AI to pause sign-ups”
- VentureBeat, “China’s Moonshot AI releases Kimi K3, the largest open-source model ever”
- Fortune, “Moonshot’s Kimi K3 pushes Chinese AI into Fable-level territory”
- CNBC, “China’s Moonshot AI unveils Kimi K3 that rivals OpenAI, Anthropic”
- Hacker News, “Kimi K3 is now live”
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.