Modelos de Ollama Cloud en 2026: GLM-5.2, Kimi K2.7 y MiniMax M3
(actualizado )
Modelos de Ollama Cloud en 2026: GLM-5.2, Kimi K2.7 y MiniMax M3 ¶
Pagar 20 dólares al mes por Ollama Cloud parece un capricho hasta que un día miras la factura de Anthropic, los límites semanales de Copilot y los créditos de OpenAI evaporándose, y empiezas a hacer las cuentas como en la cocina de tu abuela.
Y entonces aparece la duda real: ¿qué hay dentro?
Porque Ollama Cloud no es “un modelo”. Es un parque de unos 20 modelos open-weight que se renueva cada pocas semanas, donde la mayoría son modelos chinos que han crecido como setas: GLM-5.2 de Z.ai, Kimi K2.7 Code de Moonshot AI, MiniMax M3, la familia Qwen de Alibaba y los DeepSeek. El resto lo cubren Gemma 4 y Gemini 3 Flash de Google, los GPT-OSS de OpenAI y los Nemotron de NVIDIA. Si el término open-weight te resulta borroso, o no tienes claro qué te deja hacer cada licencia, empieza por qué son los modelos de pesos abiertos y qué no te dan.
Esa concentración no es casualidad. Los laboratorios chinos llevan dos años publicando modelos open-weight a un ritmo que el ecosistema occidental no ha igualado, y Ollama Cloud se ha convertido en la vía más cómoda para usarlos sin descargarlos.
Si vienes de la versión anterior de esta comparativa, donde mandaban Kimi K2.6, DeepSeek V4 Pro y GLM-5.1, prepárate: el catálogo ha rotado. En junio de 2026 la cabeza la pelean otros tres nombres.
En este post vas a ver:
- Qué es Ollama y cómo se instala en menos de cinco minutos
- Qué hace
ollama launchy por qué te ahorra tocar configuración - Cuánto cuesta Ollama Cloud y cómo se mide el consumo de verdad
- Los modelos de la liga A hoy: GLM-5.2, Kimi K2.7 Code y MiniMax M3
- Los workers de segunda fila que pican piedra barato
- Cómo se comparan con GPT-5.5 y Claude Opus 4.8
- Un stack recomendado y cuándo merece la pena pasar al plan de pago
Qué es Ollama y cómo se instala ¶
Ollama es una herramienta open source que permite ejecutar modelos de lenguaje en tu propia máquina con un comando, descargarlos de un catálogo público o conectarse a su servicio cloud para usar modelos que no caben en hardware doméstico. Lo descargas, eliges el modelo y lo lanzas desde la terminal con algo del estilo ollama run gemma4. Sin Python, sin Docker, sin pelearte con los drivers de la GPU durante una tarde de domingo.
La instalación es de las que no necesitan tutorial:
# macOS y Linux con un solo comando
curl -fsSL https://ollama.com/install.sh | sh
# En macOS también con Homebrew
brew install ollama
En Windows hay instalador nativo con interfaz de toda la vida. Una vez arriba, levantas un servidor local en http://localhost:11434 que habla el dialecto de la API de OpenAI. Eso es lo que hace que cualquier herramienta moderna de programación con IA lo entienda sin esfuerzo.
¿Cómo lo usas? Hay tres caminos.
- Modo standalone: descargas un modelo y chateas con él desde la terminal. Útil para probar, comparar respuestas o tener un asistente sin conexión.
- Como backend de otras herramientas: apuntas OpenCode, Pi, Goose, Claude Code o cualquier cliente compatible al endpoint local y trabajas como si fuera GPT.
- Con
ollama launch: integraciones oficiales que arrancan tu agente favorito apuntando ya al modelo correcto.
En el tutorial de OpenCode ya viste cómo encaja Ollama como uno más de los proveedores compatibles. Lo que ha cambiado es que ahora no hace falta configurar casi nada: el comando lo hace por ti.
Qué hace ollama launch y por qué cambia las reglas ¶
ollama launch es un comando que arranca tu agente de código apuntando ya a un modelo cloud, sin que toques configuración manual. Mueve a Ollama de “ejecutor de modelos locales” a “orquestador de agentes”. La idea es de las más simples que vas a ver: en lugar de instalar el cliente, configurar el endpoint, exportar variables de entorno y rezar para que el harness no se rompa, escribes una línea.
# Lanza Claude Code apuntando a Kimi K2.7 Code en cloud
ollama launch claude --model kimi-k2.7-code:cloud
# OpenCode con su menú de selección de modelo
ollama launch opencode
# OpenCode apuntando a un modelo concreto
ollama launch opencode --model glm-5.2:cloud
# Codex con un modelo open-weight
ollama launch codex --model minimax-m3:cloud
Las integraciones oficiales de agentes de código hoy cubren Claude Code, Codex, OpenCode, Droid, Goose y Pi, según la documentación de Ollama. Para cada una, el comando instala el cliente si no lo tienes, genera la configuración correcta y te pasa el modelo elegido sin que abras un fichero de YAML en tu vida.
🚀 Esto es lo que cambia el juego: puedes probar cinco modelos distintos en cinco minutos sin tocar tu configuración base. Si Kimi no te convence en una tarea, lanzas GLM-5.2 con otro comando y comparas en caliente.
Hay un detalle que conviene tener presente. La documentación oficial recomienda al menos 64K de contexto para que la experiencia con agentes no se rompa, y eso justifica el plan de pago: los modelos cloud de Ollama vienen con ventanas de 200K a 1M de tokens, algo impensable en local salvo que tengas una máquina con presupuesto de bonus de Wall Street. Si estás decidiendo entre usar Ollama Cloud como backend o montar tu propio proxy, la guía de Claude Code gratis con Ollama, OpenRouter y proxys te desglosa todos los caminos.
Y si la pregunta de fondo es qué agente usar con todo esto, en Web Reactiva tienes la comparativa entre Claude Code y OpenCode y la guía para migrar de Claude Code a Codex o a OpenCode, que cubren la otra mitad de la ecuación.
Cuánto cuesta Ollama Cloud y qué incluye cada plan ¶
Ollama Cloud tiene tres planes de pago activos y uno en camino: Free a 0 dólares, Pro a 20 dólares al mes (o 200 al año), Max a 100 dólares al mes y un plan Team marcado como “coming soon”, según la página oficial de pricing. El facturado no se mide en tokens sino en tiempo de GPU, con límites por sesión que se resetean cada cinco horas y límites semanales que se resetean cada siete días.
Si en local pagas con tiempo, paciencia y energía eléctrica, en Ollama Cloud pagas con dinero. Pero la cuenta sale distinta a lo que esperarías.
Estos son los planes con detalle, tal y como los analicé en el post sobre alternativas a GitHub Copilot en 2026:
- Free a 0 dólares: uso cloud ligero, un modelo concurrente. Local siempre ilimitado.
- Pro a 20 dólares al mes: 50 veces más uso cloud que Free, tres modelos concurrentes.
- Max a 100 dólares al mes: cinco veces más uso que Pro, diez modelos concurrentes.
Hay un matiz nuevo que conviene leer antes de pagar: Ollama clasifica ahora cada modelo por nivel de consumo, de “small, light models (nivel 1)” como GPT-OSS:20b hasta “extra heavy models (nivel 4)” como DeepSeek V4 Pro, según la documentación oficial. Antes de casarte con un modelo pesado, mira su nivel en la ficha: un modelo de nivel 4 se come tu cuota mucho más rápido que uno de nivel 1.
¿Por qué importa que se mida en tiempo de GPU y no en tokens? Porque las peticiones cortas y los prompts con contexto cacheado consumen menos. Y porque cada vez que Ollama optimiza su infraestructura, tu plan rinde más sin pagar más.
🛡️ Sobre privacidad, la documentación es tajante: los prompts y respuestas nunca se registran ni se usan para entrenar, y la inferencia ocurre en infraestructura de Ollama (principalmente en Estados Unidos, con rutas a Europa y Singapur para capacidad extra). Aunque uses un modelo de pesos chinos, tus datos no viajan a Moonshot ni a Z.ai.
Por qué Ollama Cloud está dominado por modelos chinos ¶
Si miras el catálogo oficial de modelos cloud, verás un patrón claro. De la veintena de modelos disponibles a fecha de hoy (junio de 2026), la mayoría vienen de laboratorios chinos: Z.ai (GLM), Moonshot AI (Kimi), MiniMax, DeepSeek y Alibaba (Qwen). Los occidentales del catálogo son Gemma 4 y Gemini 3 Flash de Google, los GPT-OSS de OpenAI y los Nemotron de NVIDIA.
Las cifras de adopción cuentan la misma historia: GLM-5.1 lleva acumulados 2,2 millones de pulls, GLM-5.2 ya suma 36.500 en sus primeros cuatro días, MiniMax M3 va por 60.800 en dos semanas y Kimi K2.7 Code por 20.800 en una, según los contadores del catálogo de Ollama.
¿Qué está pasando? Tres factores se combinan:
- Velocidad de publicación: los laboratorios chinos sacan modelos open-weight cada pocas semanas. Las versiones nuevas aparecen antes en Ollama Cloud que en otros proveedores.
- Apertura real de pesos: mientras Anthropic, OpenAI y Google reservan sus modelos punteros, Z.ai, Moonshot y MiniMax liberan los pesos. Eso permite que Ollama los empaquete y los sirva.
- Optimización para agentes: los modelos chinos recientes se han diseñado pensando en tool calling, contextos largos y workflows agénticos, justo lo que pide el ecosistema actual de OpenCode, Claude Code y compañía.
🌏 Para un developer esto se traduce en algo concreto: si pagas por Ollama Cloud, vas a usar sobre todo modelos chinos. No es un veredicto, es un dato. Lo que los diferencia es la calidad técnica, no su origen, pero conviene saberlo si trabajas en sectores donde la procedencia importa por compliance, regulación o clientes sensibles.
Ninguno de estos modelos sustituye sin matices a un flagship cerrado: en el benchmark DeepSWE, GPT-5.5 resuelve el 70% de las tareas frente a porcentajes muy inferiores de los open-weight, y en el duelo entre GPT-5.5 y Opus tienes los números lado a lado. Lo que sí hacen es cubrir el grueso del trabajo diario por una fracción del coste, y para elegir bien según tu perfil tienes el mapa completo en los mejores modelos de IA para programar.
Vista la foto general, vamos a lo que de verdad te interesa: qué modelos hay dentro y para qué sirve cada uno.
Estamos viviendo en directo cómo cambia el ecosistema de modelos: cada semana aparece uno nuevo y todo se mueve. En la newsletter compartimos lo que probamos y lo que aportan los +6.700 developers que ya somos. Gratis, cada domingo.
Apúntate gratis →La liga A: GLM-5.2, Kimi K2.7 Code y MiniMax M3 ¶
Estos son los tres modelos que aparecen una y otra vez en foros, benchmarks y conversaciones de gente que de verdad usa esto a diario. No son intercambiables. Cada uno resuelve un problema distinto, y la gracia está en saber cuál.
GLM-5.2: el que metería primero en una prueba seria ¶
GLM-5.2 es el open-weight de Ollama Cloud con más validación independiente a día de hoy. Lo desarrolla Z.ai y se presenta como su modelo flagship “para la era de las tareas de largo recorrido”. Es un MoE de unos 753.000 millones de parámetros según Hugging Face (743.000 según Fireworks), con cerca de 40.000 millones activos por token, y arrastra una limitación importante: no tiene visión.
¿Por qué empezaría por él? Porque es el que más kilómetros lleva validados por terceros. Simon Willison publicó que GLM-5.2 es probablemente el modelo open-weights de solo texto más potente disponible hoy, y AA-Briefcase de Artificial Analysis lo sitúa por delante de GPT-5.5 en su configuración de alto esfuerzo. Lo desgrané en detalle en el análisis de GLM-5.2, que recoge también las pruebas de scraping de Zyte y los reportes de la comunidad.
El asterisco, porque siempre hay uno: GLM-5.2 es token-hungry. Según la lectura de Willison, consume unos 43.000 tokens de salida por tarea en el Intelligence Index, más que GLM-5.1, MiniMax M3, Kimi K2.6 y DeepSeek V4 Pro. Barato por token, sí. Comedido, ni de lejos.
# GLM-5.2 como revisor y planificador principal
ollama launch opencode --model glm-5.2:cloud
Kimi K2.7 Code: el todoterreno agente que ahorra tokens ¶
Kimi K2.7 Code es la respuesta directa al gran defecto de GLM-5.2: gasta menos. Lo publica Moonshot AI con licencia Modified MIT y fecha oficial del 12 de junio de 2026, según la model card de Hugging Face. No es un generalista nuevo: es una variante especializada en programación y agentes construida sobre Kimi K2.6, con mejoras claras en tareas largas de código y, lo importante, alrededor de un 30% menos tokens de razonamiento que su predecesor.
Si vienes de la generación K2.5, aquí encuentras un salto real en estabilidad de agentes y MCP. Y si lo que te duele es la factura, en agentes que dan miles de pasos ese ahorro de tokens se multiplica. Tiene una pega de diseño que condiciona tu integración: siempre razona, no existe modo instantáneo, y emite un reasoning_content que debes conservar entre turnos cuando hay tool calling. Si te lo comes, rompes el contrato y el agente pierde el hilo. Lo cuento entero en el análisis de Kimi K2.7 Code.
Honestidad por delante: en programación pura no gana. En su propia tabla pierde contra Opus 4.8 en cinco de seis benchmarks. Donde aprieta es en agentes y MCP, no en arquitectura desde cero. Se queda en 256K de contexto y cuesta 0,95 dólares por millón de tokens de entrada y 4,00 de salida en la API de Moonshot.
# Kimi K2.7 Code para tu trabajo diario con agentes
ollama launch opencode --model kimi-k2.7-code:cloud
MiniMax M3: el rey del contexto largo y la inferencia barata ¶
MiniMax M3 es el que más se atreve a mirar a Opus a los ojos en contexto y precio. Es un MoE de 229.900 millones de parámetros totales con solo 9.800 millones activos por token, repartidos entre 256 expertos, según el análisis de NYU Shanghai sobre los datos de MiniMax. Su carta fuerte es el contexto de hasta 1M de tokens gracias a su atención dispersa propia, MSA (MiniMax Sparse Attention), que ataca el cuello de botella del contexto largo desde la raíz en lugar de taparlo a base de GPU.
Y nace multimodal de verdad: acepta imagen y vídeo. Para flujos de frontend guiados por capturas o revisión de UI, hace lo que GLM-5.2 no puede ni intentar. MiniMax declara que en SWE-Bench Pro adelanta a GPT-5.5 y Gemini 3.1 Pro, y que en SVG-Bench supera a Opus 4.7. Lo cuento con los benchmarks en la mano en el análisis de MiniMax M3.
¿La pega? Hay reportes de fallos en tool calls tras la primera petición vía LiteLLM, y se siente menos sólido que Kimi para decisiones de arquitectura. Lo veo más como worker auxiliar de gran contexto que como cabeza de proyecto. Y ojo con el precio: arrancó con una promo de lanzamiento a la mitad, así que mira el precio vigente antes de hacer cuentas.
💡 Si solo te llevas una idea de esta comparativa: GLM-5.2 es el copiloto-revisor con más aval externo, Kimi K2.7 Code es el todoterreno agente que ahorra tokens, y MiniMax M3 es el rey del contexto largo barato. No hay ganador único, hay tareas distintas.
El veterano que aún aguanta: DeepSeek V4 Pro ¶
No todo es estrenar modelo cada semana. DeepSeek V4 Pro sigue siendo el cerebro bruto del catálogo cuando el harness lo soporta bien. Tiene 1M de contexto, arquitectura MoE de gran tamaño y tres modos de razonamiento configurables, según su ficha oficial en Ollama, donde figura como modelo de nivel 4 (consumo extra pesado). Sus números en LiveCodeBench, SWE Verified y Terminal-Bench entran en la categoría de “open-weight más cañero del momento”.
El asterisco es el mismo que con Kimi: su modo thinking puede romper algunos harnesses si no reenvían bien el reasoning_content entre turnos.
⚠️ DeepSeek V4 Pro es brutal cuando el harness lo soporta. Antes de casarte con él, verifica que tu agente de código pasa sin pérdidas el contexto del razonamiento entre turnos.
¿Para qué lo usaría? Como revisor antagonista del código generado por otro modelo, para análisis de repos enormes que no caben en 256K y para planificación de tareas largas. Es el segundo par de ojos crítico, no el constructor principal.
La liga B: workers de código que dan el callo ¶
Aquí entran los modelos que no van a hacer la arquitectura de tu próximo SaaS pero que pican piedra de forma fiable y barata. Son los soldados, no los generales.
GLM-5.1. El flagship anterior de Z.ai sigue en el catálogo con 2,2 millones de pulls acumulados y un papel claro tras la llegada de 5.2: revisor barato y cabezón. Para revisar planes, validar specs y criticar PRs da muy buen resultado a un coste menor que el del modelo nuevo.
Qwen3-Coder. La familia de Alibaba para código, disponible en 30b y 480b. Orientada a comprensión de repositorios, cambios multiarchivo y agentes que tocan código real. Buen worker cuando tu agente la soporta de serie, aunque hoy tiene menos tracción que los tres de la liga A.
MiniMax M2.7. El veterano de la familia MiniMax antes de M3, posicionado para “agent teams, complex skills y dynamic tool search”. Su pariente M2.1 incluye soporte explícito para ficheros SKILL.md, CLAUDE.md, agent.md y .cursorrules, lo que lo hace interesante si trabajas con el ecosistema actual de agentes. Buena relación coste/capacidad para fixes, scaffolding y reviews; más flojo en arquitectura.
💡 Una observación que se repite en foros: hay modelos que planifican bien y otros que ejecutan rápido. Si combinas modelos en pipelines multi-agente, ese reparto rinde mejor que poner uno solo a hacerlo todo.
Ranking práctico para programar con Ollama Cloud ¶
Si lo único que te interesa es programar con un agente, este es el ranking que sale al cruzar benchmarks externos, foros en inglés y chino, y experiencia reportada por usuarios reales:
| Tier | Modelo Ollama Cloud | Mejor uso | Lectura realista |
|---|---|---|---|
| A | GLM-5.2 | Revisión, planificación, daily driver de texto | El que más validación independiente tiene (Willison, AA-Briefcase por delante de GPT-5.5 xhigh). Pero gasta muchos tokens y no tiene visión. |
| A | Kimi K2.7 Code | Agentes, MCP, tareas largas con ahorro de tokens | Todoterreno agente. ~30% menos tokens de razonamiento que K2.6. Pierde contra Opus 4.8 en programación pura. 256K de contexto. |
| A | MiniMax M3 | Contexto de 1M, frontend desde captura, multimodal | Rey del contexto largo barato y único con imagen+vídeo. Fallos de tool calls vía LiteLLM y menos sólido en arquitectura. |
| A- | DeepSeek V4 Pro | Razonamiento puro, revisión, repos enormes | Cerebro bruto con 1M de contexto. Nivel 4 de consumo. Verifica que tu harness pasa bien el reasoning_content. |
| B | GLM-5.1 | Revisión barata, planificación, alternativa tipo Sonnet | El flagship anterior, ahora en su mejor papel: revisor económico. Mejor criticando que construyendo desde cero. |
| B | Qwen3-Coder | Repo grande, cambios multiarchivo, worker diario | 30b y 480b. Sigue siendo relevante, con menos tracción que la liga A. Buena opción si tu agente lo soporta de serie. |
| B | MiniMax M2.7 | Bugfixes, scaffolding, worker auxiliar | Buena relación coste/capacidad para tareas no críticas, más flojo en arquitectura. |
🔑 La diferencia entre la liga A y la liga B no es “mejor o peor en abstracto”. Es para qué tarea. Un revisor cabezón y un ejecutor rápido no compiten: se complementan.
Visión, contexto largo y modelos pequeños ¶
No todo en Ollama Cloud es el bucle del agente de código. Hay un grupo de modelos para tareas que se salen de ahí.
Para trabajar con imágenes (mockups, dashboards, capturas donde hay que mirar y devolver código), los candidatos son MiniMax M3 (imagen y vídeo nativos), Kimi K2.7 Code (también multimodal) y Gemini 3 Flash Preview, rápido y con 1M de contexto para documentos largos con gráficos o tablas. Gemma 4 entra cuando necesitas multimodalidad ligera con razonamiento decente.
Para contexto larguísimo (repos enormes, documentación masiva, análisis de PDFs), las cartas son DeepSeek V4 Flash (1M de contexto, MoE de 284B totales con 13B activos, más barato y rápido que V4 Pro para tareas no críticas), MiniMax M3 y Gemini 3 Flash Preview.
Para tareas pequeñas y baratas (clasificación, extracción, resúmenes cortos, tool calling sencillo), tiras de GPT-OSS:20b y 120b, de Gemma 4 en sus tamaños pequeños o de Qwen3.5 cuantizado. Son las mulas: nivel de consumo bajo y suficientes para el grueso del trabajo trivial.
💡 No hace falta un favorito por categoría. Lo eficiente es montar un router que mande la petición al modelo barato cuando la tarea es trivial y solo escale al grande cuando hace falta. Ahí está el ahorro real, y le dediqué un post entero al patrón de planifica caro, ejecuta barato con criterios extrapolables a este catálogo.
Comparativa contra GPT-5.5 y Opus 4.8 ¶
Aquí toca ser honesto. Los modelos de Ollama Cloud han cerrado mucho la brecha, pero ninguno sustituye sin matices a los flagship comerciales en todas las tareas.
GPT-5.5 y Claude Opus 4.8 se reparten el trono de los proyectos complejos: Opus por autonomía, honestidad sobre su propio trabajo y comprensión de intención; GPT-5.5 por dominio de la terminal y ejecución agéntica de largo recorrido. Para coding complejo o investigación profunda, siguen siendo la referencia. Si quieres ver el contraste con números, en el duelo entre GPT-5.5 y Opus tienes los benchmarks lado a lado.
¿Cuánto separa eso a los open-weight de los cerrados? Depende del benchmark, y ese es justo el problema. En el benchmark DeepSWE, que mide tareas de código más realistas que SWE-Bench Pro, GPT-5.5 resuelve el 70% de las tareas y Opus 4.7 el 54%, mientras que los open-weight como Kimi K2.6 o GLM-5.1 se quedan muy por debajo. La distancia entre el mejor y el peor de esa lista es de 70 puntos, cuando en la mayoría de leaderboards públicos esa horquilla se queda en 30.
🛡️ El mensaje honesto: si tu trabajo depende de la última décima de calidad y consistencia, no canceles GPT-5.5 ni Opus 4.8. Si lo que necesitas es bajar la factura sin sacrificar gran cosa en el día a día, Ollama Cloud te lleva muy lejos.
Conviene además recordar de dónde salen muchos de estos números: los benchmarks de Kimi K2.7 Code y MiniMax M3 son hoy en buena parte de cosecha propia de cada laboratorio, mientras que GLM-5.2 ya tiene aval de terceros. Un benchmark propio nunca ha venido sin maquillaje, jamás.
Si te toca decidir entre flagships y open-weight cada semana, en la newsletter selecciono 12 recursos sobre IA aplicada al desarrollo: comparativas, herramientas y experiencias reales de los +6.700 developers que la leemos. Gratis, desde 2018.
Suscríbete gratis →Matriz de decisión: qué modelo elegir según la necesidad ¶
Cruzando los flagship comerciales con el catálogo de Ollama Cloud, esta es la guía rápida cuando la pregunta es “¿con qué modelo abro hoy?”:
| Necesidad | Modelo de Ollama Cloud | Por qué |
|---|---|---|
| Un solo modelo para empezar en serio | glm-5.2:cloud |
El que más pruebas independientes tiene encima de la mesa. |
| Agente diario con ahorro de tokens | kimi-k2.7-code:cloud |
Todoterreno agente con ~30% menos tokens de razonamiento que K2.6. |
| Repo grande o documentación larga | minimax-m3:cloud o deepseek-v4-pro |
1M de contexto. MiniMax es más barato; DeepSeek razona más fuerte. |
| Frontend visual o UI desde captura | minimax-m3:cloud o kimi-k2.7-code |
MiniMax acepta imagen y vídeo; GLM-5.2 es ciego. |
| Revisión dura y antagonista | deepseek-v4-pro o glm-5.1:cloud |
DeepSeek por razonamiento y contexto; GLM-5.1 por revisión ordenada y barata. |
| Worker rápido y barato | qwen3-coder o minimax-m2.7:cloud |
Cambios acotados, fixes y scaffolding sin quemar cuota. |
| Sustituir Opus 4.8 o GPT-5.5 | Ninguno sin matices | Se acercan en precio y capacidad, pero los flagship siguen mejor en lo difícil. |
Qué stack de modelos de Ollama Cloud combinar ¶
Para programar a diario con un agente, la combinación más equilibrada hoy es Kimi K2.7 Code como modelo principal y GLM-5.2 o DeepSeek V4 Pro como revisor antagonista. Después de leer foros, benchmarks y reportes de gente trabajando con esto, este es el setup que probaría primero:
Plan / arquitectura: glm-5.2:cloud
Implementación principal: kimi-k2.7-code:cloud
Ejecutor rápido y barato: qwen3-coder
Revisión antagonista: deepseek-v4-pro:cloud
Revisor alternativo barato: glm-5.1:cloud
Worker de productividad: minimax-m2.7:cloud
Contexto de 1M / multimodal: minimax-m3:cloud
Pruebas con mucho contexto: deepseek-v4-flash
Si todo esto te parece un zoológico y solo quieres empezar con dos modelos, la combinación mínima viable es:
# Agente principal para programar
ollama launch opencode --model kimi-k2.7-code:cloud
# Revisor y antagonista cuando algo se atasca
ollama launch claude --model glm-5.2:cloud
La idea no es coleccionar cromos. Es tener tres o cuatro modelos bien identificados, saber para qué sirve cada uno y cambiar entre ellos según la tarea.
Cuándo merece la pena pagar Ollama Cloud ¶
Pagar Ollama Cloud merece la pena cuando ya topas con los límites de tu agente actual, cuando trabajas con varios agentes en paralelo o cuando quieres acceso a modelos open-weight grandes sin invertir en GPU. La pregunta no es “¿es mejor Ollama Cloud que Claude Pro?”. La pregunta es “¿qué hueco llena en mi flujo actual?”. Hay tres escenarios donde la respuesta es clara.
Uno: usas OpenCode, Codex o Claude Code y los límites te aprietan. Si Anthropic te corta antes de tiempo o tu factura mensual de OpenAI parece la nómina de un junior, los 20 dólares de Ollama Pro te dan acceso a un parque de modelos suficiente para el grueso de las tareas.
Dos: trabajas con varios agentes en paralelo. El plan Pro permite tres modelos concurrentes y el Max diez. Si tu flujo tiene un planner, un executor y un reviewer a la vez, esto encaja mejor que pagar tres suscripciones distintas.
Tres: quieres aislamiento o privacidad sin renunciar al cloud. Ollama no entrena con tus prompts y los modelos son open-weight. No es lo mismo que ejecutar en local, pero es un compromiso razonable.
¿Cuándo no merece la pena? Si tu trabajo crítico depende del último 5% de calidad de Opus 4.8 o GPT-5.5. Si haces un uso muy ligero, donde el plan Free ya te llega. O si tu hardware local soporta modelos como Gemma 4 o Qwen3.5 cuantizado y no necesitas ventanas de contexto enormes.
🔑 Ollama Cloud no compite con Claude o GPT en la última milla. Compite con la cuota mensual de tu proveedor cuando esa cuota empieza a doler. Y para esa pelea, está muy bien posicionado.
El veredicto rápido ¶
Si solo eliges un modelo para una prueba seria, GLM-5.2. Es el que más kilómetros lleva validados por terceros, aunque tendrás que tragar con su apetito de tokens y su falta de visión.
Si tu cuello de botella es la factura, Kimi K2.7 Code. Ahorra alrededor de un 30% de tokens de razonamiento y es el todoterreno más fiable para agentes y MCP.
Si necesitas contexto de 1M o que el modelo vea imágenes, MiniMax M3. Es el más barato de la terna con esa ventana y el único multimodal de verdad.
Y si quieres el cerebro bruto para revisión y repos enormes, DeepSeek V4 Pro, siempre que tu agente reenvíe bien el reasoning_content.
La parte difícil ya no es elegir modelo. Es elegir bien el par de modelo y agente que casa con tu cabeza. Pásate dos tardes probando y tendrás tu propia tabla, mucho más útil que cualquier ranking que leas por ahí.
Y como siempre, lo importante no es tener el mejor modelo. Es saber cuándo cambiar de modelo. ¿Te animas a probarlo este fin de semana?
Preguntas frecuentes sobre Ollama Cloud ¶
¿Qué es Ollama Cloud? ¶
Ollama Cloud es el servicio de pago de Ollama que permite usar modelos grandes open-weight sin descargarlos a tu máquina. La inferencia se ejecuta en la infraestructura de Ollama y los modelos se invocan con el sufijo :cloud desde tu cliente local.
¿Cuánto cuesta Ollama Cloud? ¶
Ollama Cloud tiene tres planes de pago: Free a 0 dólares con uso ligero, Pro a 20 dólares al mes (o 200 al año) y Max a 100 dólares al mes, más un plan Team en camino. El cobro se calcula por tiempo de GPU, no por tokens, según la página oficial de pricing.
¿Qué modelos hay en Ollama Cloud en 2026? ¶
A fecha de junio de 2026, el catálogo cloud incluye una veintena de modelos: GLM-5.2, GLM-5.1 y GLM-5, Kimi K2.7 Code, K2.6 y K2.5, MiniMax M3, M2.7 y M2.5, DeepSeek V4 Pro y Flash, Qwen3.5, Qwen3-Coder, Gemma 4, Gemini 3 Flash Preview, GPT-OSS y los Nemotron 3 de NVIDIA, entre otros.
¿Cuál es el mejor modelo de Ollama Cloud para programar? ¶
Depende de la tarea. GLM-5.2 es el que más validación externa tiene como revisor y daily driver de texto; Kimi K2.7 Code es el todoterreno agente más eficiente en tokens; MiniMax M3 es el rey del contexto de 1M y el único multimodal. No hay un ganador único.
¿Por qué la mayoría de modelos de Ollama Cloud son chinos? ¶
Los laboratorios chinos (Z.ai, Moonshot AI, MiniMax, DeepSeek, Alibaba) publican sus modelos punteros con pesos abiertos, mientras que Anthropic y OpenAI mantienen los suyos cerrados. Eso permite a Ollama servirlos en su infraestructura cloud, y por eso copan el catálogo.
¿Mis datos pasan por servidores chinos al usar Kimi, GLM o MiniMax? ¶
No. Aunque los pesos provengan de laboratorios chinos, la inferencia se ejecuta en la infraestructura de Ollama (principalmente en Estados Unidos). Los prompts no se envían a Moonshot, Z.ai ni a sus laboratorios de origen, y según la documentación nunca se registran ni se usan para entrenar.
¿Qué es ollama launch? ¶
ollama launch es un comando que arranca tu agente de código favorito (Claude Code, Codex, OpenCode, Droid, Goose, Pi) ya configurado para usar un modelo cloud de Ollama. Por ejemplo, ollama launch claude --model kimi-k2.7-code:cloud lanza Claude Code apuntando a Kimi K2.7 Code sin tocar configuración manual.
¿Qué diferencia hay entre Kimi K2.7 Code y GLM-5.2? ¶
Kimi K2.7 Code es una variante especializada en código y agentes, con 256K de contexto y un 30% menos de tokens de razonamiento que K2.6, pero sin visión. GLM-5.2 es un modelo de solo texto más potente en validación externa y razonamiento, también ciego, pero mucho más caro en consumo de tokens.
¿Cómo se compara MiniMax M3 con GPT-5.5 y Opus 4.8? ¶
MiniMax M3 declara adelantar a GPT-5.5 y Gemini 3.1 Pro en SWE-Bench Pro y superar a Opus 4.7 en SVG-Bench, pero esos números son en buena parte de cosecha propia. Para tareas críticas y consistencia, GPT-5.5 y Opus 4.8 siguen siendo más fiables.
¿Necesito GPU para usar Ollama Cloud? ¶
No. La gracia de Ollama Cloud es justo esa: ejecutas modelos enormes sin GPU local. Tu máquina solo actúa de cliente que envía peticiones al endpoint cloud.
Fuentes ¶
Documentación oficial de Ollama:
- Ollama, “Cloud models” — catálogo actualizado de modelos cloud
- Ollama, “Pricing” — planes, límites y política de privacidad
- Ollama Docs, “Integrations” — agentes compatibles con
ollama launch - Ollama Docs, “Context length”
Fichas individuales de modelos en el catálogo de Ollama:
- Ollama, “GLM-5.2”
- Ollama, “Kimi K2.7 Code”
- Ollama, “MiniMax M3”
- Ollama, “DeepSeek V4 Pro”
- Ollama, “GLM-5.1”
Análisis en Web Reactiva:
- Daniel Primo, “GLM-5.2: por qué probarlo antes que Kimi K2.7 o MiniMax M3”
- Daniel Primo, “Kimi K2.7 Code: qué trae y cómo usarlo con tus agentes”
- Daniel Primo, “MiniMax M3: el open-weight que se atreve a mirar a Opus a los ojos”
- Daniel Primo, “El benchmark DeepSWE corona a GPT-5.5 como mejor modelo para código”
Benchmarks y comunidad:
- AkitaOnRails, “LLM Coding Benchmark”
- Simon Willison, análisis de GLM-5.2
- Artificial Analysis, “AA-Briefcase”
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.