GPT-6 Sol y Luna vs Opus 5.5: precio, benchmarks y cuál usar
OpenAI ha lanzado hoy, 22 de septiembre de 2026, GPT-6 Sol y GPT-6 Luna. Y lo ha hecho unos 90 minutos después de que Anthropic soltara Claude Opus 5.5. Dos lanzamientos gordos en la misma tarde no son casualidad: es una guerra de precios con fecha y hora.
El resumen honesto cabe en una línea: Sol y Luna no son mucho más listos que sus antecesores, pero cuestan la mitad. Y para quien tiene un agente trabajando horas contra un repositorio, eso puede importar más que tres puntos en un benchmark.
Lo que vas a encontrar aquí:
- Qué son Sol y Luna dentro de la familia GPT-6 y por qué no existe un modelo llamado “GPT-6” a secas.
- Los precios frente a GPT-6 Astra, GPT-5.6, Opus 5.5 y Sonnet 5, con la letra pequeña del “50 % más barato”.
- Los benchmarks oficiales contrastados con Artificial Analysis, que enfría bastante el entusiasmo.
- Por qué la nueva caché y el steering a mitad de turno cambian más tu factura que la inteligencia bruta.
- Qué modelo poner en cada capa de tu agente: planificador, implementador y subagentes baratos.
⚠️ Esto se escribe con horas de uso real encima, no semanas. Los precios y la ficha técnica son oficiales; las opiniones de la comunidad son de las primeras horas y las reviews largas todavía no han llegado. Lo que aguanta es la estructura de precios y cómo repartir el trabajo entre modelos.
GPT-6 es una familia, no un modelo ¶
Lo primero, para desfacer un entuerto que ya circula: en la API no hay un modelo que se llame gpt-6. GPT-6 es la familia, y queda formada por tres modelos. Durante el despliegue algunos usuarios de Codex han visto etiquetas sueltas como “GPT-6” en el selector, y de ahí viene la confusión.
| Modelo | Papel | ID en la API | Entrada / 1M | Salida / 1M | Contexto |
|---|---|---|---|---|---|
| GPT-6 Astra | Máximo rendimiento, horizonte largo | — | $10 | $50 | 1,05M |
| GPT-6 Sol | Caballo de batalla: coding y agentes | gpt-6-sol |
$2 | $10 | 1,05M |
| GPT-6 Luna | Volumen, velocidad y coste | gpt-6-luna |
$0,10 | $0,50 | 1,05M |
Fuente: documentación de modelos de OpenAI y anuncio oficial.
Los tres aceptan texto e imagen como entrada, tienen 128.000 tokens de salida máxima y soportan computer use. Sol y Luna admiten seis niveles de razonamiento: none, low, medium, high, xhigh y max.
Fíjate en lo que falta: Terra. La generación GPT-5.6 tenía tres escalones (Sol, Terra y Luna, que ya repasamos en el post de GPT-5.6). En GPT-6 el mediano desaparece. La lectura que más se repite es lógica: Luna en max cubre casi todo lo que hacía Terra, y el nuevo Sol cuesta menos de lo que costaba Terra en julio.
Y ojo al cambio de papeles. En GPT-5.6, Sol era el buque insignia. En GPT-6, el buque insignia es Astra y Sol baja a modelo de trabajo diario. Mismo nombre, otra posición en la tabla. Si comparas “Sol contra Sol” sin tener esto en cuenta, vas a sacar conclusiones raras.
OpenAI lo posiciona sin rodeos: Sol para “complex coding and agentic workflows”, Astra para lo más difícil y Luna para clasificación, extracción, tareas repetitivas y subagentes baratos.
Los precios: la mitad, pero la mitad de qué ¶
OpenAI vende una rebaja del 50 % frente a GPT-5.6. Es verdad, con un asterisco que conviene tener delante:
| Modelo | Precio de lanzamiento | Precio justo antes de GPT-6 | GPT-6 |
|---|---|---|---|
| Sol | $5 / $30 (jul 2026) | $4 / $20 (promocional) | $2 / $10 |
| Terra | $2,50 / $15 | $2 / $12 | desaparece |
| Luna | $1 / $6 | $0,20 / $1,20 | $0,10 / $0,50 |
Precios por millón de tokens (entrada / salida). Fuentes: post de GPT-5.6 en Web Reactiva, OpenAI Developer Community y cobertura de VentureBeat y The New Stack.
El 50 % se calcula contra los precios rebajados de GPT-5.6, no contra los de lanzamiento. GPT-5.6 Sol ya había bajado a $4/$20 en agosto, con una tarifa promocional anunciada hasta al menos el 21 de noviembre. Luna ya había caído un 80 % a finales de julio. Si comparas con lo que costaba GPT-5.6 Sol el día que salió, el nuevo Sol es un 60 % más barato en entrada y un 67 % en salida.
Los precios de GPT-6 Sol y Luna se presentan como tarifas estándar, no como promoción de estreno. Batch y Flex salen a mitad de precio.
Ahora ponlo al lado de la competencia:
| Modelo | Entrada / 1M | Salida / 1M | Lectura de caché / 1M |
|---|---|---|---|
| GPT-6 Luna | $0,10 | $0,50 | $0,01 |
| GPT-6 Sol | $2 | $10 | $0,20 |
| Claude Sonnet 5 | $2 | $10 | — |
| Claude Opus 5.5 | $4 | $20 | $0,20 |
| GPT-6 Astra | $10 | $50 | — |
| Claude Fable 5.1 | $10 | $50 | — |
Dos coincidencias muy calculadas. Sol cuesta lo mismo que Sonnet 5, cuyo precio de estreno de $2/$10 Anthropic hizo permanente el 11 de agosto. Y Sol lee de caché al mismo precio que Opus 5.5: 0,20 dólares el millón. OpenAI ha puesto su modelo de trabajo diario justo en el precio del Sonnet y con la caché del Opus.
💡 Precio por token y coste por tarea no son lo mismo. Un modelo barato que razona el doble, gasta más tokens o necesita reintentos puede acercarse al coste del modelo caro. Por eso las cifras de coste por tarea de más abajo pesan más que esta tabla.
La caché es la mejora que más notarás en la factura ¶
Si tu agente trabaja con un AGENTS.md, skills, reglas del proyecto y un historial largo, casi todo lo que envía en cada vuelta se repite. Ahí la caché decide la factura mucho más que el precio base, y es donde GPT-6 trae más novedades:
- 90 % de descuento en las lecturas cacheadas. En Sol, 0,20 dólares el millón frente a 2 sin caché. En Luna, un céntimo.
- Cambiar el nivel de razonamiento ya no invalida el prefijo cacheado. Puedes subir de
mediumahigha mitad de conversación sin pagar otra vez todo el contexto. - Activar o desactivar herramientas tampoco rompe la caché.
- Breakpoints de caché explícitos, para marcar tú dónde termina la parte estable del prompt.
- Un dashboard de caché y una herramienta de diagnóstico que explica por qué un prompt no ha acertado.
La escritura en caché de Sol cuesta 2,50 dólares el millón, algo más que la entrada normal. Solo compensa si ese prefijo se va a leer varias veces, que es justo lo que pasa en un agente.
Para ver el orden de magnitud, imagina una tarea de agente con 2 millones de tokens de entrada, el 90 % servidos desde caché, y 50.000 tokens de salida (sin contar escrituras en caché):
| Modelo | Entrada sin caché | Entrada cacheada | Salida | Total aprox. |
|---|---|---|---|---|
| GPT-6 Luna | $0,02 | $0,02 | $0,03 | ~$0,07 |
| GPT-6 Sol | $0,40 | $0,36 | $0,50 | ~$1,26 |
| Claude Opus 5.5 | $0,80 | $0,36 | $1,00 | ~$2,16 |
Cálculo propio con precios oficiales. Es un ejemplo, no una medición: en la realidad cada modelo gasta un número distinto de tokens de salida para la misma tarea, y ahí Opus 5.5 en max es de los más derrochadores.
Lo que enseña el ejemplo es que, con buena caché, la salida pasa a ser el grueso del coste. Y la salida es donde Sol cobra la mitad que Opus 5.5.
Herramienta gratis · Calculadora
¿Cuánto te costaría tu agente con Sol, Luna u Opus 5.5?
Con la lectura de caché a 0,20$ en Sol y a un céntimo en Luna, lo que decide la factura es cuánto contexto reenvía tu agente en cada paso y cuánta salida genera. Mete tus pasos y tu contexto y mira cuánto cuesta una ejecución y cuánto te devuelve la caché.
Le das
Los pasos y el contexto de tu agente
Te devuelve
Lo que cuesta una ejecución y lo que cuesta el mes
Sol frente a GPT-5.6 Sol: más barato, no más listo ¶
Aquí conviene separar lo que dice OpenAI de lo que dicen los demás, porque no cuentan exactamente lo mismo.
La versión de OpenAI. En FrontierCode, el benchmark de Cognition que intenta medir cambios que se podrían mergear (corrección, tests, disciplina de alcance, estilo), Sol mejora de forma clara frente a GPT-5.6 Sol. En xhigh saca un 48,4 % con un coste de 1,37 dólares por tarea, prácticamente lo mismo que el 48,7 % de Fable 5.1 en xhigh, que cuesta 9,27 dólares. En DeepSWE 1.1, Sol en max llega al 68,8 %, a 1,1 puntos del 69,9 % de Fable 5 en xhigh, con un coste por tarea en torno a un 80 % menor.
La versión independiente. Artificial Analysis pone a Sol en max en 47,5 puntos de su Intelligence Index (lo verás redondeado a 48), una mejora modesta sobre GPT-5.6 Sol. En su Coding Agent Index sube de 55 a 57. Dos puntos. Lo que sí se desploma es el coste: 1,06 dólares por tarea típica del índice, frente a 1,99 de GPT-5.6 Sol. La mitad.
Y hay un detalle que el anuncio no subraya. Según el análisis de The Decoder, en dos de las seis evaluaciones principales el nuevo Sol puntúa por debajo del mejor ajuste de GPT-5.6 Sol: cede unos 4 puntos en el techo de DeepSWE a cambio de un coste por tarea un 58 % menor. En OSWorld 2.0 offline, Sol en xhigh saca un 60,5 %, cuando GPT-5.6 Sol había llegado al 65,7 % en ese mismo subconjunto.
¿Contradicción? No del todo. Es un modelo optimizado para rendimiento por dólar, no para el techo. OpenAI ha elegido dónde recortar y lo ha hecho en el extremo alto.
🔑 Si ya usabas GPT-5.6 Sol en
maxpara tareas muy difíciles, el nuevo Sol no es una mejora automática. Si lo usabas enmediumohighpara el día a día, casi seguro que sí: mismo nivel o algo mejor por la mitad.
Un modelo barato rinde el doble con una buena spec
Sol y Luna sacan lo mejor de sí con tareas bien acotadas y criterios de aceptación claros. En este curso recorres el ciclo completo de Spec Driven Development con OpenSpec sobre un proyecto real: propuesta, spec, tareas y verificación, en modo asistido antes de coger tú el volante.
Entra en el curso gratis →Los benchmarks, puestos lado a lado ¶
Esta es la foto que se puede montar hoy. Ojo a la columna de fuente: mezclar cifras de OpenAI, de Anthropic y de terceros es la forma más rápida de engañarse.
| Evaluación (fuente) | GPT-6 Sol | GPT-6 Luna | Referencia |
|---|---|---|---|
| DeepSWE 1.1 (OpenAI) | 68,8 % (max) | 66,6 % (max) | Fable 5 xhigh: 69,9 % |
| FrontierCode (OpenAI) | 48,4 % (xhigh) | — | Fable 5.1 xhigh: 48,7 % |
| OSWorld 2.0 offline (OpenAI) | 60,5 % (xhigh) | > GPT-5.6 Sol medium | Opus 5 medium: 60,3 %; Astra: 72,6 % |
| AutomationBench (OpenAI) | 33,2 % (xhigh) | — | Opus 5 max: 26,9 % |
| Intelligence Index (Artificial Analysis) | 47,5 (max) | — | Opus 5.5 max: 58; Opus 5.5 medium: 51,2 |
| Coding Agent Index (Artificial Analysis) | 57 (max) | — | GPT-5.6 Sol: 55 |
| Coste por tarea del índice (AA) | $1,06 | $0,07 | GPT-5.6 Sol: $1,99; GPT-5.6 Luna: $0,18 |
Fuentes: anuncio de OpenAI, Artificial Analysis y cobertura de The Decoder, VentureBeat y Office Chai.
Tres cosas que saltan a la vista.
La primera: OpenAI casi nunca se compara con Opus 5.5, que salió hora y media antes. Sus tablas enfrentan a Sol con Opus 5 y Fable 5, modelos que Anthropic acaba de relevar. Es normal, no les dio tiempo, pero significa que las comparaciones oficiales ya nacen algo viejas.
La segunda: los números de coste son espectaculares. AutomationBench a 0,27 dólares por tarea, un 9 % de lo que cuesta Opus 5 en max para un resultado mejor. Luna a 7 centavos por tarea del índice, un 60 % menos que GPT-5.6 Luna, y eso que gasta más tokens.
La tercera: Sol en max queda cerca de lo que hace Astra en medium en varias evaluaciones, según varios usuarios que han cruzado las tablas. Eso reabre la pregunta de siempre: si para llegar al nivel necesitas max, ¿cuánto del ahorro por token se queda por el camino en razonamiento?
Leer una tabla de benchmarks mirando quién la firma y contra qué se compara es media batalla contra el hype. Cada domingo mandamos a +7.200 developers lo que vamos aprendiendo sobre IA en el trabajo real: qué números importan, qué modelos compensan y qué decisiones tomar. Gratis, desde 2018.
Suscríbete gratis →GPT-6 Sol vs Claude Opus 5.5: el duelo de la misma tarde ¶
La lectura que se está consolidando en r/singularity y r/OpenAI es bastante clara: Opus 5.5 tiene más techo; Sol es mucho más agresivo en coste.
| Dimensión | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|
| Precio entrada / salida | $2 / $10 | $4 / $20 |
| Lectura de caché / 1M | $0,20 | $0,20 |
| Intelligence Index AA (max) | 47,5 | 58 |
| Coste por tarea del índice AA (max) | $1,06 | $5,98 |
| FrontierCode | 48,4 % (OpenAI, xhigh) | 54,4 % (Anthropic) |
| Effort por defecto | configurable, 6 niveles | medium |
En inteligencia no hay discusión: Opus 5.5 lidera el índice de Artificial Analysis con 58 frente a 47,5. Diez puntos es mucha distancia entre modelos de la misma tarde. En FrontierCode, Opus 5.5 va unos 5 puntos por delante, aunque aquí cada cifra viene de un laboratorio distinto y con configuraciones diferentes, así que tómalo como orientación.
En coste por tarea, la cosa se da la vuelta: Opus 5.5 en max cuesta 5,98 dólares por tarea del índice; Sol en max, 1,06. Casi seis veces menos. Opus 5.5 gasta muchos más tokens de salida, y ya vimos en su análisis que en max ronda los 119.000 tokens por tarea.
Opus 5.5 en medium, su nivel por defecto, saca 51,2 puntos a 1,34 dólares por tarea. Es decir: por un 26 % más que Sol en max, tienes un modelo que puntúa casi cuatro puntos por encima. Si tu criterio es “calidad por dólar” y no “dólar a secas”, el cara a cara está mucho más apretado de lo que sugiere la tabla de precios.
🔑 Sol no gana a Opus 5.5 en calidad. Gana en volumen: cuando la tarea se repite cientos de veces al día, la diferencia de precio de salida acaba pesando más que los puntos del índice.
GPT-6 Sol vs Claude Sonnet 5: mismo precio, otra generación ¶
Esta comparación la va a buscar mucha gente, porque cuestan lo mismo: $2/$10. Y aquí toca ser honesto: no hay datos comparables directos todavía.
Sonnet 5 salió el 30 de junio y sus benchmarks se publicaron contra Opus 4.8, con versiones de evaluaciones que ya no son las actuales (Terminal-Bench 2.1 frente al 4.0 de hoy, por ejemplo). En aquel análisis de Sonnet 5 lo vimos brillar como ejecutor barato dentro del patrón “planifica con Opus, ejecuta con Sonnet”. Ahora Sol llega al mismo precio con tres meses más de entrenamiento encima.
Lo que sí se puede decir con datos:
- A igualdad de precio, Sol es el modelo más reciente, con caché al 90 % y un nivel
nonede razonamiento para tareas triviales. - Sonnet 5 sigue siendo la pieza natural si ya vives en Claude Code y usas Opus 5.5 como planificador: mismo ecosistema, mismo formato de herramientas, sin traducir entre proveedores.
- En reviews de la generación anterior, varios testers destacaban que Sonnet 5 escribía comentarios de revisión más limpios que GPT-5.6 Sol. Habrá que ver si eso se mantiene frente al nuevo Sol.
Mi recomendación hasta que haya un cara a cara independiente: no cambies de ecosistema por esta comparación. Si ya estás en Claude, Sonnet 5 sigue teniendo sentido como ejecutor. Si estás en Codex, Sol es un paso adelante clarísimo sobre lo que tenías.
GPT-6 Sol vs GPT-6 Astra: el hermano mayor ¶
Astra salió el 3 de septiembre y sigue siendo el modelo más capaz de OpenAI. La distancia con Sol se nota justo donde Astra fue diseñado para brillar:
| Dimensión | GPT-6 Sol | GPT-6 Astra |
|---|---|---|
| Precio entrada / salida | $2 / $10 | $10 / $50 |
| OSWorld 2.0 offline | 60,5 % (xhigh) | 72,6 % |
| AutomationBench | 33,2 % (xhigh) | 41,4 % |
| Posición oficial | Coding y agentes diario | Razonamiento profundo y tareas largas |
En computer use y automatización de principio a fin, Astra saca 8 a 12 puntos. Cuesta cinco veces más por token, aunque gasta muchos menos tokens por tarea (unos 27.000 de salida en max, según Artificial Analysis).
OpenAI dice haber trasladado a Sol y Luna parte del estilo de colaboración de Astra: menos jerga, menos detalles de relleno, respuestas algo más cortas, menos conclusiones precipitadas y, sobre todo, indicar mejor qué ha comprobado y qué no. Ese último punto vale mucho en un agente de programación. Un modelo que dice “he ejecutado los tests” sin haberlo hecho es peor que uno que se equivoca.
Pero ojo con la otra cara. La propia guía de OpenAI para GPT-6 reconoce que la familia puede ser muy insistente con la verificación y los tests. Con Astra ya hubo quejas de tareas pequeñas que acababan en baterías de tests enormes y en cuota quemada. OpenAI incluso sugiere prompts para evitar que una tarea mínima dispare una verificación desproporcionada.
La pregunta que queda abierta es si Sol mantiene el rigor de Astra sin su tendencia a sobredimensionar.
Luna puede ser el tapado de este lanzamiento ¶
Sol se va a llevar los titulares, pero Luna es el que más me interesa para arquitecturas de agentes.
10 céntimos por millón de entrada. 50 por millón de salida. Un céntimo la lectura de caché.
Y con esos precios, OpenAI afirma que Luna en max llega al 66,6 % en DeepSWE 1.1, con un coste por tarea un 93 % menor que la configuración de Opus 5 con la que se compara y un 96 % menor que Fable 5. También dice que Luna en max supera a GPT-5.6 Sol en medium en OSWorld 2.0 a una décima parte del coste. Recuerda que GPT-5.6 Sol era el buque insignia de OpenAI hace dos meses y medio.
Esas cifras son de OpenAI y hay que verlas confirmadas. Pero aunque se queden un poco por debajo en uso real, el caso de uso es evidente:
- Explorar el repositorio y buscar archivos relevantes.
- Clasificar issues, logs o tickets.
- Preparar contexto para el modelo que va a implementar.
- Ejecutar subtareas muy acotadas: renombrar, extraer, resumir un diff.
- Hacer de “router” que decide qué modelo atiende cada petición.
Para cualquiera de esas tareas, pagar Sol u Opus es tirar dinero. Si ya trabajas con subagentes, Luna es el candidato obvio para los que hacen el trabajo de exploración.
Un apunte práctico de la documentación: en Chat Completions, Sol y Luna solo admiten llamadas a funciones con reasoning_effort en none. Si tu agente necesita herramientas y razonamiento a la vez, tienes que pasar por la Responses API. Si montas subagentes sobre Chat Completions, te vas a encontrar este muro.
La arquitectura por capas que se está dibujando ¶
Si juntas todo lo anterior, el patrón que proponen tanto AWS en su guía para Bedrock como buena parte de la comunidad es el mismo:
- Luna para el enrutado y las tareas focalizadas: explorar, clasificar, preparar contexto.
- Sol para la investigación compleja y la implementación.
- Astra u Opus 5.5 solo cuando hace falta el razonamiento más profundo: planificar, decidir arquitectura, desatascar.
En r/singularity ya hay quien propone la versión mixta: Opus 5.5 o Astra como planificador y orquestador, Sol como implementador y subagentes. Tiene todo el sentido económico. El modelo caro piensa una vez, el barato ejecuta muchas.
Es el mismo patrón que ya contamos con Sonnet 5 y Opus, y el que lleva tiempo funcionando en harness bien diseñados. Lo que cambia hoy es que el escalón barato ha bajado tanto de precio que ya no tiene sentido dejar tareas triviales en manos del modelo grande.
AWS describe el bucle de Sol de una forma que encaja con este reparto: investigar, implementar, probar y validar, manteniendo el contexto y explicando qué verificó y qué no pudo verificar. Si esa última parte se cumple en uso real, es lo que te permite dejar al implementador trabajar sin mirar cada paso.
Arquitectura de agentes por capas
Luna explora, Sol implementa, Opus decide: cómo montar las capas
Con modelos a 10 céntimos el millón, repartir el trabajo entre capas deja de ser optimización y pasa a ser la forma normal de construir agentes. En esta masterclass ves cómo separar orquestador, ejecutores y herramientas, y cómo pasar contexto entre ellos sin que el agente pierda el hilo.
Ver la masterclass →Masterclass · arquitectura, capas y orquestación
Steering a mitad de turno y herramientas asíncronas ¶
Hay dos capacidades de la familia GPT-6 que me parecen más relevantes para quien construye agentes que cualquier punto extra en un benchmark.
Mid-turn steering. Puedes cambiar los requisitos mientras el modelo está trabajando. No tienes que esperar a que termine para decirle “no, eso no, mejor así”. En sesiones largas de Codex, donde un agente puede pasar muchos minutos en una tarea, esto ahorra vueltas completas.
Llamadas a herramientas asíncronas. El modelo puede seguir razonando o avanzar trabajo independiente mientras espera la respuesta de una herramienta. Un agente que lanza una batería de tests y, mientras tanto, revisa otro archivo, en vez de quedarse mirando la pantalla.
Si las juntas con que cambiar el nivel de razonamiento ya no rompe la caché, tienes un agente al que puedes subir o bajar de marcha a mitad de tarea sin pagar el contexto otra vez. Eso cambia cómo diseñas el bucle del agente, no solo lo que pagas.
Lo que dice la comunidad en las primeras horas ¶
Tómalo con pinzas: la gente lleva horas usándolo, y en los primeros días de un lanzamiento hay tanto entusiasmo como fallos de despliegue.
La reacción dominante en r/codex no es “esto es muchísimo más inteligente”. Es “el salto está en el precio”. Uno de los comentarios más votados en el hilo principal lo resume así: la mejora de rendimiento parece marginal y el peso está en el mejor precio.
Hay tres corrientes claras:
- Los pragmáticos. Algunos desarrolladores ven a Sol en
mediumsuficiente para sustituir configuraciones mucho más caras de GPT-5.6 Sol. Si se confirma, eso importa más en el día a día que subir el techo. - Los escépticos. Un hilo titulado sin rodeos “GPT-6 Sol seems underwhelming” apunta a que Sol en
maxqueda a la altura de Astra enmediumen varias pruebas, y se pregunta si el ahorro por tarea será tan grande cuando se cuenta todo el razonamiento que consume. - Los del volumen. Varios usuarios señalan a Luna como la verdadera noticia para automatización.
Y un aviso práctico: durante las primeras horas ha habido modelos que aparecían y desaparecían del selector y errores de “model is not supported”. No saques conclusiones del selector de Codex esta noche.
Cada semana hay modelo nuevo, rebaja nueva y benchmark nuevo firmado por quien lo vende. Cada domingo seleccionamos 12 recursos para que sepas cuáles importan para tu trabajo y cuáles son ruido de lanzamiento. Ya somos +7.200 developers, gratis desde 2018.
Quiero esa dinamita 🧨Dónde puedes usar Sol y Luna hoy ¶
El despliegue es gradual a lo largo del día, así que es posible que no los veas todavía. Según el anuncio oficial:
| Dónde | Qué modelos | Quién |
|---|---|---|
| ChatGPT Work y Codex | Sol y Luna | Plus, Pro, Business, Enterprise y Edu |
| App de escritorio | Luna | Free y Go |
| API de OpenAI | gpt-6-sol, gpt-6-luna |
Todos (Batch y Flex a mitad de precio) |
| GitHub Copilot | Sol y Luna | Según plan de Copilot |
| Amazon Bedrock | Sol y Luna | Según guía publicada por AWS |
Un detalle que ha pillado a más de uno: no están disponibles como modelos seleccionables en el chat normal de ChatGPT, solo en ChatGPT Work y Codex. GitHub los describe en su changelog como Sol, el modelo equilibrado para coding interactivo y agéntico, y Luna, la opción ligera y económica.
Qué modelo usar para cada tarea ¶
Con lo que hay hoy, esta es mi lectura provisional:
| Tarea | Mi primera opción | Alternativa |
|---|---|---|
| Explorar repo, clasificar, preparar contexto | GPT-6 Luna | Sonnet 5 si vives en Claude |
| Implementar features con specs claras | GPT-6 Sol (medium/high) |
Sonnet 5 |
| Agente que trabaja horas con mucho contexto repetido | GPT-6 Sol, por coste y caché | Opus 5.5 en medium |
| Planificar, decidir arquitectura, desatascar | Opus 5.5 | GPT-6 Astra |
| Computer use y automatización de principio a fin | GPT-6 Astra | Opus 5.5 |
| Tareas muy difíciles donde el techo manda | Opus 5.5 o Fable 5.1 | GPT-6 Astra |
La fila que más me importa es la tercera. Para un agente que trabaja durante horas, la combinación de precio de salida bajo, caché al 90 % y cambio de razonamiento sin perder caché hace de Sol el candidato natural. Si quieres la foto completa de todos los modelos, la tienes en la comparativa de modelos para programar.
🛡️ Más barato también significa que vas a dejar trabajar más al agente. Antes de soltarlo con Sol durante horas, asegúrate de tener permisos por capas, entornos aislados y evidencia de que los tests se ejecutaron de verdad. Que el modelo diga mejor lo que verificó no sustituye a que lo compruebes tú.
Lo que todavía no sabemos ¶
Hay una pregunta que esta noche no se puede responder: ¿necesita GPT-6 Sol menos iteraciones que GPT-5.6 Sol en repos reales?
Si la respuesta es sí, el ahorro real será brutal: mitad de precio por token y menos vueltas por tarea. Si consume más razonamiento y más reintentos, parte del 50 % se evapora por el camino.
Faltan las reviews que de verdad importan: Simon Willison y los evaluadores que prueban con calma, pruebas controladas de coding, Artificial Analysis con todas las configuraciones de Luna, benchmarks de velocidad y, sobre todo, gente que haya tenido a Sol varias horas contra un repositorio de verdad. Eso llegará en las próximas 24 a 48 horas.
Mientras tanto, lo que yo haría es lo de siempre: coger cinco tareas reales de tu repositorio, ejecutarlas con Sol en medium y con tu modelo actual, y comparar resultado, tokens y dinero. En una tarde sabes más que con todos los benchmarks de hoy juntos.
GPT-6 Sol y Luna en una frase ¶
No es otro “momento Astra”: Sol y Luna son la generación GPT-6 a mitad de precio, con mejoras modestas en inteligencia, una caché mucho más útil para agentes y un reparto claro de papeles (Astra piensa, Sol trabaja, Luna hace el volumen) que por fin hace barato montar agentes por capas.
TL;DR ¶
- 🌞 GPT-6 Sol ($2/$10) es el modelo de trabajo diario de OpenAI para coding y agentes. GPT-6 Luna ($0,10/$0,50) es el de volumen. No existe un “GPT-6” a secas y Terra desaparece.
- 💸 La rebaja del 50 % es frente a los precios ya recortados de GPT-5.6. Sol cuesta lo mismo que Sonnet 5 y lee caché al mismo precio que Opus 5.5.
- 📊 Artificial Analysis enfría el entusiasmo: Sol en
maxsaca 47,5 frente a 58 de Opus 5.5, pero cuesta 1,06 dólares por tarea frente a 5,98. Opus 5.5 enmedium(51,2 a 1,34 dólares) es la comparación más justa. - 🧠 Frente a GPT-5.6 Sol, más barato pero no más listo: +2 puntos en el Coding Agent Index y algo por debajo en el techo de DeepSWE y OSWorld.
- 🌙 Luna es el tapado: 66,6 % en DeepSWE según OpenAI, un céntimo la lectura de caché y el candidato natural para subagentes. Caché al 90 %, steering a mitad de turno y herramientas asíncronas completan el paquete.
Preguntas frecuentes ¶
¿Qué es GPT-6 Sol? ¶
GPT-6 Sol es el modelo de OpenAI para programación compleja y flujos agénticos dentro de la familia GPT-6, lanzado el 22 de septiembre de 2026. Cuesta 2 dólares por millón de tokens de entrada y 10 de salida, tiene 1,05 millones de tokens de contexto y 128.000 de salida máxima, y se usa en la API como gpt-6-sol.
¿Qué diferencia hay entre GPT-6 Sol y GPT-6 Luna? ¶
Sol es el modelo de trabajo diario para coding y agentes; Luna es la opción ligera para clasificación, extracción, tareas repetitivas y subagentes. Luna cuesta 20 veces menos (0,10 dólares de entrada y 0,50 de salida por millón) y comparte contexto, salida máxima y niveles de razonamiento con Sol.
¿Existe un modelo llamado GPT-6? ¶
No en la API. GPT-6 es la familia formada por Astra, Sol y Luna. Algunos usuarios han visto la etiqueta “GPT-6” en Codex durante el despliegue, pero los identificadores oficiales son gpt-6-sol y gpt-6-luna.
¿Es verdad que GPT-6 Sol cuesta la mitad que GPT-5.6 Sol? ¶
Sí frente al precio que tenía GPT-5.6 Sol justo antes del lanzamiento ($4/$20, una tarifa ya rebajada). Frente al precio de lanzamiento de GPT-5.6 Sol ($5/$30), GPT-6 Sol es un 60 % más barato en entrada y un 67 % en salida. Artificial Analysis mide un coste por tarea de 1,06 dólares frente a 1,99.
¿GPT-6 Sol es mejor que GPT-5.6 Sol? ¶
Es algo mejor en la media y mucho más barato, pero no en todo. Artificial Analysis le da 2 puntos más en su Coding Agent Index (57 frente a 55), mientras que en el techo de DeepSWE y en OSWorld 2.0 queda por debajo del mejor ajuste de GPT-5.6 Sol.
¿Qué es mejor, GPT-6 Sol o Claude Opus 5.5? ¶
Opus 5.5 tiene más techo: lidera el Intelligence Index de Artificial Analysis con 58 frente a 47,5 de Sol y va unos 5 puntos por delante en FrontierCode. Sol es mucho más barato: cuesta la mitad por token y, en max, casi seis veces menos por tarea (1,06 frente a 5,98 dólares). Para planificar, Opus 5.5; para ejecutar en volumen, Sol.
¿GPT-6 Sol o Claude Sonnet 5? ¶
Cuestan lo mismo, 2 dólares de entrada y 10 de salida por millón, pero todavía no hay benchmarks independientes que los enfrenten directamente. Sol es más reciente y trae la caché mejorada de GPT-6; Sonnet 5 sigue siendo la opción natural si ya trabajas en Claude Code con Opus 5.5 como planificador.
¿Para qué sirve GPT-6 Luna? ¶
Para tareas de mucho volumen y poca complejidad: explorar repositorios, clasificar, extraer datos, preparar contexto o actuar como subagente barato. OpenAI afirma que llega al 66,6 % en DeepSWE 1.1 en max y que supera a GPT-5.6 Sol en medium en OSWorld 2.0 a una décima parte del coste.
¿Qué cambia en la caché de GPT-6? ¶
Las lecturas cacheadas tienen un 90 % de descuento (0,20 dólares por millón en Sol, 0,01 en Luna), cambiar el nivel de razonamiento o activar herramientas ya no invalida la caché, se pueden marcar breakpoints explícitos y hay un dashboard con diagnóstico de aciertos. Para agentes con mucho contexto repetido es la mejora que más baja la factura.
¿Dónde puedo usar GPT-6 Sol y Luna? ¶
En ChatGPT Work y Codex para planes Plus, Pro, Business, Enterprise y Edu; Luna en la app de escritorio para Free y Go; en la API como gpt-6-sol y gpt-6-luna; y en GitHub Copilot. No aparecen como modelos seleccionables en el chat normal de ChatGPT, y el despliegue es gradual.
Fuentes ¶
- OpenAI, “Introducing GPT-6 Sol and Luna”
- OpenAI API, documentación de modelos
- OpenAI API, guía de uso de GPT-6
- GitHub Changelog, “OpenAI’s GPT-6 Sol and GPT-6 Luna now available”
- AWS, “Bring more intelligence to everyday work with GPT-6 Sol and GPT-6 Luna on Amazon Bedrock”
- TechCrunch, “OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes”
- The Decoder, “OpenAI’s GPT-6 Sol and Luna cut prices in half but barely move the needle on performance”
- VentureBeat, “OpenAI releases GPT-6 Sol and Luna models, slashing API costs 50% or more”
- Office Chai, “GPT 6 Sol shows modest gain over GPT 5.6 Sol on Artificial Analysis Intelligence Index”
- OpenAI Developer Community, “20% price reduction for GPT 5.6 Sol”
- r/codex, “Gpt 6 sol and luna”
- r/codex, “Gpt-6 Sol seems underwhelming…”
- r/singularity, “Introducing GPT-6 Sol and Luna”
- r/OpenAI, “Opus 5.5 and GPT-6 Sol dropped on the same day, so I lined up every benchmark I could find”
- Claude Opus 5.5 vs GPT-6 Astra — Web Reactiva
- GPT-6 Astra: qué cambia frente a Sol, Fable 5.1 y Opus 5 — Web Reactiva
- GPT-5.6 Sol, Terra y Luna: precios, modos y cuál usar — Web Reactiva
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.