GPT-6.1 Sol: benchmarks, precio y si Astra aún compensa
Hace siete días OpenAI lanzó GPT-6 Sol y Luna. Hoy, 29 de septiembre de 2026, en el escenario del DevDay, ha sustituido a Sol por GPT-6.1 Sol. Una semana. Hay modelos que duran menos en producción que un yogur en la nevera.
La frase con la que lo venden es corta: “casi la inteligencia de Astra por una quinta parte del precio”. Y esta vez las primeras mediciones independientes no la desmienten del todo: Artificial Analysis lo deja a un punto de GPT-6 Astra en su índice.
Pero el contexto importa. Ayer, OpenAI canceló GPT-6.1 Astra porque en sus pruebas internas mentía más sobre lo que había hecho. Así que el “6.1” que ha llegado es el pequeño, y el grande se ha quedado en el cajón.
Lo que vas a encontrar aquí:
- Qué cambia de verdad entre GPT-6 Sol y GPT-6.1 Sol (spoiler: el precio por token no, la caché sí).
- Los benchmarks de OpenAI frente a los de Artificial Analysis, con el coste por tarea al lado.
- Si todavía tiene sentido pagar GPT-6 Astra, y cómo queda frente a Claude Opus 5.5 y Sonnet 5.5.
- Por qué se ha caído GPT-6.1 Astra y qué te dice eso sobre Sol.
- Qué tienes que tocar en tu código para migrar sin sorpresas, y cuándo compensa el nuevo modo Ultrafast.
¿Qué es GPT-6.1 Sol y qué cambia frente a GPT-6 Sol? ¶
GPT-6.1 Sol es una actualización del modelo intermedio de la familia GPT-6, con el mismo precio por token que GPT-6 Sol y mejoras en programación agéntica, computer use y trabajo profesional. En la API se llama gpt-6.1-sol y ya está disponible desde hoy.
La familia sigue teniendo los mismos papeles que contamos la semana pasada: Astra arriba, para lo más difícil; Sol como caballo de batalla para programar y agentes; Luna abajo, para volumen y subagentes baratos. Lo que cambia es que el caballo de batalla ahora pisa los talones al de arriba.
| Característica | GPT-6 Sol | GPT-6.1 Sol |
|---|---|---|
| ID en la API | gpt-6-sol |
gpt-6.1-sol |
| Entrada / salida (1M) | $2 / $10 | $2 / $10 |
| Lectura de caché (1M) | $0,20 | $0,10 |
| Contexto / salida máxima | 1,05M / 128K | 1,05M / 128K |
| Corte de conocimiento | — | 30 de abril de 2026 |
| Niveles de razonamiento | none, low, medium, high, xhigh, max |
low, medium, high, xhigh, max |
Fuentes: documentación de modelos de OpenAI, anuncio oficial y cobertura de TechCrunch y The Next Web.
Tres cosas de esta tabla que no deberías pasar por alto:
- El precio por token no baja. Quien espere otra rebaja del 50 % como la de la semana pasada se va a llevar un chasco. La novedad económica está en la caché.
- La lectura de caché cae a la mitad, a 10 céntimos el millón. Eso es un 95 % de descuento sobre la entrada estándar, frente al 90 % de GPT-6 Sol.
- Desaparece el nivel
none(yminimal). El mínimo ahora eslowy el valor por defecto esmedium. Si tu código mandabanonepara tareas triviales, lo vas a tener que cambiar. Lo vemos más abajo.
Es texto e imagen de entrada, texto de salida, y el mismo millón largo de contexto. Nada nuevo en la ficha técnica. Lo nuevo está en los benchmarks y en la factura.
¿Cuánto cuesta GPT-6.1 Sol y dónde está la letra pequeña? ¶
GPT-6.1 Sol cuesta 2 dólares por millón de tokens de entrada, 10 céntimos por millón de entrada cacheada y 10 dólares por millón de salida. Es la quinta parte de lo que cuesta GPT-6 Astra por token ($10/$50), y la mitad que Claude Opus 5.5 ($4/$20).
Hasta aquí la parte bonita. La letra pequeña tiene tres renglones.
Primero: el recargo por contexto largo. Si una petición pasa de 272.000 tokens de entrada, toda la petición (no solo el exceso) se cobra con tarifa de contexto largo: el doble en entrada y caché, y 1,5 veces en salida. Una petición de 300.000 tokens paga los 300.000 a precio largo. Si tu agente arrastra repositorios enteros al contexto, esto se come parte de la ventaja.
Segundo: Batch y Flex siguen a mitad de precio. Para trabajos que no necesitan respuesta inmediata (evaluaciones, clasificación masiva, generación de documentación en lote) sigue siendo la palanca de ahorro más gorda que tienes.
Tercero: GPT-6.1 Sol gasta más tokens de salida que su antecesor. Según Artificial Analysis, entre un 10 % y un 30 % más según el nivel de razonamiento. Y la salida es la parte cara.
¿Cómo queda eso en una tarea real de agente? Vamos con el mismo ejemplo que usamos en el post de Sol y Luna: 2 millones de tokens de entrada, el 90 % servidos desde caché, y 50.000 tokens de salida.
| Modelo | Entrada sin caché | Entrada cacheada | Salida | Total aprox. |
|---|---|---|---|---|
| GPT-6 Sol | $0,40 | $0,36 | $0,50 | ~$1,26 |
| GPT-6.1 Sol (misma salida) | $0,40 | $0,18 | $0,50 | ~$1,08 |
| GPT-6.1 Sol (+10–30 % de salida) | $0,40 | $0,18 | $0,55–$0,65 | ~$1,13–$1,23 |
| Claude Opus 5.5 | $0,80 | $0,36 | $1,00 | ~$2,16 |
Cálculo propio con precios oficiales, sin contar escrituras en caché. Es un ejemplo, no una medición.
¿Ves lo que pasa? Lo que ahorras en caché lo puedes perder en salida. En el peor caso, la factura por tarea se queda casi igual que con GPT-6 Sol. Lo que sí cambia es lo que obtienes por ese dinero, y ahí van los benchmarks.
💡 Con buena caché, en un agente la salida pasa a ser el grueso del coste. Por eso “cuánto cuesta el token” dice poco y “cuánto cuesta la tarea terminada” lo dice casi todo.
Herramienta gratis · Calculadora
¿Te ahorra algo la caché a 0,10$ o se lo come la salida?
El ejemplo de arriba es una tarea inventada. Tu agente reenvía otro contexto, da otro número de pasos y genera otra cantidad de salida: mételos y mira si GPT-6.1 Sol te sale más barato que lo que usas hoy.
Le das
Los pasos y el contexto de tu agente
Te devuelve
Lo que cuesta una ejecución y lo que cuesta el mes
¿Qué dicen los benchmarks oficiales de GPT-6.1 Sol? ¶
Según OpenAI, GPT-6.1 Sol iguala a GPT-6 Astra en programación agéntica y se queda a unos 2 puntos en computer use, con un coste por tarea entre 4 y 7 veces menor. Son cifras del propio laboratorio, así que tómalas como la versión del fabricante.
| Evaluación (OpenAI) | GPT-6.1 Sol | GPT-6 Sol | GPT-5.6 Sol | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 75,2 % (high) | 68,8 % | 72,7 % | 74,1 % | — |
| OSWorld 2.0 offline | 71,4 % (max) | 64,4 % | 65,7 % | 73,5 % | — |
| Terminal-Bench Science 0.1 (max) | 57,0 % · $5,47 | menos de la mitad | — | 68,1 % · $23,80 | 63,3 % · $23,21 |
| AutomationBench (max) | 36,1 % | — | — | — | 42,5 % (con fallbacks) |
Fuentes: anuncio de OpenAI recogido por Vellum, The Decoder, Kingy AI y The D*AI*LY Brief. Los importes son coste medio por tarea.
DeepSWE v1.1 es el titular: 75,2 % en high, 6,4 puntos por encima de GPT-6 Sol y un punto por encima de Astra. Este benchmark mide tareas complejas de ingeniería en repositorios reales, que es justo lo que le pides a un agente como Codex. Recuerda que la semana pasada GPT-6 Sol quedaba por debajo de GPT-5.6 Sol en el techo de DeepSWE. Esa espina está sacada: 6.1 supera a los dos.
En OSWorld 2.0 (usar un ordenador como lo haría una persona) sube 7 puntos sobre GPT-6 Sol y se queda a 2,1 de Astra, con un coste por tarea que OpenAI sitúa en torno a una séptima parte.
Terminal-Bench Science es donde se ve el techo. Sol más que duplica la nota de GPT-6 Sol, pero Astra (68,1 %) y Opus 5.5 (63,3 %) siguen por delante. Eso sí: ellos cuestan más de 23 dólares por tarea, y Sol, 5,47. OpenAI sigue recomendando Astra para la investigación científica más dura.
AutomationBench tiene doble lectura. En medium, Sol supera a Opus 5.5 por 2,2 puntos costando un tercio. En max, Opus 5.5 con fallbacks le saca 6,4 puntos. Depende de dónde te sientes a mirar la tabla.
Y fuera del código, OpenAI habla de mejoras de 4 y 5 puntos en AA-Briefcase y GDPval-AA, dos pruebas de trabajo de oficina con agentes que forman parte del índice de Artificial Analysis.
Antes de elegir modelo, elige agente y presupuesto
Si tanta tabla te ha dejado con la duda de por dónde empezar, en este curso-juego hay una parada para el presupuesto (gratis, API o suscripción) y otra para elegir agente entre Codex, Claude Code u OpenCode. Sales con una checklist hecha a tu medida.
Entra en el curso gratis →¿Qué dicen las mediciones independientes? ¶
Artificial Analysis coloca a GPT-6.1 Sol en 52 puntos de su Intelligence Index: 4 más que GPT-6 Sol, 5 más que GPT-5.6 Sol y 1 por debajo de GPT-6 Astra. Es la primera medición de terceros y, esta vez, respalda bastante el discurso de OpenAI.
El resumen que publicaron al poco del anuncio no deja mucho margen: “GPT-6.1 Sol reemplaza a GPT-6 Sol tras solo 7 días. Puntúa 1 punto por debajo de GPT-6 Astra en el Intelligence Index a menos de una cuarta parte del coste por tarea”.
Los datos de su ficha:
| Métrica (Artificial Analysis) | GPT-6.1 Sol (max) | Referencia |
|---|---|---|
| Intelligence Index | 52 | GPT-6 Sol: 48 · GPT-6 Astra: 53 |
| Coste medio por tarea del índice | $0,72 | Astra: más de 4 veces más |
| Tokens generados en todo el índice | 67M | Mediana de modelos comparables: 82M |
| Tasa de alucinación (AA-Omniscience) | 54,3 % | GPT-6 Sol: 60,1 % |
Fuente: ficha de GPT-6.1 Sol en Artificial Analysis y resumen publicado por AA en X.
Dos matices que conviene tener delante.
El primero: “conciso” es relativo. Con 67 millones de tokens para todo el índice está por debajo de la mediana, pero gasta entre un 10 y un 30 % más que GPT-6 Sol. Es más listo en parte porque piensa más.
El segundo: la tasa de alucinación sigue alta. AA-Omniscience mide cuántas veces un modelo se inventa una respuesta en vez de reconocer que no la sabe. Bajar del 60 % al 54 % es progreso, pero más de la mitad de las veces que no sabe algo, prefiere inventar. En un agente con acceso a tu repositorio, eso se traduce en verificar, verificar y verificar.
Frente a los rivales de Anthropic, la foto del índice queda así: Opus 5.5 en 58, Sonnet 5.5 en 56, Astra en 53 y GPT-6.1 Sol en 52. En inteligencia bruta, Sol sigue por detrás de los dos Claude. En coste por tarea, por delante de los tres.
🔑 Un punto por debajo de Astra en el índice no significa “igual que Astra en todo”. Significa que en la media de diez pruebas distintas están muy cerca. En tu tarea concreta la distancia puede ser cero o puede ser diez puntos.
¿Qué dicen los developers en Hacker News y en blogs? ¶
La primera reacción ha sido de interés por el precio y desconfianza por la memoria de la semana pasada. El hilo del lanzamiento en Hacker News pasó de 260 puntos en su primera hora, y el tono se parece mucho al que tuvo Sol hace siete días.
Tres corrientes que se repiten en los comentarios:
- La caché es lo que más gusta. Un comentario muy citado lo resume así: con la caché a la mitad que en GPT-6 Sol, “vas a sacar muchísimo más recorrido a Codex”. Para quien trabaja con límites de uso, esto se nota antes que cualquier benchmark.
- La resaca de GPT-6 Sol. Buena parte de la conversación va sobre el modelo que se sustituye, y no para bien. Varios developers cuentan que GPT-6 Sol les rendía peor que GPT-5.6 Sol en el día a día; uno lo llama “mucho peor” y otro habla de refactorizaciones sencillas que salían degradadas. Si 6.1 corrige eso, bienvenido. Si no, la gente ya viene con la mosca detrás de la oreja.
- “Iguala a Astra” solo en una gráfica. Otro usuario señala que la tabla de DeepSWE respalda el titular, pero que el resto de gráficas del propio anuncio dejan a Sol entre 1 y 11 puntos por detrás de Astra. Es una lectura justa: el “casi Astra” depende mucho de qué benchmark mires.
Simon Willison le ha pasado su prueba de siempre, el pelícano en bicicleta en SVG. Su veredicto sobre el de GPT-6.1 Sol: un cuello demasiado grueso y un “cuadro de bicicleta hecho basura”. Él mismo lo llama “el más tonto de todos los benchmarks”, pero tiene la costumbre de pillar cosas que las evaluaciones serias no ven. En su crónica del DevDay añade una lectura de fondo interesante: estas bajadas de precio no las atribuye a la generosidad de los laboratorios estadounidenses, sino a la investigación de optimización que publican laboratorios chinos como DeepSeek, que según él acaba acelerando las GPU de todos al mes de salir.
Y hay un dato que choca con Artificial Analysis. GitHub asegura en su changelog que, en sus pruebas iniciales con Copilot, GPT-6.1 Sol completó tareas con bastantes menos tokens y pasos que los modelos anteriores de GPT-6 y GPT-5.6. AA mide lo contrario en su índice: entre un 10 y un 30 % más de salida que GPT-6 Sol. Lo más probable es que las dos cosas sean ciertas a la vez: más razonamiento por paso, pero menos pasos por tarea en un harness de agente. En tu factura manda la segunda.
💡 Cuando dos mediciones serias se contradicen, casi siempre están midiendo cosas distintas. Un índice de preguntas sueltas no se parece a un agente que da veinte vueltas sobre tu repositorio.
GPT-6.1 Sol vs GPT-6 Astra: ¿sigue compensando pagar el grande? ¶
Para la mayoría de tareas de programación con agentes, no. GPT-6.1 Sol iguala o supera a Astra en DeepSWE y se queda a 1–2 puntos en OSWorld y en el índice de Artificial Analysis, costando una quinta parte por token y menos de una cuarta parte por tarea.
Astra salió el 3 de septiembre como el modelo más capaz de OpenAI. Cuatro semanas después, su hermano pequeño le ha quitado casi todos los argumentos de precio.
| Dimensión | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| Precio entrada / salida | $2 / $10 | $10 / $50 |
| DeepSWE v1.1 | 75,2 % | 74,1 % |
| OSWorld 2.0 offline | 71,4 % | 73,5 % |
| Terminal-Bench Science 0.1 | 57,0 % · $5,47/tarea | 68,1 % · $23,80/tarea |
| Intelligence Index (AA) | 52 | 53 |
| Dónde brilla | Programar, agentes, volumen | Ciencia, razonamiento muy largo |
Fuentes: OpenAI y Artificial Analysis.
¿Dónde sigue teniendo sentido Astra? En tres sitios:
- Investigación científica y razonamiento muy profundo, donde los 11 puntos de Terminal-Bench Science son una distancia real.
- Tareas muy largas en las que un fallo sale caro: migraciones grandes, decisiones de arquitectura, planes que luego ejecutarán otros modelos.
- Como planificador u orquestador, pensando una vez para que Sol ejecute muchas.
Para el resto: si pagas Astra para escribir código en el día a día, estás pagando un 400 % más por un punto de índice. El patrón por capas que contamos en el post de Sol y Luna sigue en pie, pero la capa de arriba se estrecha.
¿Por qué OpenAI ha cancelado GPT-6.1 Astra? ¶
Porque en las pruebas internas GPT-6.1 Astra mostraba más engaño que GPT-6 Astra sobre las acciones que había hecho o dejado de hacer, y tendía a seguir adelante con tareas sin pedir permiso al usuario. OpenAI tenía previsto lanzarlo en octubre y lo ha retirado un día antes del DevDay.
La noticia la adelantó el Wall Street Journal el 28 de septiembre y luego la confirmó OpenAI. Saachi Jain, responsable de sistemas de seguridad de la compañía, describió dos problemas:
- Más engaño sobre sus propias acciones: decía haber hecho cosas que no había hecho, o al revés.
- Problemas de “alcance autorizado”: avanzaba en la tarea sin pedir permiso y, a veces, echaba mano de herramientas y servicios externos aunque no fuera seguro.
Si trabajas con agentes, esos dos fallos te suenan. Son los que convierten un agente útil en uno peligroso: el que dice “tests pasados” sin haberlos ejecutado, o el que decide por su cuenta hacer un git push --force porque “era lo más rápido”. Con un modelo que se equivoca pierdes una tarde. Con uno que te dice que ha acertado sin hacerlo, acabas revisando todo lo que entrega.
¿Y Sol? OpenAI insiste en que 6.1 Sol va en la dirección contraria. Según su system card:
- En respuestas con razonamiento
low, la proporción con algún error factual baja del 11,4 % al 7,7 %, una reducción de alrededor de un tercio. - En pruebas donde se estropea a propósito la búsqueda o una API, GPT-6 Sol no avisaba al usuario en el 4,9 % de los casos; GPT-6.1 Sol, en el 2,1 %.
- Ante restricciones explícitas, como un mensaje de acceso denegado, GPT-6.1 Sol intentó saltárselas en el 23,5 % de los casos. Es muchísimo mejor que el 64,4 % de GPT-6 Sol, pero peor que el 17,4 % de GPT-6 Astra.
- Igual que Astra y GPT-6 Sol, no hizo ningún intento de esquivar el monitor que vigila su razonamiento y sus acciones.
- Es más claro sobre sus limitaciones y respeta mejor la intención del usuario y las restricciones de seguridad.
La propia OpenAI añade la letra pequeña: el conjunto de prueba de errores factuales está formado por conversaciones elegidas porque un modelo anterior se equivocó en ellas, así que las tasas absolutas no representan el uso normal. Y las pruebas de comportamiento cubren sobre todo situaciones de bajo riesgo y se ejecutan sin todas las salvaguardas de sus productos.
⚠️ Casi una de cada cuatro veces que se encuentra un “acceso denegado”, GPT-6.1 Sol intenta buscarle la vuelta. Que Astra 6.1 no haya salido es una buena noticia sobre el proceso de OpenAI, pero no garantiza nada sobre Sol en tu entorno. Mantén los permisos por capas, las confirmaciones antes de acciones destructivas y la revisión de lo que el agente dice haber comprobado.
Un modelo que se cancela por mentir sobre lo que ha hecho y otro que sale diciendo que miente menos, todo en dos días. Cada domingo contamos a +7.200 developers lo que vamos aprendiendo al trabajar con agentes de verdad, más 12 recursos elegidos para no perderse con tanto lanzamiento. Gratis, desde 2018.
Quiero esa dinamita 🧨GPT-6.1 Sol vs Claude Opus 5.5 y Sonnet 5.5: ¿cuál elegir? ¶
Opus 5.5 y Sonnet 5.5 siguen por delante en inteligencia bruta; GPT-6.1 Sol gana en coste por tarea terminada. Lo que ha cambiado esta semana es que la distancia en calidad se ha reducido y la de precio se mantiene.
| Dimensión | GPT-6.1 Sol | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|---|
| Precio entrada / salida | $2 / $10 | $2 / $10 | $4 / $20 |
| Lectura de caché (1M) | $0,10 | $0,20 | $0,20 |
| Intelligence Index (AA) | 52 | 56 | 58 |
| Terminal-Bench Science (max) | 57,0 % · $5,47 | — | 63,3 % · $23,21 |
| AutomationBench (medium) | +2,2 pts sobre Opus 5.5, a ~1/3 del coste | — | — |
Fuentes: OpenAI, Anthropic y Artificial Analysis. Las cifras de benchmarks de OpenAI comparan con la configuración de Opus 5.5 que eligió OpenAI.
Contra Opus 5.5 la lectura es la de siempre, con matices nuevos. Opus tiene más techo, sobre todo en construcciones largas y autónomas, y lidera el índice con 6 puntos de ventaja. Pero en Terminal-Bench Science, Sol entrega el 90 % del resultado de Opus por menos de una cuarta parte del coste. Si la tarea se repite cientos de veces al día, esa cuenta pesa.
Contra Sonnet 5.5 la comparación es más interesante, porque cuestan lo mismo por token. Sonnet 5.5 puntúa 4 puntos más en el índice de AA, pero tiende a generar mucha más salida por tarea, y eso encarece la factura final. Además, desde hoy Sol lee de caché a la mitad de precio que Sonnet. Para un agente que reenvía el mismo contexto en cada vuelta, eso se nota.
Mi recomendación práctica no cambia respecto a la semana pasada, solo se refuerza: no cambies de ecosistema por esta comparación. Si vives en Codex, GPT-6.1 Sol es tu nuevo modelo por defecto sin discusión. Si vives en Claude Code, Opus 5.5 para planificar y Sonnet 5.5 para ejecutar sigue siendo una combinación sólida. Y si todavía estás decidiendo, tienes una comparativa más amplia de modelos para programar que te ayuda a poner orden.
¿Qué tienes que cambiar en tu código para migrar a GPT-6.1 Sol? ¶
En la mayoría de casos, solo el nombre del modelo. Pero hay tres detalles que te pueden romper algo o disparar la factura si no los revisas.
El cambio básico, con la Responses API:
from openai import OpenAI
client = OpenAI()
# Antes: model="gpt-6-sol", reasoning={"effort": "none"}
response = client.responses.create(
model="gpt-6.1-sol",
# "none" y "minimal" ya no existen: el mínimo es "low"
reasoning={"effort": "low"},
input="Resume este diff en tres líneas para el changelog.",
)
print(response.output_text)
Los tres puntos que revisar:
- El nivel de razonamiento
noneya no existe. Si lo usabas para tareas triviales (clasificar, extraer un campo, resumir un diff), sube alowo, mejor, mueve esas tareas a GPT-6 Luna, que es donde deberían estar. Y ojo si te apoyabas en Chat Completions: con GPT-6 Sol, las llamadas a funciones ahí solo funcionaban connone. Si ese era tu camino, pasa a la Responses API. - Vigila el tamaño del contexto. Por encima de 272.000 tokens de entrada, toda la petición se cobra con recargo. Si tu harness mete el repositorio entero, compacta o resume antes de llegar ahí.
- Mide la salida. Con un 10–30 % más de tokens de salida por tarea, un agente que ya iba justo de presupuesto puede pasarse. Compara la factura de un día con GPT-6 Sol frente a un día con 6.1 antes de dar el cambio por bueno.
Si usas Codex con tu cuenta de ChatGPT, el cambio llega solo: GPT-6.1 Sol está disponible desde hoy para los planes Plus, Pro, Business, Enterprise y Edu. Asegúrate de tener la CLI actualizada si no te aparece en el selector.
Tu IA puede mentirte
Que tu agente diga que ha pasado los tests no significa que los haya ejecutado
Si OpenAI ha tenido que parar un modelo porque mentía sobre lo que había hecho, tú también necesitas un método para comprobar lo que hace el tuyo. En esta masterclass verás cómo revisar lo que programa un agente con skills, pruebas en navegador con Playwright y revisión adversarial entre modelos.
Ver el método entero →Masterclass · métodos en directo + casos Gherkin
¿Qué es GPT-6.1 Sol Ultrafast y cuándo compensa? ¶
Ultrafast es un nuevo nivel de velocidad premium que genera hasta 300 tokens por segundo: hasta 8 veces más rápido que la velocidad estándar en Codex y hasta 6 veces en la API. OpenAI lo lanzará en los próximos días y, según VentureBeat, costará seis veces el precio estándar.
Para ponerlo en contexto: Artificial Analysis mide hoy a GPT-6.1 Sol en unos 67 tokens por segundo en max y 74 en low, y en high tarda de media casi un minuto en empezar a responder (57,6 segundos hasta el primer token de respuesta, razonamiento incluido). Pasar a 300 tokens por segundo es otra experiencia.
Pero seis veces es mucho. A tarifa estándar ya hablamos de 10 dólares por millón de salida; multiplica y haz cuentas.
¿Cuándo tiene sentido pagarlo?
- Sesiones interactivas donde tú eres el cuello de botella esperando: pair programming en vivo, depuración con el agente al lado, iteraciones cortas de UI.
- Demos, directos y talleres donde cada minuto de espera pesa.
- Bucles de agente con muchos pasos cortos en los que la latencia se acumula y bloquea a una persona.
¿Cuándo no?
- Tareas en segundo plano, como los agentes de Codex en la nube que puedes lanzar desde el móvil y revisar después. Si no estás mirando, la velocidad no te aporta nada.
- Trabajo por lotes, donde lo que buscas es justo lo contrario: Batch o Flex a mitad de precio.
💡 Piensa en Ultrafast como el AVE frente al regional: si vas a una reunión, compensa; si vas a dejar un paquete que nadie espera hasta mañana, no.
¿Dónde puedes usar GPT-6.1 Sol hoy? ¶
Desde hoy, 29 de septiembre, en ChatGPT Work y Codex para los planes Plus, Pro, Business, Enterprise y Edu, y en la API como gpt-6.1-sol. Ultrafast llegará en los próximos días.
Fuera de OpenAI, el mismo día ya aparece en varios sitios:
| Dónde | Estado el día del lanzamiento |
|---|---|
| ChatGPT (chat principal) | Todavía no: de momento solo en ChatGPT Work y Codex |
| GitHub Copilot | Disponible para Pro+, Max, Business y Enterprise, con despliegue gradual y cobro por uso a precio de lista |
| Microsoft Foundry | Disponible de forma general |
| OpenRouter | Listado como openai/gpt-6.1-sol, a $2 / $10 |
| Cursor | Sin rastro en su documentación el 29 de septiembre |
Fuentes: changelog de GitHub, blog de Microsoft Foundry, OpenRouter y DataCamp.
GPT-6.1 Sol no ha sido el único anuncio del DevDay. OpenAI habló de más de veinte novedades, y varias afectan a cómo vas a usar el modelo:
- Codex en la nube: puedes lanzar tareas de programación desde cualquier dispositivo, móvil incluido. Si ya usas Codex en local, esto lo acerca al modelo de “delegar y revisar después”.
- La CLI de Codex acepta instrucciones por voz.
- La Agents API suma computer use y trae a tus aplicaciones las capacidades multiagente de Codex, la búsqueda de herramientas, las llamadas a herramientas y la compactación de contexto.
- ChatGPT Space y Pages: espacios y documentos pensados para que personas y agentes (los nuevos dots, agentes siempre activos) trabajen juntos.
Si vienes de Claude Code y te pica la curiosidad, tienes una guía para pasar de Claude Code a Codex u OpenCode sin perder tu configuración por el camino.
Veinte anuncios en una tarde, un modelo que sustituye a otro en siete días y otro que se cancela la víspera. Cada domingo separamos lo que cambia tu forma de programar de lo que es ruido de lanzamiento, junto a +7.200 developers que comparten lo que les funciona. Gratis, desde 2018.
Suscríbete gratis →¿Qué modelo usar para cada tarea tras el DevDay? ¶
Con GPT-6.1 Sol en el mercado, la capa intermedia se come parte de la de arriba. Así queda el reparto que te recomiendo hoy, con la información disponible el día del lanzamiento:
| Tarea | Modelo recomendado | Por qué |
|---|---|---|
| Explorar repo, clasificar, extraer, enrutar | GPT-6 Luna | Céntimos por tarea; el resultado lo consume código |
| Implementar, refactorizar, depurar en Codex | GPT-6.1 Sol (medium/high) |
Nivel de Astra en DeepSWE a una quinta parte |
| Computer use y automatización de escritorio | GPT-6.1 Sol (max) |
A 2 puntos de Astra en OSWorld |
| Planificar arquitectura o migraciones grandes | GPT-6 Astra u Opus 5.5 | Más techo cuando un fallo sale caro |
| Investigación científica, razonamiento muy profundo | GPT-6 Astra | 11 puntos por delante en Terminal-Bench Science |
| Ejecutar dentro del ecosistema Claude Code | Sonnet 5.5 | Mismo precio, sin cambiar de herramientas |
| Sesión interactiva donde la espera te bloquea | GPT-6.1 Sol Ultrafast | Solo si la velocidad vale seis veces el precio |
Es un punto de partida, no una tabla de verdad absoluta. Lo que mejor funciona es probar con tus tareas reales durante una semana y comparar dos cosas: cuánto has pagado y cuántas veces has tenido que corregir al agente.
Lo que todavía no sabemos ¶
Llevamos horas con el modelo. Hay preguntas que solo se responden con semanas de uso:
- ¿Se sostiene el nivel de Astra fuera de los benchmarks? DeepSWE y OSWorld son buenas pruebas, pero tu repositorio legacy con tres capas de abstracción no sale en ninguna.
- ¿Cuánto más cara es la tarea real? Artificial Analysis mide un 10–30 % más de salida; GitHub dice que en Copilot usa menos tokens y pasos. Hasta que alguien publique facturas de semanas de uso, las dos cosas son hipótesis.
- ¿Hereda Sol algo de lo que hizo caer a Astra 6.1? OpenAI dice que no, con sus propias pruebas. Faltan las de terceros.
- ¿Cuánto dura el modelo? GPT-6 Sol ha estado en primera línea siete días. Si la cadencia sigue así, diseña tu harness para cambiar de modelo con una línea de configuración, no con una refactorización.
- ¿Qué hará Anthropic? La semana pasada respondió a Sol con Sonnet 5.5 en seis días. Sería raro que esta vez se quedara quieta.
GPT-6.1 Sol en una frase ¶
Es el modelo de OpenAI que tiene más sentido usar por defecto para programar: casi Astra, al precio de Sol y leyendo de caché a la mitad de lo que cobran Opus 5.5 y Sonnet 5.5. No es el más listo de la sala, pero es el que mejor relación tiene entre lo que te cobra y lo que te devuelve.
TL;DR ¶
- 🚀 GPT-6.1 Sol sustituye a GPT-6 Sol una semana después, con el mismo precio ($2/$10) y la caché a la mitad ($0,10 por millón).
- 📊 Según OpenAI, iguala a GPT-6 Astra en DeepSWE (75,2 %) y se queda a 2,1 puntos en OSWorld 2.0; Artificial Analysis lo sitúa a un punto de Astra en su índice a menos de una cuarta parte del coste por tarea.
- ⚠️ Gasta un 10–30 % más de salida que GPT-6 Sol, pierde el nivel
noney tiene recargo por encima de 272K tokens de entrada. - 🛑 GPT-6.1 Astra se ha cancelado por engañar sobre sus propias acciones y actuar sin permiso; Sol llega con menos errores factuales y avisa más cuando fallan sus herramientas.
- 🎯 Para programar en Codex, GPT-6.1 Sol es el nuevo modelo por defecto; Astra y Opus 5.5 quedan para planificar y para lo más difícil.
Preguntas frecuentes ¶
¿Qué es GPT-6.1 Sol? ¶
GPT-6.1 Sol es la actualización del modelo intermedio de la familia GPT-6 de OpenAI, presentada en el DevDay del 29 de septiembre de 2026. Está pensado para programación agéntica, computer use y trabajo profesional, y según OpenAI se acerca mucho al rendimiento de GPT-6 Astra por una quinta parte del precio por token.
¿Cuánto cuesta GPT-6.1 Sol en la API? ¶
Cuesta 2 dólares por millón de tokens de entrada, 0,10 dólares por millón de entrada cacheada y 10 dólares por millón de salida. Las peticiones de más de 272.000 tokens de entrada pagan el doble en entrada y caché y 1,5 veces en salida. Batch y Flex cuestan la mitad.
¿Qué diferencia hay entre GPT-6 Sol y GPT-6.1 Sol? ¶
El precio por token es el mismo, pero la lectura de caché baja de 0,20 a 0,10 dólares por millón. GPT-6.1 Sol mejora 6,4 puntos en DeepSWE v1.1 y 7 en OSWorld 2.0, gana 4 puntos en el Intelligence Index de Artificial Analysis y elimina el nivel de razonamiento none. A cambio, genera entre un 10 y un 30 % más de tokens de salida.
¿GPT-6.1 Sol es mejor que GPT-6 Astra? ¶
En programación agéntica está al mismo nivel: 75,2 % frente a 74,1 % en DeepSWE v1.1, según OpenAI. En computer use, investigación científica y el índice general de Artificial Analysis, Astra sigue algo por delante. La diferencia está en el coste: Sol cuesta una quinta parte por token y menos de una cuarta parte por tarea.
¿Por qué se ha cancelado GPT-6.1 Astra? ¶
OpenAI retiró GPT-6.1 Astra, previsto para octubre, porque sus pruebas internas mostraron una regresión en alineamiento: engañaba más que GPT-6 Astra sobre las acciones que había realizado y tendía a avanzar en tareas sin pedir permiso, a veces usando herramientas externas de forma no segura.
¿GPT-6.1 Sol es mejor que Claude Opus 5.5? ¶
Depende de qué midas. Opus 5.5 puntúa más alto en el índice de Artificial Analysis (58 frente a 52) y en Terminal-Bench Science. GPT-6.1 Sol cuesta la mitad por token, supera a Opus 5.5 en AutomationBench en nivel medium según OpenAI y tiene un coste por tarea varias veces menor.
¿Qué es GPT-6.1 Sol Ultrafast? ¶
Es un nivel de velocidad premium que genera hasta 300 tokens por segundo, hasta 8 veces más rápido que la velocidad estándar en Codex y hasta 6 veces en la API. Llegará en los próximos días y, según VentureBeat, costará seis veces el precio estándar.
¿Dónde puedo usar GPT-6.1 Sol? ¶
Está disponible desde el 29 de septiembre de 2026 en ChatGPT Work y Codex para los planes Plus, Pro, Business, Enterprise y Edu, y en la API de OpenAI con el identificador gpt-6.1-sol. También está en GitHub Copilot (planes Pro+, Max, Business y Enterprise), Microsoft Foundry y OpenRouter. Todavía no aparece en el chat principal de ChatGPT.
¿Qué ventana de contexto tiene GPT-6.1 Sol? ¶
Tiene una ventana de contexto de 1.050.000 tokens y una salida máxima de 128.000 tokens. Su corte de conocimiento es el 30 de abril de 2026. Acepta texto e imagen como entrada y genera texto.
¿Tengo que cambiar mi código para usar GPT-6.1 Sol? ¶
Basta con cambiar el identificador del modelo a gpt-6.1-sol, pero revisa tres cosas: el nivel de razonamiento none ya no se admite (el mínimo es low), las peticiones de más de 272.000 tokens tienen recargo, y el modelo genera más salida, así que conviene medir la factura antes y después del cambio.
Fuentes ¶
- Introducing GPT-6.1 Sol — OpenAI
- GPT-6.1 Sol — documentación de modelos de la API de OpenAI
- GPT-6.1 Sol System Card (addendum) — OpenAI
- DevDay 2026 Recap — OpenAI
- GPT-6.1 Sol — Artificial Analysis
- OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less — TechCrunch
- GPT-6.1 Sol offers Astra-like performance at 1/5th price — VentureBeat
- GPT-6.1 Sol comes close to Astra at a fifth of the price — The Decoder
- OpenAI cancels GPT-6.1 Astra release over misbehavior and safety concerns — 9to5Google
- OpenAI DevDay 2026 live blog — Simon Willison
- Addendum to GPT-6 Astra System Card: GPT-6.1 Sol — OpenAI Deployment Safety Hub
- GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price — Hacker News
- GPT-6.1 Sol in GitHub Copilot — GitHub Changelog
- Introducing GPT-6.1 Sol in Microsoft Foundry — Microsoft Community Hub
- GPT-6.1 Sol — OpenRouter
- GPT-6.1 Sol costs a fifth of Astra. What is the catch? — Rolling Out
🧨 Última oprtunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.