+250 skills, dinamita para tu productividad 🧨Explorar →

Claude Opus 5.5 vs GPT-6 Astra: precio, benchmarks y agentes

Anthropic ha lanzado Claude Opus 5.5 hoy, 22 de septiembre de 2026, dos meses después de Opus 5. Y la noticia no es que sea más listo, que lo es. La noticia es la combinación.

Opus 5.5 rinde al nivel de Fable 5.1 en casi todo, cuesta un 20 % menos por token que Opus 5, lidera el índice de inteligencia de Artificial Analysis y, por primera vez en una página de lanzamiento, Anthropic dedica una sección entera a arreglar cómo escribe Claude. Sí, lo del “load-bearing”.

La documentación oficial lo deja claro desde la primera línea: si no sabes qué modelo usar, empieza por Opus 5.5. Fable 5.1 queda para el razonamiento más exigente y el trabajo agéntico de horizonte muy largo, o para cuando Opus 5.5 a esfuerzo alto se queda corto en tus evaluaciones.

Hay letra pequeña, claro. En este artículo te cuento:

  • Qué cambia en precio y por qué “un 40 % más barato” no significa lo que parece
  • Los benchmarks oficiales frente a los independientes, y dónde GPT-6 Astra sigue ganando
  • Por qué medium es ahora el ajuste que más te interesa, y max el que más te puede doler
  • Los cuatro cambios incompatibles que rompen harnesses y agentes montados sobre Opus 5
  • Qué hay de verdad en el fin del “Claudish” y qué demos de X conviene ignorar

🪞 Nota de transparencia. El borrador de este análisis lo ha preparado el propio Claude Opus 5.5 (lo comprobamos antes de empezar: la sesión se ejecutaba con claude-opus-5-5). Juez y parte. Por eso cada cifra lleva su fuente y las opiniones van marcadas como tales. Si al leerlo notas menos relleno que en los posts de Opus 5, ya tienes una primera prueba casera de lo que promete Anthropic.

Vamos al lío.

Qué es Claude Opus 5.5

Claude Opus 5.5 es el primer modelo de la familia 5.5 de Anthropic, pensado para coding agéntico de larga duración y trabajo de conocimiento. Su identificador en la API es claude-opus-5-5 y está disponible desde hoy en la API de Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry, además de en los planes Pro, Max, Team y Enterprise.

Estas son las especificaciones según la tabla oficial de modelos:

Especificación Claude Opus 5.5 Claude Opus 5 Claude Fable 5.1
ID en la API claude-opus-5-5 claude-opus-5 claude-fable-5-1
Contexto 1M tokens 1M tokens 1M tokens
Salida máxima 128k tokens 128k tokens 128k tokens
Corte de conocimiento fiable Junio 2026 Mayo 2026 Junio 2026
Thinking Adaptativo, siempre activo Activo por defecto Adaptativo, siempre activo
Effort por defecto medium high high
Precio entrada / salida 4$ / 20$ 5$ / 25$ 10$ / 50$

Fuente: documentación oficial de modelos de Claude y página de novedades de Opus 5.5.

Dos filas merecen atención. La primera, el effort por defecto baja a medium: si tu código no fija el effort, hoy va a ejecutarse con menos esfuerzo que ayer con Opus 5. La segunda, el precio: Opus 5.5 se queda en dos quintos de lo que cuesta Fable 5.1 por token. Y Opus 5 pasa a la sección de modelos legacy, aún disponible pero ya no recomendado.

Anthropic también anuncia que Sonnet 5.5 y Haiku 5.5 llegarán “en las próximas semanas” con mejoras parecidas. Si tu carga diaria vive en Sonnet 5, no hay prisa por moverte hoy.

El precio baja un 20 %, no un 40 %

Opus 5.5 cuesta 4$ por millón de tokens de entrada y 20$ por millón de salida, frente a los 5$ y 25$ de Opus 5. Eso es un 20 % menos por token. El 40 % que verás en muchos titulares es otra cosa: es la estimación de Anthropic de coste por tarea en sus cargas típicas, porque además de cobrar menos por token, el modelo gasta menos tokens.

La tabla completa:

Opus 5 Opus 5.5 Cambio
Entrada / 1M 5$ 4$ −20 %
Salida / 1M 25$ 20$ −20 %
Lectura de caché / 1M 0,50$ 0,20$ −60 %
Escritura de caché 5 min / 1M 6,25$ 5$ −20 %
Escritura de caché 1 h / 1M 8$
Batch (entrada / salida) 2,50$ / 12,50$ 2$ / 10$ −20 %
Fast mode (entrada / salida) 8$ / 40$

Fuentes: anuncio oficial de Anthropic y página de precios de la documentación de Opus 5.5.

La fila que más me interesa es la de lectura de caché: baja un 60 %, a 0,05× el precio de entrada. Anthropic lo dice sin rodeos en el anuncio: en coding agéntico, las lecturas de caché son la mayor parte del coste. Un agente reenvía el repositorio, las instrucciones, las skills y el historial en cada vuelta, y casi todo eso sale de caché. Si tu harness cachea bien, esta rebaja pesa más en la factura que el 20 % del precio base.

A eso se suma que Anthropic afirma que Opus 5.5 genera la salida más de un 30 % más rápido que Opus 5. Y el fast mode, en research preview y solo en la API de Claude, llega hasta 2,5× más rápido a 8$/40$.

💡 Si repites en voz alta “Opus 5.5 es un 40 % más barato”, repite también la coletilla: por tarea, en las cargas típicas de Anthropic. Por token es un 20 %. Y en max, como vas a ver ahora, las cuentas pueden salir al revés.

Herramienta gratis · Calculadora

¿Cuánto te ahorra de verdad la caché de Opus 5.5?

Con la lectura de caché a 0,20$ el millón, el coste de un agente depende más de cuánto contexto reenvías en cada paso que del precio por token. Mete los pasos y el contexto de tu agente y mira cuánto cuesta una ejecución y cuánto te devuelve la caché.

Le das

Los pasos y el contexto de tu agente

Te devuelve

Lo que cuesta una ejecución y lo que cuesta el mes

Calcular mi agente

Qué dicen los benchmarks oficiales de Opus 5.5

Los números que publica Anthropic muestran un salto grande frente a Opus 5 y ponen a Opus 5.5 por delante de Fable 5.1 en casi todas las pruebas. Pero no gana en todo: GPT-6 Astra queda por delante en AutomationBench y en Terminal-Bench-Science.

Benchmark Opus 5 Opus 5.5 Fable 5.1 GPT-6 Astra GPT-5.6 Sol
Terminal-Bench 4.0 52,3 % 66,4 % 55,8 % 57,9 % 37,3 %
FrontierCode 1.1 48,0 % 54,4 % 50,3 % 53,3 % 47,5 %
CursorBench 4.0 46,6 % 57,8 % 51,8 % 41,7 %
GDPval-AA 2.1 (Elo) 1.708 1.846 1.735 1.542 1.588
AutomationBench 26,9 % 40,0 % 31,4 % 41,4 % 28,8 %
Humanity’s Last Exam (con tools) 63,6 % 67,7 % 65,6 % 57,2 %
Terminal-Bench-Science 0.1 29,0 % 58,7 % 52,6 % 64,6 % 22,4 %
OSWorld 2.0 (parcial) 74,0 % 81,8 % 80,7 %

Fuente: anuncio oficial de Anthropic. Resultados de Opus 5.5 a esfuerzo max salvo indicación.

Tres matices antes de sacar conclusiones.

El primero: son números del fabricante. Y la letra pequeña importa. En Terminal-Bench 4.0, Opus 5.5 se mide a esfuerzo xhigh y Astra a high, con un error estándar de ±2,6 puntos. Las pruebas se hicieron con las salvaguardas de producción activas, y en AutomationBench cada intervención de un clasificador cuenta como fallo.

El segundo es más raro de ver en una página de lanzamiento. Anthropic avisa de que, entre modelos de este nivel, las diferencias en benchmarks están dejando de reflejar las diferencias que se notan en uso real, y que la distancia práctica entre Opus 5.5 y Fable 5.1 es menor de lo que sugiere la tabla. Es decir: no leas los 10 puntos de Terminal-Bench 4.0 como “Opus 5.5 programa un 20 % mejor que Fable 5.1”.

El tercero: el salto en Terminal-Bench-Science, de 29,0 % a 58,7 %, dobla el resultado de Opus 5. Y aun así Astra está seis puntos por encima.

Artificial Analysis lo pone primero, con un asterisco en el gasto

Artificial Analysis ya ha publicado sus propias mediciones, y pesan más que las gráficas del fabricante porque las ejecutan ellos. Su veredicto: Opus 5.5 en max ocupa el primer puesto de su Intelligence Index con 58 puntos, varios por delante del siguiente.

Lo interesante es la escalera de esfuerzos:

Effort de Opus 5.5 Intelligence Index (AA)
low 42
medium (defecto) 51
high 54
xhigh 56
max 58

Fuente: Artificial Analysis, ficha de lanzamiento de Claude Opus 5.5.

En gráfico se ve mejor dónde cae el ajuste por defecto:

Opus 5.5 en cada nivel de effort Intelligence Index de Artificial Analysis (escala desde 0) 42 low 51 medium 54 high 56 xhigh 58 max Opus 5 en max: 51 por defecto ~119k tokens/tarea El nivel por defecto ya rinde como el techo de Opus 5. De medium a max son 7 puntos más, con bastantes más tokens.

Para situar esas cifras: en la versión actual del índice, GPT-6 Astra y Fable 5.1 empataban a 53 antes de este lanzamiento, y Opus 5 (max) sacaba 51. Ojo si vienes de nuestro análisis de GPT-6 Astra: allí citábamos un 61 para Astra y un 66 para Fable 5.1, pero eran de una versión anterior del índice que Artificial Analysis ha rehecho dos veces desde entonces. Las cifras de versiones distintas no se comparan entre sí.

Leído así, el dato que más me sirve no es el 58: Opus 5.5 en medium iguala a Opus 5 en max (51 frente a 51). El ajuste por defecto del modelo nuevo rinde como el techo del anterior. Artificial Analysis añade que cuatro de los cinco niveles (medium, high, xhigh y max) están en la frontera de Pareto de inteligencia frente a coste por tarea.

Y ahora el asterisco. En max, Opus 5.5 gasta unos 119.000 tokens de salida por tarea del índice, según los datos de Artificial Analysis recogidos por The Decoder. Opus 5 en max gastaba unos 73.000, Fable 5.1 unos 78.000 y GPT-6 Astra unos 27.000.

Haz la cuenta solo con la salida (es un cálculo mío, sin contar entrada ni caché):

Modelo en max Tokens de salida por tarea Precio salida / 1M Coste de salida aprox. por tarea
Opus 5.5 ~119k 20$ ~2,38$
Opus 5 ~73k 25$ ~1,83$
Fable 5.1 ~78k 50$ ~3,90$
GPT-6 Astra ~27k 50$ ~1,35$

En max, la salida de Opus 5.5 sale más cara por tarea que la de Opus 5, pese a costar un 20 % menos por token. El “40 % más barato” de Anthropic se refiere a cargas típicas, y no se puede extrapolar al esfuerzo máximo.

Esto encaja con otra advertencia de la documentación: a igual nivel de effort, Opus 5.5 tiende a pensar más por turno que Opus 5, sobre todo en xhigh y max. La recomendación oficial es volver a medir el esfuerzo con tus propias tareas en lugar de copiar el que tenías y dejar margen en max_tokens para el thinking.

🎯 Mi apuesta, a falta de medirlo en tareas propias: Opus 5.5 en medium o high va a ser la configuración interesante para la mayoría, y max quedará para los atascos de verdad. Pasar de medium a max te da 7 puntos de índice a cambio de gastar bastantes más tokens.

Guía interactiva gratis

El effort es presupuesto, y el presupuesto se decide antes

Opus 5.5 te da cinco niveles de esfuerzo y una factura distinta en cada uno. La parada del presupuesto del curso-juego te enseña a decidir cuánto gastas antes de lanzar al agente, y la parada 3 separa modelo de agente sin humo. 17 paradas, eliges proyecto y sales con una checklist a tu medida.

Entra en el curso gratis →

Claude Opus 5.5 vs GPT-6 Astra: cuál elegir

Si lo que quieres es un modelo para programar dentro de un agente, Opus 5.5 parte con ventaja en los benchmarks de coding publicados y es bastante más barato por token. Si tu trabajo es automatización de flujos, ciencia o computer use de horizonte largo, Astra sigue siendo el rival a batir.

GPT-6 Astra salió el 3 de septiembre como una generación nueva de OpenAI centrada en computer use y autonomía. Tres semanas después, este es el cara a cara:

Dimensión Claude Opus 5.5 GPT-6 Astra
Precio entrada / salida 4$ / 20$ 10$ / 50$
Terminal-Bench 4.0 (Anthropic) 66,4 % (xhigh) 57,9 % (high)
FrontierCode 1.1 (Anthropic) 54,4 % 53,3 %
GDPval-AA 2.1 (Elo) 1.846 1.542
AutomationBench 40,0 % 41,4 %
Terminal-Bench-Science 0.1 58,7 % 64,6 %
Tokens de salida por tarea en max (AA) ~119k ~27k
Intelligence Index AA (max) 58 53 (antes del lanzamiento)

Fuentes: anuncio de Anthropic, Artificial Analysis y The Decoder. Los benchmarks de la tabla los publica Anthropic.

La lectura que hago:

Donde Opus 5.5 gana con claridad es en coding agéntico medido por terminal y en trabajo de conocimiento. Los 300 puntos Elo de GDPval-AA son mucha distancia. Anthropic afirma además que en FrontierCode supera a Astra con un coste por tarea en torno a un 80 % menor, aunque ese dato es suyo.

Donde Astra aguanta es en lo que OpenAI vendía: automatización de principio a fin y ciencia en terminal. Y en eficiencia de tokens no hay comparación. Astra resuelve una tarea del índice con menos de una cuarta parte de la salida que Opus 5.5 en max. A 50$ el millón sigue saliendo más barato por tarea en ese nivel.

Donde no hay datos todavía es en lo que más nos importa: cómo se comportan los dos dentro de un harness real con tu repositorio. En el post de Astra ya vimos que Cognition, dentro de Devin, y Artificial Analysis llegaban a conclusiones opuestas sobre el mismo modelo. Con Opus 5.5 va a pasar lo mismo.

🔑 La comparación honesta hoy es esta: Opus 5.5 para programar y para trabajo de conocimiento denso, Astra para automatizar flujos largos y operar el ordenador. Y en los dos casos, el nivel de esfuerzo y el harness van a mover más la aguja que el nombre del modelo.

Qué cambia frente a Opus 5 y Fable 5.1

Frente a Opus 5, el salto es de los grandes para una versión “punto cinco”. Frente a Fable 5.1, el mensaje de Anthropic es que Opus 5.5 rinde a su nivel en la mayoría de trabajos por dos quintos del precio.

Los ejemplos del anuncio van casi todos de tareas largas, no de “responde mejor a esta pregunta”:

  • Una auditoría y corrección de una base de código de 200.000 líneas en menos de tres horas, frente a más de 20 horas de Opus 5 gastando 2,5 veces más tokens.
  • Una migración de 680.000 líneas en menos de un día.
  • La reescritura de HAProxy de C a Rust en 9,5 horas, frente a las 12 de Fable 5.1 y con un 51 % menos de coste.

Los testimonios de clientes van en la misma dirección. Stripe cuenta un rebase de varios días de 40 pull requests apiladas que pasaron todas CI. Clio habla de más de 18 horas seguidas en una tarea sin perder el hilo. Quantium pasó de 38 prompts en cuatro días a 11 prompts en tres horas. Y Deloitte reporta que detectó el 72 % de bugs conocidos frente al 56 % de Opus 5 en high.

Son ejemplos elegidos por Anthropic y sus socios, así que hay que leerlos como lo que son: casos que alguien ha querido enseñar. Hasta que haya réplicas independientes, cuentan como indicio.

Frente a Fable 5.1, las diferencias prácticas se resumen así:

Dimensión Claude Opus 5.5 Claude Fable 5.1
Precio entrada / salida 4$ / 20$ 10$ / 50$
Latencia relativa Moderada Más lenta
Effort por defecto medium high
Posición oficial Por defecto para casi todo Razonamiento exigente y horizonte muy largo
Tokens por tarea en max (AA) ~119k ~78k

Fuente: tabla oficial de modelos de Claude y Artificial Analysis vía The Decoder.

Si tenías Fable 5.1 como modelo principal para programar, tiene sentido probar Opus 5.5 en high con tus tareas. Lo más probable es que pagues bastante menos por un resultado parecido. Si Opus 5.5 en esfuerzo alto sigue quedándose corto, entonces Fable 5.1 sigue siendo la respuesta, y la documentación lo dice con esas palabras.

Separar lo que mide el fabricante de lo que mide un tercero es medio trabajo de seguir el ritmo de los modelos. Cada domingo te cuento qué vamos aprendiendo adoptando IA en el desarrollo real. Ya somos +7.200.

Apúntate gratis →

Los cuatro cambios que rompen tu harness

Si tienes código en producción contra Opus 5, cambiar el ID del modelo no basta. La documentación oficial enumera cuatro cambios incompatibles que devuelven error 400, y un quinto que no da error pero cambia la forma de la respuesta.

De Opus 5 a Opus 5.5: lo que rompe tu harness Con Opus 5 Con Opus 5.5 Qué haces thinking: disabled (válido hasta effort high) Error 400: el thinking está siempre activo Quita el campo thinking y controla con effort any o una tool concreta para forzar la llamada Error 400: solo acepta auto o none auto + strict: true, o pídelo en el prompt Cambiar de modelo o editar el historial sin más Bloques atados al modelo y al prefijo de la conversación Conversación solo de añadir; cuidado al enrutar modelos computer_20251124 con cabecera beta Error 400 en la API de Claude y Google Cloud Pasa al toolset computer_toolset_20260801 Notas entre tool calls llegan como texto Llegan como thinking vacío sin error: la UI calla Ajusta thinking.display para recuperarlas Rojo: la petición falla con un 400. Amarillo: no falla, pero tu interfaz deja de mostrar el progreso.

El thinking ya no se puede desactivar

En Opus 5.5 el pensamiento adaptativo está siempre activo. Una petición con thinking: {"type": "disabled"} o con un presupuesto manual ("type": "enabled" con budget_tokens) devuelve un 400. El único control es el effort:

// Error 400 en Opus 5.5
{"model": "claude-opus-5-5", "thinking": {"type": "disabled"}}

// Válido: quitas thinking (o usas "adaptive") y controlas con effort
{"model": "claude-opus-5-5", "output_config": {"effort": "low"}}

Si en Opus 5 desactivabas el thinking para ahorrar, la sustitución es bajar el effort.

Ya no puedes forzar el uso de una herramienta

tool_choice con {"type": "any"} o {"type": "tool", "name": "..."} devuelve un 400. Solo se aceptan auto (el valor por defecto) y none. Si forzabas una tool para obtener JSON con un esquema, la alternativa oficial es mantener auto y activar strict: true, o pasar a salidas estructuradas. Y si querías que el modelo llamara a una herramienta concreta, ahora se lo tienes que decir en el prompt.

Los bloques de thinking van atados al modelo y a la conversación

Cada bloque de pensamiento registra qué modelo lo produjo. Opus 5.5 lee los bloques de Opus 5 y modelos anteriores, pero no los de Fable ni Mythos. En la API de Claude, Fable 5.1 y Mythos 5.1 sí leen los de Opus 5.5, pero ningún otro modelo lo hace. Cuando un bloque no se puede leer, la API lo descarta sin error y el modelo sigue sin ese razonamiento previo.

Además, en cuentas creadas desde el 31 de agosto de 2026, si cambias algo anterior a un bloque de thinking (el system prompt, las tools o un mensaje previo) y lo reenvías, la API devuelve un 400. La recomendación es mantener la conversación solo de añadir, sin editar lo anterior, y usar mensajes de sistema a mitad de conversación para cambiar instrucciones.

Esto complica el enrutado dinámico entre modelos, ese patrón de “Opus para planificar, Sonnet para ejecutar y vuelta a Opus para revisar” dentro de la misma conversación. Sigue siendo posible, pero cada salto puede perder el razonamiento acumulado.

La computer use tool antigua deja de funcionar

En la API de Claude y en Google Cloud, Opus 5.5 solo acepta el toolset nuevo computer_toolset_20260801. La herramienta computer_20251124 devuelve un 400. En Amazon Bedrock sigue funcionando.

Y un quinto que no da error: el texto entre herramientas desaparece

Las notas cortas que el modelo escribe entre llamadas a herramientas ahora llegan como bloques de thinking, no como texto. Con la configuración por defecto (display: "omitted") vienen vacías. Si tu interfaz enseñaba esas notas como progreso, se quedará en silencio entre tool calls sin que nada falle. Hay que ajustar thinking.display para recuperarlas.

⚠️ Revisa tu harness antes de cambiar el ID: quita cualquier thinking desactivado o con presupuesto, sustituye tool_choice forzado por auto más strict, fija el effort a mano (el defecto baja a medium), deja sitio en max_tokens para el thinking y comprueba si tu UI dependía del texto entre tool calls. Cambiar el ID son cinco minutos. El resto es lo que evita el susto en producción.

Lo nuevo que sí suma para agentes

No todo son restricciones. Opus 5.5 soporta effort por mensaje (beta), task budgets, compaction bajo demanda (beta) y definir herramientas dentro de un mensaje a mitad de conversación (beta) sin romper la caché. El mínimo cacheable sigue en 512 tokens.

Si juntas todo, la dirección es clara. Thinking obligatorio, herramientas que elige el modelo, esfuerzo ajustable turno a turno, presupuestos por tarea y compactación: Anthropic está dando más control de ejecución al modelo y pidiendo harnesses menos prescriptivos. Es la misma tendencia que vimos en Opus 5 con el consejo de borrar skills, llevada ahora a la API. Si quieres entender qué parte del andamiaje sigue siendo tuya, lo contamos en qué es un AI harness y en cómo diseñar el tuyo.

Domina la herramienta a fondo

Opus 5.5 cambia las reglas del harness; Claude Code es donde más se nota

Effort, CLAUDE.md, hooks, subagentes y MCP: las piezas que tienes que recalibrar cuando cambia el modelo por debajo. Dos horas y media de taller con los workflows EPCC, TDD y worktrees que aguantan de un modelo al siguiente.

Ver la masterclass →

Masterclass en directo · 2h30

Claude escribe menos “a lo Claude”

Anthropic dedica una sección del anuncio a la escritura, y los primeros usuarios van en la misma dirección. Según el anuncio, Opus 5.5 pone la información importante primero, usa menos jerga, evita expresiones idiosincrásicas y sigue mejor las guías de estilo que le das.

En las semanas anteriores al lanzamiento, buena parte de las críticas a Opus 5 en Reddit iban por ahí: un modelo brillante trabajando solo e insoportable en una conversación, que hablaba de más y metía “load-bearing” en cualquier frase. Un hilo de r/ClaudeCode llegaba a decir que Claude Code se estaba quedando atrás frente a Codex por culpa de Opus 5, no del coste.

Los testimonios del anuncio apuntan a lo mismo. Box dice que Opus 5.5 es un 40 % menos verboso sin perder precisión y que usó un tercio de los tokens de Opus 5. Un ingeniero de Ramp resume su mayor frustración con los modelos anteriores, la salida verbosa y difícil de seguir, y dice que Opus 5.5 la arregla.

En Reddit, los primeros hilos de hoy dicen algo parecido: respuestas de pocas frases, más al grano, menos “one thing I want to flag” y, en algunos casos, menos consumo de cuota. Son impresiones de unas horas. No son evidencia, pero cuadran con lo que Anthropic dice haber buscado.

💡 Si en tu CLAUDE.md o en tus prompts tienes reglas del tipo “sé conciso”, “no uses jerga” o “ve al grano”, Opus 5.5 probablemente las necesite menos. Pruébalo sin ellas antes de mantenerlas por inercia: cada instrucción que sobra es contexto que pagas en cada vuelta.

Cuidado con las demos de X

Durante las primeras horas, X y Reddit se llenan de demos “zero-shot” atribuidas a Opus 5.5. Yo no usaría ninguna como prueba todavía.

El caso más claro es anterior al lanzamiento. Un usuario publicó un supuesto render 3D de un Waymo generado con “Opus 5.5” desde Claude Code, con números de uso incluidos. Horas después, la misma cuenta lo retiró: el vídeo venía de YouTube. La retractación tuvo unas 370 visualizaciones; el original, más de 18.000. Y aunque hubiera sido real, Claude no genera imágenes ni vídeo: una captura de un modelo 3D enseña lo que hace la herramienta que lo renderiza.

Hoy circula también una animación SVG espectacular atribuida a Opus 5.5 en un solo prompt, y en los propios comentarios del hilo se pregunta qué prueba hay de que la hiciera el modelo.

La regla que aplico en cada lanzamiento: si no puedes reproducirlo, no cuenta. Una demo sin prompt, sin modelo verificable y sin número de intentos no dice nada de tu trabajo diario.

Cada lanzamiento trae su ración de demos imposibles y hay que separar el ruido de lo que se puede reproducir. Cada domingo seleccionamos 12 recursos sobre IA y desarrollo, y los suscriptores aportan lo suyo. Gratis, desde 2018.

Suscríbete gratis →

Cuándo migrar a Opus 5.5

Migrar compensa casi siempre si vienes de Opus 5, siempre que dediques una tarde a revisar el harness. La pregunta real es con qué esfuerzo.

Si usas Claude Code a diario

Pruébalo ya. El salto en tareas agénticas largas está respaldado por los benchmarks oficiales y por el índice de Artificial Analysis. Empieza en medium o high y sube a xhigh solo en las tareas que se atasquen. Y aprovecha para limpiar instrucciones de estilo que el modelo ya no necesita.

Si tienes un harness en producción contra la API

Lee los cambios incompatibles antes de tocar nada. thinking desactivado y tool_choice forzado son los dos 400 más probables. Si enrutas entre modelos dentro de una misma conversación, revisa qué razonamiento se pierde en cada salto. Y fija el effort a mano: si no lo hacías, estabas en high con Opus 5 y ahora pasarás a medium sin enterarte.

Si pagas Fable 5.1 para programar

Haz una prueba con tus tareas reales con Opus 5.5 en high. Cuesta dos quintos por token y la propia Anthropic dice que la distancia práctica es pequeña. Si no llega, vuelve a Fable 5.1 sin remordimientos.

Si tu flujo vive en computer use o en automatizaciones largas

Aquí GPT-6 Astra sigue teniendo argumentos: gana en AutomationBench y gasta muchísimos menos tokens por tarea. Opus 5.5 saca un 81,8 % en OSWorld 2.0 parcial, pero no hay cifra comparable de Astra en esa tabla. Mide con lo tuyo.

Si tu criterio es el precio por rendimiento en volumen

Espera unas semanas. Sonnet 5.5 viene de camino según Anthropic, y mientras tanto Sonnet 5 sigue siendo el caballo de batalla para trabajo guiado. Si quieres ver el mapa completo, lo mantenemos al día en el mejor modelo para programar.

Lo que queda por ver

Hay cuatro cosas que no se resuelven en un día.

La primera, si el gasto de tokens en max se modera. Los 119.000 tokens por tarea son de la primera versión servida y Anthropic ya ha ajustado el comportamiento de otros modelos tras el lanzamiento.

La segunda, cómo se comporta en sesiones largas de verdad: repositorios grandes, bugs difíciles, planificación y degradación a lo largo de horas. Los testimonios de 18 horas son de clientes seleccionados; las experiencias de la comunidad llegarán en los próximos días.

La tercera, qué dicen METR y el resto de evaluadores independientes. METR participó en las pruebas previas al lanzamiento, pero sus resultados públicos todavía no están.

La cuarta, cuánto cuesta adaptarse a un modelo que decide más solo. Sin tool use forzado y con el thinking siempre encendido, parte del control que tenías en el harness pasa al modelo. Para muchos equipos será una mejora. Para quien tenía flujos muy deterministas, va a haber trabajo.

Claude Opus 5.5 en una frase

Opus 5.5 es el modelo de Anthropic que tiene más sentido usar por defecto: rinde al nivel de Fable 5.1 en casi todo por dos quintos del precio, lidera el índice independiente de Artificial Analysis, abarata un 60 % la caché que pagan los agentes y escribe más al grano. A cambio, en max gasta más tokens que cualquier rival, obliga a revisar el harness por cuatro cambios incompatibles y deja a GPT-6 Astra por delante en automatización y ciencia.

La recomendación es la de siempre: pruébalo con tus tareas y mide coste por tarea resuelta. Esta vez, con una pista extra: empieza por medium.

TL;DR

  • 🚀 Claude Opus 5.5 (22 sep 2026, claude-opus-5-5) es ahora el modelo recomendado por defecto de Anthropic: 1M de contexto, 128k de salida, corte de conocimiento de junio de 2026 y effort medium por defecto.
  • 💸 Cuesta 4$/20$, un 20 % menos por token que Opus 5. El “40 % más barato” es coste por tarea en cargas típicas. La lectura de caché baja un 60 %, a 0,20$.
  • 📊 Lidera el Intelligence Index de Artificial Analysis con 58 en max, pero ahí gasta ~119k tokens por tarea frente a ~27k de GPT-6 Astra. En medium iguala a Opus 5 en max.
  • ⚔️ Frente a GPT-6 Astra, gana en coding agéntico y trabajo de conocimiento según Anthropic, y pierde en AutomationBench y Terminal-Bench-Science.
  • 🛠️ Trae cuatro breaking changes: thinking siempre activo, sin tool use forzado, bloques de thinking atados al modelo y computer use solo con el toolset nuevo.

Preguntas frecuentes sobre Claude Opus 5.5

¿Qué es Claude Opus 5.5?

Claude Opus 5.5 es el modelo de Anthropic lanzado el 22 de septiembre de 2026 para coding agéntico de larga duración y trabajo de conocimiento. Es el primero de la familia 5.5, su ID en la API es claude-opus-5-5 y Anthropic lo recomienda como punto de partida para la mayoría de cargas. Tiene 1M de tokens de contexto y 128k de salida máxima.

¿Cuánto cuesta Claude Opus 5.5?

Cuesta 4 dólares por millón de tokens de entrada y 20 por millón de salida, un 20 % menos que Opus 5. La lectura de caché cuesta 0,20$ por millón (un 60 % menos), la escritura de caché de 5 minutos 5$, la Batch API la mitad (2$/10$) y el fast mode 8$/40$.

¿Es verdad que Opus 5.5 es un 40 % más barato que Opus 5?

Por token es un 20 % más barato. El 40 % es la estimación de Anthropic de coste por tarea en cargas típicas, porque además usa menos tokens. En esfuerzo max no se cumple: según Artificial Analysis gasta unos 119.000 tokens de salida por tarea frente a unos 73.000 de Opus 5.

¿Opus 5.5 es mejor que GPT-6 Astra?

Depende de la tarea. En los benchmarks publicados por Anthropic, Opus 5.5 gana en Terminal-Bench 4.0, FrontierCode 1.1 y GDPval-AA 2.1, y lidera el índice de Artificial Analysis. Astra gana en AutomationBench y Terminal-Bench-Science, cuesta más por token (10$/50$) pero gasta muchos menos tokens por tarea.

¿Opus 5.5 es mejor que Fable 5.1?

En la mayoría de benchmarks publicados, sí, y cuesta dos quintos por token. La propia Anthropic advierte de que la diferencia práctica es menor de lo que sugieren las tablas, y recomienda Fable 5.1 para razonamiento especialmente exigente y trabajo agéntico de horizonte muy largo, o cuando Opus 5.5 a esfuerzo alto no llegue.

¿Qué nivel de effort conviene usar con Opus 5.5?

El defecto es medium, que según Artificial Analysis saca 51 puntos en su índice, lo mismo que Opus 5 en max. max llega a 58, pero gastando muchos más tokens. La recomendación oficial es volver a medir el esfuerzo con tus tareas: a igual nivel, Opus 5.5 piensa más por turno que Opus 5.

¿Se puede desactivar el thinking en Opus 5.5?

No. El pensamiento adaptativo está siempre activo y una petición con thinking desactivado o con budget_tokens devuelve un error 400. Para controlar coste y latencia hay que usar el parámetro effort.

¿Qué pasa con tool_choice en Opus 5.5?

Opus 5.5 no admite tool use forzado: tool_choice con any o con una herramienta concreta devuelve un 400. Solo acepta auto y none. Para JSON con esquema se recomienda auto con strict: true o salidas estructuradas, y para que llame a una herramienta hay que indicarlo en el prompt.

¿Opus 5.5 escribe mejor que Opus 5?

Anthropic afirma que pone lo importante primero, usa menos jerga, evita expresiones idiosincrásicas y sigue mejor las guías de estilo. Box reporta respuestas un 40 % menos verbosas sin perder precisión, y los primeros usuarios en Reddit describen respuestas más cortas y directas, aunque son impresiones de las primeras horas.

¿Dónde puedo usar Claude Opus 5.5?

En la API de Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry, y en los planes Pro, Max, Team y Enterprise de Claude. El fast mode solo está disponible en la API de Claude, en research preview.

Fuentes

🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter

Imagen de Daniel Primo
Claude, IA de Anthropic

Escrito con la ayuda de la IA generativa de Claude, fuentes fidedignas y con un human in the loop:
Dani Primo.

CEO en pantuflas de Web Reactiva. Programador y formador en tecnologías que cambian el mundo y a las personas. Activo en linkedin, en substack y canal @webreactiva en telegram

12 recursos para developers cada domingo en tu bandeja de entrada

Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.