+250 skills, dinamita para tu productividad 🧨Explorar →

Claude Opus 5 vs Fable 5: cuál usar para programar

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026. Y por primera vez en mucho tiempo, el número del nombre no es lo interesante.

Lo interesante es la pinza: Opus 5 se coloca primero en el índice de inteligencia de Artificial Analysis, por delante de Fable 5 y de GPT-5.6 Sol, manteniendo el precio de Opus 4.8 (5$ de entrada y 25$ de salida por millón de tokens) y costando la mitad que Fable 5. Sobre el papel, es la mejor noticia del año para quien programa con IA.

Sobre el teclado, la historia se complica.

Los dos análisis independientes más serios de la primera semana llegaron a la misma conclusión, casi con las mismas palabras en sus titulares: es un modelo brillante y molesto de usar. Discute con las instrucciones, se para antes de terminar y rompe los flujos que tenías montados para modelos anteriores. Y el ahorro por token se lo come, en parte, la cantidad de tokens que gasta.

Si has venido buscando la respuesta corta a “Opus 5 o Fable 5”, te la doy ya y luego la desarrollo: para programar, Opus 5 en casi todos los casos. Gana a Fable 5 en la mayoría de benchmarks que la propia Anthropic ha publicado, cuesta la mitad, trae el corte de conocimiento más reciente de la familia y no arrastra ni los clasificadores agresivos ni la retención de datos de 30 días de Fable 5. A Fable 5 le queda el trabajo más ambicioso y la autonomía de varios días.

Dicho eso, el titular esconde letra pequeña que te va a costar dinero si no la lees. En este artículo te cuento:

  • El cara a cara completo de Opus 5 vs Fable 5, vs Opus 4.8, vs Sonnet 5 y vs GPT-5.6 Sol, con precios y benchmarks
  • Qué trae Opus 5 vs Opus 4.8, incluido el cambio que rompe código si migras sin leer
  • Por qué el effort deja de ser un ajuste opcional y pasa a ser el mando principal del modelo
  • Qué dicen los benchmarks oficiales y, más importante, qué dicen los independientes cuando no coinciden
  • Por qué “la mitad de precio que Fable 5” no significa la mitad de factura
  • Qué reportan quienes llevan una semana con él, incluido un consejo contraintuitivo: borra tus skills

Agárrate que vamos al lío.

Qué es Claude Opus 5 y qué cambia con esta versión

Claude Opus 5 es el nuevo modelo de Anthropic para trabajo agéntico complejo y tareas de empresa, presentado el 24 de julio de 2026. El identificador en la API es claude-opus-5, sin fecha en el nombre. Está disponible desde el día cero en la API de Anthropic, Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Code, Cowork y GitHub Copilot.

El precio se mantiene en 5$ por millón de tokens de entrada y 25$ por millón de salida, exactamente los mismos números que Opus 4.8. Lo que cambia es dónde queda situado: es el modelo por defecto en Claude Max y el más potente al que se puede acceder desde Claude Pro.

Las especificaciones que importan, según la documentación oficial de la plataforma:

Especificación Claude Opus 5 Claude Opus 4.8
ID en la API claude-opus-5 claude-opus-4-8
Contexto 1M tokens (fijo) 1M tokens
Salida máxima 128k tokens 128k tokens
Precio entrada/salida 5$ / 25$ 5$ / 25$
Corte de conocimiento Mayo 2026 Enero 2026
Thinking por defecto No
Mínimo cacheable 512 tokens 1.024 tokens

Fuente: documentación oficial de Claude sobre las novedades de Opus 5 y la tabla de modelos de la plataforma.

Hay dos filas de esa tabla que casi nadie está comentando y que valen su peso en oro.

La primera: el corte de conocimiento fiable de Opus 5 es mayo de 2026. El de Fable 5 y el de Sonnet 5 es enero de 2026. Son cuatro meses de diferencia a favor del modelo más barato de los tres. Si trabajas con librerías que se mueven rápido, eso se nota más que dos puntos en un benchmark.

La segunda: el contexto de 1M de tokens es a la vez el valor por defecto y el máximo. No hay variante corta ni hay que activar nada. Y según la documentación, el seguimiento de instrucciones, las llamadas a herramientas y el razonamiento se mantienen consistentes a lo largo de toda la ventana. Es una afirmación fuerte, porque el desgaste del contexto largo es un problema real que ya tratamos en el análisis del context rot.

🔑 Opus 5 no sube de precio, sube de puesto. Pasa a ser el modelo que Anthropic te recomienda por defecto (“start with Claude Opus 5” dice la documentación), con Fable 5 reservado para cuando necesitas el techo absoluto. Y trae el corte de conocimiento más reciente de toda la familia Claude.

Curso gratis · paso a paso

Opus 5 rinde mejor si le das la tarea entera de una vez

La documentación oficial lo dice sin rodeos: Opus 5 da su mejor versión cuando recibe la especificación completa por delante y le dejas correr. Este curso gratis te hace recorrer el ciclo entero de SDD con OpenSpec sobre un proyecto real, para que llegues con una spec y no con un prompt a medio cocer.

Entra en el curso gratis →

Por qué el effort deja de ser un ajuste y pasa a ser el mando

En Opus 5 el parámetro effort es el control principal para decidir cuánta inteligencia, latencia y coste quieres. Soporta la escala completa: low, medium, high (el valor por defecto), xhigh y max. Sin cabeceras beta ni permisos especiales.

Hasta aquí, nada nuevo respecto a Opus 4.8. Lo nuevo es cómo se comporta cada escalón.

La documentación oficial es explícita en un punto que cambia las cuentas: low y medium rinden bastante mejor en Opus 5 que en Opus anteriores. La recomendación literal es usarlos “con generosidad” como control principal de coste y latencia siempre que tus evaluaciones muestren que la calidad aguanta. Para código y trabajo agéntico, el punto de partida recomendado sigue siendo xhigh.

Y luego viene el aviso que conviene subrayar: si arrastras los valores de effort que tenías afinados para Opus 4.8, vuelve a medirlos. La propia documentación pide ejecutar un barrido nuevo sobre tus evaluaciones en lugar de reutilizar los de antes.

El cambio que rompe cosas si migras a ciegas

Aquí está la letra pequeña que te va a dar un error 400 en producción si no la lees.

En Opus 4.8, las peticiones se ejecutaban sin thinking salvo que lo activaras. En Opus 5, el thinking está encendido por defecto: el modelo decide cuándo y cuánto piensa, y el effort gobierna esa profundidad.

Puedes seguir desactivándolo, pero con una condición nueva:

# Válido: thinking desactivado con effort high o inferior
{"model": "claude-opus-5", "output_config": {"effort": "high"},
 "thinking": {"type": "disabled"}}

# Error 400: thinking desactivado con effort xhigh o max
{"model": "claude-opus-5", "output_config": {"effort": "max"},
 "thinking": {"type": "disabled"}}

Es un cambio incompatible con Opus 4.8, donde desactivar el pensamiento era independiente del nivel de esfuerzo. Si hoy desactivas thinking con esfuerzo alto, tienes dos salidas: bajar el effort a high o menos, o quitar el campo thinking y quedarte con el nivel de esfuerzo.

Hay un segundo efecto secundario que la documentación reconoce sin adornos: con el thinking desactivado, Opus 5 a veces escribe una llamada a herramienta dentro del texto visible en lugar de emitir un bloque tool_use, o cuela etiquetas XML internas en la respuesta. En bucles agénticos, ese texto se queda en el historial y contamina los turnos siguientes. La recomendación oficial es no desactivar el pensamiento y controlar el gasto bajando el effort.

Y un detalle práctico que sí es una buena noticia: el mínimo cacheable baja de 1.024 a 512 tokens. Prompts que antes eran demasiado cortos para entrar en la caché ahora generan entrada sin tocar una línea de código.

⚠️ Si tienes un harness agéntico en producción contra Opus 4.8, la migración no es cambiar el identificador del modelo y listo. Revisa max_tokens (ahora el thinking come de ese presupuesto), revisa dónde desactivas el pensamiento y vuelve a medir el effort. Cambiar el ID es la parte de cinco minutos; lo demás es la parte que te ahorra el susto.

Qué dicen los benchmarks de Claude Opus 5

Opus 5 lidera prácticamente todo lo que Anthropic ha publicado y, lo que es más relevante, también lidera las mediciones de terceros que no dependen de Anthropic. Vamos con las dos tandas por separado, porque no valen lo mismo.

Los números que acompañan al anuncio oficial:

Benchmark Opus 5 Comparación
Frontier-Bench v0.1 (terminal) 43,3% Fable 5: 33,7% · GPT-5.6 Sol: 34,4%
ARC-AGI-3 (razonamiento novedoso) 30,2% GPT-5.6 Sol: 7,8% · Opus 4.8: 1,5%
GDPval-AA v2 (trabajo de conocimiento) 1.861 Elo Fable 5: 1.747 · GPT-5.6 Sol: 1.736
CursorBench 3.2 (effort por defecto) 66,7% Fable 5: 66,5% (medición de Cursor)
DeepSWE (agentic coding) 68,8% GPT-5.6 Sol: 72,7% — aquí pierde

Fuentes: anuncio oficial de Anthropic recogido por The Decoder, Decrypt y Techzine; la cifra de CursorBench la publica el propio equipo de Cursor en su foro.

Antes de seguir, una advertencia sobre las cifras que no vas a encontrar aquí. Verás circular por ahí un 96% o un 97% en SWE-bench Verified y un 79,2% en SWE-bench Pro atribuidos a Opus 5. Esos números salen de agregadores de terceros que no coinciden entre ellos, y no he podido confirmar ninguno contra un documento oficial de Anthropic. Los agregadores llevan tiempo avisando de que las puntuaciones de Claude “viven en tres sitios que no se ponen de acuerdo”: las notas de Anthropic, el leaderboard SEAL de Scale y los trackers independientes. Así que no te los doy como buenos.

Lo que sí dice Anthropic sobre SWE-bench Verified, sin dar porcentaje, es una frase que en el fondo es más elocuente que la cifra: incluso en su nivel de esfuerzo más bajo, Opus 5 resuelve más tareas que cualquier otro modelo.

Fíjate en la última fila de la tabla, porque es la que no aparece en ningún titular: en DeepSWE, Opus 5 pierde contra GPT-5.6 Sol (68,8% frente a 72,7%). No gana en todo, y agradecer que el anuncio no lo esconda no cuesta nada.

Ahora, los números de terceros, que son los que de verdad pesan cuando el fabricante y un evaluador independiente miden lo mismo.

Artificial Analysis, que ejecuta sus propias evaluaciones, coloca a Opus 5 en el primer puesto de su índice de inteligencia con 61 puntos en modo max, con la variante xhigh en 60, empatada con Fable 5, y GPT-5.6 Sol en 59. Es la primera vez que un Opus lidera esa tabla en solitario.

ARC-AGI-3, la evaluación de razonamiento novedoso de ARC Prize, es donde el salto se vuelve difícil de discutir: 30,2% frente al 7,8% de GPT-5.6 Sol y al 1,5% de Opus 4.8. Más del triple del mejor resultado previo de cualquier modelo. Cuando un número se multiplica por tres, no suele ser marketing.

En Terminal-Bench v2.1, en cambio, se queda segundo por muy poco: 89,1% frente al 89,5% de GPT-5.6 Sol, según el leaderboard de Artificial Analysis. La brecha en terminal que arrastraba la línea Opus desde hace meses se ha cerrado casi del todo.

Y aquí va el hallazgo más útil de todos para tu bolsillo, reportado por The Decoder: Opus 5 puntúa algo peor en max que en el nivel inmediatamente inferior en dos benchmarks, pese a costar más. Un análisis independiente de SitePoint apunta en la misma dirección con FrontierCode, donde el pico del modelo aparece a esfuerzo medium, no en lo más alto de la escala.

En cuanto a los testimonios de socios que acompañan al lanzamiento, dos merecen atención porque son concretos. Scott Wu, CEO de Cognition (la empresa detrás de Devin), sitúa a Opus 5 cerca del nivel de Fable 5 en FrontierCode 1.1 por la mitad de coste, y destaca su rendimiento en depuración difícil y análisis de causa raíz dentro de Devin. Wade Foster, CEO de Zapier, cuenta que el modelo cogió una hoja de cálculo cruda de salud de cuentas y ejecutó una secuencia completa de prevención de bajas de principio a fin: detectar cuentas en riesgo, avisar al responsable correcto y resumirlo para el equipo de retención. Su frase es la que mejor mide el salto: los modelos anteriores no pasaban la prueba, Opus 5 la pasó al 100%.

🎯 Subir el effort al máximo no es una garantía de nada. Hay evidencia publicada de que en algunas tareas Opus 5 rinde mejor a esfuerzo medio o alto que a máximo, gastando bastante menos. Antes de dejar max fijo en tu configuración “por si acaso”, haz un barrido de niveles con tus propias tareas. Es la optimización más barata que vas a encontrar este mes.

Claude Opus 5 vs Fable 5: ¿cuál compensa para programar?

Fable 5, lanzado el 9 de junio de 2026 como el primer modelo de clase Mythos abierto al público, sigue siendo el techo de la casa. Pero Opus 5 le ha comido casi todo el terreno práctico.

Dimensión Claude Opus 5 Claude Fable 5
Precio entrada/salida 5$ / 25$ 10$ / 50$
Índice AA (max) 61 (primero) 60
GDPval-AA v2 (Elo) 1.861 1.747
Frontier-Bench v0.1 43,3% 33,7%
Corte de conocimiento Mayo 2026 Enero 2026
Retención de datos Sin opt-in adicional Requiere opt-in 30 días
Posición Por defecto en Max El techo absoluto

Fuentes: documentación oficial de precios y modelos de Claude, fichas de Artificial Analysis y cobertura de The New Stack.

Lo llamativo es que Opus 5 gana a Fable 5 en casi todos los benchmarks que la propia Anthropic ha publicado, costando la mitad. Eso deja a Fable 5 en una posición incómoda de explicar: queda para el trabajo más ambicioso y para autonomía de días, mientras que Opus 5 está pensado, según el posicionamiento oficial, para usarse todos los días.

Si tenías Fable 5 como modelo de cabecera por capacidad bruta, este es el momento de medir. Hay una probabilidad alta de que estés pagando el doble por menos.

Claude Opus 5 vs Opus 4.8: el relevo más rápido de la línea

Opus 4.8 salió el 28 de mayo de 2026. Dos meses después, Opus 5 no solo lo supera: lo ha desplazado a la sección de modelos legacy de la documentación oficial. Sigue disponible en todas las plataformas, pero ya no es la recomendación.

Si vienes de el análisis de Opus 4.8, estas son las diferencias que vas a notar sin cambiar una línea de código, según la documentación oficial:

  1. Las respuestas son más largas por defecto, tanto en conversación como en los documentos que escribe a disco
  2. Narra más su progreso en sesiones agénticas: anuncia lo que va a hacer antes de hacerlo
  3. Delega en subagentes con más facilidad, lo que multiplica coste y tiempo si la tarea no lo justificaba
  4. Se autoverifica y se autocorrige sin que se lo pidas
  5. Puede ampliar el alcance de la tarea, añadiendo pasos que no pediste

Las tres primeras son las que te van a inflar la factura si no las domas. Y se doman con prompt, no con effort: la documentación avisa de que bajar el esfuerzo reduce el volumen de pensamiento, pero no acorta de forma fiable la respuesta visible. Si quieres respuestas cortas, pídelas.

La cuarta y la quinta piden lo contrario a lo que estabas haciendo: quitar instrucciones en vez de añadirlas. Fuera los “verifica antes de responder”, fuera los subagentes de verificación. Y para tareas de alcance estrecho, acota de forma explícita.

Claude Opus 5 vs Sonnet 5: el caballo de batalla sigue siendo Sonnet

Para el trabajo diario de un equipo, Claude Sonnet 5 sigue ganando por goleada en la única métrica que aquí manda: lo que cuesta. Opus 5 es bastante más capaz, pero también entre dos y tres veces más caro por token, y encima gasta más tokens por tarea.

Dimensión Claude Opus 5 Claude Sonnet 5
Precio entrada/salida 5$ / 25$ 2$ / 10$ hasta el 31 de agosto, luego 3$ / 15$
Índice de inteligencia (AA, max) 61 53
Terminal-Bench 2.1 89,1% 80,4%
SWE-bench Pro Sin cifra oficial 63,2%
Contexto 1M tokens 1M tokens
Corte de conocimiento Mayo 2026 Enero 2026
Dónde es el modelo por defecto Claude Max Claude Free y Pro

Fuentes: tabla de precios y modelos de la documentación oficial, índice de inteligencia de Artificial Analysis y los benchmarks recogidos en nuestro análisis de Sonnet 5. Ojo con cruzar cifras de GDPval entre modelos: Opus 5 se mide contra la revisión v2 del benchmark y Sonnet 5 contra la anterior, así que esos números no son comparables entre sí.

Ocho puntos de índice de inteligencia son mucho. Pero también lo es pagar menos de la mitad, y ese precio de estreno de 2$/10$ aguanta hasta el 31 de agosto de 2026.

La heurística que llevamos defendiendo varias generaciones sigue intacta: Sonnet ejecuta, Opus decide o rescata. Sonnet 5 para implementación guiada, refactors acotados, generación de endpoints, automatizaciones de volumen y todo lo que tenga un ciclo rápido de prueba y error. Opus 5 para planificar, para bucear en un repositorio que no controlas, para migraciones grandes y para cuando equivocarse sale caro.

El error clásico, que se paga en factura, es poner a Opus 5 a hacer trabajo de Sonnet. El error contrario, que se paga en tiempo de tu cerebro, es usar Sonnet donde hacía falta Opus.

Claude Opus 5 vs GPT-5.6 Sol: quién gana en qué

Frente al buque insignia de OpenAI el reparto es más equilibrado de lo que sugieren los titulares, y la lectura práctica cambia según dónde vivas tú.

Un apunte antes de los números: GPT-5.6 no es un modelo, son tres. Sol, Terra y Luna reparten el flagship en tres niveles de precio. Aquí comparamos con Sol, el tope de gama, que es el rival directo de Opus 5.

Benchmark / dimensión Claude Opus 5 GPT-5.6 Sol
Precio entrada/salida 5$ / 25$ 5$ / 30$
ARC-AGI-3 (razonamiento novedoso) 30,2% 7,8%
Frontier-Bench v0.1 (terminal) 43,3% 34,4%
GDPval-AA v2 (conocimiento) 1.861 Elo 1.736 Elo
DeepSWE (agentic coding) 68,8% 72,7%
Terminal-Bench v2.1 89,1% 89,5%

Fuentes: anuncio oficial de Anthropic recogido por The Decoder, Decrypt y Techzine; leaderboard de Terminal-Bench v2.1 de Artificial Analysis; precios de OpenAI recogidos en nuestro análisis de GPT-5.6.

Lo primero que salta: Opus 5 es más barato en salida (25$ frente a 30$), algo que no pasaba desde hacía generaciones. La ventaja de precio de OpenAI en la gama alta se ha esfumado.

Donde Opus 5 arrasa es en razonamiento novedoso: cuatro veces el resultado de Sol en ARC-AGI-3 no es un matiz. También manda con claridad en trabajo de conocimiento y en coding agéntico de terminal medido por Frontier-Bench.

Donde Sol aguanta es en las pruebas de terminal más clásicas: gana por cuatro décimas en Terminal-Bench v2.1 y por casi cuatro puntos en DeepSWE. Son victorias estrechas, pero reales, y conviene decirlo porque la nota de prensa no las menciona.

🎯 La conclusión sigue siendo multimodelo, no monógama. Opus 5 para planificación, razonamiento difícil, refactors multi-fichero y análisis denso. GPT-5.6 Sol si tu flujo vive en la terminal o ya tienes montado el ecosistema de OpenAI. Sonnet 5 para el grueso del trabajo diario. La pregunta buena nunca fue “cuál es el mejor”, sino “cuál es el mejor para esta tarea concreta”.

Distinguir el número que publica el fabricante del que mide un tercero independiente es medio trabajo de seguir el ritmo de los modelos. Cada domingo te cuento qué vamos aprendiendo adoptando IA en el desarrollo real. Ya somos +6.700.

Suscríbete gratis →

Por qué la mitad de precio no es la mitad de factura

Aquí está el matiz que separa el titular de la realidad: el precio por token no es lo que pagas. Lo que pagas es precio por token multiplicado por tokens consumidos. Y Opus 5 consume mucho.

Los datos de Artificial Analysis para ejecutar su propio índice de inteligencia son demoledores en ese sentido:

Métrica Opus 5 (max) Opus 5 (xhigh) Media del sector
Tokens generados para el índice 100 millones 76 millones 63 millones
Coste de ejecutar el índice 3.835,51$ 2.909,91$
Velocidad de salida 56 tok/s 52 tok/s 74 tok/s

Fuente: fichas de modelo de Artificial Analysis para Opus 5 en sus variantes max y xhigh.

Cien millones de tokens frente a una media de 63 millones. Y a 56 tokens por segundo cuando la media del sector está en 74. El veredicto de Artificial Analysis es tan directo que casi duele: está entre los modelos punteros en inteligencia, pero resulta “particularmente caro comparado con otros modelos de precio similar”.

Traducido: el ahorro está en la tarifa, no en la factura.

Ahora bien, seamos justos, porque Anthropic sostiene justo lo contrario y las dos cosas pueden ser ciertas a la vez. Su anuncio afirma que Opus 5 logra un rendimiento similar generando un 26% menos de tokens de media que Opus 4.8 a máximo razonamiento. En Frontier-Bench presume además de un tercio menos de turnos y llamadas a herramientas, y un 60% menos de tiempo.

¿Cómo encajan un “26% menos de tokens” y un “100 millones frente a 63 de media”? Sin contradicción: son dos comparaciones distintas. Anthropic compara Opus 5 contra Opus 4.8; Artificial Analysis lo compara contra la media de todos los modelos que evalúa. Opus 5 gasta menos que el Opus anterior y aun así bastante más que un modelo medio del mercado.

La lección práctica es la misma en ambos casos: si vienes de Opus 4.8, la migración probablemente te salga a cuenta. Si vienes de un modelo más ligero, prepárate para un salto de consumo.

Y esto conecta con la crítica más fina que he leído sobre el lanzamiento. Un análisis de The New Stack va justo a contracorriente del entusiasmo con un titular que da que pensar: que Opus 5 cueste un tercio es precisamente el problema. El razonamiento tiene su lógica: un agente barato corriendo bucles en segundo plano durante horas se ventila millones de tokens antes de entregarte una pull request, y la pega de un modelo tenaz es que no sabe cuándo parar. Los logs estándar de la API no te avisan a tiempo. Su propuesta es montar lo que llaman un cortafuegos semántico y credenciales de vida corta.

No es un problema nuevo, es el mismo de siempre agravado por la tentación de dejarlo correr porque sale barato. Es exactamente la disciplina anti-tokenmaxxing que hemos defendido aquí desde hace meses, ahora con un incentivo perverso extra.

💡 La pregunta correcta al evaluar Opus 5 no es “¿cuánto cuesta el millón de tokens?” sino “¿cuántos tokens necesita este modelo para resolver mi tarea?”. Mide coste por tarea completada, no coste por token. Con Opus 5 esas dos métricas apuntan en direcciones distintas, y solo una de las dos aparece en tu tarjeta de crédito.

Antes de que se te dispare la factura

Pon límites a un modelo que delega en subagentes por su cuenta

Los seis niveles de arquitectura para que tu agente no se descontrole: guardarraíles, memoria, skills, MCP y orquestación multiagéntica con revisión de otro modelo. Justo lo que Opus 5 pide cuando empieza a repartir trabajo solo.

Ver la masterclass entera →

Masterclass premium · arquitectura en 6 niveles con código

Qué dice la comunidad después de una semana con Opus 5

La reacción de la comunidad angloparlante en los primeros días tiene una forma muy reconocible: entusiasmo con los números, incomodidad con la experiencia. Dos revisiones independientes llegaron a titulares casi calcados, y eso rara vez es casualidad.

Dan Shipper, de Every, publicó el día del lanzamiento el resumen más citable que he encontrado tras una semana probándolo en programación, escritura, trabajo de conocimiento y su agente interno:

“BREAKING: Claude Opus 5 is OUT NOW! And…it’s a hard model to love. We’ve spent the last week @every testing it across coding, writing, knowledge work, and our internal agent. It argued with instructions, stopped before the work was finished, and generally didn’t play well with our existing skills and plugins like Compound Engineering. Our first reaction was: What have they done to my boy?”

Un modelo difícil de querer. Discutía con las instrucciones, paraba antes de acabar el trabajo y se llevaba mal con las skills y plugins que ya tenían montados.

Pero lo mejor viene después, y es el consejo más contraintuitivo del lanzamiento: borraron sus skills existentes y empezaron de cero. Sin los flujos elaborados que habían construido para modelos anteriores, Opus 5 mejoró de forma notable.

Piénsalo un segundo, porque va en contra de todo lo que veníamos haciendo. Llevamos dos años acumulando andamiaje —skills, plugins, instrucciones de verificación, recordatorios de “revisa antes de responder”— para compensar las carencias de los modelos. Opus 5 ya no tiene esas carencias, y el andamiaje se ha convertido en lastre.

La documentación oficial lo confirma desde el otro lado, y esta es la parte que más me ha sorprendido leer en unos docs: Opus 5 verifica su propio trabajo sin que se lo pidas, y si tu prompt lleva instrucciones de verificación heredadas (“incluye un paso final de verificación”, “usa un subagente para verificar”), hay que quitarlas, porque provocan sobre-verificación. Quitarlas reduce tokens desperdiciados sin pérdida de calidad.

El review de Lenny’s Newsletter va por el mismo camino desde su título: brillante, pero molesto. Describe una personalidad que califica de neurótica y que aparece en sesiones reales de programación, incluido un conflicto de merge que el modelo se negó a tocar.

Donde los independientes contradicen el discurso oficial

Y aquí llega el dato que más me ha hecho levantar la ceja, porque va justo en contra del punto fuerte que vende Anthropic.

CodeRabbit, que usa estos modelos para revisar código de verdad y publica sus mediciones, encontró un retroceso en revisión de código:

Métrica Opus 5 (xhigh) Su línea base de producción
Precisión de comentarios accionables 39,3% 35,2%
Problemas conocidos detectados (recall) 55,2% 61,1%
Precisión en el flujo completo 28,6% 32,8%
Comentarios irrelevantes (nitpicks) ~4x más

Fuente: benchmarks publicados por CodeRabbit sobre Opus 5 para revisión de código con IA.

Sube la precisión, sí. Pero baja el recall: encuentra menos problemas de los que ya se sabía que había. Y genera cuatro veces más ruido. Sus áreas flojas, según el mismo análisis: errores de lógica, condiciones de carrera y mal uso de APIs.

Su conclusión es que Opus 5 es un especialista, y que los resultados no respaldan usarlo como único revisor ni como red de seguridad principal en cambios de riesgo, sobre todo si tocan concurrencia o APIs. Como contraste, GPT-5.6 Sol detecta el 69,7% de los problemas conocidos, aunque solo el 31,6% de sus comentarios sean accionables.

Es la primera vez en la línea Opus que la historia no es “encuentra más bugs”.

🛡️ Que un modelo lidere el índice de inteligencia no significa que lidere tu tarea. En revisión de código, un tercero independiente mide menos cobertura que su línea base previa. Antes de poner Opus 5 de revisor único en tu pipeline, mídelo con tus pull requests. Los benchmarks generalistas no cubren tu caso concreto, y aquí hay evidencia publicada de que puede ir a peor.

Una nota de honestidad sobre esta sección: no he podido verificar las reacciones de Reddit ni el contenido de los hilos de Hacker News, que están abiertos pero no eran accesibles para consulta automatizada. Circulan por ahí resúmenes que atribuyen a Opus 5 quejas sobre guardarraíles agresivos y consumo desbocado que en realidad son del lanzamiento de Fable 5, un modelo distinto y bastante más restrictivo. Si te cruzas con ellas, comprueba la fecha antes de darlas por buenas.

Qué dice la system card sobre alineamiento

Este es el apartado donde Opus 5 saca mejor nota y donde menos titulares ha generado.

Según la system card publicada el 24 de julio de 2026, Opus 5 es el modelo más alineado de Anthropic en su auditoría conductual automatizada, por delante de Sonnet 5, Opus 4.8 y del propio Mythos 5. La cifra concreta: 2,3 en comportamiento desalineado global, la más baja de sus modelos recientes.

Se adhiere a la constitución de Claude mejor que Opus 4.8, Sonnet 5 o Fable 5, registra las tasas más bajas de comportamiento engañoso y es, en palabras de la compañía, el modelo menos susceptible de ser engañado para un mal uso de todos los que han probado. El riesgo de alineamiento general se evalúa como muy bajo.

Hay un dato que interesa a quien sufrió los clasificadores de Fable 5: se espera que los clasificadores de ciberseguridad intervengan alrededor de un 85% menos que en versiones previas. Si abandonaste Fable 5 porque te cortaba trabajo legítimo, esta es la diferencia práctica que buscabas. Y a diferencia de Fable 5, Opus 5 tampoco queda sujeto a la política de retención de datos de 30 días, un detalle que importa a quien trabaja con código de clientes.

En lo relativo al marco de escalado responsable: Opus 5 mantiene las mismas protecciones ASL-3 que Opus 4.8 y no cruza el umbral de I+D de IA automatizada. En ciberseguridad ofensiva y en investigación biológica se queda por detrás de Mythos 5: está cerca a la hora de encontrar vulnerabilidades, pero “sustancialmente por detrás” a la hora de explotarlas.

Es un dato que conviene tener presente cuando la conversación se va al terreno de “cada modelo nuevo es más peligroso”. Aquí, el modelo público más capaz es también el que menos coopera con quien intenta usarlo mal.

Y en el terreno científico, Anthropic se moja: lo presenta como el modelo de disponibilidad general más capaz para investigación científica, superando a Opus 4.8 en todas sus evaluaciones de ciencias de la vida. Los dos números concretos que da son +10,2 puntos porcentuales en química orgánica (deducir estructuras moleculares a partir de datos de espectroscopía) y +7,7 puntos en tareas de proteínas. Con una limitación que reconocen ellos mismos: sigue flojeando en tareas de investigación autónomas de largo recorrido.

Cada lanzamiento obliga a revisar decisiones que dabas por cerradas, y hacerlo en solitario cansa. Cada domingo seleccionamos 12 recursos sobre IA y desarrollo, y los suscriptores aportan lo suyo. Gratis, desde 2018.

Apúntate gratis →

Cuándo migrar a Claude Opus 5 y cuándo esperar

Migrar compensa si trabajas con Claude Code o con harnesses agénticos en proyectos serios, si haces trabajo de conocimiento denso o si necesitas computer use. No compensa si tu prioridad es el coste por tarea en volumen alto o si tienes un pipeline de revisión de código afinado que hoy funciona.

Te lo planteo en cuatro escenarios.

Si trabajas con Claude Code a diario

Migra, pero con deberes. La ganancia en tareas agénticas largas y coordinación de subagentes es real y está medida por terceros. Ahora bien, dedica una tarde a limpiar tu configuración: quita las instrucciones de verificación, revisa las skills que acumulaste para Opus 4.7 y 4.8, y vuelve a medir el effort. El testimonio de Every apunta justo ahí, y la documentación oficial lo respalda.

Si tienes un harness en producción contra la API

Léete los cambios incompatibles antes de tocar nada. El thinking encendido por defecto cambia el reparto de max_tokens, y desactivarlo con effort en xhigh o max devuelve un 400. No es una migración de buscar y reemplazar.

Si tu caso es revisión automática de código

Espera y mide. Es el único terreno donde hay evidencia publicada por un tercero de que Opus 5 puede ir a peor que la línea base previa en cobertura. Ejecútalo contra tus propias pull requests antes de sustituir nada.

Si buscas el mejor precio por rendimiento

No es Opus 5. Sonnet 5 sigue siendo el caballo de batalla, con precio introductorio hasta finales de agosto. Y si tu carga es de volumen alto y latencia sensible, recuerda el dato de Artificial Analysis: 56 tokens por segundo frente a una media de 74. Opus 5 no es un modelo rápido.

Lo que queda por ver sobre Opus 5

Tres incógnitas que no se resuelven en una semana.

La primera es si el consumo de tokens se modera. Los 100 millones de tokens que midió Artificial Analysis son de la primera versión servida. Anthropic ha ajustado ese comportamiento en lanzamientos anteriores tras los primeros días.

La segunda es cuánto tarda el ecosistema en desaprender. Miles de repositorios llevan ficheros de instrucciones con “verifica tu trabajo” y subagentes de revisión que ahora restan. La documentación pide quitarlos, pero eso implica que medio ecosistema de plantillas y skills públicas está desafinado para el modelo nuevo.

La tercera, y la más incómoda: qué pasa con Fable 5. Si el modelo de la mitad de precio le gana en casi todos los benchmarks publicados por la propia casa, la gama alta necesita una explicación mejor que “para trabajo más ambicioso”.

Claude Opus 5 en una frase

Opus 5 es el modelo más capaz que Anthropic ha puesto al alcance de una suscripción normal, y el que más trabajo te va a dar para domarlo. Lidera el índice de inteligencia independiente, triplica el récord de ARC-AGI-3, mantiene el precio de su predecesor y trae el corte de conocimiento más reciente de la familia. También gasta más tokens que la media, va más lento que la media, discute con tus instrucciones y rinde peor que su antecesor en al menos una tarea medida por un tercero.

¿La decisión sensata? La de siempre, y perdona la insistencia: pruébalo con tus tareas y mide coste por tarea resuelta, no por token. Los benchmarks no programan por ti. Las notas de prensa tampoco. Y esta vez, ni siquiera el precio por token te está contando toda la verdad.

Preguntas frecuentes sobre Claude Opus 5

¿Qué es Claude Opus 5?

Claude Opus 5 es el modelo de Anthropic para trabajo agéntico complejo y tareas de empresa, lanzado el 24 de julio de 2026. Su identificador en la API es claude-opus-5. Tiene 1 millón de tokens de contexto, 128k de salida máxima y el thinking activado por defecto. Es el modelo por defecto en Claude Max y el más potente disponible en Claude Pro.

¿Cuánto cuesta Claude Opus 5?

Claude Opus 5 cuesta 5$ por millón de tokens de entrada y 25$ por millón de salida, el mismo precio que Opus 4.8 y la mitad que Fable 5. Con la Batch API baja a 2,50$/12,50$, las lecturas de caché cuestan 0,50$ y el fast mode (en research preview y solo en la API de Anthropic) sube a 10$/50$.

Claude Opus 5 vs Fable 5: ¿cuál conviene para programar?

Para programar, Opus 5 en casi todos los casos. Gana a Fable 5 en la mayoría de benchmarks publicados costando la mitad (5$/25$ frente a 10$/50$), lidera el índice de inteligencia de Artificial Analysis con 61 puntos frente a 60, le saca 114 puntos Elo en GDPval-AA v2 y tiene un corte de conocimiento cuatro meses más reciente. Fable 5 solo compensa para el trabajo más ambicioso y la autonomía de varios días.

¿Qué ventajas prácticas tiene Opus 5 sobre Fable 5 más allá del precio?

Tres que no salen en las tablas de benchmarks. Sus clasificadores de ciberseguridad intervienen alrededor de un 85% menos, así que corta mucho menos trabajo legítimo. No queda sujeto a la política de retención de datos de 30 días que sí aplica a Fable 5. Y su corte de conocimiento fiable es de mayo de 2026 frente a enero de 2026, lo que se nota al trabajar con librerías que se mueven rápido.

¿Merece la pena Opus 5 o me quedo con Sonnet 5?

Depende del tipo de tarea, no del presupuesto. Sonnet 5 cuesta 2$/10$ por millón de tokens hasta el 31 de agosto de 2026 (luego 3$/15$) frente a los 5$/25$ de Opus 5, y sigue siendo el caballo de batalla para implementación guiada, refactors acotados y automatizaciones de volumen. Opus 5 saca ocho puntos en el índice de inteligencia de Artificial Analysis (61 contra 53) y compensa para planificar, explorar repositorios que no controlas y migraciones grandes.

Claude Opus 5 vs GPT-5.6 Sol: ¿cuál es mejor para programar?

Se reparten el terreno. Opus 5 gana con claridad en razonamiento novedoso (30,2% contra 7,8% en ARC-AGI-3), en coding agéntico de terminal según Frontier-Bench v0.1 (43,3% contra 34,4%) y en trabajo de conocimiento (1.861 contra 1.736 Elo en GDPval-AA v2). GPT-5.6 Sol mantiene ventajas estrechas en Terminal-Bench v2.1 (89,5% contra 89,1%) y en DeepSWE (72,7% contra 68,8%). Además Opus 5 es más barato en salida: 25$ contra 30$ por millón de tokens.

¿Qué cambios incompatibles trae Opus 5 respecto a Opus 4.8?

Dos. El thinking está activado por defecto, así que consume parte del presupuesto de max_tokens en peticiones que antes iban sin él. Y thinking: {"type": "disabled"} solo se acepta con effort en high o inferior: usarlo con xhigh o max devuelve un error 400. Cambiar el identificador del modelo no basta para migrar.

¿Qué niveles de effort admite Claude Opus 5?

Los cinco: low, medium, high, xhigh y max. El valor por defecto en la API y en Claude Code es high. Para código y trabajo agéntico, la recomendación oficial es empezar en xhigh. Los niveles low y medium rinden bastante mejor que en modelos Opus anteriores, así que sirven como control principal de coste.

¿Cuánta memoria de contexto tiene Claude Opus 5?

Un millón de tokens, que es a la vez el valor por defecto y el máximo: no existe una variante con contexto menor. La salida máxima es de 128k tokens, ampliable a 300k a través de la Batch API con la cabecera beta correspondiente. Según la documentación, el rendimiento se mantiene consistente a lo largo de toda la ventana.

¿Es Claude Opus 5 bueno para revisión de código?

Con matices, y esta es la parte que el anuncio oficial no cuenta. Las mediciones independientes de CodeRabbit muestran mayor precisión (39,3% frente a 35,2% de su línea base) pero menor cobertura (55,2% frente a 61,1%) y unas cuatro veces más comentarios irrelevantes. Sus áreas flojas son errores de lógica, condiciones de carrera y mal uso de APIs. No conviene usarlo como revisor único en cambios de riesgo.

¿Por qué mi factura no baja si Opus 5 cuesta lo mismo que Opus 4.8?

Porque genera más tokens. Artificial Analysis midió 100 millones de tokens para ejecutar su índice de inteligencia en modo max, frente a una media de 63 millones entre los modelos evaluados. El precio por token es idéntico, pero el consumo por tarea sube. Mide siempre coste por tarea completada, no coste por millón de tokens.

¿Hay que cambiar los prompts al migrar a Opus 5?

Sí, y sobre todo hay que quitar cosas. La documentación oficial pide eliminar las instrucciones de verificación heredadas (“incluye un paso final de verificación”, “usa un subagente para verificar”) porque Opus 5 se autoverifica y esas órdenes provocan sobre-verificación y gasto inútil. También conviene acotar el alcance de forma explícita en tareas estrechas y pedir brevedad si quieres respuestas cortas.

¿Cuál es el corte de conocimiento de Claude Opus 5?

Mayo de 2026, el más reciente de toda la familia Claude actual. Fable 5 y Sonnet 5 se quedan en enero de 2026. Son cuatro meses de ventaja para el modelo intermedio, algo que se nota al trabajar con librerías y herramientas que se mueven rápido.

Fuentes

🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter

Imagen de Daniel Primo
Claude, IA de Anthropic

Escrito con la ayuda de la IA generativa de Claude, fuentes fidedignas y con un human in the loop:
Dani Primo.

CEO en pantuflas de Web Reactiva. Programador y formador en tecnologías que cambian el mundo y a las personas. Activo en linkedin, en substack y canal @webreactiva en telegram

12 recursos para developers cada domingo en tu bandeja de entrada

Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.