Fable 5.1: qué cambia, cuánto cuesta y cuándo usarlo
Claude Fable 5.1 salió el 1 de septiembre de 2026, y lo interesante es que el “.1” se queda corto. No es “Fable 5 pero más listo”. Es Fable 5 con mucha menos fricción, mejor forma de comunicar lo que hace, menos falsos positivos de seguridad y una economía de tokens en agentes que cambia las cuentas.
Dicho de otra forma: la misma inteligencia base, pero por fin agradable de usar.
Y de rebote llega Mythos 5.1, el gemelo sin parte de los frenos, reservado otra vez a organizaciones verificadas de ciberseguridad y ciencias de la vida. Tú y yo, los civiles, jugamos con Fable. Como siempre.
Este post lo escribo en las primeras horas tras el lanzamiento, filtrando sobre todo Reddit, Hacker News, Bluesky, Substack y blogs de gente que ya lo está estrujando, más que prensa tecnológica. Esto es lo que vas a encontrar:
- Qué cambia de verdad entre Fable 5 y Fable 5.1 (pista: no es la inteligencia bruta)
- El nivel de esfuerzo que compensa y por qué
Maxpuede ser un despilfarro absurdo - Los benchmarks, con los asteriscos puestos donde tocan
- Cómo programa en tareas reales, y por qué destaca el que le monta buen harness
- La mejora en salvaguardas, que es media diferencia con Mythos
- Qué sabemos (y qué no) de Mythos 5.1
- Cuándo compensa frente a Opus 5 y GPT-5.6 Sol
⚠️ Este post se escribió en las primeras horas del 1 de septiembre de 2026. Lo más volátil es el precio por token y la disponibilidad exacta por plan; lo que aguanta el paso del tiempo es la lectura de qué tipo de mejora es esta y cómo leer un lanzamiento sin comerte el hype. Si lees esto semanas después, salta directo a la sección de “cuándo compensa” y a la del harness, que es la parte que no caduca.
¿Qué es Fable 5.1 y qué cambia respecto a Fable 5? ¶
Fable 5.1 es el modelo público más capaz de Anthropic tras la familia Fable/Mythos 5, y su gran novedad no está en subir un peldaño de inteligencia sino en quitar la fricción que hacía a Fable 5 brillante pero incómodo. Comparte el planteamiento de su antecesor: mismo motor por debajo que Mythos 5.1, con clasificadores de seguridad encima que, cuando saltan, derivan la petición a otro modelo.
Si tuviera que resumir el consenso de las primeras horas en una ecuación, sería esta:
Inteligencia de Fable 5 + mucha menos fricción + mejor comunicación + mejor economía en agentes.
No es poca cosa. La queja de fondo con Fable 5 nunca fue que fuera tonto: era que resultaba lento y desagradable de usar en interactivo, que quemaba tokens sin piedad y que los clasificadores te frenaban trabajo legítimo cada dos por tres. Fable 5.1 va justo a por eso.
| Especificación | Fable 5.1 |
|---|---|
| Familia | Fable / Mythos 5.1 (mismo motor base) |
| ID de modelo | claude-fable-5-1 |
| Gemelo sin frenos | claude-mythos-5-1 (acceso restringido) |
| Niveles de esfuerzo | low, medium, high, xhigh, max |
| Nivel recomendado | high (el punto dulce, no max) |
| Pensamiento | Adaptativo, siempre activo |
| Subagentes en paralelo | Sí, y sabe orquestarlos por su cuenta |
| Salvaguardas | Sí (menos intrusivas que en Fable 5) |
Fíjate en lo que no cambia: sigue siendo un modelo de gama alta, pensado para tareas largas y ambiguas, con pensamiento adaptativo siempre activo. Lo que cambia es todo lo que lo rodea. Every, que lo tuvo una semana antes del lanzamiento y firma probablemente la review más útil que he leído, lo describe como el Claude más fuerte para programar que han usado, pero sobre todo como el primero que sirve tanto para sesiones interactivas como para tareas largas autónomas sin obligarte a cambiar de modelo a mitad de faena.
Su frase resume el cambio de carácter mejor que cualquier benchmark: Fable 5 era un modelo brillante pero horrible de usar; 5.1 es “Fable para todos”. Kieran Klaassen, de su equipo, cuenta que ha podido sustituir con un único modelo tanto los modelos rápidos que usaba para lo interactivo como el propio Fable para lo pesado.
🔑 Para el trabajo agéntico, ese cambio pesa más que cinco puntos arriba o abajo en un benchmark. Un modelo que sirve para el ida y vuelta rápido y para dejarlo trabajando solo una hora te ahorra la gimnasia de andar cambiando de modelo según la tarea.
¿Cuánto cuesta usar Fable 5.1 y qué nivel de esfuerzo compensa? ¶
La respuesta corta: el punto dulce es high, no max. Y esto no es un detalle de propina, es la decisión que más te va a mover la factura.
Empecemos por el dato que más ruido está haciendo en Reddit. En las pruebas de Artificial Analysis, Fable 5.1 obtiene 66 en su Intelligence Index, colocándose en cabeza de la clasificación actual. Está bien para titular, pero la propia discusión es más interesante que la cifra: hay usuarios que cuestionan que ese índice refleje bien el coding real, y hay una observación mucho más útil enterrada ahí debajo.
Fable 5.1 en high consigue aproximadamente la inteligencia de Fable 5 gastando muchísimo menos. Subirlo a max dispara el gasto sin una mejora proporcional. Es decir, el gran salto de economía no está en llevar el modelo al límite, sino en que el nivel intermedio ya te da lo que antes te costaba el doble.
Eso encaja con lo que Every encontró por otro camino: en su agente interno para Slack, Fable 5.1 usó menos de la mitad de tokens que Opus 5 obteniendo resultados comparables. Dos medidas distintas apuntando al mismo sitio.
Y luego está el aviso de Simon Willison, que hizo su clásico benchmark del pelícano en SVG probando los cinco niveles. low y medium prácticamente no razonaron. high le costó unos 0,13 dólares. Pero al subir a max obtuvo uno de los mejores resultados que ha visto de un Claude… a un coste de alrededor de 3,30 dólares por un solo SVG. Animarlo después le costó otros 1,37.
Léelo dos veces: más de tres dólares por una imagen vectorial.
💡 Cuando compares niveles, mide coste por tarea resuelta, no lo listo que quieres que se ponga el modelo.
maxno es el modo por defecto: es la palanca que aprietas deliberadamente para el problema más difícil que tengas encima. Para casi todo,highte sobra y te sale mucho más barato.
La conclusión práctica es que Fable 5.1 parece diseñado para que elijas cuánto “modelo” compras en cada tarea, en lugar de pagar el máximo por defecto. Y ahí es donde la aritmética se vuelve personal: depende de cuánto uses la IA cada día y de si ya estás pagando una suscripción que te lo incluye.
Herramienta gratis · Calculadora
¿Y a ti te sale más barato por suscripción o por API?
Fable 5.1 mueve las cuentas otra vez: el punto dulce es high, no max, y la caché pesa más que nunca. Antes de decidir cómo pagarlo, mira lo que costaría tu uso real de cada día pagando por tokens, plan a plan.
Le das
Lo que usas la IA cada día
Te devuelve
Lo que costaría ese mismo uso pagando por tokens
¿Fable 5.1 es más inteligente o solo menos incómodo? ¶
Las dos cosas, pero sobre todo lo segundo. Y esa distinción es la que separa una lectura sensata del lanzamiento de la fiebre de titular.
El consenso inicial no es “es mucho más inteligente que Fable 5”. Es que resuelve el gran defecto de Fable 5: con la versión anterior tenías un modelo genial pero que te obligaba a tragarte lentitud y falsos positivos para trabajar de forma iterativa. Con 5.1, según Every, sus propios escritores y programadores quieren usarlo directamente, sin peajes.
Ahí está la palabra clave del lanzamiento: convergencia. Fable deja de ser “el modelo caro que sueltas para lo grande y asíncrono” para volverse también un modelo con el que puedes tener una conversación normal. Every insiste precisamente en eso: 5.1 borra la frontera entre el modelo interactivo y el de largo recorrido.
Que un solo modelo cubra los dos casos tiene una consecuencia poco glamurosa pero muy real: dejas de gestionar un zoo de modelos. Nada de “para esto uso el rápido, para esto el potente, para esto el barato”. Uno solo, y ajustas el esfuerzo según la tarea.
⚠️ Ojo con leer esto como “ya no necesito pensar qué modelo uso”. Sí lo necesitas: sigue habiendo tareas donde Opus 5 o un modelo más barato salen mejor de cuentas. Lo que desaparece es la fricción de cambiar de modelo dentro de Claude según sea interactivo o autónomo.
¿Qué dicen los benchmarks de Fable 5.1 y Mythos 5.1? ¶
Los números publicados dejan un titular claro y muchos matices. Aquí están los que de verdad importan a quien programa, con Fable 5.1 y Mythos 5.1 frente a Fable 5, Opus 5 y GPT-5.6 Sol:
| Benchmark | Fable 5.1 | Mythos 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6% | — | 24,7% | 29,0% | 22,4% |
| Terminal-Bench 4.0 | 55,8% | 60,9% | 42,0% | ~52,3% | 37,3% |
| HLE, sin herramientas | 60,9% | — | 57,8% | 56,6% | — |
| AutomationBench | 31,4% | — | 17,1% | 26,9% | 19,6% |
| CursorBench 3.2 | 73,4% | — | 70,5% | 70,0% | 67,2% |
El resultado espectacular, el que hay que mirar, es Terminal-Bench-Science: de 24,7 a 52,6. Más del doble. Simon Willison señala precisamente ese: es el salto grande de verdad, mientras que en el resto las mejoras son bastante más incrementales. En HLE sin herramientas pasa de 57,8 a 60,9; en CursorBench, de 70,5 a 73,4. Buenas subidas, no revoluciones.
Y aquí va el asterisco grande, que conviene grabarse: la mayoría de estos benchmarks los ejecuta y publica Anthropic, no son replicaciones independientes. Además, Terminal-Bench-Science 0.1 acaba de estrenarse, así que todavía no sabemos cuánto valor predictivo tiene para tu trabajo real.
Mi lectura, entonces, es más afinada que “salto de inteligencia 2×”:
Fable 5 → Fable 5.1 no es un salto general del doble de listo. Es un salto enorme en un sitio concreto —investigación agéntica y científica, autonomía prolongada— y mejoras finas en el resto.
Eso enlaza con una idea que llevamos tiempo repitiendo: un modelo no programa solo. Es una pata; la otra es el harness que lo envuelve, el andamiaje de plan, permisos, subagentes y verificación que le montas alrededor. Fable 5.1 sube justo donde ese andamiaje importa más.
El modelo es una pata; el harness es la otra
Antes de pelearte con Fable, la parada 3 del curso-juego separa modelo de agente sin humo, y la del presupuesto te evita el susto de dejar el esfuerzo en max por defecto. 17 paradas, eliges proyecto y sales con una checklist a tu medida.
Entra en el curso gratis →¿Cómo programa Fable 5.1 en tareas reales? ¶
Aquí es donde las opiniones empiezan a ponerse llamativas, y donde una prueba real vale más que un benchmark sintético.
Kieran Klaassen, de Every, le pidió reconstruir Proof, su editor de documentos, desde cero con un solo prompt. Fable 5 ya podía; 5.1 también, pero según él profundizó más, añadió detalles útiles que nadie le había pedido y tomó mejores decisiones de producto. Funcionó bien dentro de su flujo de planificar → implementar → revisar → probar sin humano en el bucle. Otro tester migró un blog entero fuera de Webflow con un prompt, y a continuación le pidió una versión de la Stanford AI Town: acabó construyendo 25 personajes con memoria, rutinas y propagación de información entre ellos.
Y luego está el ejemplo que se ha vuelto viral en Reddit. Un usuario pidió, tal cual:
constrúyeme algo del nivel de Cities: Skylines II usando Three.js.
Fable diseñó primero la arquitectura, creó alrededor de 14 agentes en paralelo, añadió agentes críticos que inspeccionaban capturas de pantalla del resultado, y trabajó cerca de una hora antes de que el usuario lo parara. El consumo declarado fue enorme —1,9 millones de tokens de salida y 118 millones de lecturas de caché—, pero justo ahí es donde el nuevo precio de la caché empieza a importar de verdad.
No lo tomo como benchmark. Lo tomo como evidencia de una propiedad interesante:
Fable 5.1 parece especialmente diseñado para harnesses donde el modelo se monta sus propios planes, workers, verificadores y bucles.
Eso conecta con lo que ya contábamos sobre las dynamic workflows y el harness que envuelve al modelo: el ejemplo de Cities: Skylines no impresiona porque genere Three.js, impresiona porque a partir de una especificación cortísima construye arquitectura → sistema de verificación → agentes especializados → críticos visuales → iteraciones. Es casi una demostración de que el harness multiplica al modelo, no de “vibe coding con un modelo más listo”.
Y ahí está la idea que me parece más relevante para tu día a día: Fable 5.1 aumenta de valor cuanto mejor es el harness que le das. El modelo pone la capacidad; el andamiaje que le montas decide cuánto de esa capacidad aprovechas.
El andamiaje que aprovecha a Fable
Si el harness multiplica al modelo, más te vale saber montarlo
Verás los seis niveles de arquitectura —tools, guardarraíles, memoria, skills, MCP y orquestación— para pasar de un LLM con herramientas a un sistema multiagéntico revisado por otro modelo, que es exactamente lo que Fable 5.1 se monta solo cuando le das margen.
Ver la arquitectura →Masterclass en directo · Acceso con Web Reactiva Premium
¿Por qué Fable 5.1 molesta menos que Fable 5? ¶
Porque las salvaguardas están mejor afinadas, y eso aparece una y otra vez en las pruebas de código. Con Fable 5, una parte enorme del malestar no venía de la inteligencia del modelo, sino de la interferencia de los clasificadores de seguridad frenando trabajo legítimo.
Every afirma haber podido realizar tareas relacionadas con seguridad que Fable 5 rechazaba o desviaba. Kieran vio muchos menos falsos positivos durante ingeniería normal. El único caso absurdo que encontraron fue el modelo negándose a introducir una contraseña de prueba durante un bucle automatizado, que es exactamente el tipo de fricción tonta que hacía a Fable 5 desesperante.
Esto importa por un motivo de fondo: buena parte de la diferencia entre Fable y Mythos no es inteligencia, es cuánto te interfieren los frenos. Y ahora tenemos una forma bonita de medirlo.
Mythos 5.1: ¿supermodelo secreto o Fable sin frenos? ¶
Aquí toca mucha prudencia, porque prácticamente no existen todavía reviews independientes reales de Mythos 5.1. El motivo es simple: el modelo está limitado a organizaciones verificadas de ciberseguridad y ciencias de la vida, igual que su antecesor vivía en Project Glasswing. Las búsquedas de “probé Mythos 5.1” o “usé Mythos 5.1” dan casi solo conversaciones sobre el lanzamiento, no sesiones de uso.
Así que la foto de hoy es esta:
Fable 5.1 tiene reviews. Mythos 5.1 tiene benchmarks. Y yo no extrapolaría mucho más.
Lo que sí sabemos por las cifras publicadas es que Mythos no parece “otro modelo más inteligente”. Es esencialmente la misma base que Fable 5.1 con menos interferencia de ciertos mecanismos de seguridad. Jake Handy hace justo esta distinción en su análisis: no compras un cerebro distinto, compras el mismo cerebro con menos correa.
Y aquí está el experimento natural que me parece más valioso de todo el lanzamiento:
Terminal-Bench 4.0
- Mythos 5.1: 60,9
- Fable 5.1: 55,8
Misma base, distintos niveles de protección. Esa diferencia de unos 5 puntos nos da una estimación rara de ver en público: cuánto pueden penalizar los mecanismos de seguridad ciertas tareas agénticas. Por eso ese 60,9 frente a 55,8 me interesa muchísimo más que toda la narrativa del “supermodelo secreto”. No mide un modelo mejor; mide el precio de los frenos.
🛡️ Que Mythos saque más no significa que sea “más listo”: significa que le estorban menos las salvaguardas en ese tipo de tarea. Para quien defiende sistemas, es una noticia con doble filo. Si te mueves por ese terreno, el análisis de GPT-5.4-Cyber frente a Claude Mythos te da el contexto de por qué estas capacidades viven detrás de acceso verificado.
Cada semana hay modelo nuevo, benchmark nuevo y titular nuevo. Cada domingo seleccionamos 12 recursos para que no tengas que perseguirlos tú. Ya somos +6.700 developers, gratis desde 2018.
Quiero esa dinamita 🧨¿Escribe bien Fable 5.1? Sorprendentemente sí, con una bandera roja ¶
En escritura las impresiones iniciales también son positivas, y esto no es habitual con un modelo pensado para código. Every dice que es el primer Claude en cerca de un año que sus escritores quieren usar directamente para redactar. Encontraron menos “AI tells”, estructura más clara y un nivel de lectura más sencillo que Fable 5, Opus 5 o Sol. En una prueba de completar una sección de un ensayo obtuvo el mejor resultado que habían medido.
Coincide con una impresión que circula en Hacker News: Fable 5.1 sería mucho menos “Claude-ish”, más natural y más obediente a instrucciones de estilo.
Pero aquí aparece el defecto más claro que he encontrado, y es de los que exigen vigilancia. Every le pidió cosas concretas y el modelo se pasó de largo:
- 1.000 palabras → entregó 1.288.
- 3-6 temas → entregó 8.
- 8-12 citas → produjo 43.
- Y algunas de esas citas no estaban en las fuentes.
Además observaron que con esfuerzo muy alto puede crear subagentes innecesarios y seguir trabajando incluso cuando le pides que pare y te explique qué está haciendo.
Así que hay una contradicción curiosa: mejor criterio global, pero todavía cierta tendencia a excederse cuando le das demasiada libertad. Para research, eso te obliga a verificar. Un modelo que se inventa citas con aplomo es exactamente el tipo de “basura convincente” que más caro te sale si la das por buena.
El caso del cifrado de 373 años (y por qué no me lo creo del todo) ¶
Circula mucho estos días una historia: Vals AI afirma que Fable 5.1 ayudó a resolver en unos minutos un cifrado histórico de 373 años que seguía sin resolver. Se está compartiendo como prueba de las capacidades de investigación del modelo.
Yo no lo usaría todavía como evidencia fuerte.
La propia discusión en Reddit cuestiona rápidamente la dificultad real del procedimiento utilizado y si de verdad se habían agotado antes soluciones similares. Es un caso interesante, no un benchmark. Y encaja con la bandera roja de la sección anterior: cuando un modelo es tan capaz de producir resultados espectaculares, la carga de la prueba se mueve hacia ti. El titular es bonito; la verificación es tuya.
¿Fable 5.1 frente a Opus 5, GPT-5.6 Sol y compañía? ¶
Vamos al mapa para decidir, con la honestidad de que estamos en el primer día y varias filas tienen asteriscos.
| Escenario | Quién manda ahora mismo |
|---|---|
| Coding agéntico / harness | Fable 5.1: planificación, autonomía, subagentes, criterio, horas vivas |
| Coding interactivo | Fable 5.1: deja de obligarte a cambiar de modelo a mitad de sesión |
| Tareas normales precio/valor | Opus 5: relación coste/prestaciones muy defendible para lo del día |
| Instrucciones finas / textos cortos | GPT-5.6 Sol: más disciplinado y más barato en varios escenarios |
| Ciberseguridad con acceso | Mythos 5.1, pero sin reviews independientes todavía |
Desgranado:
Para coding agéntico y harness engineering, Fable 5.1 es ahora mismo el modelo a batir. No tanto porque escriba funciones mejores, sino por planificación, autonomía, criterio, subagentes y capacidad de mantener una tarea viva durante horas.
Contra Opus 5: Opus sigue teniendo una relación precio/prestaciones muy defendible para tareas normales. Pero Fable 5.1 parece ampliar la distancia en trabajos difíciles y largos. Si dudas entre los dos Claude, tienes el cara a cara en Opus 5 vs Fable 5.
Contra GPT-5.6 Sol: no veo evidencia suficiente para decir “Fable gana a Sol” y ya. Sol sigue pareciendo mejor compresor, más disciplinado en ciertas instrucciones y más barato en varios escenarios; Every, de hecho, sigue prefiriéndolo para posts cortos en X. Pero en coding agéntico largo, Fable 5.1 tiene ahora mismo las señales más fuertes.
Mythos 5.1: no compraría el hype todavía. El 60,9 de Terminal-Bench es espectacular, pero hasta que haya usuarios externos con acceso y resultados reproducibles, básicamente estamos viendo a Fable 5.1 sin parte de los frenos.
Si tu duda es más amplia —qué modelo usar para programar en general— el comparativo de los mejores modelos para código pone a Fable en contexto con toda la competencia, y para el enrutado por tarea tienes el routing de modelos con matrices de decisión.
Elegir qué modelo usar para cada tarea es una decisión que caduca cada pocas semanas. En la newsletter te ayudamos a poner orden en este cambio con 12 recursos seleccionados cada domingo. Ya somos +6.700.
Quiero esa dinamita 🧨¿La comunidad está de acuerdo con la velocidad? ¶
No del todo, y es sano contarlo. Every describe Fable 5.1 como mucho más rápido y suficientemente ágil para sustituir a los modelos interactivos. Pero ya hay usuarios en Reddit reportando tareas donde sigue pareciendo lento.
No creo que sea una contradicción real. Depende muchísimo del nivel de esfuerzo y, sobre todo, de si el modelo empieza a desplegar subagentes: en el momento en que se monta su enjambre de workers y críticos, deja de sentirse como un chat y pasa a sentirse como un proceso largo. Rápido en interactivo, pausado cuando se pone a orquestar. Las dos cosas a la vez.
¿Cómo seguir un lanzamiento así sin comerte el hype? ¶
Esta sección seguirá sirviendo cuando Fable 5.1 sea historia y estemos hablando de la 5.2 o de lo que toque. Los lanzamientos siguen todos el mismo guion, y hay un orden sensato para consumirlos:
- La ficha oficial primero, pero como declaración de intenciones. Te dice qué han optimizado, no qué has conseguido tú.
- Separa lo verificable de lo autoproclamado. Un benchmark que puede reproducir cualquiera y uno publicado por el propio laboratorio no pesan igual, aunque salgan en la misma tabla.
- Desconfía de los benchmarks recién estrenados. Terminal-Bench-Science 0.1 impresiona, pero todavía no sabemos cuánto predice sobre tu trabajo.
- La señal de calidad llega con los terceros. Cuando aparecen reviews independientes y quejas concretas de gente usándolo en repos sucios, es cuando por fin sabes algo. Hoy, Fable tiene reviews tempranas; Mythos, solo benchmarks.
- Tu repo es el único benchmark que importa. Coge cinco tareas de verdad y mide vueltas, tests rotos, coste por tarea y cuánta basura convincente deja por el camino. La última no sale en ninguna tabla y es la que más caro te sale.
¿Cuándo compensa Fable 5.1 y cuándo no? ¶
Te lo pongo en forma de decisión, no de tabla.
Tiene sentido si:
- Tu trabajo son tareas largas y multiarchivo donde el modelo sostiene el contexto durante horas.
- Montas harnesses con planes, subagentes, verificadores y bucles, y quieres un orquestador que aguante.
- Quieres un único modelo para lo interactivo y lo autónomo, sin andar cambiando.
- Haces trabajo legítimo de seguridad que Fable 5 te frenaba: los falsos positivos han bajado.
Todavía no compensa si:
- Tus tareas son cortas y acotadas: un bug, un commit, un refactor de un módulo. Ahí Opus 5 o un modelo más barato salen mejor de cuentas.
- El coste te pesa y dejas el esfuerzo en
maxpor costumbre: eso es tirar el dinero. - Tu criterio de compra son reviews independientes reproducibles de Mythos: no las hay.
- Necesitas máxima disciplina en instrucciones cerradas o textos muy cortos: ahí Sol sigue peleando fuerte.
Y una prueba concreta para no decidir por intuición. Coge cinco tareas de tu repo de verdad y pásaselas a tu modelo actual y a Fable 5.1 en high:
- Una feature que toque al menos cuatro archivos.
- Un bug viejo con reproducción incómoda.
- Una migración pequeña con tests que tienen que pasar de verdad al ejecutarlos.
- Una tarea agéntica larga donde el modelo tenga que planificar y verificar solo.
- Un encargo con criterios cerrados —“1.000 palabras, 5 temas”— para ver si respeta los límites o se pasa de largo.
La quinta es la trampa a propósito: es justo donde Fable 5.1 tiende a excederse.
Lo que queda por demostrar ¶
Fable 5.1 llega con una tesis fuerte y unos cuantos agujeros. Los agujeros, ordenados por importancia:
- Casi todos los benchmarks son de Anthropic. Faltan replicaciones independientes sobre repositorios reales.
- El resultado estelar es un benchmark recién nacido. Terminal-Bench-Science 0.1 aún no tiene historial que diga cuánto predice.
- Tiende a excederse con libertad. Más palabras, más temas, más citas de las pedidas, y alguna inventada.
- Mythos 5.1 no tiene reviews. Solo benchmarks y acceso restringido.
- La velocidad depende del caso. Rápido en interactivo, pausado cuando orquesta subagentes.
Y la tesis, que es lo que a mí me hace guardar este lanzamiento en la carpeta de “esto importa”: Fable 5.1 rinde más cuanto mejor sea el andamiaje que le das. El salto no está solo en el modelo; está en lo que el modelo hace cuando le montas un buen harness alrededor. Que es, casualmente, lo mismo que llevamos tiempo diciendo sobre tu flujo de trabajo. El modelo importa. El método importa más.
Fable 5.1 en una frase ¶
El mismo cerebro de Fable 5, por fin sin las asperezas que lo hacían incómodo: más económico en high, menos entrometido con las salvaguardas y especialmente bueno cuando lo dejas montarse su propio equipo de agentes.
TL;DR ¶
- 🧠 Fable 5.1 no es un salto de inteligencia sobre Fable 5: es el mismo motor con mucha menos fricción, mejor economía en agentes y menos falsos positivos. Every lo llama “Fable para todos”.
- 💸 El nivel que compensa es
high, nomax: enhighroza la inteligencia de Fable 5 gastando mucho menos, y Simon Willison pagó 3,30 dólares por un solo SVG enmax. - 📈 El benchmark estelar es Terminal-Bench-Science: de 24,7 a 52,6; el resto son mejoras incrementales, y casi todos los publica Anthropic.
- 🛡️ El experimento bonito: Mythos 5.1 saca 60,9 y Fable 5.1 55,8 en Terminal-Bench 4.0 — misma base, ~5 puntos que miden el coste de las salvaguardas, no un modelo más listo.
- ✍️ Escribe mejor que ningún Claude reciente, pero se excede: 1.288 palabras cuando pides 1.000, 43 citas cuando pides 8-12, y alguna inventada. Verifica.
Preguntas frecuentes sobre Fable 5.1 ¶
¿Qué es Claude Fable 5.1? ¶
Fable 5.1 es el modelo público de gama alta de Anthropic lanzado el 1 de septiembre de 2026, evolución de Fable 5. Comparte motor base con Mythos 5.1 y lleva clasificadores de seguridad encima. Su gran novedad no es más inteligencia bruta, sino menos fricción de uso, mejor economía de tokens en agentes y menos falsos positivos de seguridad.
¿En qué se diferencia Fable 5.1 de Fable 5? ¶
Sobre todo en la experiencia de uso. Fable 5 era brillante pero lento e incómodo para trabajar de forma iterativa, y sus salvaguardas frenaban trabajo legítimo. Fable 5.1 mantiene esa inteligencia base pero sirve tanto para sesiones interactivas como para tareas largas autónomas, gasta menos tokens y molesta menos con los falsos positivos. En benchmarks el salto grande está en investigación agéntica; en el resto, las mejoras son incrementales.
¿Qué nivel de esfuerzo conviene usar en Fable 5.1? ¶
high es el punto dulce. En las pruebas iniciales, Fable 5.1 en high consigue aproximadamente la inteligencia de Fable 5 gastando mucho menos, mientras que max dispara el coste sin una mejora proporcional. Simon Willison pagó unos 0,13 dólares por un SVG en high frente a unos 3,30 en max. Reserva max para el problema más difícil que tengas, no para el trabajo diario.
¿Cuánto cuesta Fable 5.1? ¶
El coste real depende del nivel de esfuerzo y del uso de caché más que de una tarifa fija por token, y en el primer día la tarifa exacta es lo más volátil del lanzamiento. Lo accionable hoy es medir coste por tarea resuelta trabajando en high, aprovechar la caché de contexto (que en los ejemplos agénticos pesa muchísimo) y evitar dejar el esfuerzo en max por defecto.
¿Qué es Mythos 5.1 y en qué se diferencia de Fable 5.1? ¶
Mythos 5.1 es el gemelo de Fable 5.1 con menos interferencia de ciertos mecanismos de seguridad, reservado a organizaciones verificadas de ciberseguridad y ciencias de la vida. No es “más inteligente”: es la misma base con menos frenos. Se ve en Terminal-Bench 4.0, donde Mythos saca 60,9 y Fable 55,8: esa diferencia mide el coste de las salvaguardas, no una capacidad distinta.
¿Cuáles son los benchmarks de Fable 5.1? ¶
Los publicados incluyen Terminal-Bench-Science 0.1 (de 24,7 a 52,6), Terminal-Bench 4.0 (55,8), HLE sin herramientas (60,9), AutomationBench (31,4) y CursorBench 3.2 (73,4). Artificial Analysis le da 66 en su Intelligence Index, en cabeza de la clasificación. Ojo: la mayoría los ejecuta Anthropic, y Terminal-Bench-Science acaba de estrenarse, así que aún no hay validación independiente sólida.
¿Fable 5.1 es mejor que Opus 5 para programar? ¶
Para coding agéntico largo y harness engineering, ahora mismo sí: planifica mejor, mantiene tareas vivas durante horas y orquesta subagentes con criterio. Para tareas normales y acotadas, Opus 5 mantiene una relación precio/prestaciones muy defendible. La regla no cambia: usa el modelo mínimo suficiente y escala solo cuando la tarea lo pida.
¿Fable 5.1 sirve para escribir? ¶
Sí, y sorprendentemente bien: es el Claude reciente que menos “suena a IA” según las primeras reviews, con estructura más clara y mejor respuesta a instrucciones de estilo. El defecto es que se excede: entrega más palabras, más temas y más citas de las pedidas, y a veces inventa citas que no están en las fuentes. Para cualquier research, verifica lo que produce.
¿Se puede usar Mythos 5.1 siendo un developer normal? ¶
No. Mythos 5.1 está restringido a organizaciones verificadas de ciberseguridad y ciencias de la vida, igual que su antecesor vivía en Project Glasswing. Para casi todos, el techo accesible es Fable 5.1. Por eso hoy Fable tiene reviews de uso real y Mythos solo tiene benchmarks.
¿Por qué se dice que Fable 5.1 mejora cuanto mejor es el harness? ¶
Porque sus mejores resultados aparecen cuando el modelo puede montarse sus propios planes, workers, verificadores y bucles. En el ejemplo del clon de Cities: Skylines en Three.js, a partir de una especificación corta construyó arquitectura, agentes en paralelo y críticos visuales que revisaban capturas. El modelo pone la capacidad; el andamiaje que le das decide cuánto de esa capacidad aprovechas.
Fuentes ¶
- Vibe Check: Fable 5.1 — Anthropic Is So Back (Again) — Every
- Model Drop: Fable 5.1 — Jake Handy (Handy AI)
- Claude Fable 5.1 made me a really nice animated pelican — Simon Willison
- Fable 5.1 on Artificial Analysis — Reddit r/singularity
- Used Claude Fable 5.1 and said “build me Cities: Skylines in three.js” — Reddit r/ClaudeCode
- (I work at Anthropic) Beyond all the benchmarks, Fable 5.1 is a big improvement — Hacker News
- Fable 5.1 dropped like 3 hours ago and I have already cancelled my plans — Reddit r/ClaudeAI
- Fable 5.1 helped solve a 373 year old cipher — Reddit r/singularity
- Fable 5: el primer modelo Mythos más allá de Opus — Web Reactiva
- Claude Opus 5 vs Fable 5: cuál usar para programar — Web Reactiva
- GPT-5.6 Sol, Terra y Luna: precios, modos y cuál usar — Web Reactiva
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.