Claude Sonnet 5.5 vs Opus 5.5: cuál usar para programar
Anthropic ha presentado hoy, 28 de septiembre de 2026, Claude Sonnet 5.5. Seis días después de Opus 5.5 y tres meses después de Sonnet 5.
Te lo resumo antes de que te lo cuenten a medias: Sonnet 5.5 empata con Opus 5.5 en trabajo profesional, le gana en el benchmark de terminal que usa Anthropic y cuesta la mitad por token. No es un titular inventado. Está en la tabla oficial, con sus notas al pie.
Pero lo que más me interesa está en otra fila: el precio, que no se ha movido. Sonnet 5.5 cuesta lo mismo que Sonnet 5, pero según la empresa es más de un 30 % más rápido y resuelve el trabajo con menos tokens, hasta un 30 % menos de coste por tarea. Para quien tiene un agente dando vueltas contra un repositorio, eso pesa más que tres puntos en cualquier tabla.
Esto es lo que vas a encontrar aquí:
- Qué es Sonnet 5.5, qué cambia frente a Sonnet 5 y dónde encaja en el catálogo
- El precio real, y por qué frente a Opus 5.5 no te ahorras la mitad aunque cueste la mitad
- Los benchmarks con su letra pequeña: ese 70,6 % frente al 10,3 % que ya está dando vueltas
- Los cara a cara: Sonnet 5.5 vs Opus 5.5, vs GPT-6 Sol y vs los rivales baratos
- El patrón que más me interesa: Opus 5.5 coordinando varios Sonnet 5.5
- Seguridad, primeras impresiones y cómo empezar a usarlo hoy
Un aviso antes de empezar: el modelo lleva disponible unas horas. Lo que hay son datos del fabricante, notas al pie y primeras impresiones. Ni una review de semanas. Voy a separar las tres cosas en cada sección.
¿Qué es Claude Sonnet 5.5? ¶
Claude Sonnet 5.5 es el modelo de gama media de la familia 5.5 de Anthropic, pensado para iteración rápida, programación del día a día y trabajo de conocimiento con un alcance claro. Sustituye a Sonnet 5 como el Sonnet recomendado, y la documentación de modelos lo describe como “la mejor combinación de velocidad e inteligencia” del catálogo.
Anthropic insiste en qué hace mejor: arreglar bugs, tareas bien delimitadas, trabajo con herramientas desde la terminal y, una novedad en el discurso de un Sonnet, documentos, presentaciones, hojas de cálculo e interfaces con buen ojo para el diseño. Lo dicen con esas palabras: “a sharp eye for design”.
La ficha técnica, según la tabla oficial de modelos:
| Especificación | Claude Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 |
|---|---|---|---|
| ID en la API | claude-sonnet-5-5 |
claude-sonnet-5 |
claude-opus-5-5 |
| Contexto | 1M tokens | 1M tokens | 1M tokens |
| Salida máxima | 128k tokens | 128k tokens | 128k tokens |
| Corte de conocimiento | Junio 2026 | — | Junio 2026 |
| Thinking | Adaptativo | Adaptativo | Adaptativo, siempre activo |
| Effort por defecto (API) | high |
high |
medium |
| Precio entrada / salida | 2$ / 10$ | 2$ / 10$ | 4$ / 20$ |
| Latencia relativa | Rápida | — | Moderada |
Fuente: documentación oficial de modelos y de precios de Claude.
Hay un detalle en esa tabla que conviene no pasar por alto. En la API, Sonnet 5.5 arranca en effort high; Opus 5.5 arranca en medium. En Claude Code, según el anuncio, Sonnet 5.5 usa medium por defecto. Si comparas los dos modelos “tal cual vienen”, no los estás comparando al mismo nivel de esfuerzo. Volveré a esto.
Sonnet 5 pasa a la lista de modelos legacy: sigue disponible, pero deja de ser el recomendado. Y Anthropic repite lo que ya dijo con Opus 5.5: Haiku 5.5 llegará “en las próximas semanas”. Hoy el Haiku del catálogo sigue siendo Haiku 4.5.
🔑 La jerarquía queda así: Fable 5.1 para el razonamiento más exigente, Opus 5.5 como punto de partida para casi todo, Sonnet 5.5 para velocidad e iteración, y Haiku 4.5 esperando relevo.
¿Sonnet 5.5 o Opus 5.5? La respuesta corta ¶
Si tienes prisa: Sonnet 5.5 para ejecutar, Opus 5.5 para decidir. Sonnet para tareas con un alcance claro, bugs, terminal, documentos e iteración rápida. Opus para planificar, para lo ambiguo y para agentes que trabajan solos durante horas.
La propia documentación lo deja ver. Anthropic dice que, si no sabes qué modelo usar, empieces por Opus 5.5, y reserva a Sonnet 5.5 para cuando mandan la velocidad y el coste. No lo vende como “el Opus barato”. Lo vende como otra herramienta.
Esa idea ya estaba en la historia de la familia. Cuando comparé Sonnet 4.6 y Opus 4.6, Sonnet ganaba en flujos agénticos iterativos y Opus en planificación profunda de una pasada. Con Sonnet 5 la distancia se estrechó. Con Sonnet 5.5, en algunas pruebas, desaparece.
Lo que cambia la conversación es el tamaño del empate. Si en el trabajo de conocimiento Sonnet 5.5 queda a 2 puntos Elo de Opus 5.5, la pregunta deja de ser “¿cuál es mejor?” y pasa a ser “¿cuánto trabajo le quito a Opus sin perder calidad?”.
Herramienta gratis · Selector
¿Sonnet 5.5, Opus 5.5 o ninguno de los dos?
La tabla te da la foto general, pero tu caso depende de lo que programas hoy y de las suscripciones que ya pagas. Cuéntamelo y te digo qué modelo encaja, con alternativa barata incluida.
Le das
Tu tarea y las suscripciones que ya pagas
Te devuelve
El modelo que te conviene, con alternativa barata
¿Cuánto cuesta Claude Sonnet 5.5? ¶
Sonnet 5.5 cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida, lo mismo que Sonnet 5. La lectura de caché sale a 0,20 dólares el millón y el Batch API a la mitad: 1$ / 5$.
Un apunte para quien leyó nuestro análisis de Sonnet 5: aquel 2/10 era una tarifa de estreno que iba a subir a 3/15 el 1 de septiembre. No subió. Anthropic la hizo permanente en agosto, y la página de precios lo confirma en una nota al pie. Sonnet 5.5 hereda ese precio.
La tabla completa frente a sus vecinos:
| Sonnet 5 | Sonnet 5.5 | Opus 5.5 | |
|---|---|---|---|
| Entrada / 1M | 2$ | 2$ | 4$ |
| Salida / 1M | 10$ | 10$ | 20$ |
| Escritura de caché 5 min | 2,50$ | 2,50$ | 5$ |
| Escritura de caché 1 h | 4$ | 4$ | 8$ |
| Lectura de caché / 1M | 0,20$ | 0,20$ | 0,20$ |
| Batch (entrada / salida) | 1$ / 5$ | 1$ / 5$ | 2$ / 10$ |
Fuente: página de precios de la documentación de Claude.
Mira la fila de la caché. En un agente es la que más pesa.
Sonnet 5.5 y Opus 5.5 leen de caché exactamente al mismo precio: 0,20 dólares el millón. Sonnet aplica el multiplicador estándar (0,1× la entrada) y Opus 5.5 tiene uno rebajado (0,05×) desde su lanzamiento. Resultado: la misma cifra.
¿Por qué importa? Porque en un agente de programación la mayor parte de la entrada sale de caché. El agente reenvía el repositorio, las instrucciones, las skills y el historial en cada vuelta. Hago una cuenta de servilleta (mía, no de Anthropic) con una sesión de agente que lee 20 millones de tokens de caché, envía 1 millón sin cachear y genera 1 millón de salida:
| Concepto | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 20M lecturas de caché | 4$ | 4$ |
| 1M de entrada sin caché | 2$ | 4$ |
| 1M de salida | 10$ | 20$ |
| Total | 16$ | 28$ |
Con esta mezcla, Sonnet 5.5 cuesta un 57 % de lo que cuesta Opus 5.5, no un 50 %. Cuanto más dependa tu agente de la caché, más se acercan las facturas. Cuanta más salida genere, más se nota la diferencia.
💡 Si repites “Sonnet 5.5 cuesta la mitad que Opus 5.5”, añade la coletilla: por token. En un agente con mucha caché, el ahorro real se parece más a un 40 % que a un 50 %. Y ese cálculo aún no cuenta cuántos tokens gasta cada uno para resolver la misma tarea.
El 30 % que sí importa: menos tokens por tarea ¶
Aquí está la parte buena del anuncio. Anthropic no ha bajado la tarifa, pero afirma que Sonnet 5.5 necesita menos tokens que Sonnet 5 para completar el mismo trabajo, lo que se traduce en hasta un 30 % menos de coste por tarea y más de un 30 % más de velocidad.
¿Por qué esto es más interesante que una rebaja? Porque Sonnet 5 tenía un problema serio de verbosidad. Artificial Analysis midió que Sonnet 5 costaba 2,29 dólares por tarea en su Intelligence Index, unas dos veces más que Sonnet 4.6 y un 15 % más que Opus 4.8, todo por consumo de tokens. Ya lo contamos en su día: el Sonnet “barato” acababa saliendo caro cuando lo apretabas.
Si Sonnet 5.5 corrige eso, el ahorro llega por tres vías a la vez:
- Menos tokens de salida, que son los caros.
- Menos vueltas del agente, así que menos contexto reenviado.
- Menos latencia, que en iteración rápida se traduce en menos tiempo tuyo esperando.
Los datos de clientes que publica Anthropic van en esa dirección. Slack cuenta que, sin cambiar sus prompts, Sonnet 5.5 mejoró a Sonnet 5 en casi todas sus evaluaciones internas en menos pasos y con un 14 % menos de tokens de salida. Box habla de un modelo 2,4 veces más rápido y con un 12 % menos de tokens totales. Son testimonios elegidos por el fabricante, pero apuntan todos al mismo sitio.
⚠️ Nadie independiente ha medido todavía el coste por tarea de Sonnet 5.5. Con Sonnet 5 fue justo esa medición la que desmontó el titular del precio. Hasta que Artificial Analysis u otro tercero publique cifras, el “hasta un 30 %” es una promesa de Anthropic.
¿Qué dicen los benchmarks de Sonnet 5.5? ¶
Los benchmarks oficiales ponen a Sonnet 5.5 muy cerca de Opus 5.5 en casi todo, por delante en Terminal-Bench 4.0 y claramente por encima de Sonnet 5. GPT-6 Sol le gana en FrontierCode. Esta es la tabla del anuncio:
| Benchmark | Sonnet 5 | Sonnet 5.5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 10,3 % | 70,6 % | 66,4 % ¹ | — |
| FrontierCode 1.1 (max) | 42,4 % | 46,2 % ² | 54,4 % | 49,3 % |
| CursorBench 4.0 | 34,1 % | 55,5 % | 57,8 % | — |
| GDPval-AA v2.1 (Elo) | 1.449 | 1.844 ³ | 1.846 | 1.487 ⁴ |
| AA-Briefcase v1.1 (Elo) | 1.359 | 1.811 ³ | 1.822 | 1.483 ⁴ |
| Humanity’s Last Exam | 54,9 % | 64,5 % | 67,7 % | — |
| OSWorld 2.1 | 57,0 % | 80,1 % | 81,8 % | — |
| Chartography | 15,6 % | 61,6 % | 64,4 % | 53,6 % ⁴ |
Fuente: anuncio oficial de Anthropic. Las notas al pie van justo debajo, y son importantes.
Las notas, traducidas:
- ¹ Opus 5.5 en Terminal-Bench 4.0 está medido a esfuerzo
xhigh, su mejor resultado. - ² En FrontierCode, Sonnet 5.5 puntúa más bajo en
maxque enxhigh. FrontierCode mide si un cambio se podría mergear sin que un humano lo toque. - ³ Artificial Analysis ejecutó GDPval-AA y AA-Briefcase sobre un despliegue previo al lanzamiento que, según Anthropic, tenía un bug que podía degradar las respuestas con salidas estructuradas.
- ⁴ OpenAI corrigió hace poco un bug que degradaba la comprensión de imágenes en GPT-6 Sol, y las cifras oficiales de Artificial Analysis quizá no lo reflejen todavía.
El 70,6 % frente al 10,3 %: léelo con calma ¶
La cifra que más se está compartiendo es la de Terminal-Bench 4.0: Sonnet 5.5 saca un 70,6 % y Sonnet 5 un 10,3 %. Es un salto de casi siete veces en un benchmark que mide trabajo agéntico desde terminal: ejecutar comandos, explorar un entorno, modificar cosas y completar tareas de varios pasos.
Dos lecturas, y las dos son verdad.
La primera: un 10,3 % para Sonnet 5 es rarísimo. Sonnet 5 sacaba un 80,4 % en Terminal-Bench 2.1 según su propio anuncio. Mi hipótesis, a falta de que alguien la confirme: Terminal-Bench 4.0 es una versión mucho más dura y la comparación mide, en parte, cuánto ha envejecido Sonnet 5 frente a una prueba nueva. El salto es real, pero no significa “siete veces más capaz en tu terminal”.
La segunda: el 70,6 % frente al 66,4 % de Opus 5.5 sí es llamativo. Un Sonnet por delante del Opus de su misma generación en el benchmark de coding agéntico que Anthropic pone en cabeza de la tabla. Y frente a Opus en xhigh, su mejor resultado. Para ponerlo en contexto, Artificial Analysis midió a GPT-6 Sol en un 43 % en Terminal-Bench 4.0, aunque con su propio harness, así que no es comparable punto a punto.
⚠️ Hasta que haya reproducciones independientes de Terminal-Bench 4.0, trata el 70,6 % como el techo de lo que Anthropic ha conseguido en sus condiciones, no como lo que vas a ver en tu repo.
GDPval-AA: el empate que importa ¶
En GDPval-AA, que intenta aproximarse a trabajo profesional real (análisis, documentos, tareas de dominio), Sonnet 5.5 saca 1.844 puntos Elo y Opus 5.5, 1.846. Dos puntos. Es un empate técnico con todas las letras.
Y ojo con la nota ³: esa cifra se midió sobre una versión con un bug que podía empeorar las respuestas. Si el bug afectó, el resultado real de Sonnet 5.5 podría ser algo mejor. O no. No lo sabemos.
La otra lectura de esta fila es el salto desde Sonnet 5: casi 400 puntos Elo, de 1.449 a 1.844. En el análisis de Sonnet 5 celebrábamos que empatara con Opus 4.8 en esta misma prueba. Ahora el empate es con el Opus de la generación actual.
Donde Opus 5.5 sigue mandando ¶
No todo es empate. FrontierCode 1.1 es el benchmark que mejor separa a los dos: 54,4 % para Opus 5.5 frente a 46,2 % para Sonnet 5.5. Ocho puntos. Y es justo el que mide si el código que sale del agente se puede mergear sin retoques humanos.
Es decir: Sonnet 5.5 termina tareas en la terminal tan bien o mejor que Opus, pero el código que entrega necesita más revisión. En la práctica, eso encaja con el reparto que te propongo más abajo: Sonnet ejecuta, alguien revisa.
Sonnet 5.5 rinde con tareas bien acotadas. Acotarlas es cosa tuya
El modelo brilla cuando el alcance está claro, y eso no lo pone Anthropic: lo pones tú. En el curso recorres el ciclo completo de SDD con OpenSpec, de la propuesta y la spec a las tareas y el apply, sobre un proyecto real y en modo asistido.
Entra en el curso gratis →Claude Sonnet 5.5 vs Opus 5.5: el cara a cara ¶
Sonnet 5.5 gana en velocidad, en precio y en Terminal-Bench 4.0. Opus 5.5 gana en FrontierCode, en razonamiento difícil y, según Anthropic, en juicio para tareas largas y ambiguas. En trabajo de conocimiento están empatados.
| Dimensión | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| Precio entrada / salida | 2$ / 10$ | 4$ / 20$ |
| Lectura de caché | 0,20$ | 0,20$ |
| Latencia | Rápida | Moderada |
| Effort por defecto en la API | high |
medium |
| Terminal-Bench 4.0 | 70,6 % | 66,4 % (xhigh) |
| FrontierCode 1.1 | 46,2 % | 54,4 % |
| CursorBench 4.0 | 55,5 % | 57,8 % |
| GDPval-AA v2.1 | 1.844 | 1.846 |
| Humanity’s Last Exam | 64,5 % | 67,7 % |
| Posición oficial | Velocidad e iteración | Punto de partida para casi todo |
Fuentes: anuncio de Sonnet 5.5 y documentación oficial de modelos.
Mi mapa práctico, a falta de probarlo semanas:
Tira de Sonnet 5.5 para:
- Bugs con reproducción clara y tareas de alcance definido.
- Trabajo desde terminal: scripts, migraciones pequeñas, automatizaciones.
- Implementar un plan que ya existe, paso a paso.
- Interfaces, documentos, presentaciones y hojas de cálculo.
- Subagentes en paralelo, donde la latencia y el volumen mandan.
Sigue tirando de Opus 5.5 para:
- Planificar y tomar decisiones de arquitectura.
- Código que tiene que salir listo para mergear, sin revisión pesada.
- Tareas largas y ambiguas, con mucho hilo del que tirar.
- Revisar lo que han hecho otros modelos, incluido Sonnet.
- Cualquier cosa donde repetir el trabajo por un error salga más caro que el modelo.
Un aviso sobre el effort. Si llamas a los dos modelos por la API sin fijar el nivel, Sonnet 5.5 va en high y Opus 5.5 en medium. Puede que Sonnet “piense más” que Opus en tu comparación sin que te des cuenta. Fija el mismo effort en los dos antes de sacar conclusiones, y recuerda que en FrontierCode a Sonnet 5.5 le va peor en max que en xhigh: subir el esfuerzo no siempre mejora el resultado.
🎯 La regla de siempre sigue funcionando: el modelo mínimo suficiente, y escalar solo cuando haya señales claras. Lo que cambia con Sonnet 5.5 es que “mínimo suficiente” cubre bastante más terreno que hace una semana.
Si quieres la lógica completa para elegir modelo según la tarea, la tienes en cómo gastar menos eligiendo bien el modelo.
Elegir modelo ya no va de cuál es más listo, sino de qué le encargas a cada uno. De eso hablamos cada domingo: cómo estamos adoptando la IA en el día a día del desarrollo, con lo que funciona y lo que no. Gratis, ya somos +7.200.
Apúntate gratis →Claude Sonnet 5.5 vs GPT-6 Sol: el duelo de los 2/10 dólares ¶
Sonnet 5.5 y GPT-6 Sol cuestan exactamente lo mismo: 2 dólares de entrada, 10 de salida y 0,20 de lectura de caché. OpenAI colocó Sol el 22 de septiembre justo en el precio de Sonnet. Seis días después, Anthropic responde con un Sonnet nuevo al mismo precio.
Con la tarifa empatada, la comparación va de lo que hace cada uno:
| Dimensión | Claude Sonnet 5.5 | GPT-6 Sol |
|---|---|---|
| Precio entrada / salida | 2$ / 10$ | 2$ / 10$ |
| Lectura de caché | 0,20$ | 0,20$ |
| Contexto | 1M | 1,05M |
| FrontierCode 1.1 | 46,2 % | 49,3 % |
| GDPval-AA v2.1 | 1.844 | 1.487 ⁴ |
| AA-Briefcase v1.1 | 1.811 | 1.483 ⁴ |
| Chartography | 61,6 % | 53,6 % ⁴ |
Fuente: anuncio de Sonnet 5.5 (tabla de Anthropic) y fichas oficiales de precio de cada modelo.
Donde Sonnet 5.5 gana con claridad es en trabajo de conocimiento: más de 350 puntos Elo en GDPval-AA. Aunque la nota ⁴ avisa de que las cifras de Sol quizá no reflejen su último arreglo de visión, esa distancia no se cierra con un parche.
Donde Sol aguanta es en FrontierCode, la prueba de código mergeable: tres puntos por encima. Y en nuestro análisis de Sol vimos que OpenAI lo había afinado para coste por tarea, con 1,37 dólares por tarea en FrontierCode a xhigh según sus propios datos.
Lo que no sabemos es cómo rinden los dos en Terminal-Bench 4.0 medidos en las mismas condiciones. Anthropic no pone a Sol en esa fila, y el 43 % de Sol que publicó Artificial Analysis usa otro harness.
En las pruebas grises de los días previos circularon en X y Reddit filtraciones que ponían a Sonnet 5.5 por encima de Sol y cerca de GPT-6 Astra. Parte era cierta (el modelo existía y se estaba probando), pero algunas especificaciones eran datos reciclados de otros modelos. La tabla oficial deja un resultado más matizado: Sonnet gana en trabajo de conocimiento, Sol en código mergeable.
🔑 Si ya vives en Claude Code, Sonnet 5.5 es el cambio natural. Si vives en Codex, Sol sigue siendo una opción muy seria al mismo precio. Lo que no tiene sentido es cambiar de ecosistema por tres puntos en una tabla del fabricante.
¿Y frente a Gemini 3.5 Flash, GLM-5.3 o Kimi K3? ¶
En la categoría de “modelo de trabajo” hay más vida que Sonnet y Sol, pero hoy no hay benchmarks publicados que pongan a Sonnet 5.5 frente a ellos en las mismas condiciones. Lo que sí se puede comparar es el precio y el perfil de uso:
| Modelo | Entrada / salida (1M) | Pesos abiertos | Para qué lo miraría |
|---|---|---|---|
| Claude Sonnet 5.5 | 2$ / 10$ | No | Agentes en Claude Code, terminal, documentos |
| GPT-6 Sol | 2$ / 10$ | No | Agentes en Codex, código mergeable |
| Gemini 3.5 Flash | 1,50$ / 9$ | No | Multimodal, velocidad, ecosistema Google |
| Grok 4.5 | 2$ / 6$ | No | Coste por tarea muy bajo |
| Kimi K3 | 3$ / 15$ | Sí (licencia propia) | Frontend generativo, autoalojar |
| GLM-5.3 | 1,40$ / 4,40$ | Sí | Presupuesto ajustado, planes de suscripción |
Fuentes: fichas de precio de cada proveedor y catálogo de precios de models.dev.
La lectura rápida: Sonnet 5.5 no es el más barato de su categoría. GLM-5.3 y Grok 4.5 cobran bastante menos por la salida, y Gemini 3.5 Flash algo menos. Lo que ofrece Sonnet 5.5 es una capacidad que, según los números de Anthropic, roza a un modelo insignia, y una integración nativa con Claude Code que los demás tienen que suplir con otro harness.
Si quieres el cuadro completo, con todos los modelos de la temporada y cuál rinde mejor en cada tipo de tarea, lo mantengo en la comparativa de los mejores modelos para programar.
¿Tiene sentido que Opus 5.5 coordine a varios Sonnet 5.5? ¶
Si solo te llevas una idea de este artículo, que sea esta: la comparación interesante ya no es Sonnet 5.5 contra Opus 5.5, sino Opus 5.5 solo contra Opus 5.5 dirigiendo a varios Sonnet 5.5.
Anthropic está convergiendo hacia modelos especializados por función, no hacia una escalera de “bueno, mejor, todavía mejor”. Sonnet deja de ser “el Claude barato” y pasa a estar diseñado como modelo ejecutor. En un hilo de Reddit sobre la familia 5.5 circulaba la broma del stack perfecto: Fable asesora a Opus, Opus planifica, Sonnet implementa y Haiku escribe el código. Es una broma, pero describe bien cómo estamos empezando a pensar: menos en “qué modelo uso” y más en qué modelo asigno a cada función del harness.
El reparto que propongo, a falta de medirlo en proyectos propios:
Opus 5.5 → planifica, divide el trabajo, revisa y decide
│
├── Sonnet 5.5 → implementa la tarea A (alcance cerrado)
├── Sonnet 5.5 → implementa la tarea B
└── Sonnet 5.5 → prepara docs, tests o la interfaz
Haiku (4.5 hoy, 5.5 cuando llegue) → trabajo mecánico y masivo
La última capa habrá que reevaluarla cuando salga Haiku 5.5.
En Claude Code esto se monta con subagentes. Defines un subagente que implemente con Sonnet y dejas la sesión principal en Opus:
---
name: implementer
description: Implementa una tarea ya planificada, con alcance cerrado, y devuelve un resumen de los cambios
model: sonnet
---
Recibes una tarea concreta del plan. Implementa solo lo que pide.
Si algo del plan es ambiguo, detente y pregunta en vez de improvisar.
Al terminar, ejecuta los tests afectados y resume qué has cambiado.
Si nunca has creado uno, en cómo crear subagentes para programar con IA tienes doce prompts para copiar y la explicación del campo model. Y si quieres coordinar varias sesiones en paralelo en lugar de subagentes, el mismo reparto funciona con los Agent Teams de Claude Code.
¿Por qué ahora encaja mejor que con Sonnet 5? Por tres motivos:
- El empate en GDPval-AA y el 70,6 % en terminal hacen que el trabajo delegado salga bien más veces.
- La velocidad y los menos tokens por tarea reducen el coste de tener varios ejecutores a la vez.
- FrontierCode sigue siendo de Opus, así que tiene sentido que el Opus revise lo que entrega Sonnet antes del merge.
🛡️ Delegar en varios Sonnet no te libra de verificar. Cuanto más se reparte el trabajo, más importa que alguien, humano u Opus, revise lo que vuelve. Un ejecutor rápido que se equivoca rápido multiplica el problema.
Orquestación de agentes
Opus decide, Sonnet ejecuta: monta la orquesta con criterio
Repartir trabajo entre un modelo que planifica y varios que ejecutan es el último de los seis niveles de arquitectura de esta masterclass: roles, guardarraíles, memoria, skills, MCP y orquestación, con evals y revisión entre modelos.
Ver la masterclass →Masterclass en directo · 6 niveles de arquitectura
Diseño, documentos y Pokémon Red: lo que no sale en Terminal-Bench ¶
Sonnet 5.5 trae dos novedades que no caben en una tabla de coding: mejor ojo para el diseño y una prueba de horizonte largo bastante curiosa.
La primera. Anthropic dice que Sonnet 5.5 está preparado para interfaces, documentos pulidos, presentaciones y hojas de cálculo: seguir plantillas y añadir el acabado visual que suele faltar. El salto en Chartography, de 15,6 % a 61,6 %, apunta en esa dirección. Si generas componentes, artefactos o vídeo programático, puede que Sonnet 5.5 sea un buen ejecutor de la parte visual mientras Opus diseña el resultado.
La segunda. Anthropic afirma que es el primer Sonnet capaz de completar Pokémon Red usando solo capturas de pantalla. Parece una demo de juguete, pero obliga al agente a mantener el estado durante muchísimo tiempo, interpretar la pantalla, decidir el siguiente paso y recuperarse de sus errores. Visión, estado, plan, acción, observación y vuelta a planificar, durante horas.
Para quien construye agentes, eso es más informativo que cualquier examen de cultura general. Un modelo que no pierde el hilo durante una partida entera tiene más papeletas de no perderlo en una sesión larga contra tu repo.
Anthropic también ha pasado a Sonnet el cambio de estilo de Opus 5.5: lo importante primero, más directo, mejor respeto a las instrucciones de estilo y menos relleno. Parece un detalle menor, pero en un agente de programación cada párrafo sobrante es salida que pagas y contexto que arrastras.
¿Qué dicen quienes ya lo están usando? ¶
Con horas de uso, lo que hay son primeras impresiones, no reviews. En r/ClaudeAI se repite que la mejora frente a Sonnet 5 se nota desde el primer rato, y hay mucho entusiasmo con comentarios del estilo “este Sonnet es una locura”. Sirve para medir el ánimo, no para afirmar que supera a GPT-6 Sol, a Astra o a Opus 5.5.
Los datos de producción que hay los aporta Anthropic en el propio anuncio:
- Zendesk, con cientos de casos reales de soporte: menos decisiones incorrectas, casos resueltos antes y tickets procesados un 20 % más rápido.
- Slack: mejor que Sonnet 5 en casi todas sus evaluaciones del Slackbot, en menos pasos y con un 14 % menos de tokens de salida.
- Box: más preciso, 2,4 veces más rápido y con un 12 % menos de tokens.
- Atlassian: sus agentes Rovo, hasta un 30 % más rápidos que con Sonnet 5.
Son cargas reales, no tests académicos, y eso vale algo. Pero son clientes elegidos por Anthropic para su página de lanzamiento. Cuentan como indicio.
Lo que sí me parece revelador del debate en Reddit es la pregunta que se hace la gente. No es “¿Sonnet 5.5 es más listo?”. Es “¿para qué sigo necesitando Opus?”. Y esa pregunta, con los números de hoy, tiene una respuesta más corta que hace una semana.
Las primeras impresiones de cada modelo se mueven rápido, y cada domingo te cuento con calma lo que vamos aprendiendo al usarlos en proyectos reales, junto a 12 recursos seleccionados. +7.200 developers, gratis desde 2018.
Suscríbete gratis →¿Es seguro Sonnet 5.5? Las salvaguardas de Opus llegan al Sonnet ¶
Sonnet 5.5 es el primer Sonnet con las mismas salvaguardas de ciberseguridad que Opus 5.5. En biología mantiene las de Sonnet 5, y también es el primer Sonnet con clasificadores que impiden extraer su razonamiento.
En la práctica, cuando el modelo detecta ciertas peticiones sensibles de ciberseguridad, se activan clasificadores y respuestas de reserva. Anthropic dice que el desarrollo de software convencional no debería notar cambios.
La experiencia con Opus 5.5 invita a vigilarlo. En el repositorio de Claude Code hay abiertos varios reportes de falsos positivos con Opus 5.5: una compilación rutinaria bloqueada, depuración de sistemas embebidos marcada como amenaza e incluso sesiones que quedan “contaminadas” porque el texto marcado sigue en el historial. Anthropic admite que las salvaguardas de Opus 5.5 pueden marcar trabajo que no es de ciberseguridad y que está afinándolas.
Si Sonnet 5.5 hereda las salvaguardas, es razonable esperar que herede algo de ese ruido. Todavía es pronto para saber cuánto.
⚠️ Si trabajas con seguridad, reversing, firmware o código de sistemas, prueba Sonnet 5.5 con tus tareas reales antes de moverlo a tu flujo principal. Un falso positivo a mitad de una sesión larga de agente te hace perder más tiempo que el que ganas con la velocidad.
Cómo empezar a usar Sonnet 5.5 hoy ¶
Sonnet 5.5 está disponible desde hoy en las apps de Claude, en Claude Code y en la API con el identificador claude-sonnet-5-5, además de en Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS.
Un ejemplo mínimo en Python, fijando el effort para no depender del valor por defecto:
import anthropic
client = anthropic.Anthropic()
# Sonnet 5.5 como ejecutor de una tarea bien especificada
response = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=16000, # el thinking también cuenta dentro de max_tokens
# En la API el effort por defecto es high: para tareas acotadas, medium
output_config={"effort": "medium"},
messages=[
{
"role": "user",
"content": "Corrige el bug descrito en ISSUE.md y añade un test que lo reproduzca",
}
],
)
for block in response.content:
if block.type == "text":
print(block.text)
En Claude Code basta con elegirlo en /model o arrancar con él:
# Sesión completa con Sonnet 5.5
claude --model claude-sonnet-5-5
Tres avisos antes de migrar, sacados de la documentación de effort y thinking:
- Los niveles de effort están recalibrados.
mediumen Sonnet 5.5 no produce el mismo razonamiento quemediumen Sonnet 5. La recomendación oficial para coding agéntico es empezar enmediumcon tareas bien especificadas, subir ahighen las más largas o difíciles y usarxhighomaxsolo si tus evaluaciones muestran una mejora. Para coding agéntico, Anthropic sugieremax_tokensa 128.000 con streaming. - Si usas Sonnet con el thinking desactivado, ya no vale
"disabled". Tienes que enviarthinking: {"type": "between_tools"}, que apaga el thinking inicial pero deja pensar entre llamadas a herramientas. Funciona enlow,mediumyhigh. Enxhighomaxdevuelve un error 400. - Compara al mismo nivel. En la API arranca en
highy en Claude Code enmedium. Si enfrentas Sonnet 5.5 a Opus 5.5 o a Sonnet 5, fija el mismo effort en todos.
Un detalle útil para agentes largos: Sonnet 5.5 admite cambiar el effort a mitad de conversación con un mensaje de sistema por turno (en beta) sin romper la caché. Puedes planificar un turno en high y bajar a low para los retoques. Eso sí, no funciona si usas between_tools.
Si vienes de Sonnet 5 y tu flujo funciona, la migración en sí es poca cosa: cambiar el ID y revisar el effort. Lo que sí merece una tarde es comprobar si el ahorro de tokens se nota en tus tareas. Diez tareas reales, los dos modelos al mismo effort, y anota coste, tokens, tiempo y correcciones. Esa es la cifra que acaba en tu factura.
La lectura que me llevo ¶
Si quito todo el ruido del lanzamiento, me quedo con cinco cosas:
- Sonnet se ha convertido en el ejecutor de la familia Claude. Anthropic ya no lo vende como “el barato”, sino como el que itera rápido.
- Más de un 30 % de velocidad y hasta un 30 % menos de coste por tarea importan más que cualquier punto de benchmark, si se confirman fuera de la página de Anthropic.
- El 70,6 % frente al 10,3 % en Terminal-Bench 4.0 apunta a un salto enorme en coding agéntico, pero quiero ver reproducciones independientes.
- Quedar a 2 puntos de Opus 5.5 en GDPval-AA por la mitad del precio por token hace muy difícil justificar Opus para trabajo rutinario.
- FrontierCode sigue siendo de Opus, y eso dibuja el reparto: Sonnet ejecuta, Opus decide y revisa.
Me quedo con una idea para el día a día: por fin tiene sentido montar el harness con los dos modelos, uno que piensa y varios que ejecutan.
¿Qué parte de tu trabajo de hoy le seguirías encargando a Opus?
TL;DR ¶
- 🚀 Claude Sonnet 5.5 sale el 28 de septiembre de 2026 como el Sonnet recomendado:
claude-sonnet-5-5, 1M de contexto, 128k de salida. - 💰 Mismo precio que Sonnet 5 (2$ / 10$), pero Anthropic promete más de un 30 % de velocidad y hasta un 30 % menos de coste por tarea.
- ⚡ 70,6 % en Terminal-Bench 4.0, por delante de Opus 5.5 (66,4 %), y empate en GDPval-AA (1.844 frente a 1.846).
- 🎯 Opus 5.5 sigue ganando en FrontierCode (54,4 % frente a 46,2 %): Sonnet para ejecutar, Opus para planificar y revisar.
- 🛡️ Hereda las salvaguardas de ciberseguridad de Opus 5.5; vigila los falsos positivos si trabajas con código de sistemas.
Preguntas frecuentes sobre Claude Sonnet 5.5 ¶
¿Cuándo salió Claude Sonnet 5.5?
Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre de 2026, seis días después de Opus 5.5. Está disponible desde el primer día en las apps de Claude, Claude Code, la API y las plataformas de Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS.
¿Cuánto cuesta Claude Sonnet 5.5?
Cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida, igual que Sonnet 5. La lectura de caché cuesta 0,20 dólares por millón y el Batch API tiene un 50 % de descuento (1$ / 5$). Anthropic afirma que, al necesitar menos tokens, cuesta hasta un 30 % menos por tarea que Sonnet 5.
¿Cuál es el identificador de Sonnet 5.5 en la API?
El identificador es claude-sonnet-5-5, el mismo en la API de Claude, Google Cloud, Microsoft Foundry y Claude Platform on AWS. En Amazon Bedrock es anthropic.claude-sonnet-5-5.
¿Es Claude Sonnet 5.5 mejor que Opus 5.5?
No en todo. Sonnet 5.5 supera a Opus 5.5 en Terminal-Bench 4.0 (70,6 % frente a 66,4 %) y empata en GDPval-AA (1.844 frente a 1.846), pero Opus 5.5 gana en FrontierCode, CursorBench, Humanity’s Last Exam y OSWorld. Anthropic recomienda Opus 5.5 como punto de partida y Sonnet 5.5 cuando mandan la velocidad y el coste.
¿Cuándo conviene usar Sonnet 5.5 en lugar de Opus 5.5?
Para bugs con alcance claro, tareas desde terminal, implementar un plan ya definido, documentos, interfaces y subagentes en paralelo. Para planificar, tareas largas y ambiguas o código que debe quedar listo para mergear sin revisión, Opus 5.5 sigue siendo la opción más segura.
¿Sonnet 5.5 es más barato que Opus 5.5?
Por token cuesta la mitad. En un agente con mucha caché la diferencia se reduce, porque los dos leen de caché al mismo precio (0,20 dólares por millón): en un ejemplo con 20 millones de lecturas de caché, Sonnet 5.5 costaría alrededor de un 57 % de lo que cuesta Opus 5.5.
¿Qué diferencia hay entre Sonnet 5.5 y Sonnet 5?
Mismo precio, pero Sonnet 5.5 es más de un 30 % más rápido, gasta menos tokens por tarea y mejora en todos los benchmarks publicados, con saltos grandes en Terminal-Bench 4.0 (de 10,3 % a 70,6 %), OSWorld 2.1 (de 57 % a 80,1 %) y GDPval-AA (de 1.449 a 1.844). Sonnet 5 pasa a ser un modelo legacy.
¿Sonnet 5.5 es mejor que GPT-6 Sol?
Depende de la tarea. Cuestan lo mismo (2$ / 10$). En la tabla de Anthropic, Sonnet 5.5 gana con claridad en GDPval-AA, AA-Briefcase y Chartography, mientras GPT-6 Sol gana en FrontierCode (49,3 % frente a 46,2 %). No hay todavía comparativas independientes en las mismas condiciones.
¿Tiene Sonnet 5.5 las mismas restricciones de seguridad que Opus 5.5?
En ciberseguridad, sí: es el primer Sonnet con las salvaguardas de Opus 5.5. En biología mantiene las de Sonnet 5. Anthropic dice que el desarrollo de software convencional no debería verse afectado, pero con Opus 5.5 se han reportado falsos positivos en trabajo legítimo de sistemas.
¿Cuándo sale Claude Haiku 5.5?
Anthropic ha dicho que Haiku 5.5 llegará “en las próximas semanas”, sin fecha concreta. Mientras tanto, el Haiku disponible en la API sigue siendo Haiku 4.5, a 1$ / 5$ por millón de tokens.
Fuentes ¶
- Anthropic, “Introducing Claude Sonnet 5.5”
- Claude Platform Docs, “Models overview”
- Claude Platform Docs, “Pricing”
- The Decoder, “Anthropic’s Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task”
- VentureBeat, “Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per-task”
- The New Stack, “Anthropic launches Claude Sonnet 5.5 with near-Opus performance at half the price”
- SiliconANGLE, “Anthropic debuts Claude Sonnet 5.5 running 30% faster”
- Artificial Analysis, “Claude Sonnet 5: strong agentic performance at a higher cost per task”
- Startup Fortune, “The Claude Sonnet 5.5 leak beating GPT-6 Sol is not what it looks like”
- Claude Code en GitHub, issue #97600: falso positivo de ciberseguridad con Opus 5.5
- Claude Help Center, “Real-time cyber safeguards on Claude Opus and Sonnet”
🧨 Última oprtunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.