+250 skills, dinamita para tu productividad 🧨Explorar →

GPT-6 Astra: qué cambia frente a Sol, Fable 5.1 y Opus 5

OpenAI acaba de soltar GPT-6 Astra y, por primera vez en mucho tiempo, el titular no lo pone la prensa: lo pone Greg Brockman diciendo “bienvenidos a la era de la AGI”.

Grábate esa frase, porque es la que hay que meter en agua con sal antes de creerla.

Astra salió hoy, 3 de septiembre de 2026, y no parece una actualización incremental sobre GPT-5.6 Sol. OpenAI lo vende como su mayor entrenamiento hasta la fecha, su primer modelo clasificado como Critical en ciberseguridad y “el mejor modelo de uso de ordenador del mundo”. Son tres afirmaciones muy gordas para un mismo día, y conviene desmontarlas una a una.

Este post lo escribo en las primeras horas tras el lanzamiento. Eso significa una cosa importante: casi todo lo que hay encima de la mesa son benchmarks de OpenAI y pruebas de clientes seleccionados. Las sesiones independientes de developers metiéndolo en repos sucios todavía no existen. Así que voy a separar con cuidado lo verificable de lo autoproclamado.

Lo que vas a encontrar:

  • Por qué Astra no es “GPT-5.7” y qué es eso de computer use que tanto repite OpenAI.
  • Los benchmarks bestiales (ARC-AGI-3 al 98,6 %) y dónde poner los asteriscos.
  • El primer modelo que descubre zero-days solo, y por qué eso le cierra el grifo de acceso.
  • Las pruebas de Playco y Legora, con el matiz del “40 % vs 3 %” que lo cambia todo.
  • Cuándo empezará a importar de verdad frente a Fable 5.1, y cuándo es puro ruido.

⚠️ Este post se escribió el mismo 3 de septiembre de 2026, con horas de vida del modelo. Lo más volátil son los precios, la disponibilidad exacta por plan y las primeras impresiones. Lo que aguanta el paso del tiempo es la lectura de qué tipo de salto es este y cómo leer un lanzamiento así sin comerte el hype. Si llegas semanas después, salta a la sección de “Astra frente a Fable 5.1” y a la del harness.

¿Qué es GPT-6 Astra y por qué no es un GPT-5.7?

GPT-6 Astra es el nuevo modelo insignia de OpenAI, presentado el 3 de septiembre de 2026 como una nueva generación, no como un retoque de la familia Sol. Y la etiqueta de generación, esta vez, tiene músculo detrás.

OpenAI afirma que Astra salió de su mayor entrenamiento hasta la fecha, con más de 100.000 GPUs en su sede de Stargate en Texas, combinando avances en pretraining, aprendizaje por refuerzo y alineamiento. No es un modelo pequeño destilado sobre Sol para exprimir un poco más de razonamiento. Es otro barco.

La idea central tampoco es “razona mejor”. OpenAI posiciona Astra como un modelo diseñado para hacer trabajo largo y autónomo dentro de entornos reales: navegador, ordenador, IDE, documentos, hojas de cálculo. La palabra que repiten hasta la saciedad es computer use: navegar webs, rellenar formularios, manipular spreadsheets y operar aplicaciones directamente, en lugar de contarte cómo hacerlo tú.

Fíjate en el cambio de verbo. Sol te decía. Astra hace.

Y aquí aparece lo que de verdad me interesa para programar. Astra parece pensado para el patrón:

entender → modificar → ejecutar → observar → corregir → verificar.

Eso no es “qué modelo escribe mejor esta función”. Eso es harness engineering: el bucle completo de un agente que toca un sistema real, mira qué pasa y se corrige solo. Es exactamente el terreno donde se juega el coding con agentes hoy, y donde el modelo es solo una de las dos patas.

🔑 El titular útil no es “hay un modelo más listo”. Es que OpenAI ha dejado de venderte un chat que responde y ha empezado a venderte un operario que actúa. Y a un operario no lo evalúas por lo que dice, sino por lo que rompe.

¿Y yo qué modelo uso ahora?

Esa es la pregunta que deja abierta cualquier lanzamiento, y la que ni Brockman ni un benchmark te van a responder, porque depende de tu tarea, de tu presupuesto y de las suscripciones que ya pagas. Astra hoy ni siquiera está disponible para la mayoría, así que la decisión real de esta semana no es “¿me paso a Astra?” sino “¿con qué me quedo mientras tanto y para qué?”.

Herramienta gratis · Selector

¿Y a ti qué modelo te conviene esta semana?

Astra va llegando por fases y no lo vas a tener mañana. Dime qué vas a programar y qué suscripciones ya pagas, y te digo qué modelo usar ahora mismo, con una alternativa barata para cada tarea.

Le das

Tu tarea y las suscripciones que ya pagas

Te devuelve

El modelo que te conviene, con alternativa barata

Ver qué modelo uso

Con eso resuelto para el corto plazo, vamos a lo que sí es noticia: qué trae Astra y cuánto de ello está de verdad demostrado.

¿Qué hace distinto a Astra frente a Sol?

La diferencia fundamental, según la cobertura del briefing en Fortune y Wired, es el uso de ordenador combinado con autonomía prolongada. No es un modelo que responde más rápido: es uno que sostiene una tarea de muchos pasos sin que le lleves de la mano.

El dato que mejor lo resume viene de OSWorld 2.0, el benchmark de uso de ordenador. En su subconjunto offline, Astra saca un 72,6 % frente al 65,7 % de GPT-5.6 Sol. Siete puntos está bien, pero lo interesante es la otra columna: Astra tarda unos 40 minutos por tarea frente a los 75 minutos de Sol. Casi la mitad de tiempo para el mismo tipo de trabajo.

Traducido a tu día: no es solo que acierte más. Es que aguanta el tirón de una tarea larga y la cierra antes. Para un agente que revisa, prueba y corrige en bucle, el tiempo por tarea pesa tanto como el acierto.

Astra está pensado para producir entregables terminados —documentos, presentaciones, hojas de cálculo revisadas— y para recorrer flujos de varios pasos de principio a fin. Es la diferencia entre un copiloto que te dicta y un becario al que le encargas y vuelves a la hora a revisar lo que ha dejado.

Y esa palabra, revisar, es la que no puedes soltar. Porque un becario muy capaz que trabaja 40 minutos sin que mires es justo el que más falta te hace controlar.

Guía interactiva gratis

El modelo es una pata; el agente que lo envuelve es la otra

Astra sube justo donde importa el andamiaje. La parada 3 del curso-juego separa modelo de agente sin humo, y la 12 va entera sobre por qué la IA miente y cómo verificarla. 17 paradas, eliges proyecto y sales con una checklist a tu medida.

Entra en el curso gratis →

¿Qué dicen los benchmarks de GPT-6 Astra?

Dicen números que asustan, y por eso mismo hay que leerlos con la mano en la cartera. Casi todos los que siguen los publica OpenAI a partir de sus propias evaluaciones, no replicaciones independientes. Con ese asterisco puesto, esta es la foto:

Benchmark GPT-6 Astra Referencia
ARC-AGI-3 98,6 % Sol 7,8 % · Claude Opus 5 30 %
ExploitBench 100 % Ciberseguridad ofensiva
FrontierMath Tier 4 v2 97,6 % Matemáticas de frontera
GPQA Diamond 96 % Ciencia nivel doctorado
BenchCAD 95,9 % Diseño asistido por ordenador
DeepSWE v1.1 74,1 % Ingeniería de software long-horizon
OSWorld 2.0 (offline) 72,6 % Uso de ordenador (Sol: 65,7 %)

El que más ruido hace es ARC-AGI-3. Pasar de un 7,8 % en Sol y un 30 % en Opus 5 a un 98,6 % no es el clásico “+5 puntos entre generaciones”. Es otra liga. Si las evaluaciones independientes reproducen algo remotamente parecido, esto es un cambio de escala.

Ese “si” es todo el partido.

⚠️ ARC-AGI-3 y el resto de la tabla salen de OpenAI. Un benchmark que puede reproducir cualquiera y uno publicado por el propio laboratorio no pesan igual, aunque aparezcan en la misma fila. La señal de calidad llega cuando terceros con acceso publican sus números, y hoy eso todavía no ha pasado.

Un apunte sobre el DeepSWE. Ese 74,1 % es el que a ti te toca de cerca, porque DeepSWE mide agentes de programación en tareas largas sobre bases de código reales, no funciones de juguete. Es un número fuerte, pero es el que más ganas tengo de ver replicado en repos ajenos, porque coding agéntico es justo donde la diferencia entre el benchmark y tu lunes por la mañana se nota más.

Leer un benchmark con los asteriscos puestos es media batalla contra el hype. Cada domingo mandamos a +6.700 developers lo que vamos aprendiendo sobre IA en el trabajo real: qué números importan, qué herramientas cumplen y qué decisiones tomar. Gratis, desde 2018.

Suscríbete gratis →

Ciberseguridad: el primer modelo que OpenAI llama “Critical”

Aquí es donde el lanzamiento deja de ser una nota de producto y se vuelve otra cosa. Astra es el primer modelo que OpenAI clasifica como Critical en capacidades de ciberseguridad dentro de su Preparedness Framework. Y esto no es marketing de terceros: lo reconoce OpenAI oficialmente.

¿Qué hace falta para cruzar ese umbral? Que el modelo pueda desarrollar por su cuenta exploits funcionales de día cero contra sistemas endurecidos del mundo real, o planificar y ejecutar un ataque completo partiendo solo de un objetivo de alto nivel.

Astra sacó un 100 % en ExploitBench. Pero el dato de verdad inquietante es otro. OpenAI montó un test interno con 20 vulnerabilidades de alta severidad de V8 —el motor de JavaScript de Chrome— divulgadas este verano. Durante esa evaluación, Astra descubrió y encadenó dos zero-days que nadie conocía, y que OpenAI dice estar todavía comunicando a los responsables afectados.

Léelo otra vez. El modelo encontró agujeros nuevos mientras le hacían el examen.

Por eso OpenAI ha reforzado sus protecciones contra el uso ofensivo del modelo y ha decidido limitar el acceso a las capacidades avanzadas de ciberseguridad. No es prudencia de relaciones públicas: es un modelo que, con las herramientas y el acceso adecuados, encuentra fallos desconocidos y se inventa la forma de explotarlos sin que nadie le guíe cada paso.

Si te mueves por el lado defensivo, esto tiene doble filo, y ya lo desgranamos cuando OpenAI empezó a apretar por aquí con GPT-5.4-Cyber frente a Claude Mythos: las mismas capacidades que te ayudan a encontrar y parchear vulnerabilidades son las que obligan a esconder el modelo detrás de acceso verificado. Astra lleva esa tensión al extremo.

La autonomía sin verificación sale cara

Un agente que trabaja 40 minutos solo es un agente al que hay que auditar

Astra actúa en tu navegador, tu IDE y tus hojas de cálculo sin que mires cada paso. Te llevas los métodos para revisar y verificar lo que generan los agentes: pruebas en navegador con Playwright, casos Gherkin y adversarial review entre modelos.

Ver el método entero →

Masterclass en directo · casos Gherkin y adversarial review

¿Programa mejor Astra? Aquí quiero ver más pruebas

OpenAI afirma que es su mejor modelo de ingeniería de software hasta ahora, y los medios que estuvieron en el briefing recogen que supera a Sol y a los Claude actuales en las evaluaciones presentadas. Pero “en las evaluaciones presentadas” es la coletilla que lo cambia todo. Todavía no lo proclamaría ganador frente a Fable 5.1 basándome solo en esto.

Lo que sí me parece más interesante que un HumanEval son las pruebas de clientes con acceso temprano. Y hay dos que valen su peso.

Playco integró Astra en Playbot, su IDE con IA que se enchufa directamente a Unity y Godot. Ahí el modelo puede modificar el juego, ejecutarlo, observar el resultado y corregirlo —el bucle entero— trabajando en paralelo a los flujos que ya tenían. Según el caso de estudio que OpenAI publicó hoy, reportan un 50 % menos de correcciones manuales durante el prototipado, además de mejoras en razonamiento espacial, reproducción de referencias visuales, UI responsive, detección de bugs y la capacidad de evaluar lo que él mismo acaba de construir.

Ese último punto es el que me interesa. Un modelo que juzga su propio trabajo antes de dártelo es media batalla del harness ganada de fábrica.

Legora, un sistema agéntico para trabajo legal y financiero que usan más de 100.000 profesionales, lo probó con tareas largas de verdad. Una ejecución del agente revisó 41 documentos en minutos, cruzando cada cifra con su soporte, y encontró 4 de 4 errores introducidos a propósito. En ese workflow concreto de revisión financiera, la mejora rondó el 40 % frente al modelo anterior.

Y aquí está el matiz que evita malinterpretar ese 40 %: en el conjunto completo de su benchmark interno, la mejora media fue de alrededor del 3 %.

Eso es revelador. Astra no es “40 % más listo” en general. Es muchísimo mejor en un tipo concreto de trabajo: el largo, con estado, donde hay que revisar muchas cosas y terminar una tarea sin dejarse nada. Para agentes, esa capacidad de cerrar bien vale más que cinco puntos en cualquier tabla.

💡 Cuando un modelo mejora un 40 % en una tarea y un 3 % de media, no compres el 40 como si fuera el titular. Pregúntate qué tenían en común las tareas donde brilló. Casi siempre es lo mismo: horizonte largo, muchos pasos y una definición clara de “terminado”.

Cada semana hay modelo nuevo, benchmark nuevo y proclama de AGI nueva. Cada domingo seleccionamos 12 recursos para que no tengas que perseguirlos tú y sepas cuáles importan para tu trabajo. Ya somos +6.700 developers, gratis desde 2018.

Apúntate gratis →

¿Es AGI o es hype? El discurso necesita bastante sal

Brockman está diciendo cosas muy fuertes. Ha descrito Astra como un “salto generacional” y cerró el briefing con la frase que ha dado la vuelta al mundo: “bienvenidos a la era de la AGI”. Axios, Fortune, Wired y FT recogen sus declaraciones.

Yo separaría dos cosas que no son la misma.

Que Astra sea un salto importante: hay evidencia interesante, sobre todo en autonomía y uso de ordenador. Que Astra sea AGI: por ahora es, fundamentalmente, una interpretación de OpenAI y de Brockman. El propio Brockman admite que la definición de AGI es discutible y deja que cada usuario decida si Astra la cumple.

Hay un detalle que sí me parece más sustancioso que la etiqueta. Sam Altman dijo que los próximos lanzamientos de OpenAI vendrán marcados por consideraciones de seguridad y alineamiento, no de capacidad, y que “la próxima generación de modelos va a ser aleccionadora para todos”. Eso, viniendo de la empresa que ha empujado el ritmo estos años, es un cambio de tono que dice más que cualquier benchmark.

Que un modelo se clasifique como Critical y que su propio CEO diga que a partir de ahora el freno lo pone la seguridad es, en el fondo, la misma noticia contada dos veces.

¿Cómo lo entrenaron y por qué eso importa?

Porque explica por qué lo llaman generación y no versión. Astra no es un Sol afinado.

Además del entrenamiento con más de 100.000 GPUs en Stargate Texas, hay un detalle técnico que a mí me parece de los más jugosos: OpenAI dice que es su primer modelo que usa otros modelos con un papel relevante en la supervisión de su propio entrenamiento.

Modelos entrenando modelos. Es un paso que llevábamos tiempo viendo venir en los papers y que ahora aparece en un lanzamiento de producto. No lo tomo como prueba de nada por sí solo, pero sí como señal de que el cuello de botella se está moviendo del cómputo bruto hacia cómo supervisas y alineas lo que sale.

¿Puedo usar Astra hoy?

Casi seguro que no, y esto es parte de sus características. El rollout es deliberadamente progresivo.

De entrada llega a un grupo limitado de organizaciones enterprise, empezando por los socios del programa de ciberseguridad Daybreak. Después, según OpenAI, irá llegando a Plus, Pro, Business y Enterprise, a la API y a AWS “en los próximos días”. Y algunas capacidades avanzadas de ciberseguridad se quedan restringidas de forma indefinida.

Así que es perfectamente posible que dos personas estén viendo disponibilidades distintas ahora mismo, y que tú leas esto sin poder tocarlo. Como ya pasó con Sol, la disponibilidad de un modelo se ha vuelto parte de su ficha técnica: no basta con preguntarte si es bueno, tienes que preguntarte si estará ahí, para tu plan y tu región, cuando lo necesites.

¿Astra frente a Fable 5.1 y Mythos 5.1?

La respuesta honesta del primer día: todavía no hay suficientes sesiones reales de developers como para dar un veredicto. Y la comparación relevante no va a ser la que espera la gente.

Antes del lanzamiento había muchísimo hype en Reddit. En r/codex se hablaba de mejor coding agéntico, planificación, verificación y razonamiento long-horizon, pero casi todo eran filtraciones y rumores. También había escepticismo sano: la reacción a las capacidades Critical oscilaba entre “esto es extraordinario” y “marketing antes de la IPO”. Y ya está el inevitable meme de que “Astra estaba increíble hace 40 nanosegundos y ya lo han nerfeado”, que es una broma sobre el ritual que se repite con cada modelo, no un dato.

Con lo que hay hoy, esta es mi lectura provisional:

Escenario Quién parte con ventaja hoy
Uso de ordenador / navegador GPT-6 Astra: es literalmente para lo que está diseñado
Tareas largas con estado GPT-6 Astra: el 40 % de Legora sale justo aquí
Coding agéntico / harness Empate por ver: Fable 5.1 tiene reviews reales; Astra, benchmarks
Coding interactivo del día a día Fable 5.1 o modelos accesibles: Astra ni está disponible aún
Ciberseguridad con acceso Astra, pero detrás de acceso verificado, como Mythos

Lo que más me interesa de Astra no es ARC-AGI ni la palabra AGI. Es la combinación de computer use + coding + visión + autonomía + verificación + horizontes largos. Si las pruebas independientes lo confirman, la comparación con Fable 5.1 no va a ser “haz esta app en un prompt”.

Va a ser algo como: toma este repo, entiende el problema, inspecciona el sistema, implementa la feature, ejecuta los tests, encuentra lo que has roto, corrígelo y entrégame el trabajo terminado.

Ahí sí podríamos estar ante un cambio importante para Codex y para cómo se construyen los harness alrededor de los agentes. Pero eso se demuestra en repos de verdad, no en un briefing. Si quieres la foto completa de dónde encaja cada modelo mientras llegan esas pruebas, la tienes en la comparativa de los mejores modelos para programar, y el cara a cara de los Claude está en Fable 5.1: qué cambia y cuándo usarlo.

¿Qué haría yo esta semana con todo esto?

Nada espectacular. Cuatro cosas:

Primero, no reescribir nada por un lanzamiento que aún no puedo usar. El hype quema, pero tu flujo de trabajo no cambia por un briefing.

Segundo, apuntar a Astra las tareas donde de verdad se va a notar cuando llegue: las largas, con muchos pasos y estado, donde hoy tu agente se pierde a mitad. Ahí es donde el 40 % de Legora tiene pinta de repetirse, no en el commit de tres líneas.

Tercero, apretar las barandillas antes de que llegue un modelo que actúa solo durante 40 minutos. Permisos por capas, entornos aislados, confirmación humana para lo destructivo y evidencia de que los tests se ejecutaron de verdad. Un agente con capacidades Critical es exactamente el que no quieres soltar sin correa.

Cuarto, montar tu propia batería de cinco tareas reales de tu repo y guardarla como un test más. Cuando puedas tocar Astra, esa batería te dará en una tarde lo que ningún benchmark de OpenAI te va a dar: si sirve para tu trabajo. Que es la única pregunta que importa.

Porque el que decide si algo llega a producción sigues siendo tú. Y a un modelo que trabaja media hora sin que mires, lo próximo que le vas a pedir no es que sea más listo. Es que te demuestre lo que ha hecho.

Astra en una frase

El primer modelo que OpenAI vende como operario en vez de como oráculo: mejor en uso de ordenador, tareas largas y ciberseguridad ofensiva, envuelto en un discurso de AGI que conviene tomar con sal y en un acceso tan restringido que su disponibilidad es parte de la noticia.

TL;DR

  • 🚀 GPT-6 Astra (3 de septiembre de 2026) es una nueva generación, no un Sol afinado: mayor entrenamiento de OpenAI, +100.000 GPUs en Stargate Texas y foco en computer use y autonomía prolongada.
  • 📊 Los benchmarks asustan —98,6 % en ARC-AGI-3, 100 % en ExploitBench, 74,1 % en DeepSWE— pero casi todos los publica OpenAI. Espera a las replicaciones independientes.
  • 🛡️ Es el primer modelo Critical en ciberseguridad: encontró y encadenó dos zero-days de V8 durante una evaluación interna, y por eso le limitan el acceso.
  • 🧪 Las pruebas de terceros valen más que el hype: Playco reporta 50 % menos correcciones manuales y Legora un 40 % en revisión financiera, pero solo un 3 % de media en su benchmark completo. Brilla en lo largo y con estado.
  • 🧠 El discurso “era de la AGI” de Brockman es interpretación, no dato. Lo sustancioso es Altman diciendo que ahora el freno lo pone la seguridad, no la capacidad.

Preguntas frecuentes

¿Qué es GPT-6 Astra?

GPT-6 Astra es el modelo insignia de OpenAI presentado el 3 de septiembre de 2026, posicionado como una nueva generación centrada en el uso de ordenador (navegador, IDE, documentos, hojas de cálculo) y en el trabajo autónomo de horizonte largo. OpenAI afirma que es su mayor entrenamiento hasta la fecha y su primer modelo clasificado como Critical en ciberseguridad.

¿GPT-6 Astra es AGI?

No hay consenso. Greg Brockman lo describe como un salto generacional y habla de “la era de la AGI”, pero él mismo reconoce que la definición de AGI es discutible y deja que cada usuario decida. A día de hoy, “Astra = AGI” es una interpretación de OpenAI, no un hecho verificado por terceros.

¿Cuáles son los benchmarks de GPT-6 Astra?

Los publicados por OpenAI incluyen 98,6 % en ARC-AGI-3, 100 % en ExploitBench, 97,6 % en FrontierMath Tier 4 v2, 96 % en GPQA Diamond, 95,9 % en BenchCAD, 74,1 % en DeepSWE v1.1 y 72,6 % en el subconjunto offline de OSWorld 2.0. El asterisco importante es que casi todos proceden de las evaluaciones internas de OpenAI, sin replicación independiente todavía.

¿Por qué GPT-6 Astra es el primer modelo “Critical” en ciberseguridad?

Porque, bajo el Preparedness Framework de OpenAI, alcanzó el umbral de poder desarrollar por su cuenta exploits de día cero contra sistemas endurecidos. En una evaluación interna con 20 vulnerabilidades de V8, Astra descubrió y encadenó dos zero-days desconocidos hasta entonces. Por eso OpenAI reforzó sus salvaguardas y limita el acceso a esas capacidades.

¿Astra programa mejor que Fable 5.1?

Todavía no se puede afirmar. OpenAI dice que es su mejor modelo de ingeniería de software y que supera a los Claude en sus evaluaciones, pero son benchmarks propios. Fable 5.1 ya tiene reviews independientes de uso real; Astra, de momento, solo tiene benchmarks y pruebas de clientes seleccionados. La comparación seria llegará con sesiones en repositorios reales.

¿Qué es “computer use” en GPT-6 Astra?

Es la capacidad de operar aplicaciones directamente como lo haría una persona: navegar webs, rellenar formularios, manipular hojas de cálculo y usar el escritorio, en lugar de limitarse a explicar cómo hacerlo. En el benchmark OSWorld 2.0 offline, Astra saca 72,6 % frente al 65,7 % de GPT-5.6 Sol, y en la mitad de tiempo por tarea.

¿Puedo usar GPT-6 Astra ya?

Probablemente no de inmediato. El despliegue es por fases: primero un grupo limitado de organizaciones enterprise, empezando por los socios del programa Daybreak, y después Plus, Pro, Business, Enterprise, API y AWS en los días siguientes. Algunas capacidades avanzadas de ciberseguridad quedan restringidas de forma indefinida.

¿Qué significó el 40 % de mejora que reportó Legora?

Que Astra mejoró alrededor de un 40 % frente al modelo anterior en un workflow concreto de revisión financiera, revisando 41 documentos en minutos y encontrando 4 de 4 errores plantados. El matiz clave es que, en el conjunto completo de su benchmark interno, la mejora media fue de solo un 3 %. Astra no es “40 % más listo” en general: destaca en tareas largas, con estado y con un “terminado” claro.

¿Cómo se entrenó GPT-6 Astra?

Con el mayor entrenamiento de OpenAI hasta la fecha, más de 100.000 GPUs en su sede de Stargate en Texas, combinando avances en pretraining, aprendizaje por refuerzo y alineamiento. OpenAI destaca además que es su primer modelo en el que otros modelos tuvieron un papel relevante supervisando el entrenamiento.

¿Cómo sigo un lanzamiento así sin comerme el hype?

Separa lo verificable de lo autoproclamado: un benchmark del propio laboratorio no pesa igual que uno que puede reproducir cualquiera. Desconfía de las cifras espectaculares hasta que aparezcan reviews independientes y quejas concretas de gente usándolo en repos sucios. Y mide en tu propio repositorio con cinco tareas reales: es el único benchmark que decide si el modelo sirve para tu trabajo.

Fuentes

🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter

Imagen de Daniel Primo
Claude, IA de Anthropic

Escrito con la ayuda de la IA generativa de Claude, fuentes fidedignas y con un human in the loop:
Dani Primo.

CEO en pantuflas de Web Reactiva. Programador y formador en tecnologías que cambian el mundo y a las personas. Activo en linkedin, en substack y canal @webreactiva en telegram

12 recursos para developers cada domingo en tu bandeja de entrada

Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.