Crear vídeos con IA con Opus 5.5 y GPT-6 Astra (ejemplos brutales)
Le pedí a un agente un vídeo de 15 segundos con una sola frase. Me devolvió esto.
Con música. Sin plantilla, sin After Effects y sin un modelo generativo de vídeo por medio: cada fotograma lo pinta código y la banda sonora también sale de código.
El prompt, tal cual lo escribí:
Make a dynamic 15-second motion graphics video that shows what an incredible motion designer you are. Go all out.
Lo que ha pasado estas semanas es que Opus 5.5 y GPT-6 Astra ya pueden dirigir una producción audiovisual completa: guion, montaje, animación, sonido, revisión y render. No generan cada píxel por arte de magia; escriben el código, eligen las herramientas, revisan lo que sale y lo corrigen.
En este post vas a ver:
- Mis dos vídeos, el del prompt de una línea y uno con la marca de Web Reactiva, y cómo se construyó el primero por dentro
- Las cuatro formas en que la gente está haciendo vídeo con estos modelos (y cuál es cuál)
- Los prompts más reseñables de X, traducidos
- El ruido que conviene filtrar antes de creerse una demo
- Un prompt y un proceso para que lo intentes tú esta semana
Dale al play con el sonido puesto. Luego seguimos.
Dos vídeos hechos por un agente con casi ningún prompt ¶
Dos piezas. La primera ya la has visto: quince segundos que el propio modelo tituló “Every frame is a decision”. Un punto que se convierte en tipografía, una cuadrícula que se enrosca en espiral, una carta de curvas de easing, una nube de partículas en 3D, los principios de la animación y una firma final que vuelve al punto para cerrar el bucle.
La segunda es más elaborada y lleva la marca de Web Reactiva. Aquí no hay prompt que enseñarte: salió de una skill de marca que aplica la misma técnica con Hyperframes, los colores de la casa y el robotito.
Fíjate en el robotito.
Es la primera vez que un modelo entiende que el logo de Web Reactiva podía cobrar vida en forma de bot. Nadie se lo dijo. Hasta ahora, un logo en manos de un modelo era una imagen que se escala, se desliza o hace un fundido. Esta vez el agente lo leyó como un personaje, le dio movimiento propio y lo puso a actuar dentro de la pieza.
Y los dos vídeos tienen música. No es una pista de stock pegada al final: en el primero la banda sonora está sintetizada con Python y compuesta sobre la misma rejilla de tiempo que la imagen, de modo que los cortes caen en el golpe de bombo. En el segundo, el robotito se mueve al ritmo de una pista con aire rockero.
🔑 Lo que ha cambiado no es que un modelo “sepa hacer vídeo”. Es que sabe qué pinta tiene un buen vídeo y tiene paciencia para revisar fotogramas hasta que se parece.
Cómo se construye un vídeo en el que cada fotograma es código ¶
La etiqueta que mejor lo describe es motion graphics in code. Si se lo pides así a un agente, te entenderá mejor que con “haz un vídeo”. No es edición de vídeo ni IA generativa de vídeo: es programación gráfica pura, renderizada fotograma a fotograma.
El primer vídeo son cuatro piezas:
| Fichero | Qué hace |
|---|---|
index.html |
Toda la animación: un canvas 2D y una función drawScene(ctx, t) que pinta cualquier instante |
audio.py |
La banda sonora, sintetizada con numpy y scipy, exportada a audio.wav |
render.mjs |
Abre Chrome headless, captura fotograma a fotograma y se lo pasa a ffmpeg |
fonts/ |
Archivo (variable, de grosor 100 a 900) y JetBrains Mono, de Google Fonts |
El resultado es un MP4 de 15 segundos a 1920×1080 y 60 fps: 900 fotogramas en H.264 con audio AAC, unos 35 MB.
El vídeo es una función del tiempo ¶
No hay keyframes. drawScene(ctx, t) recibe el segundo t y decide qué se ve. Eso tiene una consecuencia muy de programador: cada fotograma se puede renderizar suelto y en cualquier orden. Las partículas no se simulan paso a paso; su posición sale de una fórmula cerrada que depende del tiempo.
Si alguna vez has escrito un juego con un bucle de update(), esto es lo contrario. Aquí no hay estado que arrastrar entre fotogramas.
Imagen y música comparten la misma rejilla ¶
El detalle que más me gustó. El agente fijó 1 beat = 28 fotogramas a 60 fps, lo que da un tempo de 128,57 BPM. Con esa elección, cualquier corte cae en un fotograma exacto. Imagen y sonido se escribieron en beats sobre la misma estructura de 8 compases (32 beats × 28 fotogramas = 896, casi los 900 del vídeo).
El movimiento “a golpes de beat” es una línea:
// Avanza a saltos: cada beat arranca rápido y frena suave
function beatMotion(t, bpm = 128.57) {
const b = (t * bpm) / 60; // tiempo expresado en beats
const whole = Math.floor(b); // beats completos ya pasados
const frac = b - whole; // cuánto llevamos del beat actual
return whole + easeOutExpo(frac); // salto con frenada al final
}
function easeOutExpo(x) {
return x === 1 ? 1 : 1 - Math.pow(2, -10 * x);
}
Es la versión simplificada de lo que usa la pieza (floor(b) + easeOutExpo(frac(b))). Con eso, lo que se mueve lo hace al compás de la música sin sincronizar nada a mano.
El oficio que el modelo aplica sin que se lo pidas ¶
Aquí se nota el salto de calidad. En el prompt no mencioné ninguno de estos recursos y aparecieron todos:
- Easing con intención, anticipación y squash & stretch, los principios clásicos de animación
- Una idea-hilo: el punto que abre, se transforma y vuelve al final
- Tipografía variable animando el grosor de la fuente
- Paleta cerrada de cuatro colores
- Acabado de cine: motion blur real (media de 8 subinstantes por fotograma, con obturador de 180°), grano, viñeta, temblor de cámara en los impactos y un HUD en modo de fusión
difference
La música sigue el mismo nivel de detalle: bombo con caída de tono, palmas, hi-hats, bajo, pads en Fa menor (Fm, D♭, E♭), arpegios, subida de tensión, un silencio justo antes del impacto y sidechain para que el bombo respire. Encima, reverb por convolución y saturación con tanh.
Nadie le pidió ese silencio antes del golpe. Lo puso porque así suena mejor.
Revisar antes de entregar ¶
El render completo tardó unos 4 minutos. Pero lo interesante pasó antes y después: el agente generó hojas de contactos con fotogramas sueltos y las revisó como haría un motion designer mirando la línea de tiempo.
Así detectó y corrigió tres fallos: la nube 3D se veía tenue, el anillo de letras era demasiado grande y las rotaciones rápidas producían un efecto estroboscópico. Para lo último subió el motion blur de 5 a 8 muestras por fotograma.
💡 Si solo te llevas una cosa de esta sección: pide siempre que el agente se mire a sí mismo. Renderizar fotogramas sueltos, inspeccionarlos y corregir es lo que separa una demo resultona de una pieza que aguanta un segundo visionado.
Con la misma técnica llevada a Hyperframes y a los colores, la tipografía y el robotito de Web Reactiva, montamos una skill de marca. De ahí sale el segundo vídeo.
El vídeo lo hace el agente, no el modelo solo: aprende a montar esa pareja
Todo lo de arriba sale de un modelo con manos: terminal, Chrome y ffmpeg. En la parada Modelos vs Agentes del curso ves las dos patas y eliges la tuya antes de lanzarte con algo así.
Entra en el curso gratis →Lo que otros están haciendo con Opus 5.5 y GPT-6 Astra ¶
He revisado publicaciones y conversaciones en inglés de X, Reddit, Hacker News y creadores que explican su proceso. Salen cuatro rutas distintas que se venden bajo el mismo titular de “vídeo hecho con IA”:
| Ruta | Qué se ha visto | Qué hace de verdad el modelo |
|---|---|---|
| Motion graphics programáticos | Anuncios, interfaces animadas y explicadores hechos con HTML y JS, Remotion u otros motores | Construye y ajusta escenas que después se renderizan. Remotion es una opción, no un requisito |
| Edición de vídeo grabado | Nate Herk dio a GPT-6 Astra grabaciones de cámara y pantalla: cortes, subtítulos sincronizados, cambios de encuadre y gráficos con Hyperframes | Decide los cambios visuales según lo que se explica, sobre material real |
| Dirección de modelos generativos | Gavin Purcell conectó un agente con Opus 5.5 a Runway por MCP para un documental de cinco minutos | Hace de director y coordinador. Las imágenes las genera Runway |
| Captura y presentación de software | Un creador enseñó cómo Astra construyó una experiencia interactiva y luego grabó, editó, sonorizó y renderizó su demo | Convierte una app o una funcionalidad real en pieza audiovisual |
Mis dos vídeos van por la primera ruta. Las tres capturas que siguen enseñan las otras.
Un anuncio de SaaS con Opus 5.5 ¶
Moritz Kremb pidió a Opus 5.5 que eligiera un SaaS conocido y le montara un vídeo de lanzamiento. Aquí tienes su post y el vídeo: 46 segundos, y la captura es del segundo 32. Él mismo lo resume con un “omg, tuve que probarlo y estoy alucinado”.

Un reel editado con GPT-6 Astra ¶
Nate Herk publicó un artículo con sus vídeos donde explica el proceso: Codex, Hyperframes y ElevenLabs para transcribir. El fotograma, a los 18 segundos, es de un reel que mezcla su intervención a cámara con elementos animados. Él habla de una primera pasada de unos 18 minutos y varias revisiones después.

Es su experiencia declarada, no una medición de tiempos que puedas extrapolar. Pero es la ruta que más me interesa para los vídeos de cámara y pantalla que hacemos en Web Reactiva.
Un documental dirigido por Opus 5.5 y rodado con Runway ¶
El post de Gavin Purcell superó las 820.000 reproducciones en unos días. Cinco minutos y cuarto de documental “estilo Netflix” sobre superinteligencia, con una presentadora que se mantiene coherente de principio a fin. La captura es del minuto 1:50.

Ojo con la lectura: aquí Opus no pinta nada. Coordina. Escribe el guion, decide los planos, llama a Runway a través de su servidor MCP, monta el resultado y lo revisa. Si quieres entender esa pieza de la arquitectura, tienes qué es un servidor MCP y cómo conecta un agente con herramientas externas.
Cada semana sale una demo de vídeo que parece imposible y hay que separar lo que hizo el modelo de lo que hizo la herramienta. Cada domingo seleccionamos 12 recursos sobre IA y desarrollo para que no te toque perseguirlos. Ya somos +7.200.
Quiero esa dinamita 🧨Los prompts de las demos más compartidas, traducidos ¶
Tres, traducidos al español. Merecen leerse despacio porque cada uno enseña algo distinto.
El anuncio de Moritz Kremb, traducido del prompt que publicó:
Quiero que crees un vídeo de lanzamiento de un producto SaaS muy profesional. Busca un SaaS, preferiblemente uno conocido para que resulte fácil reconocerlo. Elígelo y consigue de internet imágenes y materiales reales. Con todo ello, crea uno de esos vídeos de lanzamiento con edición profesional y estilo motion graphics que la gente publica en Twitter al lanzar un SaaS. Muestra sus funciones y beneficios.
El valor está en que pide material real del producto, no solo animación. Y cuidado con el “lo hice con un solo prompt”: eso describe la instrucción del usuario. No significa que el agente hiciera una sola operación; por debajo investigó, programó y renderizó.
El documental de Gavin Purcell, condensado y traducido de su prompt público:
Crea un explicador de cinco minutos sobre la superinteligencia para principiantes. Mantén un personaje coherente durante toda la pieza y dale el aspecto de una producción documental de alta calidad. La presentadora debe ser británica, ingeniosa y muy inteligente, con comentarios ligeramente mordaces. Investiga lo necesario. Puedes usar Runway, con un límite aproximado de 25.000 créditos. Trabaja en 16:9 y, de momento, en 480p para contener el coste; después podremos aumentar la resolución.
Dos detalles de adulto: pone un techo de gasto (25.000 créditos de Runway) y baja la resolución para iterar barato. El propio autor cuenta que tuvo que arreglar dos cosas: unos fotogramas fugaces y gráficos mal colocados. Llamativo, sí; sin revisión humana, no.
La instrucción más útil para un flujo propio sale del desglose de Nate Herk. No es un prompt literal suyo; es una adaptación de su proceso:
Transcribe la grabación con marcas de tiempo por palabra. Elimina errores, repeticiones y silencios antes de animar. Divide el contenido en escenas según lo que estoy explicando. Sincroniza subtítulos y gráficos con mis palabras; pasa a cámara completa cuando explico una idea y vuelve a pantalla más cámara cuando hago una demostración. Renderiza una vista previa, inspecciona encuadres y tiempos, y corrige los fallos que encuentres.
Herk cuenta que la primera versión necesitó cambios en la apertura, en el tamaño del texto y en la disposición de unas tarjetas 3D. Otra vez el mismo patrón: el agente hace el 80 % y tú diriges el resto.
Y el mío sigue siendo el más corto de los cuatro. Una línea en inglés, “Go all out” al final, y ninguna mención a canvas, música o motion blur. Todo eso lo decidió el modelo.
El modelo no genera el vídeo, lo dirige ¶
En todas las demos que he revisado pasa lo mismo.
Ni Opus 5.5 ni GPT-6 Astra producen fotogramas de vídeo por sí mismos. Lo que ha mejorado es todo lo que rodea al fotograma: el criterio visual, la capacidad de escribir código gráfico que funciona a la primera, el uso de herramientas durante muchos pasos seguidos y la costumbre de revisar su propio trabajo. Ya lo avisábamos en el análisis de Opus 5.5: una captura bonita enseña lo que hace la herramienta que la renderiza.
Por eso el resultado depende tanto de qué herramientas y qué materiales le das:
| Si le das… | Obtienes… | Coste principal |
|---|---|---|
| Un navegador, ffmpeg y Python | Motion graphics y música generados por código, como mis vídeos | Tokens y minutos de render |
| Un framework como Remotion o Hyperframes | Lo mismo, con componentes reutilizables y un proyecto editable | Tokens y aprender el framework |
| Tus grabaciones y una transcripción | Edición: cortes, subtítulos, encuadres y gráficos | Tokens y tu revisión |
| Un MCP de un modelo generativo (Runway) | Imagen realista rodada por otro modelo | Créditos del servicio, que pueden dispararse |
La tabla también explica por qué mis vídeos no parecen el de Gavin Purcell. No hay personas ni bibliotecas: hay formas, tipografía y ritmo. Es otro lenguaje, y para explicar software suele ser mejor, porque todo es editable y reproducible.
⚠️ Si conectas un agente a un servicio de pago por uso, ponle límite de gasto en el prompt y en la cuenta. Un agente que itera sobre vídeo generativo puede quemar créditos mucho más rápido que tokens.
Lleva tus skills al siguiente nivel
Convierte tu estilo de vídeo en una skill que el agente cargue cada vez
El robotito salió de una skill de marca con colores, tipografía y reglas de movimiento. Te llevas el método para escribir la tuya y que el agente no parta de cero en cada vídeo.
Abrir la guía →Plantillas SKILL.md descargables incluidas
El ruido que conviene filtrar antes de creerse una demo ¶
Toda demo viral tiene su letra pequeña. Tres cosas que he visto repetirse.
Más movimiento no es mejor comunicación. En un hilo sobre un anuncio de 42 segundos hecho con Opus 5.5 y Remotion, varios espectadores señalaron que el montaje iba tan rápido que costaba leerlo o entender el producto. El autor lo aceptó y dijo que tocaba ralentizar partes. Un modelo con buen oficio tiende a lucirse; tú decides cuándo hace falta aire.
“Un solo prompt” casi nunca es un solo paso. El documental de Purcell necesitó dos correcciones. El reel de Herk, varias rondas. Mi vídeo de 15 segundos pasó por hojas de contactos y tres arreglos antes del render final. Lo que es de un solo prompt es la instrucción; el proceso es largo y el agente lo recorre solo.
Hay procesos muy distintos bajo el mismo titular. En Hacker News, un creador relata unas cinco horas para convertir una viñeta de XKCD en vídeo: discutió estilo, guion y storyboard por etapas, usó ElevenLabs y acabó con código Python generado por Opus. Otro explica una ruta de HTML animado y ensamblaje de fotogramas con ffmpeg. Los dos son “vídeo hecho con Opus”, y no se parecen en nada.
🛡️ Antes de fiarte de una demo, busca tres cosas: el prompt completo, qué herramientas tenía el agente y cuántas correcciones hubo. Si falta alguna, trátala como anuncio, no como prueba.
Probar cosas como esta y contarte qué aguanta el segundo visionado es lo que hacemos cada semana. Cada domingo mandamos a +7.200 developers lo que vamos aprendiendo sobre IA en el trabajo real. Gratis, desde 2018.
Suscríbete gratis →Tu primer vídeo con un agente, esta misma semana ¶
Empieza por la ruta de código. Es la más barata, la más reproducible y la que menos depende de servicios externos. Necesitas un agente con terminal, como Claude Code, y lo que pedía el proyecto del primer vídeo:
- Node 18 o superior, con
playwright-corepara controlar Chrome - Python 3 con numpy y scipy, si quieres música sintetizada
- ffmpeg para unir fotogramas y audio
- Google Chrome instalado
Con eso, el prompt para repetir la técnica es este:
Haz un vídeo de motion graphics in code de N segundos: todo generado por código (canvas + función del tiempo), música sintetizada en la misma rejilla de beats, motion blur y render frame a frame con Chrome headless + ffmpeg. Revisa hojas de contactos antes de entregar.
El proyecto que te devuelva debería funcionar con algo parecido a esto:
# Dependencia para controlar Chrome desde Node
npm i playwright-core
# Genera la banda sonora (tarda alrededor de un segundo)
python3 audio.py
# Renderiza el vídeo completo (unos 4 minutos para 900 fotogramas)
node render.mjs
# Solo los fotogramas 60 y 300 como PNG, para revisarlos
node render.mjs 60,300 /tmp/stills
Ese último comando es el que más vas a usar. Renderizar el vídeo entero para comprobar un detalle es tirar minutos; pedir dos fotogramas sueltos y mirarlos es inmediato. Y como la animación es una función del tiempo, cualquier fotograma sale igual que en el render final.
Tres consejos que te ahorran vueltas:
- Empieza corto. Quince segundos es un buen primer objetivo: da para una idea completa y el render no se eterniza.
- Dale una restricción de estilo. Una paleta, una tipografía, un tempo. Cuanto más cerrado el marco, más criterio muestra el modelo dentro.
- Cuando te guste, empaquétalo. Si repites estilo, conviértelo en una skill con tus colores y reglas de movimiento, como hicimos con las skills de GSAP para animación o con la de marca de Web Reactiva.
Mi próximo experimento va por la segunda ruta: darle a un agente una grabación real de pantalla y cámara, una regla editorial sobre cuándo cambiar de plano y la obligación de entregar un MP4 y el proyecto editable. Quiero comprobar tres cosas: si los cortes respetan el sentido de la explicación, si las animaciones ayudan a entenderla y cuánto trabajo queda para dejarla publicable.
TL;DR ¶
- 🎬 Opus 5.5 y GPT-6 Astra ya dirigen vídeos completos: guion, animación, música, revisión y render
- 🧮 Mi vídeo de 15 segundos es motion graphics in code: cada fotograma y la música salen de código, con una rejilla de beats común
- 🤖 El vídeo con la marca de Web Reactiva es el primero en el que un modelo convierte el logo en un bot con vida propia
- 🎥 Las demos virales mezclan rutas distintas: código, edición de grabaciones y dirección de Runway por MCP, donde el vídeo lo genera otro modelo
- 🔍 Pide siempre que el agente revise fotogramas sueltos antes del render final; ahí está la diferencia de calidad
Preguntas frecuentes ¶
¿Puede Claude Opus 5.5 crear vídeos? ¶
Opus 5.5 no genera fotogramas de vídeo por sí mismo. Sí puede escribir el código que los pinta (canvas, Remotion, Hyperframes), sintetizar la música, renderizar con Chrome headless y ffmpeg y revisar el resultado. También puede dirigir a un modelo generativo como Runway a través de un servidor MCP.
¿Qué es “motion graphics in code”? ¶
Es una forma de hacer vídeo en la que cada fotograma lo dibuja un programa a partir del tiempo, sin keyframes ni editor visual. Una función como drawScene(ctx, t) decide qué se ve en cada instante y un script captura los fotogramas y los une en un MP4. Es la etiqueta que mejor funciona al pedírselo a un agente.
¿Qué prompt usaste para el vídeo de 15 segundos? ¶
Una sola frase en inglés: “Make a dynamic 15-second motion graphics video that shows what an incredible motion designer you are. Go all out.” No mencioné canvas, música ni motion blur; el modelo decidió la técnica, compuso la banda sonora y revisó fotogramas antes de entregar.
¿Cómo se añade música a un vídeo hecho con IA? ¶
En mi caso, el agente la sintetizó con Python (numpy y scipy): bombo, palmas, hi-hats, bajo, pads y arpegios, con reverb y sidechain. La clave fue componerla sobre la misma rejilla de beats que la animación, para que cortes e impactos coincidan con la música. ffmpeg une después el audio y los fotogramas.
¿GPT-6 Astra puede editar vídeos grabados? ¶
Según el proceso que describe Nate Herk, sí: a partir de grabaciones de cámara y pantalla, Astra hizo cortes, subtítulos sincronizados, cambios de encuadre y gráficos con Hyperframes. Usó Codex y ElevenLabs para la transcripción. Él habla de una primera pasada de unos 18 minutos y varias revisiones; es su experiencia, no una medición independiente.
¿Qué diferencia hay entre Remotion e Hyperframes para vídeo con IA? ¶
Remotion construye vídeos con componentes de React; Hyperframes usa HTML plano con atributos data-* y una CLI pensada para que la maneje un agente. Los dos convierten código en vídeo y los dos funcionan con agentes de IA. No son obligatorios: un canvas y ffmpeg bastan, como en mi vídeo de 15 segundos.
¿Cómo se hizo el documental de Gavin Purcell con Opus 5.5? ¶
Conectó un agente con Opus 5.5 al MCP de Runway y le pidió un documental de cinco minutos sobre superinteligencia, con una presentadora coherente. Opus coordinó guion, planos y montaje, y Runway generó las imágenes. El prompt limitaba el gasto a unos 25.000 créditos y la resolución a 480p para contener el coste.
¿Cuánto tarda un agente en hacer un vídeo así? ¶
Depende de la ruta. El render de mi vídeo de 15 segundos a 60 fps tardó unos 4 minutos, más el tiempo de diseño y revisión del agente. En Hacker News hay quien cuenta unas cinco horas para un vídeo de una viñeta de XKCD trabajando por etapas. No hay una cifra generalizable.
¿Qué necesito instalar para hacer vídeo con código y un agente? ¶
Para la ruta del vídeo de 15 segundos: Node 18 o superior con playwright-core, Python 3 con numpy y scipy, ffmpeg y Google Chrome. Además, un agente con acceso a la terminal, como Claude Code, que pueda ejecutar los scripts de render y leer los fotogramas que genera.
¿Son fiables las demos de vídeo con IA que circulan por X? ¶
Hay que leerlas con cuidado. “Un solo prompt” suele describir la instrucción, no el proceso, y casi todas las demos tuvieron correcciones. Comprueba el prompt completo, qué herramientas tenía el agente y cuántas revisiones hubo. Ya ha circulado algún vídeo atribuido a Opus 5.5 que venía de YouTube.
Fuentes ¶
- Moritz Kremb: vídeo de lanzamiento de SaaS hecho con Opus 5.5 y su prompt
- Gavin Purcell: documental dirigido por Opus 5.5 con Runway y su prompt con las correcciones
- Nate Herk: edición de reels con GPT-6 Astra, Codex e Hyperframes
- Cómo crear vídeos con Remotion y skills de Claude Code
- Hyperframes: crea vídeos con HTML, skills y un solo prompt
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.