Cómo escribir prompts de video con IA: una fórmula práctica
Una fórmula práctica para escribir prompts de texto a video e imagen a video, con un ejemplo explicado, diagnóstico de fallas y un ciclo de iteración consciente de los créditos.
Publicado 29 jul 20268 min de lectura

Empieza por el material de entrada, no por una plantilla universal
La fórmula más útil para escribir un prompt de video con IA depende del material que ya tienes.
- Texto a video: el prompt debe definir la toma completa: sujeto, acción, lugar, encuadre, cámara, luz y ritmo.
- Imagen a video: la imagen ya contiene al sujeto, la composición, la iluminación y el estilo. El prompt debe concentrarse, sobre todo, en lo que se mueve.
Esta diferencia evita un error frecuente: colocar una descripción extensa de texto a video sobre una imagen terminada y darle al modelo varias versiones de la misma escena que compiten entre sí.
En esta guía encontrarás una fórmula para cada flujo, un ejemplo completo y una forma práctica de diagnosticar un prompt sin reescribirlo todo. Es un marco editorial independiente del modelo, no un benchmark ni la promesa de que una misma sintaxis funcionará igual en todas las herramientas.
Si buscas un proceso de producción más amplio —intención de la toma, iluminación cinematográfica, elección de categoría y continuidad— consulta Cómo crear video cinematográfico con IA. Aquí nos enfocamos en algo más específico: adaptar la anatomía del prompt al material de entrada y corregir primero la variable que falló.
Fórmula 1: convierte texto a video en un brief de siete partes
Para generar una toma solo a partir de texto, usa:
Sujeto + Acción + Entorno + Encuadre + Movimiento de cámara + Luz/estilo + Ritmo
No necesitas una oración larga para cada parte. Necesitas la información suficiente para resolver las decisiones visuales importantes.
| Parte | Pregunta que debes responder | Ejemplo |
|---|---|---|
| Sujeto | ¿Qué debe seguir siendo reconocible? | Una ciclista solitaria con impermeable amarillo mostaza |
| Acción | ¿Qué cambia durante la toma? | Cruza el puente a un ritmo constante |
| Entorno | ¿Dónde y cuándo ocurre? | Hora azul después de la lluvia, asfalto mojado, neblina ligera |
| Encuadre | ¿Qué debe aparecer dentro del cuadro? | Plano general a nivel de la calle, en tres cuartos |
| Cámara | ¿Cómo cambia el punto de vista? | Travelling paralelo a una distancia constante |
| Luz/estilo | ¿Qué se ve físicamente? | Ambiente frío y reflejos cálidos sobre el asfalto |
| Ritmo | ¿Cómo debe desarrollarse el movimiento? | Una sola toma continua y controlada |
La guía actual de Google para generación de video recomienda concentrar los clips cortos en una sola escena. Si tu idea incluye “encuentra una pista, cruza la ciudad y después confronta al sospechoso”, sepárala en varias tomas en lugar de intentar meter toda la trama en un solo prompt.
Elige decisiones visuales concretas en vez de biografías o etiquetas de estado de ánimo. “Épico” es una interpretación; un plano general en contrapicado, una luz de contra intensa y una revelación lenta con grúa son instrucciones. También conviene elegir un movimiento de cámara dominante, salvo que la secuencia entre varios movimientos esté descrita con claridad.
Un prompt completo, parte por parte
Así se ve la fórmula de siete partes dentro de un solo prompt:
A lone cyclist in a mustard-yellow rain jacket rides steadily across an empty suspension bridge at blue hour after rain. Wide road-level three-quarter shot, with the cyclist on the left third and open road ahead. The camera tracks parallel at a steady distance. Wet asphalt reflects distant red and amber traffic lights; cool overcast ambience, light mist, restrained contemporary film color. One continuous shot with controlled speed and smooth tracking throughout.

La imagen anterior es un fotograma editorial creado para esta guía; no es el resultado de una prueba comparativa entre modelos. Su función es mostrar cómo cada fragmento del prompt corresponde a una decisión visible:
| Parte del prompt | Decisión |
|---|---|
| Sujeto | Una ciclista con impermeable amarillo |
| Acción | Avance constante |
| Entorno | Puente colgante, hora azul, asfalto mojado y neblina |
| Encuadre | Plano general a nivel de la calle, con espacio al frente |
| Cámara | Travelling paralelo |
| Luz/estilo | Ambiente frío con reflejos cálidos |
| Ritmo | Una sola toma continua y controlada |
El prompt es detallado porque resuelve siete decisiones distintas, no porque agregar más palabras produzca automáticamente un mejor video.
Fórmula 2: en imagen a video, describe el movimiento
Cuando ya cuentas con un primer fotograma, utiliza una estructura más breve:
Movimiento de cámara + Movimiento del sujeto + Movimiento del entorno + Ritmo
Google y Runway recomiendan tratar la imagen de origen como la base visual. Esa imagen ya define al sujeto, la escena, la composición, la luz y el estilo. Repetir todos esos detalles en el prompt de movimiento puede introducir instrucciones redundantes o contradictorias.
Para el fotograma de la ciclista, el prompt de imagen a video podría ser:
The camera tracks smoothly beside the cyclist. The cyclist pedals at a steady pace while the rain jacket moves lightly in the wind. Fine mist drifts across the bridge and road reflections shimmer subtly. Controlled motion, one continuous shot.
Observa lo que no aparece: no hay una segunda descripción de su rostro, el color del impermeable, la arquitectura del puente ni la iluminación. La imagen ya aporta esos datos.
También cambia la forma de referirte al sujeto. “The cyclist” suele ser suficiente. Repetir una descripción densa del personaje puede hacer que el modelo reinterprete una identidad que ya está visible.
Diagnostica la falla antes de reescribir el prompt
Después de obtener un resultado débil, identifica la decisión más pequeña que falló y corrige primero esa parte.
| Lo que observas | Problema probable del prompt | Primera corrección |
|---|---|---|
| El sujeto se ve genérico | Le faltan rasgos visuales reconocibles | Agrega dos o tres detalles distintivos |
| Ocurren demasiadas cosas | Varias acciones compiten dentro del clip | Conserva una sola acción principal |
| El encuadre parece accidental | No se indicó el tamaño del plano ni el punto de vista | Añade una instrucción de encuadre explícita |
| El movimiento resulta confuso | La cámara y el sujeto tienen direcciones que compiten | Conserva un movimiento de cámara y una acción del sujeto |
| La imagen casi no se anima | El prompt vuelve a describir el fotograma | Elimina la descripción de la escena y especifica el movimiento |
| El ambiente se siente impreciso | Los adjetivos abstractos cargan con todo el trabajo visual | Define luz, color, clima o textura |
| No sabes qué mejoró | Cambiaste demasiadas variables a la vez | Recupera el prompt anterior y modifica un solo componente |
La guía de Gen-4 de Runway recomienda comenzar con el movimiento esencial y añadir un elemento nuevo a la vez. Es una disciplina de diagnóstico útil más allá de un modelo específico: hace que cada generación responda una pregunta concreta.
No asumas que la sintaxis funciona igual en todos los modelos
La gramática visual se puede reutilizar; la sintaxis específica de un modelo, no.
Por ejemplo, la documentación de Gen-4 de Runway recomienda escribir instrucciones en positivo e indica que la formulación negativa no está soportada. En vez de “no camera movement”, propone describir el estado deseado: “locked camera; the camera remains still”. Otro modelo podría ofrecer un campo separado para prompts negativos o interpretar las exclusiones de otra forma.
Prioriza instrucciones visuales portables en el prompt principal:
- “locked camera” en lugar de un párrafo de prohibiciones para la cámara
- “one continuous shot” en lugar de suponer que existe un comando universal para evitar cortes
- “only the cyclist moves” en lugar de una lista negativa sin límites
Después, revisa los controles actuales del modelo seleccionado antes de depender de una sintaxis especial. Incluso la terminología oficial de cámara puede variar en confiabilidad: la guía de Google advierte que algunos ángulos avanzados pueden producir resultados variables, mientras que Luma documenta el control de cámara mediante frases de movimiento en lenguaje natural y señala que expresiones parecidas todavía pueden dar resultados distintos.
Un ciclo de iteración consciente de los créditos en OpenVideos
OpenVideos separa la creación de video en categorías como text-to-video, start-frame-video y start-end-frame-video. Elige la categoría antes de pulir el prompt.
- Elige el modo de entrada. Si no tienes una imagen aprobada, usa texto a video. Si ya tienes un primer fotograma, usa start-frame-video. Si planeaste tanto el inicio como el final, corresponde un flujo de primer y último fotograma.
- Escribe el prompt mínimo completo. Resuelve una toma, no un montaje entero.
- Abre Create y revisa el modelo seleccionado. Los controles cambian entre modelos; no supongas que todos comparten parámetros o convenciones de prompt.
- Confirma los créditos mostrados antes de enviar. OpenVideos calcula el costo del trabajo según el modelo y los parámetros elegidos; esta guía no fija un precio universal. Consulta
/pricingpara conocer la información vigente sobre paquetes de créditos. - Guarda el prompt exacto y el resultado. Sin el prompt original, la siguiente revisión se convierte en una conjetura.
- Nombra la diferencia más importante. ¿Falló el sujeto, la acción, el encuadre, la cámara, la luz o el ritmo?
- Cambia un solo componente. Mantén todo lo demás estable para que la siguiente generación aporte evidencia útil.
Modificar una sola variable a la vez ayuda a aislar qué instrucción afectó la toma siguiente.
Lista de verificación rápida
Para texto a video:
- Un sujeto reconocible
- Una acción principal
- Un entorno visible
- Una decisión de encuadre
- Un movimiento de cámara dominante
- Detalles físicos de luz y estilo
- Una indicación clara de ritmo o continuidad
Para imagen a video:
- Una buena imagen de origen
- Movimiento de cámara
- Movimiento del sujeto
- Movimiento del entorno
- Ritmo
- Poca o ninguna descripción redundante de la escena
Para ambos flujos:
- Una escena corta, no una trama completa
- Ninguna afirmación sobre modelos sin respaldo
- Revisiones de una variable a la vez
- Créditos confirmados en Create antes de enviar
Fuentes y límites
Este marco sintetiza las guías oficiales actuales de Google Cloud para prompts de video, las prácticas recomendadas de Google para generación de video, la guía de prompting para Gen-4 de Runway y la documentación de generación de video de Luma.
No compara modelos ni afirma que el prompt de ejemplo producirá resultados idénticos entre ellos. Para llegar a esas conclusiones haría falta usar la misma entrada, el mismo prompt y los mismos ajustes, además de registrar créditos, reintentos y resultados dentro de un benchmark controlado.
Si quieres aplicar la fórmula, abre text-to-video para crear una toma solo con texto o image-to-video si ya tienes un primer fotograma. Para un flujo cinematográfico más amplio, consulta Cómo crear video cinematográfico con IA. Confirma el costo actual en créditos dentro de Create antes de generar.
Artículos relacionados

Guía
Prompts de video corto con IA en 9:16: hoja de beats que sí funciona
Escribe prompts verticales con una hoja de beats cronometrada, encuadre nativo 9:16 y un ejemplo verificado de transformación Seedance 2.0 de 10 s—con créditos.
