← Volver al blog

¿Por qué mi video con IA se deforma? El problema de la duración

La deformación suele crecer con la duración del clip y la cantidad de objetos. La causa probable, qué ancla acepta cada modelo, cómo probar tu propio plano y los planos donde es difícil evitarla.

La deformación (el morphing) es cuando un objeto de tu clip se va convirtiendo poco a poco en otra cosa: una mano se funde con una taza, la pata de una silla se une a la mesa, una cara cambia de identidad a mitad del plano. Es uno de los fallos más comunes del video generado, y su causa probable apunta a formas prácticas de reducirla.

Resumen

Por qué pasa

Un modelo de video genera una secuencia de fotogramas coherentes a nivel local: cada fotograma sigue de forma plausible al anterior. La razón probable de la deformación es que nada en ese proceso funciona como un registro interno que diga "esto es una taza de cerámica, tiene estas propiedades, sigue existiendo". No podemos ver el interior de los modelos, así que tómalo como la explicación que mejor encaja con el fallo, no como un mecanismo documentado.

Vista así, a lo largo de suficientes fotogramas la idea que tiene el modelo de lo que es un objeto puede desviarse, y termina dibujando algo plausible pero distinto. La deriva es gradual, y por eso se ve como una deformación y no como un salto.

También explicaría por qué el mismo plano puede salir limpio a 5 segundos y roto a 15.

Lo que suele reducirla

Clips más cortos. La palanca que controlas más directamente. Si un plano se deforma a 10 segundos, genéralo a 5 y corta. En los modelos que cobran por duración, dos clips de 5 segundos cuestan más o menos lo mismo que uno de 10 (Kling v3 Standard con sonido: 86 créditos por 5 segundos, 171 por 10), y cada uno le da a la deriva menos tiempo para acumularse.

Menos objetos. Cada cosa en cuadro es una cosa más que puede desviarse. Un solo sujeto sobre un fondo liso le deja al modelo lo mínimo que seguir.

Menos movimiento. El movimiento rápido suele empeorar la deformación, probablemente porque cada fotograma se diferencia más del anterior.

Un primer fotograma de referencia. Pasar de imagen a video desde una imagen fija que aprobaste fija el punto de partida, así que el modelo empieza desde tu diseño y no desde su propia suposición. En Wan 3.0 eso es una imagen inicial, desde 24 créditos por 5 segundos en 480p.

Un ancla más fuerte. No hemos medido qué modelo se deforma menos, y cambia de un plano a otro, así que desconfía de cualquier ranking (esta página tenía uno). Lo que sí cambia entre modelos, y se puede comprobar, es lo que le puedes dar al modelo como punto de apoyo. Precios de 8frame; un crédito cuesta unos US$ 0.01 en paquete:

Modelo Clip Créditos Duraciones en 8frame Con qué lo puedes anclar
Wan 3.0 en 480p 5 s 24 de 2 a 30 s texto, o una imagen inicial; sin imágenes de referencia en el canvas
Veo 3.1 Lite 8 s sin sonido 33 4, 6 u 8 s desde texto; 8 s con imagen inicial una imagen inicial, y un fotograma final si quieres; sin imágenes de referencia
Kling v3 Standard 5 s sin sonido 57 de 3 a 15 s una imagen inicial, obligatoria; sin imágenes de referencia
Seedance 2.5 5 s en 720p 157 de 4 a 30 s una imagen inicial y un fotograma final, o hasta 9 imágenes de referencia (no ambas cosas); un video de referencia, una pista de audio
Veo 3.1 Standard 8 s con audio 448 4, 6 u 8 s desde texto; 8 s con imagen inicial una imagen inicial y un fotograma final, o de 1 a 3 imágenes de referencia con la opción multirreferencia (solo 8 s)

Lee la última columna como una elección de ancla, no como una nota de calidad. Una imagen inicial fija cómo empieza el plano; las imágenes de referencia le muestran al modelo el sujeto en sí, que es justo lo que se desvía cuando un clip se deforma. En el canvas, las imágenes de referencia van a Seedance (hasta 9), al modo de referencia de Grok Imagine (de 1 a 10, desde 35 créditos por 5 segundos en 480p), Happy Horse (de 1 a 9), Gemini Omni Flash (de 1 a 7), Kling O1 Reference (hasta 7) y Veo 3.1 con multirreferencia (de 1 a 3). En Seedance, Gemini Omni Flash y Happy Horse, una imagen inicial y las referencias no se combinan: si adjuntas ambas, la imagen inicial se descarta. Los límites completos están en límites de imágenes de referencia por modelo.

Cámara fija. El movimiento de cámara suele sumar deformación, probablemente porque el modelo está inventando el paralaje al mismo tiempo.

Cómo probar la deformación en tu propio plano

Ningún ranking, tampoco el nuestro, te dice cómo se comporta tu sujeto. Una comparación corta, lado a lado, sí:

  1. Fija las entradas. Una imagen inicial aprobada, un prompt, una proporción. No cambies nada más que el modelo.
  2. Genéralo a 5 segundos en dos o tres modelos. Desde la misma imagen inicial: Wan 3.0 en 480p (24), Kling v3 Standard sin sonido (57) y Seedance 2.5 en 480p (70) suman 151 créditos, unos US$ 1.51, por tres versiones. Veo con imagen inicial queda fijo en 8 segundos; Veo 3.1 Lite sin sonido cuesta 33.
  3. Revísalo fotograma a fotograma. Anota el segundo en que el objeto cambia por primera vez. Mira primero donde se tocan dos objetos, las manos y cualquier cosa que pase por detrás de otra.
  4. Alarga la versión que se mantuvo consistente. Vuelve a generarla a 10 segundos antes de comprometerte con una toma larga: una toma limpia de 5 segundos no garantiza una limpia de 10.
  5. Si el sujeto necesita referencias, pruébalas igual. Las mismas imágenes de referencia en cada modelo que acepte referencias, el mismo prompt, la misma duración. Una cara en primer plano como referencia puede activar el filtro de Seedance; consulta Seedance "flagged as sensitive" (marcado como sensible, E005).

Los planos que suelen deformarse igual

Reconocerlos pronto ahorra créditos: un clip que termina se cobra aunque se deforme, así que cada reintento de un plano así vuelve a costar el precio completo.

Dos personas interactuando. Los cuerpos pueden atravesarse y las dos identidades pueden desviarse.

Manos haciendo algo concreto. Articulación extrema y manos que se tapan a sí mismas todo el tiempo. Mira qué modelo de IA resuelve mejor las manos.

Una multitud. Muchas caras, y cada una puede desviarse por su cuenta.

Cámara recorriendo arquitectura. El modelo tiene que inventar una estructura 3D que no tiene, así que las líneas rectas pueden curvarse y las superficies, flexionarse.

Planos largos de un personaje recurrente. Sin imágenes de referencia, la identidad de un personaje suele desviarse a lo largo de una secuencia, y aun con ellas puede cambiar en ángulos nuevos.

Cualquier cosa de más de unos 10 segundos con un sujeto. La excepción es el material abstracto o de texturas: sin una identidad de sujeto que mantener, la duración suele importar menos.

La excepción de los clips largos

Vale la pena conocerla porque invierte la regla: Wan 3.0 genera hasta 30 segundos de una sola vez, 142 créditos en 480p con el modelo base. Esa duración encaja mejor con material abstracto y de texturas, donde no hay ningún objeto cuya identidad pueda desviarse.

Humo, agua, follaje, luz, partículas a la deriva, degradados. Un plano de fondo de 30 segundos de cualquiera de ellos no tiene identidad que perder. Un plano de 30 segundos de una persona tiene una cara y unas manos que perder.

El flujo de trabajo que la evita

  1. Bloquea el plano a 5 segundos en Wan 3.0 en 480p, 24 créditos. Mira si se deforma con una duración corta.
  2. Si se deforma a 5 segundos, la composición probablemente es demasiado compleja. Simplifica: menos objetos, menos movimiento, cámara fija.
  3. Si sale limpio a 5 y se rompe a 10, genera a 5 y corta. No luches contra eso.
  4. Si el plano necesita que un objeto persista durante un movimiento real, dale al modelo más con qué trabajar: haz la prueba de arriba con imágenes de referencia del objeto en un modelo que acepte referencias (Seedance 2.5 acepta hasta 9, 157 créditos por 5 segundos en 720p) y quédate con la versión que se mantenga consistente en tu plano.
  5. Si es uno de los planos de la lista de arriba, cambia el plano.

En este canvas no hay escalador de video ni un paso de reparación dedicado, así que trata un clip deformado como algo que se regenera, no como algo que se arregla. La decisión se toma antes de enviar.

Preguntas frecuentes

¿Por qué mi video con IA cambia los objetos a la mitad? Lo más probable es que el modelo no mantenga una representación persistente del objeto, así que su idea de qué es esa cosa se desvía de un fotograma a otro.

¿Un clip más largo se deforma más? Por lo general, sí: cuanto más largo el clip, más fotogramas tiene la deriva para acumularse. La duración es además la palanca que controlas más directamente.

¿Qué modelo se deforma menos? No lo hemos medido, y depende del plano, así que pruébalo: la misma imagen inicial y el mismo prompt a 5 segundos en dos o tres modelos, comparados fotograma a fotograma. Lo que puedes comparar antes de gastar nada es el ancla que acepta cada modelo: Seedance 2.5 acepta hasta 9 imágenes de referencia, Veo 3.1 con multirreferencia de 1 a 3, y Kling v3 y Wan 3.0 una imagen inicial y ninguna imagen de referencia en el canvas.

¿Por qué mi clip abstracto de 30 segundos sale bien? Lo más probable es que no haya una identidad de objeto que pueda desviarse. El material abstracto suele aguantar la duración mejor que un sujeto.

Fuentes


Clips más cortos, menos objetos, y corta los planos que se siguen deformando.

Pruébalo sin registrarte: llegas directamente a un tablero real. El canvas de 8frame es gratuito e ilimitado; la generación es de pago desde US$ 19 al mes.

Artículos relacionados

guíaCómo usar Kling v3 Pro: cuándo compensan los 114 créditosguíaSeedance "flagged as sensitive" (E005): por qué fallan las fotos con carasguíaAjustes por defecto de la imagen con IA por modelo: lo que cuesta un nodo nuevo

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates