← Voltar ao blog

Por que meu vídeo com IA se deforma? O problema da duração

A deformação costuma crescer com a duração do clipe e a quantidade de objetos. A causa provável, que âncora cada modelo aceita, como testar o seu próprio plano e os planos em que é difícil evitá-la.

A deformação (o morphing) é quando um objeto do seu clipe vai virando outra coisa aos poucos: uma mão se funde com uma xícara, o pé de uma cadeira se junta à mesa, um rosto muda de identidade no meio do plano. É uma das falhas mais comuns do vídeo gerado, e a causa provável aponta para jeitos práticos de reduzi-la.

Resumo

Por que acontece

Um modelo de vídeo gera uma sequência de quadros coerentes no nível local: cada quadro segue de forma plausível o anterior. A razão provável da deformação é que nada nesse processo funciona como um registro interno dizendo "isto é uma xícara de cerâmica, tem estas propriedades, continua existindo". Não conseguimos ver por dentro dos modelos, então trate isso como a explicação que melhor combina com a falha, não como um mecanismo documentado.

Nessa leitura, ao longo de quadros suficientes a ideia que o modelo tem do que um objeto é pode se desviar, e ele desenha algo plausível, mas diferente. O desvio é gradual, e é por isso que parece uma deformação e não um salto.

Isso também explicaria por que o mesmo plano pode sair limpo com 5 segundos e quebrado com 15.

O que costuma reduzi-la

Clipes mais curtos. A alavanca que você controla mais diretamente. Se um plano se deforma com 10 segundos, gere com 5 e corte. Nos modelos cobrados pela duração, dois clipes de 5 segundos custam mais ou menos o mesmo que um de 10 (Kling v3 Standard com som: 86 créditos por 5 segundos, 171 por 10), e cada um dá ao desvio menos tempo para se acumular.

Menos objetos. Cada coisa em quadro é mais uma coisa que pode se desviar. Um único tema sobre um fundo liso deixa o modelo com o mínimo para acompanhar.

Menos movimento. Movimento rápido costuma piorar a deformação, provavelmente porque cada quadro difere mais do anterior.

Um primeiro quadro de referência. Gerar de imagem para vídeo a partir de uma imagem estática que você aprovou fixa o ponto de partida, então o modelo começa do seu design, e não do próprio palpite. No Wan 3.0 isso é uma imagem inicial, a partir de 24 créditos por 5 segundos em 480p.

Uma âncora mais forte. Não medimos qual modelo se deforma menos, e isso muda de um plano para outro, então desconfie de qualquer ranking (esta página tinha um). O que muda de fato entre os modelos, e dá para conferir, é o que você pode entregar ao modelo como base. Preços do 8frame; um crédito custa cerca de US$ 0,01 no pacote:

Modelo Clipe Créditos Durações no 8frame Com o que dá para ancorar
Wan 3.0 em 480p 5 s 24 de 2 a 30 s texto, ou uma imagem inicial; sem imagens de referência no canvas
Veo 3.1 Lite 8 s sem som 33 4, 6 ou 8 s a partir de texto; 8 s com imagem inicial uma imagem inicial, mais um quadro final se quiser; sem imagens de referência
Kling v3 Standard 5 s sem som 57 de 3 a 15 s uma imagem inicial, obrigatória; sem imagens de referência
Seedance 2.5 5 s em 720p 157 de 4 a 30 s uma imagem inicial e um quadro final, ou até 9 imagens de referência (não as duas coisas); um vídeo de referência, uma faixa de áudio
Veo 3.1 Standard 8 s com áudio 448 4, 6 ou 8 s a partir de texto; 8 s com imagem inicial uma imagem inicial e um quadro final, ou de 1 a 3 imagens de referência na opção de múltiplas referências (só 8 s)

Leia a última coluna como uma escolha de âncora, não como uma nota de qualidade. Uma imagem inicial fixa como o plano começa; as imagens de referência mostram ao modelo o próprio tema, que é justamente o que se desvia quando um clipe se deforma. No canvas, imagens de referência vão para o Seedance (até 9), o modo de referência do Grok Imagine (de 1 a 10, a partir de 35 créditos por 5 segundos em 480p), o Happy Horse (de 1 a 9), o Gemini Omni Flash (de 1 a 7), o Kling O1 Reference (até 7) e o Veo 3.1 com múltiplas referências (de 1 a 3). No Seedance, no Gemini Omni Flash e no Happy Horse, uma imagem inicial e as referências não se combinam: com as duas anexadas, a imagem inicial é descartada. Os limites completos estão em limites de imagens de referência por modelo.

Câmera parada. O movimento de câmera costuma somar deformação, provavelmente porque o modelo está inventando a paralaxe ao mesmo tempo.

Como testar a deformação no seu próprio plano

Nenhum ranking, nem o nosso, diz como o seu tema se comporta. Uma comparação curta, lado a lado, diz:

  1. Fixe as entradas. Uma imagem inicial aprovada, um prompt, uma proporção. Não mude nada além do modelo.
  2. Gere com 5 segundos em dois ou três modelos. A partir da mesma imagem inicial: Wan 3.0 em 480p (24), Kling v3 Standard sem som (57) e Seedance 2.5 em 480p (70) somam 151 créditos, cerca de US$ 1,51, por três versões. O Veo com imagem inicial fica fixo em 8 segundos; o Veo 3.1 Lite sem som custa 33.
  3. Passe quadro a quadro. Anote o segundo em que o objeto muda pela primeira vez. Olhe primeiro onde dois objetos se tocam, nas mãos e em qualquer coisa que passe por trás de outra.
  4. Estenda a versão que se manteve consistente. Gere de novo com 10 segundos antes de se comprometer com uma tomada longa: uma tomada limpa de 5 segundos não garante uma limpa de 10.
  5. Se o tema precisa de referências, teste do mesmo jeito. As mesmas imagens de referência em cada modelo que aceita referências, o mesmo prompt, a mesma duração. Um rosto em close como referência pode disparar o filtro do Seedance; veja Seedance "flagged as sensitive" (marcado como sensível, E005).

Os planos que costumam se deformar de qualquer jeito

Reconhecê-los cedo economiza créditos: um clipe que termina é cobrado mesmo que se deforme, então cada nova tentativa de um plano assim custa o preço cheio de novo.

Duas pessoas interagindo. Os corpos podem atravessar um ao outro, e as duas identidades podem se desviar.

Mãos fazendo algo específico. Articulação extrema e mãos que se tapam o tempo todo. Veja qual modelo de IA lida melhor com mãos.

Uma multidão. Muitos rostos, e cada um pode se desviar por conta própria.

Câmera passando por arquitetura. O modelo precisa inventar uma estrutura 3D que não tem, então linhas retas podem entortar e superfícies podem flexionar.

Planos longos de um personagem recorrente. Sem imagens de referência, a identidade de um personagem costuma se desviar ao longo de uma sequência, e mesmo com elas pode mudar em ângulos novos.

Qualquer coisa com mais de uns 10 segundos e um tema em cena. A exceção é o material abstrato ou de textura: sem uma identidade de tema para manter, a duração costuma pesar menos.

A exceção dos clipes longos

Vale conhecer porque ela inverte a regra: o Wan 3.0 gera até 30 segundos de uma vez, 142 créditos em 480p no modelo base. Essa duração combina melhor com material abstrato e de textura, em que não há nenhum objeto cuja identidade possa se desviar.

Fumaça, água, folhagem, luz, partículas à deriva, degradês. Um plano de fundo de 30 segundos de qualquer um deles não tem identidade a perder. Um plano de 30 segundos de uma pessoa tem um rosto e mãos a perder.

O fluxo de trabalho que evita a deformação

  1. Marque o plano com 5 segundos no Wan 3.0 em 480p, 24 créditos. Veja se ele se deforma com uma duração curta.
  2. Se ele se deforma com 5 segundos, a composição provavelmente está complexa demais. Simplifique: menos objetos, menos movimento, câmera parada.
  3. Se sai limpo com 5 e quebra com 10, gere com 5 e corte. Não brigue com isso.
  4. Se o plano precisa que um objeto persista durante um movimento real, dê ao modelo mais com o que trabalhar: faça o teste acima com imagens de referência do objeto num modelo que aceita referências (o Seedance 2.5 aceita até 9, 157 créditos por 5 segundos em 720p) e fique com a versão que se mantiver consistente no seu plano.
  5. Se for um dos planos da lista acima, mude o plano.

Não há upscaler de vídeo nem uma etapa de reparo dedicada neste canvas, então trate um clipe deformado como algo para gerar de novo, não para consertar. A decisão acontece antes de você enviar.

Perguntas frequentes

Por que meu vídeo com IA muda os objetos no meio? O mais provável é que o modelo não mantenha uma representação persistente do objeto, então a ideia que ele faz do que a coisa é vai se desviando de um quadro para o outro.

Um clipe mais longo se deforma mais? Em geral, sim: quanto mais longo o clipe, mais quadros o desvio tem para se acumular. A duração também é a alavanca que você controla mais diretamente.

Qual modelo se deforma menos? Não medimos, e depende do plano, então teste: a mesma imagem inicial e o mesmo prompt com 5 segundos em dois ou três modelos, comparados quadro a quadro. O que dá para comparar antes de gastar qualquer coisa é a âncora que cada modelo aceita: o Seedance 2.5 aceita até 9 imagens de referência, o Veo 3.1 com múltiplas referências de 1 a 3, e o Kling v3 e o Wan 3.0 uma imagem inicial e nenhuma imagem de referência no canvas.

Por que meu clipe abstrato de 30 segundos fica bom? O mais provável é que não haja uma identidade de objeto que possa se desviar. Material abstrato costuma aguentar a duração melhor do que um tema.

Fontes


Clipes mais curtos, menos objetos, e corte os planos que continuam se deformando.

Experimente sem cadastro: você cai direto num quadro real. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.

Artigos relacionados

guiaComo usar o Kling v3 Pro: quando os 114 créditos compensamguiaSeedance "flagged as sensitive" (E005): por que fotos com rosto falhamguiaConfigurações padrão da imagem com IA por modelo: quanto custa um nó novo

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates