← Voltar ao blog

Quais modelos de vídeo com IA aceitam o seu próprio áudio? Locução, música e diálogo por modelo

Todos os modelos de vídeo do 8frame, lidos do código: quais aceitam uma faixa de áudio que você traz e o que cada um faz com ela. O Pruna p-video monta o clipe em volta da sua faixa, o Creatify Boreal corta a faixa no ajuste de duração, o Seedance a usa como referência, três ferramentas de lip sync animam um rosto com ela e o resto não tem entrada de áudio. Preços para uma faixa de 10 segundos.

No 8frame, oito modelos de vídeo aceitam uma faixa de áudio que você traz (uma locução, uma trilha de fundo, uma fala de diálogo), e fazem quatro coisas diferentes com ela. O Pruna p-video e o p-video Draft montam o clipe em volta da faixa: o clipe tem a duração da faixa, até 20 segundos, e você paga pela duração da faixa. O Creatify Boreal mantém a sua faixa no lugar da fala que ele gera, mas usa só tantos segundos quanto o ajuste de duração indica, e esse ajuste começa em 5. O Seedance 2.5 e o 2.0 usam a faixa como referência para a geração e desligam o próprio som. O Pruna Avatar, o Hailuo H3 Max Lip Sync e o OmniHuman 1.5 animam um rosto com ela. Todos os outros modelos de vídeo, incluindo Veo 3.1, todos os Kling, Wan, Gemini Omni Flash, Grok Imagine e o Hailuo H3 base, não têm entrada de áudio; com eles, coloque a sua faixa sob o clipe pronto no Video Editor. Tudo abaixo foi lido do próprio código do 8frame em 2026-10-01.

Resumo

Cada modelo de vídeo e o seu áudio

Os preços são créditos para uma faixa de 10 segundos nas resoluções indicadas; um crédito vale cerca de US$ 0,01 no preço dos pacotes. "Não aceita" significa que o nó não mostra entrada de áudio para esse modelo.

Modelo no 8frame Aceita o seu áudio? O que faz com ele Regra de duração Faixa de 10 s
Pruna p-video Sim, opcional Condiciona o vídeo à faixa Clipe = a faixa, arredondada para cima ao segundo, de 1 a 20 s; uma mais longa é recusada antes da cobrança 27 / 54 (720p / 1080p)
Pruna p-video Draft Sim, opcional Igual ao p-video, em modo rascunho Igual ao p-video 7 / 14 (720p / 1080p)
Pruna p-video 2 Pro (Speed, Quality) Não aceita A entrada fica oculta; uma faixa é recusada não se aplica
Creatify Boreal Sim, opcional Mantido no resultado no lugar da fala gerada (segundo o fornecedor) Clipe = o ajuste de duração, de 1 a 20 s, padrão 5; são usados esses primeiros segundos da faixa, e uma faixa mais curta é completada com silêncio; aceita faixas de até 60 s 14 / 41 / 162 (720p / 1080p / 2K), com a duração em 10
Seedance 2.5 Sim, opcional, uma faixa Referência para a geração; o som próprio do Seedance é desligado Clipe = o ajuste de duração, de 4 a 30 s; uma faixa acima de 30 s é cortada nos primeiros 30 139 / 313 (480p / 720p); 1.307 em 720p com um vídeo de referência
Seedance 2.0 Sim, opcional, uma faixa Igual ao 2.5 Clipe = o ajuste de duração, de 4 a 15 s; uma faixa acima de 15 s é cortada nos primeiros 15 96 / 216 (480p / 720p); 264 em 720p com um vídeo de referência
Pruna Avatar Obrigatório Sincroniza os lábios de um retrato com a faixa Clipe = a faixa, arredondada para cima, até 35 s; uma mais longa é recusada antes da cobrança 34 / 61 (720p / 1080p)
Hailuo H3 Max Lip Sync Obrigatório, da sua biblioteca do 8frame Sincroniza os lábios de uma imagem parada com a faixa Clipe = a faixa, no mínimo 5 s (uma mais curta é recusada); o fornecedor corta em 14,8 s 68 / 108 / 216 / 432 (480p / 768p / 1080p / 2K)
OmniHuman 1.5 Obrigatório Anima uma imagem com a faixa Até 35 s (uma mais longa é recusada), cobrado em blocos de 5 segundos 224
Veo 3.1 (Lite, Fast, Standard), Kling v3, O3, 2.6 Pro e anteriores, Wan 3.0, 3.0 Prime, 2.5, 2.2, Hailuo H3, Max Turbo, Max Camera Controls, Gemini Omni Flash, Grok Imagine, Happy Horse, Runway Gen-4 Turbo, Runway Act Two, ID-V2V Não aceita não se aplica

Dois dos modelos marcados como "não aceita" ficam perto. A API do fornecedor do Wan 3.0 Prime tem um campo de áudio de referência, mas o 8frame não o envia. O Runway Act Two é guiado por um vídeo de atuação, não por uma faixa de áudio.

O Pruna e o Creatify Boreal são novos no 8frame, e nenhuma das ferramentas de lip sync teve execuções em produção nos 30 dias até 2026-09-30, então aqui citamos preços e regras, não qualidade.

A faixa define a duração: Pruna p-video

O p-video e o p-video Draft são os únicos modelos do 8frame em que a sua faixa decide quanto tempo o clipe dura. O esquema do Pruna descreve a entrada como "Input audio to condition video generation" e diz que o ajuste de duração é "Ignored when audio is provided". O 8frame segue isso: com uma faixa anexada, não envia duração nenhuma e cobra pela faixa.

A própria página do Pruna cita videoclipes como um uso ("combine your own audio with generated visuals"). Não verificamos um resultado do 8frame com uma faixa anexada, então não está confirmado se o arquivo toca a sua faixa sem alterações. Os ajustes e a questão do som no Draft estão em como usar o Pruna p-video.

O ajuste de duração define a duração: Creatify Boreal

O Boreal funciona ao contrário. Segundo a página da API do fal, a sua faixa "is preserved in the output instead of generated speech", e "the first duration seconds of the audio are used; shorter audio is padded with silence." O clipe tem a duração do ajuste de duração, seja qual for a faixa.

O 8frame sempre envia esse ajuste, e ele começa em 5 segundos, então uma locução de 10 segundos anexada sem mudar o ajuste volta só com os 5 primeiros segundos. Ajuste a duração à faixa (até 20 segundos) antes de gerar. O Boreal cobra pelo ajuste de duração, não pela faixa: 10 segundos custam 14 créditos em 720p, 41 em 1080p e 162 em 2K. O 8frame aceita faixas de até 60 segundos para o Boreal, mas só os primeiros 20 podem ser usados. As tags de prompt e o resto dos ajustes estão em como usar o Creatify Boreal.

A faixa guia, o modelo fica em silêncio: Seedance

O Seedance 2.5 e o 2.0 usam a sua faixa como referência. O esquema da ByteDance no Replicate descreve o áudio de referência como "for audio-driven generation and lip-sync" e pede que você se refira a ele no prompt como [Audio1]; o nó do canvas envia uma faixa, então essa é a única tag de que você precisa. Três regras vêm do código do 8frame e desse esquema:

  1. O som próprio do Seedance é desligado. Sempre que há uma faixa de referência anexada, o 8frame diz ao Seedance para não gerar áudio, seja qual for a posição da chave de som do nó. Não está confirmado se a sua própria faixa é levada para o arquivo de saída; não verificamos.
  2. O ajuste de duração continua decidindo o clipe. O 8frame não o muda para acompanhar a faixa, então ajuste você mesmo. Uma faixa mais longa do que a versão permite (30 segundos no 2.5, 15 no 2.0) é cortada nos primeiros 30 ou 15 segundos antes de ser enviada.
  3. Só o áudio não basta. Segundo o esquema do fornecedor, uma faixa de referência precisa de pelo menos uma imagem de referência ou um vídeo de referência junto, e no 2.5 não pode ser combinada com um quadro final.

O áudio não muda o preço. Um vídeo de referência muda: ele leva o Seedance para a tarifa de entrada de vídeo, 1.307 créditos por 10 segundos em 720p no 2.5, contra 313 com imagens de referência. Então o jeito mais barato de dar a sua faixa ao Seedance é com uma imagem de referência, não com um vídeo de referência.

A faixa move um rosto: ferramentas de lip sync

O Pruna Avatar, o Hailuo H3 Max Lip Sync e o OmniHuman 1.5 precisam de um retrato e de uma faixa, e o resultado segue a faixa. Eles diferem nos limites e em como arredondam:

A comparação completa de preços, incluindo o custo calculado de um apresentador falando por 30 segundos, está em preço do lip sync com IA por modelo.

Formatos e limites de arquivo

Modelo Formatos Tamanho do arquivo Faixa mais longa
Pruna p-video, Draft FLAC, MP3, WAV 10 MB 20 s (mais longa é recusada)
Creatify Boreal MP3, WAV 10 MB aceita 60 s, usa os primeiros 1 a 20 s
Seedance 2.5 / 2.0 MP3, WAV 12 MB qualquer; cortada em 30 s / 15 s
Pruna Avatar MP3, WAV 10 MB 35 s (mais longa é recusada)
Hailuo H3 Max Lip Sync MP3, WAV não confirmado mínimo de 5 s; cortada em 14,8 s
OmniHuman 1.5 MP3, WAV 10 MB 35 s (mais longa é recusada)

O canvas envia áudio como MP3 ou WAV, então o FLAC é o único formato desta tabela que só serve no p-video. Uma faixa por nó: a entrada de áudio aceita um único arquivo em todos os modelos acima.

Se o seu som já está num vídeo

Alguns modos de edição partem de um clipe em vez de um arquivo de áudio, e podem manter o som desse clipe: o Kling 2.6 Pro Motion Control mantém por padrão o som original do vídeo de movimento, o Kling O1 Video tem uma chave para manter o áudio (desligada por padrão), a edição de vídeo do Happy Horse tem uma chave para manter o som original, e no 8frame o Wan 2.7 VideoEdit sempre pede para manter o som do clipe de entrada. Eles mantêm o som que você trouxe; não aceitam uma faixa separada. Quanto custa cada um está em quais modelos de vídeo com IA funcionam só com texto.

Se você prefere som gerado

Se você não tem uma faixa, a maior parte do catálogo gera a própria. Veo 3.1, Kling v3 e Kling 2.6 Pro cobram pelo som e deixam você desligá-lo, Seedance e Wan 3.0 Prime incluem o som pelo mesmo preço, e Grok Imagine, Gemini Omni Flash, Creatify Boreal e os modelos p-video do Pruna sempre adicionam som. O que cada modelo faz, e quanto custa o som em cada um, está em quais modelos de vídeo com IA geram som. Se um clipe veio mudo, por que meu vídeo com IA está sem som passa pelas causas.

Você também pode criar a faixa no 8frame e depois usá-la como sua: o ElevenLabs texto para fala custa 13 créditos a cada 1.000 caracteres iniciados, um efeito sonoro custa de 1 a 6 créditos conforme a duração, e uma música de 30 segundos no Lyria 2 custa 13. Os preços de cada modelo de voz e de música estão em preço de música, voz e efeitos sonoros com IA por modelo.

Colocar o seu próprio áudio sob qualquer clipe depois

Para os modelos sem entrada de áudio, e para uma mixagem que você quer controlar, adicione o som depois da geração. O 8frame tem um modo Video Editor separado, ao lado do canvas, com uma linha do tempo: as camadas incluem vídeo, texto, legendas e som. Envie a sua locução ou música, coloque o clipe e a faixa na linha do tempo, alinhe os dois e renderize.

Esse caminho funciona com qualquer modelo de vídeo, e a sua faixa nunca passa por um modelo que a reinterprete. Duas dicas:

Duas observações para quem lê do Brasil: os preços do 8frame são em dólar americano, e a interface do aplicativo ainda não tem versão em português, ela abre em inglês.

Perguntas frequentes

Posso usar a minha própria locução num vídeo com IA? No 8frame, sim, em oito modelos: Pruna p-video e Draft, Creatify Boreal, Seedance 2.5 e 2.0, Pruna Avatar, Hailuo H3 Max Lip Sync e OmniHuman 1.5. Em qualquer outro modelo, adicione a locução depois no Video Editor.

Qual modelo de vídeo com IA faz o clipe com a duração do meu áudio? O Pruna p-video e o p-video Draft, até 20 segundos, e as ferramentas de lip sync (Pruna Avatar e OmniHuman até 35 segundos, Hailuo H3 Max Lip Sync até uns 15). No Creatify Boreal e no Seedance, o ajuste de duração decide o clipe.

Por que a minha locução foi cortada? No Creatify Boreal, o ajuste de duração decide quanto da faixa é usado, e ele começa em 5 segundos. No Seedance, uma faixa acima de 30 segundos (2.5) ou 15 segundos (2.0) é cortada, e o Hailuo H3 Max Lip Sync para em 14,8 segundos. Mais causas em por que meu vídeo com IA saiu mais curto do que eu pedi.

O Veo 3.1 ou o Kling conseguem usar o meu arquivo de áudio? Não. Nenhum dos dois tem entrada de áudio no 8frame; os dois geram o próprio som. Gere o clipe e depois adicione a sua faixa no Video Editor.

Qual é o jeito mais barato de fazer um clipe com a minha própria faixa? O Pruna p-video Draft: uma faixa de 10 segundos custa 7 créditos em 720p. O p-video completo custa 27, e o Creatify Boreal com a duração em 10 custa 14.

Adicionar o meu áudio custa a mais? Não como sobretaxa. No p-video e nas ferramentas de lip sync você paga pela duração da faixa; no Creatify Boreal e no Seedance você paga pelo ajuste de duração, com ou sem faixa.

Posso anexar mais de uma faixa? Não no canvas: cada nó aceita uma. O fornecedor do Seedance permite várias faixas de referência, mas o nó do 8frame envia uma.

Posso usar o meu próprio áudio pelo Claude ou pelo Cursor? Não. O conector MCP do 8frame não tem entrada de áudio em nenhuma ferramenta, então as ferramentas de lip sync e os modos guiados por áudio (p-video com uma faixa, Boreal ou Seedance com o seu áudio) não estão disponíveis por ele. A configuração está em generate AI video from Claude (em inglês).

Fontes


Escolha o modelo pelo que a sua faixa precisa fazer. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.

Artigos relacionados

comparativoQuais modelos de vídeo com IA funcionam só com texto e quais precisam de uma imagem inicialcomparativoQuanto tempo pode ter um vídeo com IA? Duração máxima por modelo em 2026comparativoFormatos de vídeo com IA por modelo em 2026: quem oferece 9:16, 4:3, 21:9 e 4:5

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates