No 8frame, oito modelos de vídeo aceitam uma faixa de áudio que você traz (uma locução, uma trilha de fundo, uma fala de diálogo), e fazem quatro coisas diferentes com ela. O Pruna p-video e o p-video Draft montam o clipe em volta da faixa: o clipe tem a duração da faixa, até 20 segundos, e você paga pela duração da faixa. O Creatify Boreal mantém a sua faixa no lugar da fala que ele gera, mas usa só tantos segundos quanto o ajuste de duração indica, e esse ajuste começa em 5. O Seedance 2.5 e o 2.0 usam a faixa como referência para a geração e desligam o próprio som. O Pruna Avatar, o Hailuo H3 Max Lip Sync e o OmniHuman 1.5 animam um rosto com ela. Todos os outros modelos de vídeo, incluindo Veo 3.1, todos os Kling, Wan, Gemini Omni Flash, Grok Imagine e o Hailuo H3 base, não têm entrada de áudio; com eles, coloque a sua faixa sob o clipe pronto no Video Editor. Tudo abaixo foi lido do próprio código do 8frame em 2026-10-01.
Resumo
- A faixa define a duração: Pruna p-video e Draft. De 1 a 20 segundos, cobrado pela faixa: uma faixa de 10 segundos custa 27 créditos em 720p, 7 no Draft. Uma faixa mais longa é recusada antes de você ser cobrado
- O ajuste de duração define a duração: o Creatify Boreal usa os primeiros N segundos da sua faixa, sendo N o ajuste de duração (padrão 5). Coloque 10 para uma faixa de 10 segundos: 14 créditos em 720p
- A faixa guia, o modelo fica em silêncio: o Seedance 2.5 e o 2.0 aceitam uma faixa de referência no canvas e desligam o próprio som. O preço segue o ajuste de duração, não o áudio: 313 por 10 segundos em 720p no 2.5
- A faixa move um rosto: Pruna Avatar (34 por 10 segundos em 720p), Hailuo H3 Max Lip Sync (108 no seu padrão de 768p), OmniHuman 1.5 (224)
- Sem entrada de áudio: todos os outros modelos de vídeo. Adicione a sua faixa depois no Video Editor
- Formatos: MP3 ou WAV em todos os modelos que aceitam uma faixa; o p-video também aceita FLAC
Cada modelo de vídeo e o seu áudio
Os preços são créditos para uma faixa de 10 segundos nas resoluções indicadas; um crédito vale cerca de US$ 0,01 no preço dos pacotes. "Não aceita" significa que o nó não mostra entrada de áudio para esse modelo.
| Modelo no 8frame | Aceita o seu áudio? | O que faz com ele | Regra de duração | Faixa de 10 s |
|---|---|---|---|---|
| Pruna p-video | Sim, opcional | Condiciona o vídeo à faixa | Clipe = a faixa, arredondada para cima ao segundo, de 1 a 20 s; uma mais longa é recusada antes da cobrança | 27 / 54 (720p / 1080p) |
| Pruna p-video Draft | Sim, opcional | Igual ao p-video, em modo rascunho | Igual ao p-video | 7 / 14 (720p / 1080p) |
| Pruna p-video 2 Pro (Speed, Quality) | Não aceita | A entrada fica oculta; uma faixa é recusada | não se aplica | |
| Creatify Boreal | Sim, opcional | Mantido no resultado no lugar da fala gerada (segundo o fornecedor) | Clipe = o ajuste de duração, de 1 a 20 s, padrão 5; são usados esses primeiros segundos da faixa, e uma faixa mais curta é completada com silêncio; aceita faixas de até 60 s | 14 / 41 / 162 (720p / 1080p / 2K), com a duração em 10 |
| Seedance 2.5 | Sim, opcional, uma faixa | Referência para a geração; o som próprio do Seedance é desligado | Clipe = o ajuste de duração, de 4 a 30 s; uma faixa acima de 30 s é cortada nos primeiros 30 | 139 / 313 (480p / 720p); 1.307 em 720p com um vídeo de referência |
| Seedance 2.0 | Sim, opcional, uma faixa | Igual ao 2.5 | Clipe = o ajuste de duração, de 4 a 15 s; uma faixa acima de 15 s é cortada nos primeiros 15 | 96 / 216 (480p / 720p); 264 em 720p com um vídeo de referência |
| Pruna Avatar | Obrigatório | Sincroniza os lábios de um retrato com a faixa | Clipe = a faixa, arredondada para cima, até 35 s; uma mais longa é recusada antes da cobrança | 34 / 61 (720p / 1080p) |
| Hailuo H3 Max Lip Sync | Obrigatório, da sua biblioteca do 8frame | Sincroniza os lábios de uma imagem parada com a faixa | Clipe = a faixa, no mínimo 5 s (uma mais curta é recusada); o fornecedor corta em 14,8 s | 68 / 108 / 216 / 432 (480p / 768p / 1080p / 2K) |
| OmniHuman 1.5 | Obrigatório | Anima uma imagem com a faixa | Até 35 s (uma mais longa é recusada), cobrado em blocos de 5 segundos | 224 |
| Veo 3.1 (Lite, Fast, Standard), Kling v3, O3, 2.6 Pro e anteriores, Wan 3.0, 3.0 Prime, 2.5, 2.2, Hailuo H3, Max Turbo, Max Camera Controls, Gemini Omni Flash, Grok Imagine, Happy Horse, Runway Gen-4 Turbo, Runway Act Two, ID-V2V | Não aceita | não se aplica |
Dois dos modelos marcados como "não aceita" ficam perto. A API do fornecedor do Wan 3.0 Prime tem um campo de áudio de referência, mas o 8frame não o envia. O Runway Act Two é guiado por um vídeo de atuação, não por uma faixa de áudio.
O Pruna e o Creatify Boreal são novos no 8frame, e nenhuma das ferramentas de lip sync teve execuções em produção nos 30 dias até 2026-09-30, então aqui citamos preços e regras, não qualidade.
A faixa define a duração: Pruna p-video
O p-video e o p-video Draft são os únicos modelos do 8frame em que a sua faixa decide quanto tempo o clipe dura. O esquema do Pruna descreve a entrada como "Input audio to condition video generation" e diz que o ajuste de duração é "Ignored when audio is provided". O 8frame segue isso: com uma faixa anexada, não envia duração nenhuma e cobra pela faixa.
- Cobrança: o 8frame mede a própria faixa e cobra arredondando para cima ao segundo inteiro. Uma faixa que ele não consegue medir é cobrada pelo teto de 20 segundos: 54 créditos no p-video em 720p.
- Limite: 20 segundos. Uma faixa mais longa é recusada antes de você ser cobrado, não cortada, então corte antes.
- Prompt: continua obrigatório. A imagem inicial é opcional.
- p-video 2 Pro: não tem campo de áudio. O nó esconde a entrada nessa variante e o backend recusa uma faixa.
A própria página do Pruna cita videoclipes como um uso ("combine your own audio with generated visuals"). Não verificamos um resultado do 8frame com uma faixa anexada, então não está confirmado se o arquivo toca a sua faixa sem alterações. Os ajustes e a questão do som no Draft estão em como usar o Pruna p-video.
O ajuste de duração define a duração: Creatify Boreal
O Boreal funciona ao contrário. Segundo a página da API do fal, a sua faixa "is preserved in the output instead of generated speech", e "the first duration seconds of the audio are used; shorter audio is padded with silence." O clipe tem a duração do ajuste de duração, seja qual for a faixa.
O 8frame sempre envia esse ajuste, e ele começa em 5 segundos, então uma locução de 10 segundos anexada sem mudar o ajuste volta só com os 5 primeiros segundos. Ajuste a duração à faixa (até 20 segundos) antes de gerar. O Boreal cobra pelo ajuste de duração, não pela faixa: 10 segundos custam 14 créditos em 720p, 41 em 1080p e 162 em 2K. O 8frame aceita faixas de até 60 segundos para o Boreal, mas só os primeiros 20 podem ser usados. As tags de prompt e o resto dos ajustes estão em como usar o Creatify Boreal.
A faixa guia, o modelo fica em silêncio: Seedance
O Seedance 2.5 e o 2.0 usam a sua faixa como referência. O esquema da ByteDance no Replicate descreve o áudio de referência como "for audio-driven generation and lip-sync" e pede que você se refira a ele no prompt como [Audio1]; o nó do canvas envia uma faixa, então essa é a única tag de que você precisa. Três regras vêm do código do 8frame e desse esquema:
- O som próprio do Seedance é desligado. Sempre que há uma faixa de referência anexada, o 8frame diz ao Seedance para não gerar áudio, seja qual for a posição da chave de som do nó. Não está confirmado se a sua própria faixa é levada para o arquivo de saída; não verificamos.
- O ajuste de duração continua decidindo o clipe. O 8frame não o muda para acompanhar a faixa, então ajuste você mesmo. Uma faixa mais longa do que a versão permite (30 segundos no 2.5, 15 no 2.0) é cortada nos primeiros 30 ou 15 segundos antes de ser enviada.
- Só o áudio não basta. Segundo o esquema do fornecedor, uma faixa de referência precisa de pelo menos uma imagem de referência ou um vídeo de referência junto, e no 2.5 não pode ser combinada com um quadro final.
O áudio não muda o preço. Um vídeo de referência muda: ele leva o Seedance para a tarifa de entrada de vídeo, 1.307 créditos por 10 segundos em 720p no 2.5, contra 313 com imagens de referência. Então o jeito mais barato de dar a sua faixa ao Seedance é com uma imagem de referência, não com um vídeo de referência.
A faixa move um rosto: ferramentas de lip sync
O Pruna Avatar, o Hailuo H3 Max Lip Sync e o OmniHuman 1.5 precisam de um retrato e de uma faixa, e o resultado segue a faixa. Eles diferem nos limites e em como arredondam:
- Pruna Avatar: arredonda para cima ao segundo, até 35 segundos; uma faixa mais longa é recusada antes da cobrança. Uma faixa que o 8frame não consegue medir é cobrada pelo teto de 35 segundos (119 em 720p).
- Hailuo H3 Max Lip Sync: não usa prompt. A faixa precisa ser um arquivo da sua biblioteca do 8frame (envie ou escolha lá). Abaixo de 5 segundos é recusada; acima de 14,8 o fornecedor corta, e a cobrança para em 15 segundos.
- OmniHuman 1.5: cobra em blocos de 5 segundos, então uma faixa de 10,4 segundos é cobrada como 15 segundos, 336 créditos.
A comparação completa de preços, incluindo o custo calculado de um apresentador falando por 30 segundos, está em preço do lip sync com IA por modelo.
Formatos e limites de arquivo
| Modelo | Formatos | Tamanho do arquivo | Faixa mais longa |
|---|---|---|---|
| Pruna p-video, Draft | FLAC, MP3, WAV | 10 MB | 20 s (mais longa é recusada) |
| Creatify Boreal | MP3, WAV | 10 MB | aceita 60 s, usa os primeiros 1 a 20 s |
| Seedance 2.5 / 2.0 | MP3, WAV | 12 MB | qualquer; cortada em 30 s / 15 s |
| Pruna Avatar | MP3, WAV | 10 MB | 35 s (mais longa é recusada) |
| Hailuo H3 Max Lip Sync | MP3, WAV | não confirmado | mínimo de 5 s; cortada em 14,8 s |
| OmniHuman 1.5 | MP3, WAV | 10 MB | 35 s (mais longa é recusada) |
O canvas envia áudio como MP3 ou WAV, então o FLAC é o único formato desta tabela que só serve no p-video. Uma faixa por nó: a entrada de áudio aceita um único arquivo em todos os modelos acima.
Se o seu som já está num vídeo
Alguns modos de edição partem de um clipe em vez de um arquivo de áudio, e podem manter o som desse clipe: o Kling 2.6 Pro Motion Control mantém por padrão o som original do vídeo de movimento, o Kling O1 Video tem uma chave para manter o áudio (desligada por padrão), a edição de vídeo do Happy Horse tem uma chave para manter o som original, e no 8frame o Wan 2.7 VideoEdit sempre pede para manter o som do clipe de entrada. Eles mantêm o som que você trouxe; não aceitam uma faixa separada. Quanto custa cada um está em quais modelos de vídeo com IA funcionam só com texto.
Se você prefere som gerado
Se você não tem uma faixa, a maior parte do catálogo gera a própria. Veo 3.1, Kling v3 e Kling 2.6 Pro cobram pelo som e deixam você desligá-lo, Seedance e Wan 3.0 Prime incluem o som pelo mesmo preço, e Grok Imagine, Gemini Omni Flash, Creatify Boreal e os modelos p-video do Pruna sempre adicionam som. O que cada modelo faz, e quanto custa o som em cada um, está em quais modelos de vídeo com IA geram som. Se um clipe veio mudo, por que meu vídeo com IA está sem som passa pelas causas.
Você também pode criar a faixa no 8frame e depois usá-la como sua: o ElevenLabs texto para fala custa 13 créditos a cada 1.000 caracteres iniciados, um efeito sonoro custa de 1 a 6 créditos conforme a duração, e uma música de 30 segundos no Lyria 2 custa 13. Os preços de cada modelo de voz e de música estão em preço de música, voz e efeitos sonoros com IA por modelo.
Colocar o seu próprio áudio sob qualquer clipe depois
Para os modelos sem entrada de áudio, e para uma mixagem que você quer controlar, adicione o som depois da geração. O 8frame tem um modo Video Editor separado, ao lado do canvas, com uma linha do tempo: as camadas incluem vídeo, texto, legendas e som. Envie a sua locução ou música, coloque o clipe e a faixa na linha do tempo, alinhe os dois e renderize.
Esse caminho funciona com qualquer modelo de vídeo, e a sua faixa nunca passa por um modelo que a reinterprete. Duas dicas:
- Gere sem som quando puder. No Veo 3.1 e no Kling v3, 2.6 Pro e O3, desligar o som baixa o preço, e você vai substituí-lo de qualquer forma. Grok Imagine, Gemini Omni Flash, Creatify Boreal e os modelos p-video do Pruna sempre adicionam som, então o áudio próprio deles também vem no clipe.
- O canvas não tem linha do tempo. O nó Montage dele junta de 2 a 10 clipes com transições por 10 créditos, mas não aceita faixa de áudio; o som entra no Video Editor. Os limites de duração dos clipes para planejar a edição estão em duração máxima do vídeo com IA por modelo.
Duas observações para quem lê do Brasil: os preços do 8frame são em dólar americano, e a interface do aplicativo ainda não tem versão em português, ela abre em inglês.
Perguntas frequentes
Posso usar a minha própria locução num vídeo com IA? No 8frame, sim, em oito modelos: Pruna p-video e Draft, Creatify Boreal, Seedance 2.5 e 2.0, Pruna Avatar, Hailuo H3 Max Lip Sync e OmniHuman 1.5. Em qualquer outro modelo, adicione a locução depois no Video Editor.
Qual modelo de vídeo com IA faz o clipe com a duração do meu áudio? O Pruna p-video e o p-video Draft, até 20 segundos, e as ferramentas de lip sync (Pruna Avatar e OmniHuman até 35 segundos, Hailuo H3 Max Lip Sync até uns 15). No Creatify Boreal e no Seedance, o ajuste de duração decide o clipe.
Por que a minha locução foi cortada? No Creatify Boreal, o ajuste de duração decide quanto da faixa é usado, e ele começa em 5 segundos. No Seedance, uma faixa acima de 30 segundos (2.5) ou 15 segundos (2.0) é cortada, e o Hailuo H3 Max Lip Sync para em 14,8 segundos. Mais causas em por que meu vídeo com IA saiu mais curto do que eu pedi.
O Veo 3.1 ou o Kling conseguem usar o meu arquivo de áudio? Não. Nenhum dos dois tem entrada de áudio no 8frame; os dois geram o próprio som. Gere o clipe e depois adicione a sua faixa no Video Editor.
Qual é o jeito mais barato de fazer um clipe com a minha própria faixa? O Pruna p-video Draft: uma faixa de 10 segundos custa 7 créditos em 720p. O p-video completo custa 27, e o Creatify Boreal com a duração em 10 custa 14.
Adicionar o meu áudio custa a mais? Não como sobretaxa. No p-video e nas ferramentas de lip sync você paga pela duração da faixa; no Creatify Boreal e no Seedance você paga pelo ajuste de duração, com ou sem faixa.
Posso anexar mais de uma faixa? Não no canvas: cada nó aceita uma. O fornecedor do Seedance permite várias faixas de referência, mas o nó do 8frame envia uma.
Posso usar o meu próprio áudio pelo Claude ou pelo Cursor? Não. O conector MCP do 8frame não tem entrada de áudio em nenhuma ferramenta, então as ferramentas de lip sync e os modos guiados por áudio (p-video com uma faixa, Boreal ou Seedance com o seu áudio) não estão disponíveis por ele. A configuração está em generate AI video from Claude (em inglês).
Fontes
- Quais nós de vídeo mostram uma entrada de áudio, por modelo, e o que enviam: registro de ferramentas do front do 8frame e mapa de compatibilidade de modelos, lidos em 2026-10-01
- O que cada modelo faz com uma faixa, formatos, tamanhos de arquivo, limites de duração, cortes e recusas antes da cobrança: código de geração do 8frame para Pruna Video, Creatify Boreal, Seedance, Hailuo H3, Pruna Avatar, OmniHuman e Wan, os validadores de áudio compartilhados e a etapa de corte de áudio, lidos em 2026-10-01
- Preços: funções de custo em créditos do registro de ferramentas do 8frame, lidas em 2026-10-01
- Entradas do conector MCP: definições de ferramentas MCP do 8frame, lidas em 2026-10-01
- O modo Video Editor e as camadas de som: código do front do 8frame, lido em 2026-10-01
- Entrada de áudio e regra de duração do Pruna p-video (em inglês): o esquema de entrada e a página do modelo prunaai/p-video, consultados em 2026-10-01
- Regra de áudio do Creatify Boreal (em inglês): fal.ai/models/creatify/boreal/api, consultada em 2026-10-01
- Regras do áudio de referência do Seedance (em inglês): os esquemas de entrada de bytedance/seedance-2.5 e bytedance/seedance-2.0, consultados em 2026-10-01
Escolha o modelo pelo que a sua faixa precisa fazer. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.