← Voltar ao blog

Pré-teste de anúncios com públicos sintéticos

Públicos sintéticos permitem pré-testar criativos com personas simuladas por LLM antes de investir. O que eles conseguem e não conseguem prever, o que a pesquisa diz sobre a validade e um fluxo seguro.

A promessa dos públicos sintéticos é sedutora: antes de gastar um dólar em mídia, você passa o criativo por um painel de personas de IA calibrado para o seu segmento-alvo e recebe reações previstas em minutos. Quando a geração com IA torna barato produzir 50 variantes de um mesmo briefing, a pergunta óbvia é qual das 50 lançar de fato, e um pré-teste sintético promete responder isso sem queimar verba de teste. O dinheiro no setor é real, e alguns resultados publicados contra dados reais de pesquisa parecem sólidos, embora o número comercial citado mais abaixo venha do cliente de um fornecedor, não de um teste independente. Também é fácil confiar demais. Este texto trata de onde o pré-teste sintético pode ganhar espaço num fluxo criativo e de onde se apoiar nele pode custar caro sem que você perceba.

O que um público sintético realmente é

Um público sintético é um painel de personas geradas por IA, montado para simular as respostas de um segmento-alvo real, que você consulta como consultaria um painel de pesquisa ou um grupo focal, só que sem nenhuma pessoa de verdade. Você descreve o seu público-alvo, o sistema gera ou recupera personas que combinam com esse perfil, e você mostra criativos a elas para coletar reações, preferências e rankings previstos. O painel prevê respostas em vez de medi-las.

Investidores apostaram na ideia. A Simile, cuja equipe fundadora "introduced the original concepts of generative agents" (introduziu os conceitos originais dos agentes generativos), segundo seu investidor principal, a Index Ventures, anunciou em fevereiro de 2026 um aporte de US$ 100 milhões liderado pela Index Ventures, com Bain Capital Ventures, Andrej Karpathy e Fei-Fei Li entre os investidores. Em 2026-07-30, anunciou uma Série B de mais de US$ 200 milhões com avaliação post-money de US$ 2 bilhões, co-liderada pela Greenoaks e pela Index Ventures.

No caso da Aaru, outra empresa de simulação com IA, o número disponível é uma afirmação de um cliente, não um resultado independente. Num texto publicado em 2025-10-07, a EY, que fez o teste com a Aaru, diz: "Using Aaru's proprietary multi-agent infrastructure, EY recreated its Global Wealth Management Survey, which normally spans 3,600 affluent investors across 30+ markets and takes six months to complete. The simulation was completed in one day and evaluated across 53 single-select questions, achieving a median Spearman correlation of 0.90." (Em resumo: com a infraestrutura multiagente da Aaru, a EY recriou em um dia a sua pesquisa global de gestão de patrimônio, que costuma levar seis meses, e chegou a essa correlação de Spearman mediana ao comparar as respostas.) A mesma página dá uma diferença média por pergunta de 7,1 pontos percentuais e também relata "notable divergences" (divergências notáveis), entre elas "a -37.82% correlation" (uma correlação negativa) em planejamento sucessório. Leia isso como o relato da EY sobre o próprio projeto com o fornecedor.

O trabalho acadêmico por trás dos agentes baseados em dados é um estudo de Joon Sung Park e colegas, que montaram agentes de 1.052 americanos a partir de entrevistas de duas horas, de questionários ou das duas fontes. Na versão atual do artigo, em perguntas da General Social Survey reservadas para a avaliação, os agentes chegaram a 83% (só entrevistas), 82% (só questionários) e 86% (as duas fontes) da consistência teste-reteste de duas semanas dos próprios participantes, contra 74% dos agentes que receberam só dados demográficos.

São números que soam fortes. A armadilha é supor que eles valem para a sua decisão criativa específica: foram medidos com perguntas de pesquisa, não com reações a um anúncio novo.

O que ele consegue prever e o que não consegue

A evidência publicada é mais forte em perguntas de pesquisa cujas respostas acompanham quem é a pessoa entrevistada. O relatório da Verasight de janeiro de 2026 diz isso com todas as letras: perguntas "heavily discussed in public discourse and well-represented in LLM training data, particularly political attitudes, are easier to impute than questions about personal behaviors and preferences that lack strong demographic correlates" (muito discutidas no debate público e bem representadas nos dados de treino dos LLMs, sobretudo atitudes políticas, são mais fáceis de imputar do que perguntas sobre comportamentos e preferências pessoais sem correlatos demográficos fortes), porque "an LLM has few demographic proxies for what type of consumer prefers a pumpkin spice latte to a regular cup of coffee." (um LLM tem poucos indicadores demográficos para saber que tipo de consumidor prefere um pumpkin spice latte a um café comum). Reações a um anúncio novo ficam mais perto do lado do pumpkin spice. Então, se você usar um painel sintético, faça perguntas relativas sobre um lote (qual destes cinco ganchos, qual abordagem soa relevante, como um conceito se posiciona frente às alternativas) e trate a resposta como um jeito de decidir o que vai para um teste real, não como previsão do desempenho de um anúncio específico.

O mesmo relatório mostra onde ele quebra. Nas perguntas de múltipla resposta, o LLM nunca escolheu 31% das opções, e os autores escrevem: "do not recommend using LLMs to generate data for multi-response questions" (não recomendamos usar LLMs para gerar dados em perguntas de múltipla resposta). As perguntas com pior desempenho tratavam de experiências pessoais e preferências de comportamento que "lack strong demographic predictors" (não têm preditores demográficos fortes), com erros absolutos médios de 27% a 33% nos quatro exemplos que o relatório cita; nas opções de resposta das perguntas de resposta única, o erro médio foi de 14,5 pontos percentuais, e o relatório encontrou "a systematic tendency to regress predictions toward the mean" (uma tendência sistemática de puxar as previsões para a média). Paglieri e colegas (2026) observam que a maioria das abordagens de geração de personas precisa de dados detalhados sobre a população-alvo e muitas vezes prioriza "density matching (replicating what is most probable) rather than support coverage (spanning what is possible), leaving long-tail behaviors underexplored." (reproduzir o mais provável em vez de cobrir o possível, deixando pouco explorados os comportamentos da cauda longa). E uma revisão de 63 estudos revisados por pares, publicados entre 2023 e 2025 em conferências de destaque de PLN e IA, feita por Batzner e colegas, concluiu que a representatividade e a validade ecológica das personas sintéticas "vary considerably between studies" (variam bastante de um estudo para outro), que a tarefa e a população de interesse muitas vezes ficam mal especificadas, e que só 35% dos estudos discutiam o quanto suas personas eram representativas.

Traduzindo para decisões criativas: um painel que puxa as respostas para a mais provável pode ajudar a ordenar um lote, mas não espere que ele surpreenda você. Ele pode subestimar reações incomuns, e uma ideia incomum pode ser justamente o que você está testando. Não conte com ele para apontar uma ofensa ou uma leitura cultural errada que uma pessoa real perceberia.

O fluxo de pré-teste e depois investimento

Usado como filtro e não como oráculo, o pré-teste sintético se encaixa num fluxo criativo com IA.

Gere em volume. Comece de um lote: um briefing transformado em 40 a 50 variantes de ganchos, visuais e abordagens, com o fluxo de teste de variantes de anúncios com IA. Volume é a matéria-prima: o pré-teste precisa de algo para filtrar.

Faça o pré-teste para ordenar, não para decidir. Passe o lote pelo seu público sintético para ordenar e agrupar. O objetivo é cortar as perdedoras óbvias e chegar a 10 a 15 candidatas para um teste real, não coroar uma única vencedora.

Invista nas sobreviventes, no mercado. Leve a lista curta para um teste real no mercado, com pouca verba, na Meta ou no TikTok. Esta é a etapa que ninguém pode pular. Junte cada previsão sintética a uma checagem real no mercado: a camada sintética estreita o campo a baixo custo, a camada ao vivo traz a verdade.

Realimente os resultados. O que vencer no mercado vira sinal de calibração. Com o tempo você aprende o quanto os rankings do seu painel sintético previram os seus resultados reais, e isso diz quanto confiar nele da próxima vez. Esse ciclo de retorno é como você descobre se, na sua categoria, o painel é um filtro ou uma muleta.

Todo o valor do fluxo está na ordem: o sintético para filtrar barato, o real para confirmar de verdade. Inverta essa ordem, ou corte a etapa ao vivo, e você terá trocado uma decisão validada por um palpite dito com confiança.

A seção do ceticismo

Algumas ideias para que a ferramenta não passe de filtro a autoridade.

Calibração não é verdade. A correlação mediana de 0,90 com uma pesquisa existente que a EY relata, ou os 83% a 86% de consistência teste-reteste do artigo de Park, descrevem o quanto os modelos acompanharam respostas a perguntas de pesquisa. Não dizem nada direto sobre como vai se sair o seu criativo novo, sobretudo se ele faz algo fora do comum.

O viés para a média pode ir contra o que você quer de um criativo. A Verasight encontrou "a systematic tendency to regress predictions toward the mean" (uma tendência sistemática de puxar as previsões para a média) em respostas de pesquisa; se um painel fizer o mesmo com anúncios, ele vai pender para a variante mais segura. Antes de cortar uma variante só porque o painel a colocou embaixo, veja se ela ficou embaixo por ser incomum, e considere manter uma ou duas fora da curva no teste ao vivo.

Pergunte o que um número mede. Fornecedores e seus clientes relatam os próprios números de precisão, e "uma correlação de 0,90" pode significar coisas muito diferentes conforme a referência: o número da EY é uma correlação de postos (Spearman) em 53 perguntas de pesquisa, não uma taxa de acerto em decisões de anúncio. Pergunte contra o que um número foi medido antes de dar peso a ele numa decisão.

Nada disso faz dos públicos sintéticos uma ferramenta ruim. Faz deles um filtro com pontos cegos, que ainda pode ser útil quando você escolhe quais 12 de 50 variantes merecem verba de verdade.

O que isso significa para times de marca

O enquadramento honesto é que o pré-teste sintético comprime o topo do funil, não o funil inteiro. Ele pode deixar mais barata e mais rápida a pergunta "quais destas vale a pena testar", e isso importa quando a geração com IA torna 50 variantes fáceis de produzir e impossíveis de testar todas de uma vez.

O que ele não faz é substituir o teste no mercado, e qualquer discurso que diga o contrário vai além do que a pesquisa sustenta. Usado como camada de triagem, ele se encaixa: gerar em volume, pré-testar para montar a lista curta, investir para confirmar, calibrar com o tempo. Usado como decisão, ele deixa uma previsão que soa confiante tomar o lugar da parte em que a realidade tem voto.

Perguntas frequentes

Qual é a precisão dos públicos sintéticos?

Depende da pergunta, e o número comercial aqui é uma afirmação de um cliente sobre um fornecedor. A EY diz que a sua réplica de uma pesquisa de patrimônio com a Aaru chegou a uma correlação de Spearman mediana de 0,90 (EY, 2025-10-07). No artigo de Park, agentes baseados em dados de 1.052 americanos chegaram a 83% a 86% da consistência teste-reteste dos próprios participantes em perguntas da General Social Survey. A Verasight encontrou erros bem maiores em perguntas de múltipla resposta e em comportamentos pessoais com preditores demográficos fracos. Reações a criativos de anúncio ficam mais perto desse segundo tipo.

Um público sintético pode substituir um teste A/B?

Não. Use-o para ordenar e encurtar a lista de variantes a baixo custo, depois invista uma verba pequena no mercado na lista curta. Realimente os resultados ao vivo para saber o quanto os rankings sintéticos preveem os seus resultados.

O 8frame oferece públicos sintéticos?

Não. O 8frame gera as variantes de imagem e de vídeo; o painel sintético é uma ferramenta à parte.

Quanto custa gerar 50 variantes para um pré-teste?

No 8frame, 50 imagens estáticas do Nano Banana 2 em 1K custam 550 créditos (11 cada). Vídeo custa mais: 50 clipes de cinco segundos do Kling v3 Standard custam 4.300 créditos com som (86 cada, o padrão da ferramenta Kling) ou 2.850 sem som (57 cada), e o Kling v3 precisa de uma imagem inicial para cada clipe, por exemplo uma dessas imagens estáticas. Um crédito vale cerca de US$ 0,01 no preço dos pacotes.

Fontes


O pré-teste sintético precisa de um lote amplo para filtrar. Gere as variantes no 8frame e depois encurte a lista e invista. Comece pelo fluxo de teste de variantes de anúncios com IA e veja o que é público sintético para o básico.

Experimente sem cadastro: você cai direto num quadro real. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.

Artigos relacionados

tendênciasBending Spoons compra o Miro: o que isso significatendênciasO estrategista criativo de IA: o cargo mais importante da publicidade em 2026tendênciasA IA no Cannes Lions 2026: o que realmente ganhou

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates