Una toma de producto generada vuelve con el nombre de tu marca casi bien: una letra corrida, el espaciado raro, una palabra que es casi la palabra. A simple vista pasa, pero cualquiera que conozca la marca nota que está mal, y eso es peor que no tener etiqueta.
Ningún modelo mantiene una etiqueta exacta por sí solo, y ningún prompt lo garantiza. Lo que funciona es partir del producto real, revisar cada fotograma y volver a poner la etiqueta real donde las palabras tengan que ser exactas.
En resumen
- Los modelos de imagen y de video no escriben las palabras de forma fiable. Un artículo de Google Research atribuye parte del problema a modelos que no ven las letras individuales de las palabras del prompt
- Ningún prompt garantiza la etiqueta. Escribe igual el texto exacto entre comillas y luego lee cada resultado letra por letra
- Parte de la foto real del producto: recórtala (eliminación de fondo, 12 créditos) y úsala en la escena o como referencia, en lugar de dejar que un modelo invente el producto
- Corrige lo que se desvía: regenera, corrígelo con una herramienta de edición de imagen (Flux Edit, unos 7 créditos a 1 MP, o Kontext Max, 13) o compón la etiqueta real en el modo Video Editor de 8frame o en tu propio editor
- En movimiento, revisa cada fotograma, no solo el primero: ningún modelo de video mantiene una etiqueta exacta
Por qué pasa
Los modelos de imagen aprenden de enormes cantidades de imágenes que contienen texto, así que aprenden cómo se ve la escritura: el grosor del trazo, el espaciado, cómo se asienta una palabra sobre un envase. Producir una secuencia exacta de letras, y solo esa, es otro problema.
Un artículo de Google Research firmado por Rosanne Liu y sus colegas, "Character-Aware Models Improve Visual Text Rendering" (los modelos que ven los caracteres representan mejor el texto), empieza así: "Current image generation models struggle to reliably produce well-formed visual text" (a los modelos actuales de generación de imágenes les cuesta producir de forma fiable texto visual bien formado). Y señala un factor que contribuye: los modelos populares de texto a imagen "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs" (carecen de rasgos de entrada a nivel de carácter, lo que hace mucho más difícil predecir la forma visual de una palabra como una serie de glifos). En las pruebas de los autores, los modelos que podían ver los caracteres individuales representaron el texto mejor que los que no. El artículo es de 2022 (revisado en 2023). Uses el modelo que uses hoy, trata el texto de la etiqueta como algo que se revisa, no como algo en lo que se confía.
En un cartel decorativo del fondo, un casi acierto se tolera. En tu producto es el nombre de tu marca, más o menos.
En video es todavía más difícil. Un modelo de video genera cada fotograma, etiqueta incluida, y la etiqueta tiene que estar bien en todos. Un desvío de un fotograma al siguiente llama más la atención que un error estático.
Parte del producto real
No le pidas a un modelo que invente tu producto. Parte de una foto del producto real.
- Fotografíalo. Luz de ventana, una superficie lisa, el celular un poco por encima y por delante, la etiqueta de frente a la cámara. Toma varias fotos y quédate con la más nítida.
- Anota la dirección de la luz y qué tan dura es. Vas a pedir la misma luz en la escena.
- Recórtalo. Eliminación de fondo, 12 créditos.
- Arma la escena. Hay dos caminos:
- Composición: genera un entorno vacío con la luz que anotaste, por ejemplo con Seedream 5 Lite a 6 créditos (el nodo de Seedream se abre en 5 Pro, así que cámbialo a 5 Lite), y luego coloca tu recorte en tu propio editor de imágenes, igualando la luz y la temperatura de color. La etiqueta sigue siendo la de tu foto.
- Nueva puesta en escena: dale el recorte a un modelo de imagen como imagen de referencia, por ejemplo Nano Banana Pro a 21 créditos en 1K o 2K, con hasta 10 imágenes de referencia (el nodo de Nano Banana se abre en Nano Banana 2, así que cambia a Pro). El modelo vuelve a dibujar el producto, etiqueta incluida, así que lee la etiqueta letra por letra. Tienes prompts para esto en prompts de Nano Banana Pro para fotografía de producto.
- Unifica el color si el producto y la escena no combinan. Flux Edit cuesta unos 7 créditos por una imagen de 1 MP, y más por las más grandes. Un modelo de edición devuelve una imagen nueva, así que vuelve a leer la etiqueta después.
- Anima a partir de la imagen fija terminada si necesitas movimiento: envíala a un modelo de video como imagen inicial.
Animar sin perder la etiqueta
Envía la imagen fija terminada a un modelo de video como imagen inicial. En 8frame:
- Kling v3 Standard necesita una imagen inicial y sigue su formato, en 720p: 57 créditos por 5 segundos sin sonido, 86 con sonido. El nodo de Kling se abre con el sonido activado.
- Seedance llega hasta 720p. El nodo se abre en Seedance 2.5, a 157 créditos por 5 segundos (70 en 480p); Seedance 2.0 cuesta 108 en 720p y 48 en 480p.
- Veo 3.1 Fast es la opción en 1080p. Con una imagen inicial siempre genera 8 segundos, en 16:9 o 9:16, por 168 créditos con sonido.
No hemos medido cuál de ellos mantiene más estable una etiqueta concreta, y ninguno la mantiene exacta. Para elegir, pasa la misma imagen por dos modelos en una configuración barata, por ejemplo Seedance 2.0 en 480p (48 créditos) y Kling v3 Standard sin sonido (57), y luego congela la imagen sobre la etiqueta en varios puntos de cada clip: el inicio, la mitad y el final. Mantén la etiqueta de frente a la cámara, la rotación pequeña y el movimiento lento.
Si un fotograma sigue con la etiqueta mal:
- Regenera. Un clip terminado que descartas igual cuesta sus créditos; solo una ejecución que falla se reembolsa automáticamente (¿las generaciones fallidas de IA cuestan créditos?).
- Compón la etiqueta real sobre el clip. En el modo Video Editor de 8frame puedes subir tu propia imagen y colocarla en la línea de tiempo como capa de imagen sobre el clip. Una capa estática sirve para un plano en el que el producto se queda quieto. Si el producto se mueve, compón en tu propio editor o gira la etiqueta lejos de la cámara en ese plano.
Qué probar en una imagen fija y qué revisar
Nombra el texto en el prompt. Pon las palabras exactas entre comillas y di dónde van. Eso no garantiza la ortografía, así que lee cada resultado letra por letra.
Usa tu foto como referencia. En Nano Banana Pro (21 créditos en 1K o 2K), la foto real del producto puede entrar como imagen de referencia. El modelo igual vuelve a dibujar la etiqueta, y no hemos medido con qué frecuencia algún modelo la escribe bien.
Edita el texto. Puedes pedirle a una herramienta de edición de imagen que corrija una palabra: Flux Edit (unos 7 créditos a 1 MP) o Kontext Max (13). Revisa la palabra corregida y el resto de la etiqueta, porque la edición puede cambiar más que la palabra que pediste.
Regenera. Vuelve a ejecutarlo y compara. Una imagen terminada que descartas igual cuesta sus créditos.
Compón la etiqueta real. Cuando las palabras tienen que ser exactas, coloca la etiqueta real de la foto de tu producto sobre la generada en tu editor. Es el único camino de esta lista en el que la etiqueta que se ve es tu propia fotografía.
No esperes que el escalado corrija la ortografía. 8frame no tiene escalador de video. En una imagen fija, un escalador agranda lo que ya está y no puede saber cómo se llama tu marca. Clarity (13 créditos) se basa en difusión, así que puede volver a dibujar el texto pequeño; BRIA Increase Resolution (6 créditos, 2x o 4x) es la otra opción de la herramienta de escalado. Lee la etiqueta después de cualquier escalado.
Cuánto cuesta un set de producto
Precios en 8frame; un crédito cuesta unos US$ 0.01 en paquete.
| Paso | Ruta | Créditos |
|---|---|---|
| Recortar el producto | Eliminación de fondo | 12 |
| Veinte variantes de entorno | Seedream 5 Lite, 6 cada una | 120 |
| Unificar el color | Flux Edit, imagen de 1 MP | unos 7 |
| Dos clips de prueba con la misma imagen | Seedance 2.0 en 480p (48) y Kling v3 Standard, sin sonido, 720p (57) | 105 |
| Clip final, 5 s en 720p | Seedance 2.0 (108; el nodo se abre en 2.5, a 157), o quedarte con el clip de Kling | 0 a 108 |
| Agrandar la imagen fija | BRIA Increase Resolution, 2x o 4x | 6 |
Un set de producto completo sale en unos 250 a 360 créditos, aproximadamente de US$ 2.50 a US$ 3.60 en paquete, sin contar las repeticiones. La etiqueta de la imagen fija es la de tu foto; en los clips, revísala fotograma por fotograma.
La regla general
No dejes que un modelo invente nada que un cliente vaya a encontrarse en la realidad: tu producto, tu comida, tu local. Si el anuncio muestra algo que el cliente no recibe, tienes un problema de devoluciones, un problema de reseñas y una cuestión legal: en Estados Unidos, la FTC dice que "claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based" (las afirmaciones publicitarias deben ser veraces, no pueden ser engañosas ni desleales y deben estar respaldadas por pruebas).
Genera el mundo. Fotografía el producto.
Preguntas frecuentes
¿Por qué sale mal el texto de mi producto generado? El modelo genera la etiqueta como parte de la imagen, y los modelos de imagen y de video no escriben las palabras de forma fiable. Un artículo de Google Research vincula parte de esto con modelos que no ven las letras individuales de las palabras del prompt. Ningún prompt garantiza la ortografía.
¿Qué modelo mantiene exacta la etiqueta de un producto? Ninguno, por sí solo. Parte de la foto real del producto, revisa cada fotograma y compón la etiqueta real donde las palabras tengan que ser exactas. Para elegir un modelo de video, pasa la misma imagen por dos de ellos en una configuración barata y compara la etiqueta fotograma por fotograma.
¿Puedo arreglar una etiqueta deformada con una edición? A veces. Prueba Flux Edit (unos 7 créditos a 1 MP) o Kontext Max (13) y lee el resultado letra por letra. Cuando las palabras tienen que ser exactas, compón la etiqueta real de tu foto.
¿El escalado arregla una etiqueta deformada? No. Un escalador agranda lo que ya está, y uno basado en difusión, como Clarity, puede volver a dibujar el texto pequeño. 8frame no tiene escalador de video.
¿Puedo generar mi producto? Hazle una nueva puesta en escena a partir de la foto real del producto, no de una descripción en texto, y compara el resultado con el producto real antes de que nadie lo vea: la etiqueta, la forma y el color.
Fuentes
- Rosanne Liu y colegas, Google Research, "Character-Aware Models Improve Visual Text Rendering" ("Current image generation models struggle to reliably produce well-formed visual text", a los modelos actuales de generación de imágenes les cuesta producir de forma fiable texto visual bien formado; los modelos populares de texto a imagen "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs", carecen de rasgos de entrada a nivel de carácter; los modelos que ven los caracteres superaron a los que no los ven al representar texto; publicado en diciembre de 2022, revisado en mayo de 2023): arxiv.org/abs/2212.10562, consultada el 2026-10-02
- Comisión Federal de Comercio de Estados Unidos (FTC), Advertising and Marketing ("Under the law, claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based", según la ley, las afirmaciones publicitarias deben ser veraces, no pueden ser engañosas ni desleales y deben estar respaldadas por pruebas): ftc.gov/business-guidance/advertising-marketing, consultada el 2026-10-02
- Precios, resoluciones y ajustes de 8frame (eliminación de fondo, Seedream 5 Lite y 5 Pro como modelo con el que se abre el nodo de Seedream, Nano Banana Pro con hasta 10 imágenes de referencia y Nano Banana 2 como modelo con el que se abre su nodo, Flux Edit con precio según el tamaño de la imagen y Kontext Max, Kling v3 Standard y su requisito de imagen inicial, Seedance 2.0 y 2.5, Veo 3.1 Fast y su bloqueo de 8 segundos con imagen inicial, Clarity y BRIA Increase Resolution, ausencia de escalador de video, reembolso automático de las ejecuciones fallidas): registro de herramientas y funciones de costo de 8frame, leídos el 2026-10-02
- Capas de imagen con tus propias subidas en el modo Video Editor: código del front-end de 8frame, leído el 2026-10-02
Fotografía la etiqueta, genera la habitación.
Pruébalo sin registrarte: llegas directamente a un tablero real. El canvas de 8frame es gratuito e ilimitado; la generación es de pago desde US$ 19 al mes.