Tu cara, tu marca

Curso digital · Edición 2026

Tu cara,
tu marca,
tu estudio

El método completo para crear contenido con inteligencia artificial usando tu propia identidad como modelo. Desde entrenar tu cara hasta generar campañas que nadie distingue de una producción real.

Noelayne Plasencia

Antes de empezar

Con qué está hecho todo lo que vas a ver

Quiero que esto quede clarísimo desde el principio, porque es la pregunta que más me hacen y la que casi nadie responde de frente. Estas son las herramientas exactas, sin misterio.

Para quéQué usoDónde
Escribir los promptsClaudeclaude.ai
Entrenar mi identidadHiggsfield Soul 2.0Higgsfield
Hoja de personaje de tres panelesHiggsfield Soul CinemaHiggsfield
Fotos sueltas para el feedHiggsfield Soul 2.0Higgsfield
Carruseles coherentesNano Banana ProHiggsfield
Todos los videos de esta guíaSeedance 2.5Higgsfield
Cambiar el fondo de mis videosSeedance 2.5Higgsfield
Grabar el material baseMi celular, en mi casaMi sala

Dos suscripciones y un celular. Eso es todo el estudio. No hay cámara, no hay luces, no hay equipo, no hay locaciones y no hay nadie más trabajando conmigo.

Por qué dos herramientas y no unaHiggsfield genera, pero no escribe. Un prompt bueno de foto tiene doscientas palabras en inglés con vocabulario técnico de cámara y de luz, y escribir eso a mano quince veces por semana es un trabajo completo. Claude me lo escribe en español a inglés en segundos, con mi formato exacto. Esa es la pareja, y el módulo nueve te enseña a montarla.

El método completo, en siete pasos

Antes de entrar en detalle, mira el camino entero. Todo lo que viene después es una de estas siete casillas explicada a fondo.

  1. Reúno mis fotosEntre cuarenta y cincuenta imágenes mías, variadas y en resolución original. Módulo 2
  2. Entreno mi identidadLas subo a Soul 2.0, le pongo nombre, y en cinco minutos mi cara vive dentro de la plataforma. Módulo 3
  3. Decido la ruta¿Construyo la escena entera, o parto de algo real mío y solo cambio el escenario? Esta decisión cambia todo lo demás. Módulo 4
  4. Escojo el modeloCada cosa se hace en un modelo distinto, y escoger mal es la forma más rápida de quemar créditos. Módulo 5
  5. Le pido el prompt a ClaudeLe describo la escena en español y me devuelve el prompt en inglés con mi formato. Módulos 6, 7 y 9
  6. Genero barato y después caroPruebo en calidad baja, ajusto una sola cosa a la vez, y solo cuando funciona corro la versión final. Módulos 1 y 10
  7. Guardo la plantillaEl prompt que funcionó se guarda con espacios en blanco. La próxima campaña sale de ahí en una frase. Módulos 11 y 13

Si en algún momento te pierdes, vuelve a estos siete pasos. Todo lo demás cuelga de aquí.

Módulo uno

El mapa de Higgsfield y cómo no quemar tus créditos

Lo primero que tienes que entender, y esto es lo que más confunde a la gente: Higgsfield no es un modelo de inteligencia artificial. Es una plataforma que te da acceso a más de treinta modelos distintos bajo una sola suscripción. Sora, Veo, Kling, Seedance, Nano Banana, más los modelos propios de la casa que son la familia Soul.

Eso cambia completamente cómo lo usas. No estás aprendiendo una herramienta. Estás aprendiendo a escoger la herramienta correcta para cada toma. Es la diferencia entre alguien que tiene un celular y alguien que tiene un set de lentes y sabe cuál poner.

Los planes y lo que de verdad necesitas

Higgsfield reorganizó sus planes en 2026 y ahora van de Basic a Pro a Max. Hay un plan gratis, pero te lo digo de una vez para que no pierdas tiempo: en el gratis todo sale con marca de agua, tienes acceso a pocos modelos y no tienes créditos reales. Y la marca de agua no se quita después. Si subes de plan, las imágenes viejas se quedan marcadas para siempre.

El detalle importante es que Basic te bloquea los modelos de arriba. Los modelos de video más fuertes piden Pro o superior. Si tu intención es hacer reels, no pierdas el mes en Basic.

Verifica siempreHiggsfield hace experimentos de precio por visitante, así que el número que ves tú puede no ser el mismo que ve otra persona. Los precios de esta guía son referencia, no evangelio. Confirma en la página antes de pagar.

Los créditos son tu presupuesto de producción

Todo en la plataforma se paga con créditos y el costo cambia según tres cosas: la resolución, la duración del clip y el modo de generación. Un video de quince segundos en 4K te puede costar lo mismo que quince imágenes.

La regla que me ahorró más dinero que ninguna otra: nunca generes en alta calidad hasta que el prompt ya esté probado. Yo hago todas mis pruebas en la resolución más baja y en modo rápido. Cuando el resultado ya me gusta, entonces sí lo corro en calidad final. Piénsalo como una prueba de vestuario antes de la sesión.

Panel de cuenta mostrando el plan, los créditos restantes y la opción de recargar
El panel de cuenta. Aquí se ve el plan, los créditos que te quedan y la barra que baja sola durante la semana.

Esta pantalla la vas a mirar todos los días. Lo importante no es el número, es la barra: cuando la ves a la mitad y todavía te falta media semana de contenido, sabes que estabas generando en calidad alta cuando debías estar probando en baja.

También hay opción de recargar créditos sin cambiar de plan. Úsala solo si te quedaste corta en una semana puntual, porque si te pasa todos los meses te sale más barato subir de plan que ir comprando sueltos.

Mi orden de trabajo, siempre el mismo

  1. Escribo el prompt fuera de la plataforma, en mis notas o con Claude.
  2. Genero un lote pequeño en calidad baja para ver si la escena funciona.
  3. Ajusto una sola cosa a la vez. Nunca cambio cinco cosas de golpe porque después no sé qué fue lo que lo arregló.
  4. Cuando sale, corro la versión final en calidad alta.
  5. Guardo el prompt que funcionó en un documento. Ese documento es tu verdadero activo.

Módulo dos

Tu set de fotos: el módulo que decide todo

Aquí es donde se separa la gente cuyo contenido se ve real de la gente cuyo contenido se ve como un videojuego. No es el prompt. Es el set de fotos con el que entrenas tu identidad.

Te lo pongo así: el modelo no te conoce. Solo sabe lo que tú le enseñaste. Si le das veinte selfies iguales tomadas con la cámara frontal en el baño, aprendió una sola versión tuya, deformada por el gran angular, y esa es la que te va a devolver siempre.

Cuántas fotos y de qué tipo

El mínimo real para un resultado que te guste son veinte. La plataforma admite hasta ochenta y te califica el set antes de entrenar, así que no tienes que adivinar. Mi punto dulce está entre cuarenta y cincuenta.

Pero ojo con esto, porque es el error más caro: la variedad importa más que la cantidad. Veinte fotos distintas entre sí ganan por mucho a cincuenta fotos casi idénticas. Y hay un segundo factor que casi nadie mira, que es la resolución: usa siempre los archivos originales de tu galería, nunca fotos reenviadas por WhatsApp ni descargadas de Instagram, porque vienen comprimidas y el entrenamiento sale blando.

Tipo de fotoCuántasPor qué hace falta
Frontal, cara completa, buena luz5 a 6Es la base de la estructura facial
Perfil izquierdo y derecho4Le enseña el volumen real de tu cara
Tres cuartos, cara ladeada4El ángulo que más vas a usar en contenido
Cuerpo completo, de pie2 a 3Sin esto las proporciones de tu cuerpo salen inventadas
Medio cuerpo, poses relajadas3 a 4Le enseña tu postura natural
Luz distinta: interior, exterior, sombra3Hace que la identidad aguante en cualquier escena

Lo que arruina un entrenamiento

  • Lentes de sol. El modelo pierde la forma de tus ojos y después no la recupera.
  • Sombras duras sobre la cara. Aprende la sombra como si fuera parte de ti.
  • Caras cortadas o muy lejos en el encuadre.
  • Fotos de épocas distintas. Si tienes fotos de hace dos años con otro corte de pelo y otro peso, el modelo mezcla las dos versiones y sale alguien que no eres ni tú ni la de antes. Usa fotos de los últimos cuatro o cinco meses.
  • Filtros de belleza. Entrenas el filtro, no tu cara.
  • Más de una persona en la foto.

Mi truco personalToma las fotos de referencia con zoom o con el lente trasero, nunca con la cámara frontal de cerca. El gran angular de la selfie te ensancha la nariz y te achica la frente, y el modelo aprende esa distorsión como si fuera tu cara real. Aléjate y haz zoom. La diferencia es brutal.

El atajo que yo uso: generárte una hoja de personaje

Todo lo de arriba sirve y funciona. Pero hay un camino más limpio, y es el que uso yo: en vez de salir a tomarme veinte fotos, genero una hoja de personaje. Tres paneles en una sola imagen: cuerpo entero de frente, primer plano de la cara, y cuerpo entero de espalda.

Hoja de personaje de tres paneles: cuerpo entero de frente, primer plano y cuerpo entero de espalda
La hoja de personaje real. Tres paneles, misma ropa, misma luz, mismo fondo. Esta es la imagen que uso como referencia de identidad en todo lo demás.

Esa imagen se convierte en tu referencia de identidad para todo. Para entrenar, para generar, para video. Una sola imagen en vez de una carpeta.

Prompt de la hoja de personaje
Hair: chocolate brown tone 6, seventies butterfly shag cut falling to mid chest,
strong face-framing layers, full curtain bangs sweeping open to both sides, deep
side part, voluminous soft blowout with pronounced outward-flicked ends, bouncy
natural movement, always worn loose and down, never tied, never in a bun or
ponytail.

Wardrobe identical in all three panels: plain fitted white crew-neck t-shirt tucked
in, straight-leg black jeans, clean white low sneakers. Torso and stomach fully
covered, navel never visible. No eyeglasses, no sunglasses, no hat, no visible
tattoos, no body piercings, no belly piercing, minimal or no jewelry.

Camera: full body panels shot at 3 meters from the subject, camera at chest height,
straight-on eye level, whole body from head to feet fully inside the frame with
even margin above the head and below the feet. Close-up panel shot at 1.2 meters
with a portrait lens, camera at eye level, straight-on.

Lighting: soft even neutral studio light, gentle wraparound fill, no harsh shadows,
no color casts, consistent across all three panels.

Photorealistic, sharp realistic detail, true-to-life color, hyper-realistic skin
texture, real photography look and not AI look. Correct anatomy with five fingers
on each hand and five toes on each foot. Same identity locked in every panel, no
face drift, no morphing, no duplicated features, no ghosting. Clean character
reference sheet layout, three panels only, plain background, vertical
composition.

Por qué está escrito así

  • La ropa es aburrida a propósito. Camiseta blanca lisa, jeans negros rectos, tenis blancos. Nada de estampados, nada de logos, nada llamativo. Si te haces la hoja con una chaqueta roja llena de detalle, esa chaqueta se te va a colar en generaciones donde no la pediste. La ropa neutra deja que lo único memorable de la imagen seas tú.
  • La luz es plana a propósito. Luz de estudio suave, pareja, sin sombras duras y sin tonos de color. Es lo contrario de la luz dorada que uso en mi contenido, y es intencional: si entrenas tu identidad con luz cálida de atardecer, esa luz se te queda pegada a la cara en todas las escenas. La referencia tiene que ser neutra para que después puedas ponerle cualquier luz.
  • El pelo se describe con obsesión. Mira cuánto espacio ocupa: el corte, el largo, las capas, el flequillo, la raya, el volumen, hacia dónde van las puntas, y que siempre va suelto. El pelo es identidad tanto como la cara. Si lo describes por encima, cambia entre generaciones y de pronto pareces otra.
  • La cámara lleva medidas exactas por panel. Tres metros a la altura del pecho para los cuerpos enteros, un metro veinte con lente de retrato para el primer plano. Sin eso, el modelo escoge distancias distintas para cada panel y las proporciones de tu cuerpo salen inconsistentes entre uno y otro.
  • El cierre bloquea la deriva. Misma identidad en cada panel, sin deriva facial, sin morphing, sin rasgos duplicados, sin fantasmas. Esas cuatro palabras son las que impiden que los tres paneles te salgan como tres mujeres parecidas.

La trampa de la hoja, y es importanteEsta imagen tiene fondo de estudio gris y está partida en tres paneles. Cuando la uses como referencia en otra generación, el modelo puede intentar copiarte también el fondo y el montaje, y te devuelve una foto de calle con fondo de estudio o partida en tres. Por eso, cada vez que llames esta imagen, tienes que escribir de forma explícita: identity reference only, do NOT copy the sheet layout or the grey studio background. Es una sola línea y te salva el trabajo entero.

Cómo saber si tu set está bien antes de gastar un solo crédito

No hace falta entrenar para saber si vas a fallar. Casi todo se ve de antemano, y estas son las dos columnas entre las que tienes que elegir.

Un set pobreUn set bueno
Cinco a diez fotosEntre cuarenta y cincuenta
Casi todas selfies de frenteFrente, perfil, tres cuartos, espalda
Solo cara y hombrosIncluye dos o tres de cuerpo entero
Reenviadas por WhatsApp o bajadas de InstagramArchivos originales de la galería
Todas con la misma luzInterior, exterior y sombra
Fotos de hace uno o dos años mezcladasTodas de los últimos meses
Con filtro de bellezaSin filtro, piel como es
Lentes de sol en la mayoríaOjos visibles en la mayoría

Y esto es lo que te devuelve cada uno

Con un set pobre, la cara que sale se parece a ti, pero no eres tú. Es la versión promedio de las pocas fotos que le diste. Los rasgos se suavizan hacia una cara genérica de modelo, el cuerpo cambia de proporciones, y en cuanto pides un ángulo que no estaba en tu set, se inventa esa parte de tu cara. Vas a generar veinte veces buscando una que se parezca, y vas a quemar los créditos en el intento.

Con un set bueno, tu cara aguanta de perfil, aguanta de espalda, aguanta con luz dura y aguanta en movimiento. Generas tres y una sirve.

La diferencia de esfuerzo entre los dos sets es una tarde. La diferencia en el resultado dura para siempre, porque esa identidad es la base de todo lo que hagas después.

Si ya entrenaste y no te gusta cómo saleNo pierdas tiempo retocando prompts. Vuelve a esta tabla, mira en qué columna cae tu set, y entrena otra vez. Un personaje mal entrenado no se arregla con palabras, y cada día que sigas generándole encima es dinero tirado.

Módulo tres

Entrenar tu Soul ID paso a paso

Soul ID es la función que hace posible todo lo demás. Entrenas tu cara una vez y esa identidad queda guardada en la plataforma. De ahí en adelante, cada vez que generas, la escoges de una lista y el modelo te pone a ti en la escena. No vuelves a subir fotos ni a describir tu cara en el prompt.

La diferencia con subir una foto de referencia cada vez es la constancia. Una foto de referencia te ancla una sola generación, pero entre generación y generación la cara se va corriendo. Para el post número doce ya eres otra persona. Una identidad entrenada no se corre.

El proceso completo

  1. Entra a Higgsfield y abre la sección Soul.
  2. Busca la opción de entrenar un personaje nuevo.
  3. Sube tu set de fotos, el que armaste en el módulo anterior.
  4. Dale entrenar. El proceso tarda entre tres y cinco minutos.
  5. Ponle nombre. Usa algo corto y claro porque lo vas a estar escogiendo de una lista todos los días.
  6. Para generar, entra al modelo, busca la pestaña de personaje y selecciona el tuyo.
La pantalla de entrenamiento de personaje con 47 imágenes cargadas y los dos indicadores de calidad
Mi pantalla de entrenamiento real. Fíjate en los dos indicadores del medio, que son lo más útil de toda esta pantalla.

Los dos indicadores que te dicen si vas bien

La plataforma te califica el set antes de entrenar, y esto te ahorra adivinar.

  • Cantidad de imágenes. Admite hasta ochenta. En esta captura hay cuarenta y siete y la califica como perfecta. Yo empecé con veinte y funcionaba, pero la diferencia entre veinte y cuarenta y algo se nota: la cara aguanta mejor en ángulos raros y en luces difíciles. Si puedes llegar a cuarenta, llega.
  • Calidad. Este es el que casi nadie mira y es tan importante como el otro. Mide la resolución de tus fotos. Aquí dice 2250 píxeles y la califica como perfecta. Si tus fotos vienen comprimidas de WhatsApp o descargadas de Instagram, este número se te cae y el entrenamiento sale blando aunque tengas ochenta fotos. Usa siempre los archivos originales de tu galería, nunca imágenes reenviadas.

Abajo van el nombre del personaje y el selector de modelo. Ese selector es el que confirma lo que te decía antes: el personaje se entrena para un modelo concreto, y ahí es donde eliges cuál.

Sobre la regla de los lentesSi miras bien mis fotos de referencia, en varias salgo con lentes. Eso contradice lo que te dije en el módulo anterior, así que te explico el matiz. Cuando tu set es pequeño, cada foto pesa mucho y una con lentes le quita información sobre tus ojos. Cuando tu set tiene cuarenta o cincuenta, unas cuantas con lentes se diluyen entre las demás y no hacen daño. La regla sigue valiendo, pero lo que de verdad manda es la proporción: que la mayoría de tus fotos tenga los ojos visibles y despejados.

Lista de personajes entrenados con pestañas por modelo arriba
Mis personajes entrenados. Fíjate en las pestañas de arriba, que es donde está la trampa.

Así se ve la lista cuando ya tienes personajes. Está el botón de crear uno nuevo, la opción de generar sin personaje, y después los tuyos. Cuando vas a generar, entras aquí y escoges cuál usar.

El detalle que casi nadie te dice

Mira otra vez las pestañas de arriba en la captura: Todos, Soul, Soul 2.0, Soul Cinema. Esas pestañas no son un filtro decorativo, son la prueba de lo que te voy a decir.

Los personajes entrenados son específicos de cada modelo. Un personaje que entrenaste en un modelo de la familia Soul no aparece automáticamente en los otros. Si estás en la pestaña de un modelo y tu personaje no sale ahí, no es un error de la plataforma: es que no lo entrenaste para ese modelo. Si lo quieres usar ahí, hay que entrenarlo otra vez.

Esto es importante para tu presupuesto y para tu paciencia. Decide desde el principio en qué modelo vas a trabajar la mayor parte de tu contenido y entrena ahí primero. Después, si hace falta, entrenas en el segundo.

Puente hacia el videoEl personaje entrenado genera imágenes. Para llevar esa misma cara al video, el camino es otro: generas una imagen buenísima tuya con tu identidad, la guardas, y esa imagen se convierte en tu referencia visual para los modelos de video. Esa imagen pasa a ser tu llave maestra. Guárdala en una carpeta aparte y no la pierdas.

Módulo cuatro

Las dos rutas: construir la escena o solo cambiar el escenario

Yo no hago todo de la misma manera, y esto es algo que casi nadie explica. Hay dos caminos para llegar a una pieza, y son distintos en costo, en tiempo y en qué tan real se ve el resultado.

Ruta A: generar desde cero con tu identidad

Es lo del módulo anterior. Llamas tu identidad entrenada, escribes la escena completa y el modelo construye todo: tu cara, tu cuerpo, la ropa, el lugar y la luz. Todo es generado.

La uso cuando la escena es imposible o carísima de conseguir en la vida real. Un rooftop en Nueva York en invierno, una calle de París, un estudio con luz de cine. Sitios donde no estoy y no voy a estar esta semana.

Ruta B: partir de una foto o video real mío y cambiar solo el escenario

Aquí subo una foto o un video real, tomado por mí, con mi cara de verdad, y solo le reemplazo el fondo. Mi cara no se genera. Mi ropa no se genera. Mi pose no se genera. Solo cambia dónde estoy.

Y por eso esta ruta se ve más real que la otra. No hay manera de que la cara se equivoque, porque la cara no la inventó nadie. Es tuya. Gastas menos créditos, sale en menos intentos y el resultado aguanta cualquier zoom.

La uso cuando ya tengo una foto que me encanta pero el fondo no sirve. Una esquina fea, un carro estacionado, una pared con rótulos, gente detrás. Antes esa foto se perdía. Ahora se salva.

SituaciónRuta
Quiero estar en un lugar donde no estoyA, desde cero
Necesito muchas variaciones de la misma ideaA, desde cero
Tengo una foto buena con fondo maloB, cambiar escenario
El cliente pidió máximo realismo en la caraB, cambiar escenario
Es contenido con producto en manoB, cambiar escenario
Estoy justa de créditosB, cambiar escenario
Quiero un video tipo campaña sin salir de mi casaB, grabo con el celular y cambio el fondo en Seedance
Un video que ya funcionó y quiero otra versiónB, con la herramienta de video a video

Cómo se hace el cambio de escenario en foto

La instrucción tiene que ser muy explícita en dos direcciones: qué se conserva y qué se reemplaza. Si solo dices lo que quieres de fondo, el modelo te toca la cara de paso.

Cambio de escenario
Keep the woman exactly as she is: same face, same hair, same outfit, same pose, same body position, same proportions and the same light falling on her. Do not retouch or alter her in any way. Replace only the background.

New setting: a quiet sunlit street with a plain smooth pale stucco wall, clean sidewalk, one palm shadow across the wall, absolutely no signs, no letters, no writing anywhere.

Match the new background to the light already on her: warm mid-morning sunlight coming from her left, golden and soft, with defined shadows that have gently diffused edges.

Keep natural hair edges with no cut-out halo and no hard outline. Add a soft contact shadow where her feet meet the ground so she sits in the scene instead of floating on top of it.

One person only, one continuous scene, vertical 4:5 portrait.

Las tres cosas que delatan un fondo cambiado

  • La luz no coincide. Es el error número uno y el más obvio. Si la foto original te la tomaron adentro con luz plana y le pones una playa al atardecer, se ve pegada con tijera. Mira de dónde viene la luz sobre ti en la foto original, de qué color es y qué tan duras son tus sombras, y pídele al fondo esa misma luz. Siempre. Sin excepción.
  • La perspectiva no cuadra. Si a ti te tomaron la foto a la altura del pecho, el fondo tiene que verse desde esa misma altura. Un fondo hecho desde arriba con una persona fotografiada de frente no se sostiene, aunque no sepas explicar por qué se ve mal.
  • El borde del pelo y la sombra de contacto. El pelo es donde todo recorte falla, y la sombra en el piso es lo que hace que estés parada en el lugar en vez de flotando encima. Pide las dos cosas de forma explícita, siempre.

En video: grabo en mi casa y Seedance hace el resto

Esta es probablemente la técnica más rentable de toda la guía, y la que hace que mi contenido parezca producido con equipo que yo no tengo.

Yo grabo en mi casa, con mi celular, contra una pared. Yo actúo la escena completa: camino, me viro, levanto el producto, hablo. Eso queda grabado de verdad, con mi cara, mi cuerpo y mis gestos reales. Después meto ese video en Seedance 2.5 y le cambio el fondo y le pongo los efectos, y sale pareciendo una campaña filmada en locación.

Lo que se conserva es todo lo que importa: el movimiento de la cámara, mi cara, mi ropa, el tiempo de cada gesto. Lo que cambia es el mundo alrededor.

¿Una agencia aprueba este contenido? Sí, y te explico por qué

Esta es la pregunta que más me hacen, con diferencia. Y la respuesta importa, porque si trabajas con marcas es lo primero que te vas a preguntar antes de entregar algo hecho así.

El contenido se graba de verdad. Yo estoy ahí, actuando la escena, con mi cara, mi cuerpo, mi ropa y el producto real en la mano. En mi casa o al aire libre, pero grabando. Eso no se salta nunca.

Lo único que se reemplaza después es el fondo, para que la escena se vea más cinematográfica y conecte con el brief de la campaña. La actuación, el producto, el gesto y la interacción con el producto son reales de principio a fin.

Esa es exactamente la diferencia. No es contenido generado desde cero con una modelo inventada. Es contenido grabado de verdad con el entorno cambiado. Si fuera de la otra forma, no lo aprobarían, y con razón.

Para estos cambios yo uso Seedance 2.5, y solo Seedance 2.5. No es capricho: es el que mejor conserva mi movimiento, mis manos y el producto exactamente como los grabé.

Cómo lo digo yo cuando me preguntanQue el material se graba tal cual, que lo que se ajusta es el entorno, y que el producto siempre aparece en su forma real porque está en mi mano al grabar. Dicho así, de frente y sin adornos, nunca he tenido un problema. Lo que genera desconfianza no es la herramienta, es no explicarla.

Cambio de fondo para contenido de marca
Keep the woman, her face, her hair, her hands, her outfit and the product exactly
as they are in the source video. Same performance, same timing, same camera motion,
same gestures, same product interaction. Do not alter her, her clothing or the
product in any way. Replace only the environment around her.

New setting: [describe el lugar en una línea].

Match the new environment to the light already on her: [dirección, color y dureza de
la luz con la que grabaste].
Keep the product sharp and clearly readable in every frame where it appears.
Add natural background movement so the scene feels alive.
Keep natural hair edges with no cut-out halo, and keep a soft contact shadow where
she meets the ground.

Real phone video feel, no colour grading, no slow motion, no CGI look.

Fíjate en la primera línea y en la última del primer bloque: se nombra todo lo que no se toca, incluido el producto, y se dice explícitamente que solo cambie el entorno. Esa precisión es lo que hace que la entrega pase revisión.

Cómo grabar en tu casa para que el cambio funcione

El noventa por ciento del resultado se decide aquí, antes de tocar la computadora. Estas son las reglas que aprendí a golpes:

  • Pared lisa y de un solo color. Nada de cuadros, muebles, puertas ni esquinas complicadas. Mientras más simple el fondo original, más limpio el reemplazo.
  • Que tu ropa contraste con la pared. Si la pared es blanca y tú andas de blanco, el borde de tu cuerpo se pierde y el reemplazo te come pedazos. Lo mismo con el pelo oscuro contra una pared oscura.
  • Luz al frente, nunca a la espalda. Si tienes la ventana detrás, sales en sombra y con el borde brillando, y eso no se arregla después. Ponte de frente a la ventana o pon la luz del lado.
  • Decide la luz antes de grabar. Esto es lo mismo que en foto pero aquí duele más. La luz que tengas encima al grabar es la luz que va a tener que tener el fondo nuevo. Si te grabaste con luz plana de interior, no le pidas un atardecer en la playa.
  • Deja aire alrededor. No te pegues al borde del encuadre. El modelo necesita espacio para construir el mundo detrás y al lado tuyo.
  • Movimiento de cámara sencillo. Fija o con una deriva suave. Los movimientos bruscos o el zoom rápido confunden el reemplazo y el fondo se despega.
  • Graba más de lo que necesitas. Dos o tres segundos extra al principio y al final te salvan en el montaje.

El prompt, corto como siempre

Acuérdate de la regla del módulo siete: en video, corto. Las imágenes de referencia cargan la estética, el prompt solo cuenta qué pasa y dónde.

Cambio de fondo en video
Keep the woman, her face, her outfit and all of her movement exactly as they are in the source video. Replace only the environment around her.

New setting: [describe el lugar en una línea].

Match the new environment to the light already on her: [dirección, color y dureza de la luz con la que grabaste].
Add natural background movement so the scene feels alive.

Real phone video feel, no colour grading, no slow motion.

Antes de escribir nada, carga tus referencias: una imagen del tipo de locación que quieres, una del ambiente y la luz, y si es contenido de marca, el producto. Esas imágenes hacen más trabajo que cualquier párrafo.

Por qué esto vale más que grabar en la calleGrabando en tu casa controlas la luz, repites la toma las veces que quieras, no hay gente mirando, no hay ruido y no pierdes media mañana en transporte. Y el resultado final se ve mejor que salir a grabar de verdad, porque el fondo que escoges es perfecto y el tuyo real casi nunca lo es.

La ruta híbrida, que es la que más usoGenero una imagen con mi identidad entrenada hasta que queda perfecta, y después a esa misma imagen le cambio el escenario todas las veces que haga falta. Una sola generación buena me da cuatro o cinco publicaciones en lugares distintos, con la misma cara exacta en todas. Ahí es donde el sistema se vuelve un negocio en vez de un pasatiempo.

Mi sala contra Ocean Drive

Esto es lo mismo. La misma toma, el mismo instante, el mismo vestuario. A la izquierda está mi sala. A la derecha está lo que se publicó.

La toma original grabada en su sala con el celular
Antes. Grabado en mi casa, con el celular.
La misma toma con el entorno reemplazado por Ocean Drive de noche
Después. Ocean Drive, de noche, con el carro.

Mira la luz, que es donde está la lección

En la toma original hay dos fuentes de luz. Una lámpara cálida a mi derecha, y una ventana con luz azul de atardecer a mi izquierda. Cálido de un lado, frío del otro.

Ahora mira el resultado. El neón rojo está a mi derecha, en el mismo lado donde estaba la lámpara. El neón azul está a mi izquierda, en el mismo lado donde estaba la ventana. Las direcciones coinciden.

Por eso esta toma se sostiene y no parece un recorte pegado. La luz que ya tenía encima al grabar encontró un entorno donde esa misma luz tiene sentido. Si yo hubiera grabado con luz plana de techo y después pido neón de colores, la cara no habría cuadrado nunca, por mucho que insistiera en el prompt.

Esto es lo que quiero decir cuando repito que la luz se decide antes de grabar. No es un consejo bonito, es la diferencia entre que funcione y que no.

De dónde salió cada cosa de esa escena

Y aquí está la parte que casi nadie entiende, así que te la desarmo pieza por pieza. Esa escena no se la inventó nadie. Cada elemento salió de algo real que yo le di.

Las dos imágenes de referencia cargadas: la calle real de noche y el carro real
Las dos referencias que cargé antes de escribir una sola palabra del prompt.
  • Yo soy real. Grabado en mi sala, con mi celular, con mi cara y mi ropa. Nada de eso se generó.
  • La calle es real. Esa esquina de Ocean Drive existe, con ese hotel y esos neónes. No le pedí que imaginara Miami de noche: le subí una foto de la calle exacta que quería.
  • El carro es real. Es un carro que existe, fotografiado a la luz del día frente a un edificio cualquiera. Eso fue lo que le di.
  • Lo único que hizo el modelo fue juntar esas tres cosas en una sola escena, ponerle a mi cuerpo la luz de esos neónes, y colocar el carro delante de mí como si estuviera ahí esa noche.

Por qué esto lo cambia todo

Mira la foto del carro: es de día, gris, delante de un edificio con setos. Nada que ver con la escena final de noche llena de neón. Y aun así el carro de la escena final se ve como un carro de verdad, con sus proporciones, sus cromados y su forma exacta.

Eso pasa porque el modelo no tuvo que inventar un carro. Tenía uno delante. Solo tuvo que volverlo a iluminar.

Esa es la diferencia entre pedir y dar. Pedir es escribir un Mercedes descapotable negro y rezar. Dar es subirle la foto del carro. Lo primero te devuelve algo parecido a un carro. Lo segundo te devuelve ese carro.

Y lo mismo con la calle. Una calle de Miami con neónes te devuelve una idea genérica de Miami, de esas que se reconocen a un kilómetro. Una foto de Ocean Drive te devuelve Ocean Drive.

La regla que sale de aquíAntes de escribir el prompt, pregúntate qué cosas de esa escena existen en el mundo real y podrías conseguir en foto. La calle, el carro, el producto, el mueble, la ropa. Todo lo que puedas darle en imagen, dáselo. Deja las palabras para lo único que no se puede fotografiar: lo que pasa, y cómo se mueve la cámara.

Lo otro que se ve aquí

  • El perfume es real. Yo tengo el frasco en la mano en la toma original. Por eso en el resultado el frasco está perfecto: nunca se generó. En contenido de marca esto es enorme, porque el producto es justo lo que el cliente va a mirar con lupa.
  • La pose es mía. Los brazos abiertos, los ojos cerrados, la cabeza inclinada. Eso no lo inventó ningún modelo. Lo actúo yo, y por eso se lee como una persona y no como una figura colocada.
  • Grabé contra cortinas claras y lisas. Fondo simple, sin muebles complicados detrás de mí, y de negro contra un fondo claro. Máximo contraste en el borde de mi cuerpo, que es justo lo que necesita el reemplazo para no comerse pedazos.

Piensa en lo que esto significaLa pieza de la campaña de perfume que verás más adelante, la de Ocean Drive con el carro y los neónes, se filmó en una sala con una lámpara y una cortina. Sin permisos, sin locación, sin carro, sin equipo y sin salir de la casa. Lo único que hizo falta fue decidir bien la luz antes de darle grabar.

Módulo cinco

Qué modelo usar para qué cosa

Menú de crear con las opciones de imagen, video y herramientas nuevas
El menú de crear. Arriba las pestañas filtran por tipo, y lo marcado como nuevo suele ser lo más potente y lo menos usado.

Por aquí entra todo. Las pestañas de arriba te filtran entre imágenes, videos y edición, y arriba del todo aparece siempre lo recién salido.

Ese primer bloque marcado como nuevo míralo cada vez que entres. Ahí es donde aparecen las herramientas que todavía nadie está usando, y esas semanas de ventaja son exactamente donde está el contenido que se siente distinto al de todo el mundo.

Esta es la tabla que yo tengo pegada mentalmente. Escoger mal el modelo es la razón número uno por la que la gente gasta créditos sin resultado.

Quiero hacer estoUso estoNota
Foto suelta, editorial, con mi caraSoul 2.0Mi caballo de batalla. Prompts largos.
Foto con look de cine, más dramáticaSoul CinemaIdentidad se entrena aparte
Generación rápida con presetsSoulBueno para explorar ideas
Carrusel con varias fotos coherentesNano Banana ProPrimera imagen en Soul, las demás aquí usándola de referencia
Reel corto con audio y varias tomasSeedancePrompts cortos, referencias fuertes
Video en 4K con historia y personajeKlingAlternativa más económica para 4K
Exterior, paisaje, atmósferaVeoLo que mejor maneja luz natural amplia
Cambiar modelo, ropa o producto en un video que ya existeGenjutsuMantiene cámara y movimiento intactos
Anuncio comercial a partir de un enlace de productoMarketing StudioDe URL a anuncio
Video hablado con labios sincronizadosLipSync StudioFunciona en varios idiomas

El que casi nadie está usando y es oro

Genjutsu es reemplazo de video a video. Tú metes un video que ya existe y le cambias la modelo, la ropa, el producto y el empaque, pero se queda intacto el movimiento de cámara, la coreografía, el tiempo, las luces, las sombras y el fondo.

Para trabajo de marca esto es una máquina de dinero. Te permite tomar la estructura de un video que ya sabes que funciona y producir una versión con tu cara y con el producto del cliente, sin volver a resolver la dirección de cámara desde cero.

Cómo armo mi plantilla de reemplazo

Yo tengo una plantilla fija con espacios en blanco que relleno cada vez. Se reemplaza en cuatro bloques:

  • Modelo: foto de referencia tuya más los detalles de identidad.
  • Ropa: la referencia exacta del atuendo que quieres poner.
  • Empaque: la caja del producto, con referencia visual, para la escena donde se saca de la mano o del abrigo.
  • Producto: la botella o envase, con referencias separadas de cerrado y abierto.

Módulo seis

Anatomía de un prompt que sale real

Antes que nada: los prompts se escriben en inglés. No porque el español no sirva, sino porque estos modelos se entrenaron mayormente en inglés y el vocabulario visual en inglés es más preciso para ellos. Tú piensas en español y escribes en inglés. Si el inglés no es lo tuyo, el módulo ocho te resuelve eso.

Mi plantilla tiene cuatro partes y va siempre en el mismo orden. La probé durante meses hasta que las fotos empezaron a salir indistinguibles de una foto real.

Parte uno: el párrafo de apertura

Un solo párrafo corrido, no lista, que abre diciendo qué tipo de foto es y que de una vez mete el casting completo. Va en este orden: tipo de captura, quién es la persona, pelo, piel, figura, expresión y pose.

Apertura
Candid iPhone 17 Pro Max photo of a young woman, mid 20s, standing on a quiet residential sidewalk. Long dark brown hair falling past her shoulders with soft natural movement and a few loose strands catching the light, defined natural brows, clean glowy makeup with a neutral lip, realistic skin texture with visible pores and a natural sheen on the cheekbones. Slim figure, relaxed posture with her weight shifted onto one hip, one hand resting on the strap of her bag. Neutral expression, lips closed, no smile, eyes looking just past the camera.

Fíjate en tres cosas que parecen tontas y no lo son. Primero, skin texture with visible pores. Esa línea sola es la diferencia entre piel humana y piel de plástico. Segundo, la pose descrita como acción, no como etiqueta: no digo pose casual, digo que tiene el peso en una cadera y la mano en la correa del bolso. Tercero, la expresión. Yo siempre pido expresión neutral, sin sonreír, porque la sonrisa generada es lo que más delata a la inteligencia artificial.

Parte dos: los bloques

Después del párrafo van cuatro bloques con su etiqueta. Cortos y concretos.

Bloques
Outfit: cream linen wide-leg trousers with a soft drape, a fitted white ribbed tank, thin gold hoops, a small structured leather bag in warm tan, flat leather sandals.

Setting: a quiet Coral Gables street, plain smooth pale stucco wall behind her, a strip of clean sidewalk, one palm shadow falling across the wall, absolutely no signs, no letters, no writing anywhere.

Camera: shot from 2.5 meters away at chest height, straight on, three-quarter body framing with space above her head.

Lighting: warm mid-morning Miami sunlight, golden and soft, with defined shadows that have gently diffused edges.

Por qué cada bloque es así

  • Outfit: describe tejidos y caída, no solo colores. Lino que cae suave no es lo mismo que algodón rígido, y el modelo lo sabe.
  • Setting: siempre superficies lisas y sin letras. Si no lo pides, el modelo inventa rótulos y carteles con texto deforme, y ese es el delator número uno.
  • Camera: distancia exacta en metros, altura de la cámara, ángulo y encuadre. Sin esto el modelo escoge por ti y casi siempre escoge mal.
  • Lighting: yo uso siempre luz cálida de media mañana, dorada y suave, con sombras de bordes difusos. Es lo que integra el contenido con el resto de mi feed.

Parte tres: la línea de cierre

Esta va idéntica al final de todos mis prompts de foto. No la cambio.

Cierre fijo
Candid iPhone 17 Pro Max photo, shot on the main wide camera, natural smartphone photography, true-to-life color, sharp realistic detail. One person only, one continuous scene, vertical 4:5 portrait.

La parte de one person only, one continuous scene no es opcional. Sin eso el modelo te devuelve collages, pantallas partidas y clones tuyos en la misma imagen.

Por qué el celular y no la cámara profesionalYo pido explícitamente estética de celular. Suena al revés, pero es que la foto de cámara profesional generada tiene un desenfoque de fondo exagerado y perfecto que grita inteligencia artificial. La foto de celular tiene más profundidad de campo, color más real y se ve como algo que una amiga te tomó. Eso es lo que quiere el algoritmo y lo que quiere la gente.

El bloque global: cuando son muchas tomas de la misma persona

Todo lo anterior sirve para una foto. Pero cuando estás armando un video de veinte tomas o un carrusel de diez imágenes, aparece el problema más frustrante de todos: para la toma seis ya eres otra persona, y para la doce llevas otro abrigo.

La solución se llama bloque global y es simple. Escribes una sola vez todo lo que no puede cambiar nunca, y ese bloque se pega encima de cada toma. Debajo le añades solo la línea que describe qué pasa en esa toma y cómo se mueve la cámara.

Lo que va en el bloque global:

  • Identidad completa: cara, pelo, piel, proporciones
  • El vestuario entero, prenda por prenda, incluidos los zapatos y las joyas
  • El tipo de luz y la textura de imagen
  • La expresión
  • La lista completa de lo que hay que evitar

Lo que va debajo, por toma: qué hace, dónde está, y cómo se mueve la cámara. Dos líneas, no más.

Esqueleto de bloque global
[BLOQUE GLOBAL - se pega igual encima de cada toma]

Photorealistic vertical footage, 9:16. [tipo de luz]. Real 35mm grain, natural
motion blur, true-to-life color. No filter look, no beauty smoothing, no
artificial bokeh. ONE clearly adult woman, mid 20s, same exact face, hair and
proportions in every shot. [casting completo: pelo, piel, figura]. Wearing
[vestuario completo, prenda por prenda]. Neutral expression, mouth closed, no
smile. Environments carry absolutely no signs, no letters, no writing anywhere.
One person only, no duplicate subject, no split screen, no collage.

Avoid: text, letters, signage, watermarks, logos, smiling, open mouth, duplicate
person, extra limbs, malformed hands, plastic skin, artificial bokeh.

[LÍNEA DE LA TOMA - cambia cada vez]

Shot 01: [qué pasa en esta toma].
Camera: [cómo se mueve la cámara].
Biblioteca con muchas tomas generadas de la misma escena y el mismo personaje
Una campaña entera en mi biblioteca. Misma mujer, mismos rulos, misma camisa blanca, misma habitación, toma tras toma.

Esto es el bloque global funcionando. Cuenta las tomas: en todas es la misma persona, con el mismo peinado, la misma camisa y la misma luz, y sin embargo cada una hace algo distinto. Una lee, otra habla por teléfono, otra es un primer plano del producto, otra son los zapatos en la alfombra.

Eso no sale generando toma por toma y cruzando los dedos. Sale de escribir una vez lo que no puede cambiar y pegarlo encima de cada una.

Y fíjate en algo más: hay tomas de detalle sin persona, como el producto sobre la mesa y los zapatos en el piso. Esas son las que dan respiro al montaje y hacen que una pieza parezca producida en vez de grabada de un tirón. Genera siempre tres o cuatro tomas de objeto, aunque al final no las uses todas.

La regla de nitidezSi tu pieza mezcla primerísimos planos con planos abiertos, pide los macros nitidísimos y los abiertos un poco suaves con desenfoque de movimiento real. Ese contraste es lo que hace que se lea como cine. Cuando todo está igual de nítido, el ojo sabe que algo está mal aunque no sepa explicar qué.

Módulo siete

La regla invertida: largo para foto, corto para video

Si te llevas una sola cosa de esta guía, que sea esta. Me costó meses y una cantidad de créditos que prefiero no calcular.

Los modelos de foto y los modelos de video quieren cosas opuestas.

Para foto: prompt largo y detallado

Soul 2.0 trabaja mejor con prompts largos y cinematográficos. Casting extenso, detalle anatómico, bloques de vestuario, escenario y luz, línea de cierre. Si le das un prompt corto, el resultado es genérico y tu cara no se lee bien. El modelo necesita el detalle para anclarse.

Para video: prompt corto y referencias fuertes

Seedance es exactamente lo contrario, y aquí es donde casi todo el mundo se equivoca. La gente aprende a escribir prompts largos para foto, los lleva al video, y el resultado se ve artificial. Yo lo hice durante semanas.

Lo que pasa es que un prompt larguísimo con desglose toma por toma confunde al modelo de video. Se pone a interpretar detalles en vez de concentrarse en que la escena se vea real. El resultado tiene todos los elementos que pediste y aun así se ve falso.

La solución es invertir el peso. Las imágenes cargan la estética, las palabras cargan la historia.

Mi flujo de video actual

  1. Subo primero las referencias, antes de escribir nada. Una imagen mía ya generada que sirva de identidad, el producto si lo hay, y dos o tres imágenes de ambiente que muestren la luz y el aire que quiero.
  2. Escribo un prompt de cuatro o cinco líneas máximo, que solo cuenta qué pasa.
  3. Genero.
Prompt de video, versión corta
Intimate handheld film of the woman from the reference image walking slowly down a sunlit street, turning to look back over her shoulder.
Golden hour light, warm and low.
Natural background movement: people passing, leaves shifting, light traffic.
She blows a kiss to the camera at the end.
Real documentary feel, no cinematic color grading, no slow motion.

Cinco líneas. Y sale mejor que el prompt de cuarenta líneas que yo escribía antes. Además gasta muchos menos créditos porque acierta en la primera o segunda pasada en vez de la octava.

Ahorro realReusar una imagen tuya ya generada como referencia, en vez de volver a llamar tu identidad entrenada dentro del modelo de video, baja el gasto de créditos de forma notable y mejora el resultado. Esa imagen tuya buena es una inversión que se paga sola cien veces.

El mismo encargo, escrito de las dos formas

Esta es la mejor manera de entender la regla, porque es exactamente el mismo trabajo: una escena de baño para un comercial de productos de pelo, con dos frascos en cuadro.

Versión corta, la que uso para video

Aquí ya existe un video mío grabado. La imagen de referencia carga el baño entero. El prompt solo tiene que decir qué se conserva y qué se reemplaza.

Corto · para video con referencia
Professional haircare commercial. Modest framing, shoulders up. Replace the entire
bathroom environment using the reference image as the location. Keep the woman, her
face, her hair, her hands and both product bottles exactly as they are, same timing,
same camera motion, same lighting direction on her.

Location: narrow bright bathroom, glossy white square tile walls, speckled white
terrazzo floor, chrome fixtures, sheer white linen curtain filtering the daylight,
white console sink with chrome legs, warm wood-framed mirror. Same bathroom in every
shot.

Soft natural daylight through the curtain, warm and diffused, gentle shadows across
the floor, calm cinematic mood, muted cream and white palette. Keep both bottles
sharp and clearly readable. Real photographed interior, natural tile imperfections,
true camera depth, subtle film grain.

No text, no logos, no labeled products, no other people, not CGI, not rendered.

Versión larga, la que usaría si no tuviera nada

Ahora imagina que no hay video grabado ni imagen de referencia del baño. Nada existe todavía y hay que construirlo entero con palabras. Ese es el terreno de los modelos de foto, y ahí el prompt crece muchísimo.

Largo · para construir la escena desde cero
Create an 8K photorealistic cinematic frame from a professional haircare commercial,
shot on a full-frame camera with a 50mm lens, in the style of a quiet premium beauty
campaign rather than an advertisement.

ONE clearly adult woman, mid 20s, framed from the shoulders up, standing at a
bathroom sink and turned three quarters toward the camera. Long dark brown hair worn
loose and freshly washed, falling past her shoulders with soft natural movement and
visible individual strands catching the light, the ends slightly damp and heavier
than the roots, no styling product sheen, no artificial gloss. Defined natural brows,
bare skin with the lightest possible makeup, realistic skin texture with visible
pores, a faint natural flush across the cheeks and a soft sheen on the nose and
forehead as real skin has after a shower. Neutral expression, lips closed, no smile,
eyes lowered toward her hands for most of the shot and lifting once toward the mirror.

She holds one product bottle in each hand at chest height, forearms relaxed, wrists
soft, turning one bottle slowly so the light travels across it. Anatomically correct
hands with exactly five fingers on each hand, fingers clearly separated with visible
gaps and defined knuckles, short square nude nails, no rings.

Wardrobe: a plain white cotton robe worn closed and tied at the waist, or a simple
high-neck white cotton top. Torso and stomach fully covered, nothing low-cut, no
midriff, no sheer or see-through fabric, fully clothed throughout. No jewellery, no
watch, no eyewear, nothing that competes with the products.

Setting: a narrow bright bathroom that feels lived in rather than staged. Glossy
white square tile walls with visible grout lines and faint natural imperfections in
the glaze, a speckled white terrazzo floor with warm grey and cream flecks, brushed
chrome fixtures with realistic wear, a white console sink with slim chrome legs, and
a warm wood-framed mirror hanging slightly off-centre. A sheer white linen curtain
covers the window and filters the daylight. Plain smooth surfaces throughout, with
absolutely no signs, no letters, no writing, no product labels and no branding
anywhere in frame. The same bathroom in every shot, with the furniture, the tile and
the mirror in identical positions.

Products: two bottles standing or held within the frame, both kept sharp and clearly
readable, their silhouettes and proportions preserved exactly, catching a soft
highlight down one edge. No other product of any kind in frame.

Camera: shot from 1.4 meters away at chest height, straight on with a very slight
three quarter angle, shoulders-up framing with a little space above her head, shallow
but natural depth of field, no exaggerated background blur.

Lighting: soft natural daylight entering through the linen curtain from camera left,
warm and diffused, wrapping around her face with a gentle falloff into the right side
of the frame, gentle shadows stretching across the terrazzo floor, no artificial fill,
no colour cast, no hard specular highlights on the tile.

Real photographed interior, natural tile imperfections, true camera depth, subtle film
grain, true-to-life colour, muted cream and white palette. Calm cinematic mood.

One person only, one continuous scene, vertical 9:16.

Avoid: text, letters, signage, logos, labelled products, watermarks, additional people,
duplicate subject, split screen, collage, smiling, open mouth, extra fingers, fused
fingers, malformed hands, plastic skin, beauty smoothing, artificial bokeh, CGI look,
rendered look, over-saturated colour.

Qué te enseña la comparación

Mira lo que aparece en el largo y no está en el corto: el casting completo, el pelo descrito hebra por hebra, la ropa prenda por prenda, las manos con su corrección anatomíca, las medidas exactas de cámara y una lista de evitar de diez líneas.

Nada de eso hace falta en la versión corta, y no porque sea menos importante, sino porque ya está resuelto en la imagen y en el video que le estás dando. Su cara ya está ahí. Sus manos ya están ahí. El baño ya está ahí. Describirlo otra vez con palabras no lo mejora: le da al modelo una segunda versión de la verdad con la que competir, y ahí es donde empieza a inventar.

Esa es la regla entera, en una frase: describe con palabras solo lo que no le estás dando en imágenes.

El sistema de etiquetas: cómo se llama cada referencia

Aquí está la parte que convierte esto en una herramienta de verdad. Cada imagen que subes recibe una etiqueta, y dentro del prompt tú la llamas por su etiqueta en el momento exacto en que la necesitas.

Eso significa que puedes cargar once imágenes, una de identidad y diez de vestuario, y sacar diez atuendos distintos en una sola generación, sin montar nada después.

Declarar las referencias
References:
@image1 = the woman's identity ONLY (her face, eyes, skin, features and body).
Identity reference only, do NOT copy the background, the layout or the studio
from this image. Keep her face IDENTICAL in every shot.
@image2 = Outfit 1: [describe el atuendo exacto: top, pantalón, zapatos, bolso,
joyas]. Reproduce exactly.
@image3 = Outfit 2: [descripción]. Reproduce exactly.

[luego, dentro del guión]
[0-3s]: she stands at [location], wearing @image2 exactly, [qué hace].
[3.5-6.2s]: revealed at [location], wearing @image3 exactly, [qué hace].

La línea que salva el trabajoIdentidad solamente, no copies el fondo ni el montaje de esa imagen. Si no lo escribes, el modelo toma tu foto de referencia y se lleva también el estudio gris donde estabas parada, y de pronto tus diez looks de calle tienen fondo de estudio. Separar tu cara de todo lo demás que hay en esa foto es una instrucción que hay que dar en voz alta.

La sintaxis de voz y sonido

Esto casi nadie sabe que se puede. Dentro del mismo prompt del video puedes escribir lo que ella dice y lo que se oye de fondo, y el video sale ya con audio. No hay que doblar nada después.

  • Entre llaves va lo que ella dice en voz alta.
  • Entre ángulos van los efectos de sonido y el ambiente.
Audio dentro del prompt
[0-3s]: she holds a phone to her ear and speaks into it: {Hey, where are you?
I'm on West End, come find me}.

Sound: {Hey, where are you? I'm on West End, come find me} spoken by her into a
phone at the very start; <a yellow taxi whooshes past at each transition>;
<ambient street noise>. No BGM.

Para las líneas habladas, escribe como hablas tú. Si tu contenido es en español, escribe la frase en español con tu jerga, no traduzcas algo del inglés. La gente reconoce cuando una frase está traducida y suena tiesa.

Módulo ocho

Video: reels con tu identidad bloqueada

Te voy a enseñar el formato exacto de uno de mis reels, para que veas cómo se aplica todo lo anterior a una pieza real.

El reel de varios atuendos con transición

La estructura es simple y funciona porque el ojo la entiende sin esfuerzo: apareces con un atuendo en una locación, hay una transición física que tapa la pantalla, y sales con otro atuendo en otra locación. Se repite tres o cuatro veces.

Lo que hace que se vea real no es el atuendo. Son tres detalles:

  • La transición tiene que ser un objeto que pase por delante. Yo uso un taxi amarillo cruzando el encuadre. El corte queda escondido detrás del objeto y el cerebro lo acepta como continuidad.
  • El fondo tiene que moverse. Gente caminando, hojas con brisa, tráfico suave. Un fondo quieto es la señal más clara de que algo es generado. La vida real nunca está quieta.
  • El gesto final. Yo tiro un beso a cámara en vez de decir adiós o saludar con la mano. El saludo generado siempre se ve raro en las manos, el beso se lee limpio y además cierra con personalidad.
Reel de atuendos, prompt completo
The woman from the reference image walks toward the camera on a city sidewalk in a cream linen outfit, confident and relaxed.
A yellow taxi crosses the frame and wipes the shot. She reappears on a different street in a black slip dress, still walking toward camera.
The taxi crosses again. She reappears in denim and a white tank on a palm-lined block.
Handheld, natural daylight, background full of movement: people walking past, leaves shifting, light traffic.
She stops, looks at the camera and blows a kiss.

Si el video lleva voz

Cuando mis videos hablan, las frases van en español dominicano, con jerga y tono desenfadado. No traduzco frases del inglés. La gente reconoce cuando algo está traducido y suena tieso. Escribe como hablarías con tu prima, no como escribirías un pie de foto.

Módulo nueve

Cómo conecto Claude con Higgsfield

Esta es la parte del sistema que más me preguntan y la que menos gente está usando. Yo no escribo mis prompts desde cero. Se los hago escribir a Claude, que es un asistente de inteligencia artificial de texto, y después los pego en Higgsfield.

Por qué esto cambia todo

Un prompt bueno de foto tiene doscientas palabras en inglés, con vocabulario técnico de cámara y de luz. Escribir eso a mano, quince veces por semana, es un trabajo completo. Y si tu inglés no es fuerte, es imposible.

Lo que hago es entrenar a Claude una vez con mi plantilla, y de ahí en adelante le pido escenas en español y me devuelve prompts listos en inglés, con mi formato exacto.

El mensaje de configuración

Esto se lo pegas una sola vez al principio de una conversación nueva. Sustituye la parte de tu descripción física por la tuya.

Configuración inicial
Vas a escribirme prompts de imagen para Higgsfield Soul 2.0. Siempre en inglés, siempre con este formato exacto y sin comentarios extra, solo el prompt listo para copiar.

Estructura:
1. Un párrafo corrido que empieza "Candid iPhone 17 Pro Max photo of a young woman, mid 20s," seguido de casting, pelo, piel, figura, expresión y pose en prosa.
2. Bloques etiquetados en este orden: Outfit: / Setting: / Camera: / Lighting:
3. Línea de cierre exacta: "Candid iPhone 17 Pro Max photo, shot on the main wide camera, natural smartphone photography, true-to-life color, sharp realistic detail. One person only, one continuous scene, vertical 4:5 portrait."

Reglas fijas:
- Expresión neutral, labios cerrados, sin sonrisa.
- Piel con textura realista y poros visibles.
- Luz cálida de media mañana, dorada y suave, sombras de bordes difusos.
- Fondos de superficies lisas, sin rótulos, sin letras, sin texto de ningún tipo.
- El bloque Camera siempre con distancia exacta en metros, altura de cámara, ángulo y encuadre.
- Nunca collage, nunca pantalla partida, una sola persona.

Cuando te describa una escena en español, devuélveme solo el prompt.

De ahí en adelante tú escribes cosas como quiero una foto sentada en una cafetería con luz de ventana, outfit beige y recibes el prompt completo. Diez segundos en vez de veinte minutos.

El nivel siguiente: conexión directa

Higgsfield tiene una conexión que permite que Claude genere video directamente, sin que tú entres a la plataforma. Se configura una vez y después le pides el video por chat y él escoge el modelo y lo renderiza.

Te lo menciono porque es real y está disponible, pero sé honesta con tu nivel: si estás empezando, quédate con el método de copiar y pegar, que es el noventa por ciento del beneficio con el diez por ciento de la complicación. La conexión directa la montas cuando ya domines lo demás.

Módulo diez

Los nueve errores y cómo se arreglan

1. Te devuelve un collage o pantalla partida

Imagen generada partida en tres paneles verticales en vez de una sola escena
Pedí una foto. Me devolvió tres paneles pegados.

Pasa cuando el prompt es demasiado largo o mete demasiadas ideas. El modelo no sabe cuál escoger, así que intenta enseñártelas todas a la vez y parte el cuadro.

Y aquí hay algo que quiero que veas bien, porque al principio este error engaña. Una imagen así parece útil, parece un lookbook, parece que te dieron tres fotos por el precio de una.

Mira los paneles con calma. El del centro es un vestido largo de encaje entero. El de la izquierda tiene lentes de sol y la prenda está cortada a la cintura, con el abdomen a la vista. No es la misma ropa. Ni siquiera es el mismo look.

O sea que no te dieron tres fotos coherentes: te dieron una imagen que no puedes publicar en ningún sitio, y te cobraron por ella. Si querías una foto vertical limpia para tu feed, esto es basura cara.

Y ahora lo que de verdad tienes que aprender de este caso

Este collage lo produjo un prompt que pedía explícitamente que no hubiera collage. Te enseño el final de ese prompt, tal cual:

La lista de evitar que no funcionó
One person only, one continuous scene, vertical 4:5 portrait.

Avoid: beautified or altered facial features, generic AI model face, thinner or
curvier or taller body, plastic skin, exaggerated bokeh, CGI look, extra fingers
or toes, incorrect anatomy, bare midriff, navel exposure, body piercings,
sunglasses, hair tied up, split screen, collage, duplicate subject, side by side,
text or logos.

Ahí dice, con todas sus letras, split screen, collage, duplicate subject y side by side. Y salió un collage de tres paneles.

Tampoco respetó lo demás. Pedía que no alterara los rasgos, que no pusiera una cara genérica de modelo y que no la hiciera más alta. Salió con otra cara y con otro cuerpo. Y pedía que no hubiera lentes de sol: mira el panel izquierdo.

La conclusión, y es dura pero te ahorra mucho dinero

La lista de evitar no es una garantía. Es una sugerencia.

Estos modelos no procesan bien las negaciones. Cuando escribes no collage, el concepto de collage entra igual en la sopa, y a veces lo que consigues es lo contrario de lo que pediste. Sirve como refuerzo, no como cerradura.

Lo que sí funciona:

  • Afirma en vez de negar. No escribas no collage, escribe one single continuous photograph, one frame. Lo positivo manda mucho más que lo negativo.
  • Para la identidad, no uses palabras. Pedirle que no te cambie la cara nunca va a funcionar bien, porque le estás pidiendo que no haga algo sin darle con qué sustituirlo. Tu cara se protege con tu personaje entrenado o con una imagen de referencia, no con una línea de texto.
  • Acorta. Mientras más largo el prompt, más peso pierde cada instrucción, incluida la línea de cierre. Un prompt de cuarenta líneas diluye sus propias reglas.
  • Si el modelo tiene campo aparte para lo negativo, úsalo ahí y no dentro del prompt principal.

Regístrate estoCada vez que te encuentres escribiendo no en un prompt, párate un segundo y pregúntate cómo dirías esa misma cosa en positivo. Casi siempre existe la forma, y casi siempre funciona mejor.

Cómo se arregla

Acorta el prompt a prosa más simple, quítale las ideas que sobran, y asegúrate de que la línea de cierre esté completa y al final. Si tu modelo tiene un campo aparte para lo que quieres evitar, escríbelo ahí y no dentro del prompt principal.

Línea anticollage
single subject, one person only, no split screen, no collage, no duplicate, no side-by-side, one continuous image

2. Manos y pies mal

El clásico. Dedos de más, dedos de menos. Hay que corregirlo por los dos lados, en el prompt positivo y en el negativo, con lenguaje anatómico explícito. Y cuando puedas, esconde las manos: en un bolsillo, sosteniendo algo, detrás del bolso. La mano que no se ve no sale mal.

Corrección anatómica
Anatomically correct hands with exactly five fingers on each hand, fingers clearly separated with visible gaps between them and defined knuckles, natural finger proportions, short square nails. Anatomically correct feet with exactly five toes on each foot.

Avoid: extra fingers, missing fingers, fused fingers, fingers merged together, extra toes, four toes, deformed hands, distorted feet, mangled limbs.

3. La cara no se parece lo suficiente

Casi siempre es el set de entrenamiento, no el prompt. Vuelve al módulo dos. Si el set está bien, revisa que no estés describiendo rasgos faciales en el prompt: si tienes identidad entrenada y además describes tu cara, estás dando dos instrucciones que compiten y el resultado es una mezcla.

4. Se ve generado aunque todo esté bien

Este es el más difícil de explicar y el que más frustra, porque no puedes señalar qué está mal. La composición funciona, la escena es creíble, la cara se parece. Y aun así algo te dice que no es real.

Imagen generada que parece falsa aunque la composición funcione
Soy yo, la escena está bien resuelta, y aun así se lee como generada. Vamos a ver por qué.

Te enseño a diagnosticarlo, porque una vez que sabes mirar ya no se te escapa.

Uno: la luz no cuadra entre ella y el cuarto

Mira el cuarto. Entra sol duro por la ventana de la derecha y se ve clarísimo en el piso y en las paredes, con sombras marcadas. Ahora mira su cara: está iluminada pareja, sin una sombra que corresponda a esa ventana. Son dos escenas de luz distintas metidas en la misma foto. El ojo lo detecta aunque la cabeza no lo sepa explicar.

Dos: hay un brillo rojo que nadie encendió

En el antebrazo y alrededor del frasco hay un resplandor rojizo. ¿De dónde sale? De ningún sitio. No hay una lámpara roja, ni un objeto rojo cerca, ni un reflejo que lo justifique. El modelo lo puso porque le pareció bonito. En la vida real toda luz tiene una fuente, y cuando no la tiene el cerebro se da cuenta.

Tres: la piel está demasiado limpia

Brazos, pecho y hombros salen lisos, casi de cera. Sin poros, sin variación de tono, sin ese brillo desigual que tiene la piel de verdad. Esto pasa cuando el prompt no exige textura, y el modelo siempre tira hacia lo suave.

Cuatro: el producto no se lee

El frasco tiene una medalla borrosa donde debería haber algo legible. Para contenido de marca esto es descalificatorio, y es justo lo que se arregla partiendo de material real en vez de generar el producto.

La lista de revisión rápida

  • ¿La luz sobre la persona coincide en dirección, color y dureza con la del entorno?
  • ¿Todo brillo o reflejo tiene una fuente visible que lo explique?
  • ¿La piel tiene poros y brillo desigual?
  • ¿Hay desenfoque de fondo exagerado?
  • ¿Hay sonrisa? La sonrisa generada delata más que ninguna otra cosa.
  • ¿El fondo tiene movimiento y desorden de vida real, o está demasiado perfecto?

Una de esas seis es la culpable el noventa por ciento de las veces. Y si la que falla es la luz, no se arregla con prompts: se arregla volviendo a la ruta B del módulo cuatro y partiendo de algo real tuyo.

5. Salen letras y rótulos deformes

Rótulos de neón generados con letras sin sentido
Generado sin ninguna instrucción sobre rótulos. Mira los neónes: no dicen nada.

Ahí lo tienes. La escena entera es creíble, la luz funciona, el ambiente funciona, y los letreros no dicen nada. Uno pone tres letras sueltas en vertical y el otro repite sílabas que no forman palabra.

Y fíjate en lo importante: eso solo se nota cuando lo miras. Al bajar rápido por el feed pasa desapercibido, pero en cuanto alguien se detiene, lo ve. Es el delator número uno del contenido generado, porque el cerebro humano lee automáticamente cualquier texto que aparece en cuadro.

La solución no es pedirles que escriban mejor, porque no pueden. Es pedirles que no escriban.

Línea contra el texto
Plain smooth surfaces with absolutely no signs, no letters, no writing anywhere.

Avoid: text, letters, signage, watermarks, logos, brand emblems.

Esa línea va dentro del bloque de escenario, en todos tus prompts, siempre. Es la que más veces me ha salvado una foto.

6. En el carrusel cada foto parece otra persona

Genera la primera imagen con tu identidad entrenada y déjala perfecta. Después usa esa imagen como referencia para las siguientes, con la intensidad de referencia entre setenta y cinco y ochenta y cinco por ciento. Si la pones al cien, todas salen casi idénticas y aburridas. Si la pones baja, se pierde la cara.

7. En escenas con espejo te salen dos mujeres

Cualquier escena con espejo, ascensor, vitrina o ventana es una trampa de clones. El modelo entiende que hay dos figuras y a veces las construye como dos personas distintas en vez de una persona y su reflejo. Hay que bloquearlo de forma explícita.

Bloqueo de reflejo
Exactly one clean reflection of her, never duplicated into separate people. One person only, no duplicate subject.

8. Te bloquea la generación entera y te cobra igual

Seis generaciones seguidas bloqueadas por el filtro de contenido
Seis seguidas bloqueadas. Los créditos se gastaron igual y no quedó nada.

Este es el error que más rabia da, porque no sale una foto fea: no sale nada. El filtro de contenido de la plataforma marca tu generación, te la tapa, y los créditos ya se fueron.

Y lo que más confunde es que casi nunca se trata de algo sexual. En contenido de belleza y moda el filtro salta con cosas perfectamente normales.

Lo que lo dispara más seguido

  • Ropa que enseña piel. Top corto, abdomen al aire, bikini, tirantes finos, escotes, tejidos transparentes. Nada de eso es sexual, pero el filtro lee piel y salta.
  • Vocabulario. Palabras como sensual, seductora, íntima, deseo, piel desnuda o mojada. Aunque describan una atmósfera de perfume, encienden la alarma.
  • Escenas de baño o cama. Ducha, bañera, sábanas, batas, cualquier rutina de noche.
  • Primeros planos de cuerpo. Cuello, hombros, clavículas, piernas, aunque estés vestida.

Cómo se arregla

La solución no es quitar la escena, es blindarla con lenguaje de cobertura. Yo lo tengo metido de fijo en mis bloques globales de campaña y desde entonces casi no me pasa.

Blindaje anti bloqueo
ONE clearly adult woman, age 22+. Torso and stomach fully covered, navel never visible, nothing low-cut, no midriff, no sheer or see-through fabric. Fully clothed throughout. Editorial fashion photography, composed and elegant.

Y cambia el vocabulario sin perder la intención. En vez de sensual escribe composed o confident. En vez de íntimo escribe close and quiet. En vez de piel desnuda escribe natural skin texture. Dicen lo mismo y no encienden nada.

La regla de oroSi tu escena lleva ropa corta o piel a la vista, pruébala primero en calidad baja con una sola generación. Si pasa el filtro, entonces sí corres el lote completo. Descubrir que una escena está bloqueada después de seis intentos en calidad alta es la forma más cara de aprender esto, y lo digo por experiencia.

9. Se te van los créditos sin resultados

Estás generando en calidad alta mientras pruebas. Prueba barato, produce caro. Y cambia una sola variable a la vez.

Módulo once

Banco de prompts listos para copiar

Estos están probados. Cámbiale el vestuario y el escenario, pero deja la estructura, la cámara y la luz como están.

Retrato en la calle, luz dorada

Prompt 01
Candid iPhone 17 Pro Max photo of a young woman, mid 20s, standing on a quiet residential sidewalk. Long dark brown hair falling past her shoulders with soft natural movement, defined natural brows, clean glowy makeup with a neutral lip, realistic skin texture with visible pores and a natural sheen across the cheekbones. Slim figure, relaxed posture with her weight shifted onto one hip, one hand resting on the strap of her bag, the other loose at her side. Neutral expression, lips closed, no smile, eyes looking just past the camera.

Outfit: cream linen wide-leg trousers with a soft drape, fitted white ribbed tank, thin gold hoops, small structured tan leather bag, flat leather sandals.

Setting: a quiet residential street, plain smooth pale stucco wall behind her, clean sidewalk, one palm shadow falling across the wall, absolutely no signs, no letters, no writing anywhere.

Camera: shot from 2.5 meters away at chest height, straight on, three-quarter body framing with space above her head.

Lighting: warm mid-morning sunlight, golden and soft, defined shadows with gently diffused edges.

Candid iPhone 17 Pro Max photo, shot on the main wide camera, natural smartphone photography, true-to-life color, sharp realistic detail. One person only, one continuous scene, vertical 4:5 portrait.

Interior luminoso, sentada junto a la ventana

Prompt 02
Candid iPhone 17 Pro Max photo of a young woman, mid 20s, sitting sideways on a low linen sofa with one leg tucked under her. Long dark brown hair loose over one shoulder, a few strands falling forward, defined natural brows, minimal glowy makeup, realistic skin texture with visible pores. Slim figure, shoulders relaxed, one forearm resting along the back of the sofa, a ceramic mug held loosely in the other hand. Neutral expression, lips closed, no smile, gaze turned toward the window light.

Outfit: oversized oatmeal knit sweater slipping off one shoulder, soft white lounge shorts, bare feet, a single thin gold chain.

Setting: a bright modern apartment with warm white walls and light natural wood, a large window to her left, one small green plant out of focus in the background, plain smooth surfaces with absolutely no signs, no letters, no writing anywhere.

Camera: shot from 2 meters away at seated eye level, slight three-quarter angle, waist-up framing.

Lighting: warm natural window light falling from the left, soft golden tone, gentle falloff into the room, no artificial fill.

Candid iPhone 17 Pro Max photo, shot on the main wide camera, natural smartphone photography, true-to-life color, sharp realistic detail. One person only, one continuous scene, vertical 4:5 portrait.

Producto en mano, contenido de marca

Prompt 03
Candid iPhone 17 Pro Max photo of a young woman, mid 20s, holding a small cosmetic product up near her jawline, fingers curved naturally around it with the label facing the camera. Long dark brown hair pushed behind one ear, defined natural brows, clean glowy makeup with a neutral lip, realistic skin texture with visible pores and a soft natural sheen. Neutral expression, lips closed, no smile, eyes on the camera.

Outfit: simple white ribbed tank, thin gold hoops, no other jewelry competing with the product.

Setting: plain smooth warm white wall directly behind her, nothing else in frame, absolutely no signs, no letters, no writing anywhere except the product label.

Camera: shot from 1.2 meters away at eye level, straight on, chest-up framing, product clearly in focus alongside her face.

Lighting: warm soft daylight from the front left, gentle shadow on the right side of her face, no harsh highlights on the product.

Anatomically correct hand with exactly five fingers, natural finger proportions.

Candid iPhone 17 Pro Max photo, shot on the main wide camera, natural smartphone photography, true-to-life color, sharp realistic detail. One person only, one continuous scene, vertical 4:5 portrait.

Carrusel, imagen dos en adelante

Prompt 04 · usar con la imagen 1 como referencia al 80%
Same woman, same outfit, same location and same lighting as the reference image. She has turned away from the camera and is walking a few steps down the sidewalk, seen from behind at a slight angle, head turned just enough to show her profile.

Camera: shot from 3.5 meters away at chest height, full body framing.

Keep the identity, hair, outfit, colour and light exactly consistent with the reference. One person only, one continuous scene, vertical 4:5 portrait.

Video corto de producto

Prompt 05 · con referencias cargadas primero
The woman from the reference image sits by a window and slowly lifts the product from the table, turning it once in her hand before setting it down.
Warm natural window light, late morning.
Handheld camera, small natural drift, no smooth gimbal movement.
Background alive: light shifting on the wall, a curtain moving slightly.
Real documentary feel, no colour grading, no slow motion.

Video de presentación hablado

Prompt 06
The woman from the reference image stands against a plain warm white wall, talking directly to the camera in a relaxed, confident way, gesturing lightly with one hand.
Soft daylight from the front left.
Handheld, slight natural movement, framed from the chest up.
Natural blinking and micro-expressions, no exaggerated head movement.
Real phone video feel, no cinematic look.

Módulo doce

Mis piezas reales, con el prompt que las hizo

Aquí se acaba la teoría. Estas son piezas que están publicadas en mi Instagram ahora mismo, con el enlace para que las veas corriendo, el modelo que usé y el prompt exacto, palabra por palabra, sin editar ni maquillar.

Míralas en este orden: primero abre el enlace y ve la pieza terminada. Después vuelve y lee el prompt. Vas a empezar a reconocer qué línea del prompt produjo qué cosa en pantalla, y ese reconocimiento es lo que te convierte en alguien que dirige en vez de alguien que pide y reza.

Pieza uno · campaña de perfume

Las cuatro imágenes de referencia cargadas antes de generar
Las cuatro referencias que cargé antes de escribir el prompt. De aquí sale todo lo que se ve en el video.

Ver el resultado en Instagram →

Las cuatro referencias, una por una

Esta tira es lo más útil de toda la pieza, porque es lo que nadie enseña. Cada imagen cubre una cosa distinta, y entre las cuatro no dejan casi nada a la imaginación del modelo.

  1. Yo, con la ropa exactaUna foto mía con el mismo abrigo negro y el mismo top con el que iba a grabar. No solo mi cara: mi cara con ese vestuario puesto. Así no tengo que describir la ropa con palabras, que es donde más se equivoca.
  2. El lugar, realUna foto de esa esquina de Ocean Drive de noche, con el hotel y los neónes encendidos. No le pedí que imaginara Miami. Le di Miami.
  3. El objeto grande de la escenaEl carro. Fotografiado de día, delante de un edificio cualquiera, con luz que no tiene nada que ver con la escena final. Da igual: lo que necesitaba era su forma, sus proporciones y sus cromados.
  4. El productoEl frasco solo, sobre fondo blanco, limpio y de frente. En contenido de marca esta es la referencia innegociable, porque el cliente va a mirar el frasco antes que nada.

La regla que sale de aquí

Una referencia por cada cosa que tiene que salir exacta. Si algo en tu escena no puede cambiar, no lo describas: enséñaselo.

Y fíjate en el orden de importancia, porque es el orden en que yo las cargo: primero yo con el vestuario, después el lugar, después los objetos grandes, y por último el producto. Si un día solo puedes cargar dos, carga las dos primeras.

Un detalle que cambia muchoPara la referencia de identidad no uses una foto tuya cualquiera: usa una foto tuya con la ropa de esa escena. Mata dos pájaros, porque el modelo aprende tu cara y tu vestuario de una sola imagen, y deja de improvisar prendas que tú nunca pediste.

Modelo
Seedance 2.5
Duración
15 segundos exactos
Referencias
Cinco imágenes: una mía de identidad y vestuario, dos del carro, una de Downtown Miami de noche y una de los neones de Ocean Drive
Tipo
Contenido de campaña para marca de lujo
Prompt exacto, sin editar
PRODUCT:
YSL BLACK OPIUM PINK GLAZE EDP (50ML)
- Burgundy/wine deep glass body
- Black dome cap
- YSL medallion (gold)
- Exact size visible throughout

CONCEPT:
"THE SPARK" - PART 2: MIAMI LIBERATION
15 SECONDS EXACTLY

Following VIDEO 1's sensory awakening, Noelayne steps into Miami's night with complete freedom and power. One woman. One fragrance. One city. She owns the moment - hands free, perfume visible, surrounded by luxury, neon, and authentic Miami energy. No performance. Pure liberation.

AESTHETIC:
Miami Editorial Luxury. Not European - authentically Miami. Ocean Drive meets high-fashion cinematography. Tropical, sensual, shock-value moments. Neon, city lights, palm trees, convertible, architectural beauty. Warm and cool lighting interplay (pink/blue/gold from neon + natural warmth).

STRUCTURE (15 SECONDS):

OPENING (0-3s):
Noelayne emerges. Black outfit (same from locker scene). She's holding the exact YSL Black Opium Pink Glaze bottle (50ml, burgundy glass, clearly visible). Hands UP or FREE - arms raised, showing liberation. No constraint. Inside or outside the Mercedes convertible, but VISIBLE and PRESENT. Perfume in one hand, arms expressing freedom. Camera: beauty wide shot or medium capturing her full presence with the perfume.

CARRO MOMENT (3-7s):
Cut to Noelayne inside/around the black Mercedes convertible. Her hands visible on the wheel or raised up (arms free, power). Perfume bottle VISIBLE in shot. Conductor's hands visible (her hands), but face doesn't need to be crystal clear - editorial style, cinematic framing. Motion: driving or posed power moment. City lights in background. Warm glow from street lighting. Camera: cinematic car interior or exterior tracking shot.

CITY/STREET MOMENTS (7-12s):
Quick cuts of Miami aesthetic: Ocean Drive neon lights, architectural details, palms in pink/blue lighting, Noelayne walking with perfume VISIBLE in hand, arms free/raised, full glam, confidence absolute. She's moving through the city holding the perfume like it's an extension of her power. Close-ups of her face with city lights reflecting (neon pink, blue, gold). Perfume bottle catching light in multiple shots.

CLOSING (12-15s):
Final power moment. Noelayne with perfume held high or proud. Full glam. City lights bokeh or neon signs behind/around her. She's the focal point. Expression: magnetic, powerful, present, free. The spark has become fire. She owns Miami.

CAMERA LANGUAGE:
Handheld but smooth editorial beauty cinematography. Mix of wide shots (city landscape), medium shots (her in environment), and beauty close-ups (face, perfume, hands). Tracking shots as she walks. Motion blur on car movement. Cinematic framing throughout - this is not documentation, it's high-fashion editorial. Transitions smooth and motivated. No jarring cuts.

LIGHTING & COLOR:
Neon-influenced but warm at core. Miami's actual neon aesthetic: pink, blue, gold, green neon signs + warm ambient street lighting + city glow. The perfume's burgundy glass catches these lights beautifully. Warm gold highlights on her face and jewelry. Cool blues and pinks from neon surroundings creating editorial depth.
Palette: Burgundy (perfume), black (outfit, car), gold (jewelry, warm light), neon pink/blue (city backdrop), warm amber/gold (street lighting).

AUDIO:
Ambient: Car engine (subtle), street sounds, heels on pavement, wind, distant music/life of the city.
Music: Confident, sensual, luxury beat. Contemporary but timeless. Builds from opening through to peak at closing. Warm bass undertone with rhythmic edge. Not EDM - more cinematic, powerful, sensual luxury soundtrack.

REFERENCE IMAGES (all 5 used):
- Noelayne reference (model, outfit, presence)
- Black Mercedes convertible (daytime reference)
- Black Mercedes convertible (stationary, details)
- Downtown Miami evening (architecture, palm trees, lighting)
- Ocean Drive neon (blue/red neon, tropical vibes)
Use all as cinematography, lighting, location, and aesthetic guidance.

NOELAYNE PRESENCE:
Visible throughout. Same woman from VIDEO 1, now transformed and unleashed. Hands free, perfume visible, full glam makeup, gold jewelry catching light. Expression: powerful, magnetic, confident, sensual. Never smiling - presence speaks louder than expression.

PERFUME AS PROTAGONIST:
The 50ml bottle is VISIBLE in at least 50% of the shots. Held in hand, catching neon/street light, reflecting city colors. It's not hidden - it's part of her power. Product is hero throughout.

CAR AS AESTHETIC, NOT FOCUS:
Black Mercedes convertible is a luxury element, an extension of her world, not the star. She is. The car frames her freedom and power, but doesn't dominate the narrative.

NON-NEGOTIABLES:
- 15 SECONDS EXACTLY
- Noelayne visible throughout (same identity from VIDEO 1)
- Exact YSL Black Opium Pink Glaze bottle (50ml, burgundy, black cap, YSL medallion) VISIBLE in 50%+ of shots
- Black Mercedes convertible featured
- Miami aesthetic (Ocean Drive, neon, palms, architecture - not European)
- Hands FREE / ARMS EXPRESSING POWER and LIBERATION
- Full glam makeup, gold jewelry visible and catching light
- Warm + cool lighting interplay (neon pink/blue + warm gold)
- Hyper-realistic, 8K cinematic quality
- High-fashion editorial cinematography (not documentary)
- No dialogue, no narration
- Music builds to power peak by end

Por qué funcionó

Las cinco imágenes de referencia hicieron el trabajo pesado. El carro no lo describí con adjetivos, le di dos fotos del carro. Los neones de Ocean Drive no los inventé, le di la foto. Cuando le das la imagen, el modelo no tiene que adivinar y por eso la escena se ve real en vez de imaginada.

Lo segundo fue bloquear el producto con precisión de ficha técnica: cincuenta mililitros, vidrio color vino, tapa negra, medalla dorada. En contenido de marca el frasco tiene que ser el frasco. Si lo describes por encima, el modelo te inventa una botella parecida y el cliente te devuelve el video.

Y lo tercero, la expresión. Nunca sonriendo. En este video ella tiene los ojos cerrados y los brazos abiertos, y eso se lee como poder. Una sonrisa generada ahí lo habría hundido.

Por qué este prompt es largo si yo dije que en video hay que ser corta

Buena pregunta y vale la pena entenderla, porque es el matiz que separa a quien sigue reglas de quien entiende por qué existen.

El prompt corto es para cuando lo que necesitas es una atmósfera. Aquí no era atmósfera, era un encargo: quince segundos exactos, un producto específico que no se puede alterar, un carro específico, una ciudad específica y una estructura por tiempos que el cliente aprobó. Eso no cabe en cinco líneas.

Pero fíjate en qué es largo este prompt. No está lleno de adjetivos poéticos ni de descripciones de cómo se ve la luz. Es un pliego de condiciones: qué pasa en cada tramo, qué es innegociable, qué se ve y qué no. El realismo sigue viniendo de las imágenes de referencia, no de las palabras. Las palabras mandan la estructura, las imágenes mandan la estética. Esa regla no cambió.

Qué cambiaría hoy

Le daría una referencia más de una toma cerrada del frasco en la mano con luz de neón encima, para no depender de que el modelo resolviera bien ese detalle. Y le quitaría las indicaciones de audio, porque la música la monto yo después y ahí solo estaban ocupando espacio.

Pieza dos · campaña de perfume en veinte tomas

Toma de producto generada para la campaña, vista dentro de la plataforma
La toma de apertura, dentro de la plataforma. Ver el reel completo en Instagram
Modelo
Seedance 2.5
Duración
24 segundos, 20 tomas
Método
Material grabado ese mes más tomas generadas, montado después
Clave técnica
Un bloque global que se pega encima de cada una de las 20 tomas
Guión y prompts completos, sin editar
VALENTINO BEAUTY VENDETTA | THE WITHHOLD | 24s

NO TEXT IN THE FILM. Generated clean, typography added in the edit.
24 seconds. 20 shots. Three acts. Every shot has camera movement except one.

THE PURPOSE
You do not see her face for the first eight seconds. That is the whole retention
engine. The film opens on glass, light, a hand, a wrist, a rail, hair moving
against the sun. Fragments. The viewer stays because a person is clearly there
and the film keeps refusing to show her. When the face finally arrives at 0:08
it lands as an event, not as an introduction.

Three acts:
1. WITHHOLD (0:00-0:08) - hands, glass, light. Slow moves. No face.
2. RELEASE (0:08-0:16) - the reveal, then movement. Cuts shorten.
3. AFTER (0:16-0:24) - the sun is gone, the city takes over, she leaves.

CAMERA DOCTRINE
Act I moves are slow and mechanical: push, tilt, rack focus, track. Patient.
Act II moves get human: handheld follow, whip, orbit. The camera is chasing her.
Act III moves settle: the camera stops fighting and just watches her go.
Macros stay tack sharp. Wides stay slightly soft with real motion blur. That
contrast is what makes it read as film and not as generation.

=====================================================================
GLOBAL BLOCK - paste at the top of EVERY shot prompt, then add the shot line
=====================================================================

Photorealistic vertical cinematic footage, 9:16. Hard low golden sunlight with
sharp-edged bars and defined shadows on raw grey concrete, or deep dusk with warm
streetlight where stated. Deliberately imperfect framing, real 35mm grain, gentle
halation, natural motion blur, true-to-life color. No filter look, no beauty
smoothing, no artificial bokeh. ONE clearly adult woman, mid 20s, same exact face,
hair and proportions in every shot. Petite, slim frame, narrow shoulders.
Sun-kissed skin with hyper-realistic pores and texture. Chocolate brown hair tone
6, seventies butterfly shag to mid-chest, strong face-framing layers, full curtain
bangs to both sides, deep side part, voluminous blowout with outward-flicked ends,
worn loose. Silver hoop earrings, pale neutral nails. Neutral expression, mouth
closed, no smile, no lip movement, no dialogue. No eyewear. Wearing a black
high-neck long-sleeve top, a long black tailored coat worn open with an oversized
shoulder, a grey and silver tweed asymmetric wrap skirt panel with a wide black
belt and square buckle over a black midi skirt, black patent pointed slingback
kitten heels. No logos, no branded accessories, no handbag. Environments carry
absolutely no signs, no letters, no writing anywhere. The only saturated color in
frame is the fragrance juice. One person only, no duplicate subject, no split
screen, no collage, no text overlay.

Avoid: text, letters, signage, watermarks, logos, brand emblems, car badges,
dashboard, handbag, smiling, open mouth, talking, tied hair, glasses, duplicate
person, extra limbs, malformed hands, plastic skin, artificial bokeh, static
lifeless camera.

=====================================================================
ACT I - WITHHOLD  (0:00-0:08. No face. Slow mechanical camera. Hard golden sun.)
=====================================================================

01 - 0.0-1.6s - THE LEDGE
Both fragrance bottles standing together on a raw concrete ledge, hard low sun bar
cutting across them, long sharp shadows, dust suspended in the beam. One deep red
juice, one amber, clear sculptural glass, black pleated caps.
Camera: very slow push in, 100mm macro, tack sharp. No people in frame.

02 - 1.6-2.8s - RACK
Same two bottles, tighter. Focus sits on the red juice, then pulls smoothly across
to the amber. The out-of-focus one blooms into warm light.
Camera: locked, rack focus red to amber, no movement.

03 - 2.8-4.2s - THE HAND
A hand in a black sleeve enters low in frame and lifts the deep red bottle up into
the sun bar. The juice goes translucent, the sculpted V reads dark inside it.
Camera: tilts up following the bottle as it rises, slight handheld weight.

04 - 4.2-5.4s - WRIST
Extreme macro of her inner wrist as the bottle sprays once. Fine mist hangs visible
in the hard light. Black sleeve pushed back.
Camera: slow push, 100mm macro, mist stays sharp.

05 - 5.4-6.6s - THE RAIL
Her hand sliding along a grey metal stair rail, black coat sleeve, hard sun and a
sharp shadow line running down the rail and across the concrete.
Camera: tracks laterally along the rail at her speed, tight.

06 - 6.6-8.0s - HAIR
Nothing but the back and side of her head, hair backlit and lifting in the air,
edges burning gold, the black coat collar below. Still no face.
Camera: slow orbit around her from behind, hair rimlight sweeping.

=====================================================================
ACT II - RELEASE  (0:08-0:16. The reveal, then movement. Cuts shorten.)
=====================================================================

07 - 8.0-9.4s - THE REVEAL
Raw concrete stairwell. She stands with a hard bar of low sun across her chest and
her face in shadow, coat open, hair still settling from the movement. She turns her
head into the light and the face arrives.
Camera: slow push in, 40mm, eye level, slightly off-center. Land the push exactly
as she turns.

08 - 9.4-10.4s - WRIST TO NECK
Close. She brings the sprayed inner wrist to the side of her neck, chin tilted away,
eyes softly closed for one beat. Hair falls forward across her jaw.
Camera: slow push, 85mm, shallow natural depth.

09 - 10.4-11.2s - DOWN THE STEPS
Low angle from the bottom of the concrete stairs. She walks down toward camera, coat
swinging open, heels landing hard on the tread, tweed panel moving.
Camera: low tracking backward as she descends, real handheld bounce, motion blur on
the coat.

10 - 11.2-12.0s - THE TURN
Tight. She whips her head and the hair follows in a full blurred arc across frame,
hard backlight rimming it.
Camera: whip pan with the movement, settles one beat after the hair does.

11 - 12.0-13.0s - THE MIST
She releases the spray into the air ahead of her and steps forward into the cloud.
The mist catches the hard sun bar and hangs. She passes through it.
Camera: static wide-ish, she moves through frame. The only shot in the film where
the camera does not move.

12 - 13.0-14.0s - THE WALL
She leans back against a raw concrete wall, half her body in a hard bar of sun and
half in deep shadow, arms loose, head tipped slightly back. The light is visibly
weaker now.
Camera: very slow drift sideways, revealing more of the shadow.

13 - 14.0-15.0s - THE TURN OF THE GLASS
Extreme macro, the bottle rotating slowly in her hand, light sweeping across the
sculpted V and the ridges of the pleated cap.
Camera: locked macro, the object does the moving.

14 - 15.0-16.0s - THE CUT
One frame of saturated red filling the screen, then black for two frames.
Land this exactly on the drop. The sun does not come back.

=====================================================================
ACT III - AFTER  (0:16-0:24. Dusk and streetlight. The camera stops chasing.)
=====================================================================

15 - 16.0-17.2s - WINDOW DOWN
Interior of a dark sedan at dusk, window fully down, dark leather and door panel, no
dashboard, no badges, no emblems. Her hair moves hard in the air from the open
window, strands across her face. She looks out, not at camera.
Camera: handheld, chest-up, moving with the car.

16 - 17.2-18.2s - HAND OUT
Her hand and forearm out of the open window against deep dusk sky, fingers loose,
black sleeve pushed back, warm streetlight streaking past behind.
Camera: tracks with the arm, background streaking into motion blur.

17 - 18.2-19.4s - AMBER AT THE GLASS
She holds the amber bottle up against the open window frame. Focus sits on the
streetlight behind, then racks forward onto the juice.
Camera: locked, rack focus background to bottle.

18 - 19.4-20.6s - THROAT
She pushes her hair back off one shoulder and sprays the amber bottle once at the
base of her throat, then lowers her chin level and looks straight into the lens.
Neutral, mouth closed.
Camera: slow push ending on her eyes.

19 - 20.6-22.2s - WALK AWAY
Wide and low. She walks away from camera on a concrete sidewalk at last light, warm
out-of-focus glow ahead, coat moving. She turns her head back over her shoulder and
blows a kiss to the lens without stopping.
Camera: low tracking behind her, falling gradually further back.

20 - 22.2-24.0s - DUSK PAIR
Both bottles side by side on concrete, warm streetlight raking across the glass,
deep blue everywhere else.
Camera: extremely slow pull back, then hold completely still for the last full
second.

=====================================================================
RHYTHM MAP
=====================================================================
Act I  (0-8s)   average shot 1.3s   patient, withholding, tactile
Act II (8-16s)  average shot 1.0s   accelerating, human, chasing
Act III(16-24s) average shot 1.3s, last shot 1.8s   settling, letting go

The longest shot in the film is the last one. Ending on the longest hold is what
makes people watch it again instead of scrolling.

=====================================================================
SHOOT ORDER - hard sun lasts about 25 minutes, so sequence matters
=====================================================================
Golden block, real bottles first: 01, 02, 13, then 03, 04, 05, then 06, 07, 08,
09, 10, 11, 12.
After the sun drops: 15, 16, 17, 18, then 19, then 20 last.

=====================================================================
QC CHECKLIST
=====================================================================
- Product visible within the first 3 seconds
- Both scents featured, tied to different moments of the day
- No other product of any kind in frame
- No car badge, emblem, grille or dashboard visible
- No product emerging from box, packaging or bag
- No logos on clothing
- No filters of any kind at export
- Same face, hair and outfit in all 20 shots
- No face visible in shots 01 through 06
- Mouth closed, no smiling, no lip movement anywhere
- Bottles are real footage, never framed against clothing
- Juice is the only saturated color in every frame
- Macros sharp, wides slightly soft with real motion blur
- Every shot has camera movement except shot 11
- Hands correct, five fingers per hand, especially 03, 04, 13, 16
- Reveal lands at 0:08, hard cut lands on the drop
- Final shot held still for a full second before the end

La técnica que tienes que robarte de aquí: el bloque global

Veinte tomas separadas de la misma mujer, con la misma cara, el mismo pelo y el mismo abrigo. Si escribes cada toma por su cuenta, para la toma seis ya eres otra persona y para la doce llevas otro abrigo. Es el problema más frustrante del video generado.

La solución es el bloque global. Escribes una sola vez todo lo que no puede cambiar nunca: identidad, pelo, cuerpo, ropa completa, tipo de luz, textura de imagen y la lista de lo que hay que evitar. Ese bloque se pega encima de cada toma, y después le añades abajo la única línea que describe qué pasa en esa toma y cómo se mueve la cámara.

Bloque global más dos líneas. Veinte veces. Así se sostiene un personaje a lo largo de un video entero.

Por qué funcionó

No se ve la cara durante los primeros ocho segundos. Manos, cristal, luz, una muñeca, un pasamanos, el pelo a contraluz. La gente se queda mirando porque es obvio que hay alguien ahí y el video se niega a enseñarlo. Cuando por fin aparece la cara, aparece como un acontecimiento y no como una presentación. Eso es retención diseñada, no suerte.

Lo segundo es la regla de nitidez: los macros nitidísimos, los planos abiertos un poco suaves con desenfoque de movimiento real. Ese contraste es lo que hace que se lea como cine y no como generación. Cuando todo está igual de nitido, el ojo sabe que algo está mal aunque no sepa qué.

Y lo tercero, el ritmo. Act I a 1,3 segundos por toma, Act II a 1,0 acelerando, Act III volviendo a 1,3 con la última toma en 1,8. La toma más larga de todo el video es la última, a propósito. Terminar en una pausa larga es lo que hace que la gente lo vuelva a ver en vez de seguir bajando.

Qué cambiaría hoy

Las tomas 03, 04, 13 y 16 son todas de manos en primer plano, que es justo donde estos modelos fallan más. Hoy generaría esas cuatro de último y con más intentos guardados en reserva, en vez de confiar en que salieran bien a la primera.

Pieza tres · diez atuendos en un solo video

Fotograma del resultado: ella en una acera de Nueva York, uno de los diez looks
Uno de los diez looks, tal como salió. Fíjate en el fondo: los peatones, la vespa amarilla, la profundidad real de la calle.
La pantalla de Seedance 2.5 con las imágenes de referencia cargadas y el prompt con las etiquetas de imagen
La pantalla real: arriba el modelo, en el medio las referencias cargadas una por una, y abajo el prompt con las etiquetas de imagen resaltadas. Ver el reel completo en Instagram
Modelo
Seedance 2.5
Duración
29 segundos, diez cambios de atuendo
Referencias
Once: una de identidad y diez de vestuario, una por cada look
Audio
Voz generada dentro del mismo prompt, sin música
Prompt exacto, sin editar
Shot: locked-off full-body camera across the street, a New York street-style OOTD,
high-fashion editorial mood. She looks straight into the lens with a serious,
fashion-forward expression, closed mouth, no smiling, doing small subtle movements.
Background is alive with ambient motion - pedestrians walking past at a natural
distance, tree leaves and branches swaying gently in the breeze, light traffic
passing in the far background. Between each look a yellow taxi rushes across the
foreground, motion blur wipes the frame, and she is revealed in a new place wearing
a new outfit. Warm 35mm street film look, natural daylight, shallow depth of field,
real skin texture. 9:16 vertical.

References:
@image1 = the woman's identity ONLY (her face, eyes, skin, features and body).
Identity reference only, do NOT copy the sheet layout or the grey studio. Give her
LONG LOOSE WAVY hair worn down. Keep her face IDENTICAL in every shot. Serious,
composed, fashion-forward expression throughout, closed mouth, no smiling, no
laughing, no teeth showing.
@image2  = Outfit 1: [describe outfit 1 exactly - top, bottoms, shoes, bag, jewelry]. Reproduce exactly.
@image3  = Outfit 2: [describe outfit 2 exactly]. Reproduce exactly.
@image4  = Outfit 3: [describe outfit 3 exactly]. Reproduce exactly.
@image5  = Outfit 4: [describe outfit 4 exactly]. Reproduce exactly.
@image6  = Outfit 5: [describe outfit 5 exactly]. Reproduce exactly.
@image7  = Outfit 6: [describe outfit 6 exactly]. Reproduce exactly.
@image8  = Outfit 7: [describe outfit 7 exactly]. Reproduce exactly.
@image9  = Outfit 8: [describe outfit 8 exactly]. Reproduce exactly.
@image10 = Outfit 9: [describe outfit 9 exactly]. Reproduce exactly.
@image11 = Outfit 10: [describe outfit 10 exactly]. Reproduce exactly.

[0-3s]: locked-off full-body. She stands at [location 1, e.g. beside a parked scooter
under a cafe awning], a couple of pedestrians strolling past in the background,
wearing @image2 exactly, holding a phone to her ear with a serious, composed
expression, closed mouth, no smile, speaking into the phone: {Hey, where are you?
I'm on West End, come find me}. A small shoulder sway.

[3-3.5s]: a yellow taxi rushes across the foreground close to camera, motion blur
fills the frame.

[3.5-6.2s]: the taxi clears to reveal her at [location 2, e.g. beside a red street
water-pump on a tree-lined block], leaves rustling softly overhead, wearing @image3
exactly, serious expression, closed mouth, a small hand-on-hip pose.

[6.2-6.7s]: a second yellow taxi sweeps across the foreground, motion blur wipes the
frame.

[6.7-9.2s]: revealed at [location 3, e.g. a flower and deli stand], shoppers passing
casually behind her, awning fabric fluttering slightly, wearing @image4 exactly,
serious expression, closed mouth, a small confident shoulder shimmy.

[9.2-9.7s]: a third yellow taxi rushes past close to the lens, motion blur wipes the
frame.

[9.7-12.2s]: revealed at [location 4, e.g. in front of a grand limestone building],
pigeons and pedestrians moving in the distance, wearing @image5 exactly, serious,
composed expression, closed mouth, a small subtle pose.

[12.2-12.7s]: a fourth yellow taxi wipes across the frame, motion blur.

[12.7-15.0s]: revealed at [location 5, e.g. a corner newsstand under scaffolding],
light traffic passing behind her, wearing @image6 exactly, serious expression,
closed mouth, an edgy, confident stance.

[15.0-15.5s]: a fifth yellow taxi rushes past, motion blur wipes the frame.

[15.5-17.8s]: revealed at [location 6, e.g. a tree-lined brownstone stoop], branches
swaying overhead, wearing @image7 exactly, serious expression, closed mouth, a
relaxed hand near the bag strap.

[17.8-18.3s]: a sixth yellow taxi sweeps across the foreground, motion blur.

[18.3-20.6s]: revealed at [location 7, e.g. a subway station entrance], commuters
moving in and out in the background, wearing @image8 exactly, serious editorial
expression, closed mouth, a poised standing pose.

[20.6-21.1s]: a seventh yellow taxi wipes across the frame, motion blur.

[21.1-23.4s]: revealed at [location 8, e.g. a corner bodega with a striped awning],
the awning fluttering gently, pedestrians crossing behind her, wearing @image9
exactly, serious expression, closed mouth, a graceful turn of the shoulder.

[23.4-23.9s]: an eighth yellow taxi rushes past close to the lens, motion blur.

[23.9-26.2s]: revealed at [location 9, e.g. a park entrance with wrought-iron gates],
trees swaying and a jogger passing in the distance, wearing @image10 exactly,
serious expression, closed mouth, a small confident stride.

[26.2-26.7s]: a ninth yellow taxi sweeps across the foreground, motion blur.

[26.7-29.0s]: revealed at [location 10, e.g. in front of a grand limestone building],
light foot traffic passing behind her, wearing @image11 exactly, calm serious
expression, closed mouth, blowing a small kiss toward the camera with one hand.

Only her outfit and location change, and only during each taxi wipe. Her face, skin
tone and hair stay IDENTICAL across all ten looks. Serious, composed,
fashion-forward facial expression in every shot, closed mouth, no smiling, no
laughing, no teeth showing, except for the final blown-kiss gesture. Background
elements (pedestrians, foliage, light traffic) move naturally and continuously
throughout, adding lived-in realism. Photorealistic street candid, no plastic skin,
no warped hands, no extra fingers, no morphing background crowds, no text, no
watermark.

Sound: {Hey, where are you? I'm on West End, come find me} spoken by her into a
phone at the very start; ; . No BGM.

La técnica de aquí: el sistema de etiquetas de imagen

En la captura de arriba se ve lo que casi nadie enseña. Cada imagen que subes recibe una etiqueta, y después la llamas por su etiqueta dentro del prompt en el momento exacto en que la necesitas.

La primera es tu identidad. Las otras diez son los atuendos, uno por look. Y en cada tramo del guión escribes qué etiqueta se usa. Así diez atuendos distintos salen de un solo prompt, en una sola generación, sin montar nada después.

La línea más importante de todo el prompt es esta: identidad solamente, no copies el fondo ni el montaje de la imagen. Si no lo escribes, el modelo toma tu foto de referencia y se lleva también el estudio gris donde estabas parada, y de pronto tus diez looks de Nueva York tienen fondo de estudio. Separar la identidad de todo lo demás que hay en esa foto es una instrucción que hay que dar en voz alta.

Un detalle honesto sobre el texto

En el prompt yo puse no text, no watermark, y sin embargo en el fotograma se lee perfectamente el rótulo del toldo. No es un fallo: esa instrucción se refiere a textos sobrepuestos y marcas de agua, no a los letreros que forman parte de la calle.

Si tú quieres de verdad un entorno sin una sola letra, tienes que pedirlo con más fuerza: plain smooth surfaces with absolutely no signs, no letters, no writing anywhere. Es la línea que uso en mis fotos de Miami. Aquí no la puse porque en una calle de Nueva York los letreros suman realismo en vez de restarlo. Decide cada vez cuál de los dos casos es el tuyo.

La sintaxis de audio

Otra cosa que vale su peso en oro. Dentro del prompt, lo que va entre llaves es lo que ella dice en voz alta, y lo que va entre ángulos es efecto de sonido. Escribes la voz y el ambiente en el mismo prompt del video y sale ya con audio. No hay que doblar nada después.

Por qué funcionó

El taxi. Una transición hecha con un objeto real que pasa por delante y borra el encuadre esconde el corte por completo, y el cerebro lo acepta como si fuera continuidad. Sin ese taxi son diez clips pegados. Con el taxi es una sola pieza.

Lo segundo es el fondo vivo. En cada tramo está escrito qué se mueve detrás: peatones caminando, hojas con brisa, tráfico ligero, un toldo ondeando. Un fondo quieto es la señal más clara de que algo es generado, porque la vida real nunca está quieta.

Y lo tercero, la expresión seria repetida en cada tramo sin fallar una vez. Boca cerrada, sin sonreír, sin enseñar dientes. La única excepción es el beso del final. Esa disciplina es lo que hace que se lea como editorial de moda y no como contenido casero.

Qué cambiaría hoy

Veintinueve segundos con diez cambios es mucho pedirle a una sola generación. Hoy lo partiría en dos prompts de cinco looks cada uno y los uniría en el montaje. Sale más barato en créditos y si un look sale mal solo repites la mitad, no el video entero.

Pieza cuatro · la misma plantilla con otro producto

La pantalla de Seedance con dos referencias cargadas: la modelo y el producto
Dos referencias y ya: yo en el ascensor y el producto. Abajo se ve la parte del prompt con las instrucciones de manos y de reflejo único. Ver el reel completo en Instagram
Modelo
Seedance 2.5
Duración
15 segundos, cuatro locaciones, cuatro looks
Referencias
Solo dos: una mía de identidad y una del producto
Origen
Una plantilla que ya tenía escrita para otro producto
La plantilla completa
PLANTILLA DE COMERCIAL DE 15 SEGUNDOS
Una chica. Un producto. La misma pregunta. Otro mundo.

Lo unico que cambia entre una campana y la siguiente es el BLOQUE DE PRODUCTO.
Todo lo demas se queda igual.

=====================================================================
01 - BLOQUE DE PRODUCTO  (lo unico que se cambia)
=====================================================================
Use the supplied product reference as the exact product lock.
Preserve: [color and finish of the casing], [silhouette and shape], exact
proportions, [visible product colour], [exact typography as it appears],
cap and opening construction, realistic material, believable size in the
model's hand.
Do not allow: redesigns, generic substitutes, altered typography, duplicate
products, swapped caps, warped packaging, melted product, invented shades.

=====================================================================
02 - BLOQUE DE MODELO  (se escribe una vez y se reutiliza siempre)
=====================================================================
Create ONE master model reference first and reuse it across all scenes.
ONE clearly adult woman, age 22+, unique high-fashion face rather than generic
influencer beauty, distinctive cheekbones, expressive eyes, natural brows,
natural lips, realistic pores and skin texture, effortless hair, confident
model-off-duty presence.
Locked across every generation: exact face, exact hair colour and length,
facial proportions, skin tone, body proportions, makeup base, character energy.
Only the outfit and the environment change.

=====================================================================
03 - CUATRO LOOKS
=====================================================================
LOOK 1 STREET: fitted white tank, oversized dark leather jacket, relaxed
trousers, clean sneakers, narrow sunglasses.
LOOK 2 ELEVATOR: oversized tailored blazer, mini skirt or tailored shorts,
tall boots, statement bag, minimal jewellery.
LOOK 3 CAFE: sporty-luxe cropped technical jacket, wide-leg trousers or mini
skirt, statement sneakers, small structured bag.
LOOK 4 ROOFTOP: sleek evening look in black, cream or deep berry, sharp
silhouette, minimal jewellery.
All looks current, editorial, expensive and wearable. Never costume-like.

=====================================================================
04 - PROMPT DE VIDEO
=====================================================================
STYLE: 8K photorealistic 15-second commercial, youthful, fashion-forward, fast,
witty and effortlessly cool. Premium beauty editorial mixed with spontaneous
street-interview filmmaking. ONE clearly adult young woman, age 22+, moves
through multiple locations and multiple fashion looks while different off-camera
voices keep asking her the exact same question: "What do you use?" Every time,
she answers with the brand name. Fast handheld tracking, crash zooms, whip pans,
foreground wipes, mirror transitions, product-to-lens wipes, outfit match-cuts
and tactile macro beauty inserts. Natural adult skin texture, realistic daylight,
subtle 35mm grain, gentle halation, premium fashion photography. Vertical 9:16.

CONCEPT: One young adult woman. One hero product. Four locations. Four fashion
looks. One repeated question. The recurring rhythm is QUESTION - ANSWER -
PRODUCT - TRANSITION - NEW PLACE / NEW LOOK. Use only the exact product from the
supplied reference image. No other product of the same brand appears anywhere.

0.0-3.0s STREET / LOOK 1: Cold open. She is already walking quickly toward camera
through a stylish city street while the handheld camera moves backward in front
of her. OFF-CAMERA: "What do you use?" She looks directly into lens without
slowing down and answers. Instant CRASH ZOOM. She reveals the exact product and
applies it naturally to one cheek while walking. Macro flash inserts: logo,
product tip, pigment touching real skin. She moves the product directly toward
lens until the casing fills frame. PRODUCT-TO-LENS WIPE.

3.0-6.0s MIRRORED ELEVATOR / LOOK 2: The casing colour becomes the warm metallic
tone of a mirrored elevator. New outfit, same exact woman. She is already looking
at herself in the reflection while tapping the product into her cheek.
OFF-CAMERA: "What do you use?" Without turning, she answers. Quick macro rhythm:
reflection, casing, cheek, typography. The elevator doors close rapidly across
the lens. DOOR WIPE.
Exactly one clean reflection of her, never duplicated into separate people. Hands
anatomically correct, fingers clearly separated with visible gaps and defined
knuckles, short square nude nails. No glasses, no sunglasses, no eyewear. Torso
stays covered.
Warm reflective metallic light, chrome surfaces, cinematic symmetry, 35mm
fashion-film framing for the wide, 85-100mm macro for the inserts. Realistic skin
texture, subtle analog grain. Vertical 9:16.

6.0-9.0s CAFE / LOOK 3: Elevator doors reopen into bright cafe sunlight. New
outfit. She steps onto the terrace, puts down a coffee and catches her reflection
in the window. OFF-CAMERA: "What do you use?" Tiny amused glance, she answers.
She pulls out the same exact product and taps colour high on one cheekbone.
Macro: pigment, fingertips, natural skin texture. A stylish passerby crosses
extremely close to lens. FOREGROUND WIPE.

9.0-12.0s ROOFTOP / LOOK 4: Foreground wipe reveals a golden-hour rooftop. Final
outfit. Slight breeze catches her hair, skyline behind her. Camera tracks sideways
as she walks. OFF-CAMERA: "What do you use?" This time she stops, looks directly
into lens and raises the product. She answers. Tiny beat. "Obviously." She applies
it once. Extreme macro of the cheek catching golden sunlight. Warm colour fills
frame. COLOUR MATCH CUT.

12.0-13.5s RAPID MONTAGE: Ultra-fast rhythmic inserts: street walk, jacket
movement, product opening, elevator reflection, cafe sunlight, hand inside bag,
cheek pigment, rooftop hair movement, typography, product texture, finished look.
Each shot roughly 0.1-0.3 seconds, matching movement direction frame to frame.

13.5-15.0s HERO END: Hard cut into pristine product photography. ONE exact product
standing vertically on a sculptural cream surface. Warm directional sunlight, long
elegant shadow, subtle tonal reflection. A final off-camera voice begins "What do
you-" and is cut off. Sharp product CLICK. Cut to black.

CAMERA LANGUAGE: The camera behaves like someone trying to keep up with her. Fast
responsive handheld tracking, 24-35mm environmental lenses, aggressive but
controlled crash zooms and quick reframing. Product moments switch immediately to
precise 85-100mm macro. Physical transitions only: product-to-lens wipe, elevator
doors, passerby foreground wipe, colour match cut. Avoid generic digital morphing.

LIGHT / COLOUR: Street crisp daylight. Elevator warm reflective metallic. Cafe warm
sunlight. Rooftop golden hour. The product colour subtly connects all four
environments.

PERFORMANCE: Cool, confident, dry and naturally charismatic. Never behaves like an
influencer. She is always already going somewhere. Each answer has a slightly
different attitude: effortless, casual, amused, then obvious. Facial reactions stay
minimal.

AUDIO: Fast contemporary fashion beat with crisp percussion and clean bass. Layer
footsteps, city ambience, elevator ding, cafe sounds, product cap sounds, bag
movement, rooftop wind. Keep every "What do you use?" clearly audible. Different
off-camera voices may ask it, but the wording stays identical.

NON-NEGOTIABLES: ONE clearly adult woman age 22+ throughout. Same exact identity
across all scenes. Only ONE product type. Never show two of the product at the same
time. No other cosmetics. No distorted typography, warped casing, extra hands,
broken anatomy, floating products or CGI-looking skin. A different outfit in every
location. All application natural and physically believable.

=====================================================================
05 - MAPA DE TRANSICIONES  (todas motivadas por objetos reales)
=====================================================================
Street to Elevator: the product moves into the lens, its casing colour matches the
warm metallic of the elevator.
Elevator to Cafe: the doors physically close over the frame, then reopen elsewhere.
Cafe to Rooftop: a passerby moves extremely close to lens as a natural wipe.
Rooftop to Montage: the warm cheek colour fills the frame and becomes the first
montage frame.
Montage to Hero: cut on a crisp packaging click.

=====================================================================
06 - RITMO DE MONTAJE
=====================================================================
0-3s     hook immediately: question, answer, product
3-9s     repeat the structure fast enough for the pattern to be understood
9-12s    payoff: she knows the question before it is finished
12-13.5s sensory montage
13.5-15s clean brand landing
Keep dialogue cuts tight. Remove dead air except the tiny beat before "Obviously."

=====================================================================
07 - CONTROL DE CALIDAD ANTES DE EXPORTAR
=====================================================================
- same model identity in every scene
- model clearly reads as adult 22+
- exactly one product visible at any given moment
- correct typography, casing and proportions
- no product morphing between shots
- application looks physically natural
- skin texture remains real
- four clearly different outfits, four distinct locations
- all transitions are motivated
- the repeated question stays identical and audible
- no influencer presentation gestures
- final hero shot clean enough to hold the brand

Lo que de verdad pasó aquí, y es la lección más rentable de la guía

Yo no escribí este guión. Ya lo tenía escrito para otro producto de otra marca, de otra campaña. Lo único que hice fue abrir Claude y pedirle: dame ese mismo documento pero cámbiale el producto, que en vez de esa marca sea este blush.

Una frase. Y salió el guión completo con el producto nuevo bloqueado en cada tramo, en cada macro y en la toma final.

La plantilla es el activo, no el prompt. Un comercial de quince segundos con esta estructura sirve para un blush, para un perfume, para una crema, para unos tenis. Lo único que cambia es el bloque de producto. Por eso arriba te lo dejé separado en su propia sección, con los espacios para rellenar.

Piensa lo que eso significa para tu tiempo. La primera campaña te toma una tarde de escritura. La segunda te toma una frase. La tercera también. Ahí es donde esto deja de ser una habilidad y se convierte en un negocio.

Dos líneas de la captura que vale la pena robarse

La primera es sobre las manos, y es mejor que lo que yo escribía antes. No basta con pedir cinco dedos. Lo que funciona es dedos claramente separados, con espacios visibles entre ellos y nudillos definidos. Los dedos pegados son el error más común y esa frase lo corrige.

La segunda es sobre los espejos. En la escena del ascensor hay que pedir explícitamente exactamente un reflejo limpio de ella, nunca duplicada en personas separadas. Cualquier escena con espejo es una trampa de clones, y si no lo bloqueas te salen dos mujeres distintas en el mismo encuadre.

Por qué funcionó

La repetición. La misma pregunta cuatro veces, la misma respuesta cuatro veces. Al segundo ciclo el espectador ya entendió el juego, y al cuarto se queda a ver si ella contesta antes de que termine la pregunta. Esa es la razón por la que el video se ve completo en vez de abandonarse a los tres segundos.

Y las transiciones motivadas. Nada de efectos digitales: el producto que se acerca al lente, las puertas del ascensor que se cierran, alguien que pasa pegado a la cámara, el color de la mejilla que llena la pantalla. Cada corte lo esconde un objeto real.

Qué cambiaría hoy

La plantilla original pedía formato horizontal porque nació pensada para otra cosa. Yo lo cambié a vertical al vuelo, pero se me quedó el formato viejo escrito en algunos tramos. Cuando reutilices una plantilla, revisa el formato antes de generar, porque es el detalle que más se olvida y el que más créditos cuesta.

Por qué estas cuatroEstas cuatro no son mis piezas más bonitas, son las que mejor enseñan algo distinto: las referencias, el bloque global, las etiquetas de imagen y la plantilla reutilizable. Si te fijas, cada una resuelve un problema que la anterior no tocaba.

Módulo trece

Tu rutina de producción semanal

De nada sirve el sistema si no tienes ritmo. Así es como yo produzco una semana entera de contenido en una tarde.

Lunes, dos horas

  • Escribo las escenas de la semana en español, en una lista. Solo la idea, no el prompt.
  • Se las paso a Claude y recibo todos los prompts de una vez.
  • Genero todo en calidad baja y descarto lo que no funcionó.

Martes, una hora

  • Corro en calidad alta solo lo que pasó el filtro.
  • Guardo los prompts ganadores en mi documento.
  • Escojo la mejor imagen de la semana y la guardo como referencia para video.

Miércoles, dos horas

  • Video. Referencias primero, prompt corto, generar.
  • Monto y edito.

Y lo que hace que esto crezca: tu biblioteca de plantillas

Cada vez que una pieza te salga bien, no guardes solo el prompt. Guarda la estructura con los espacios en blanco.

Un comercial de quince segundos con cuatro locaciones sirve igual para un blush, para un perfume, para una crema o para unos tenis. Lo único que cambia es el bloque de producto. Un reel de varios atuendos sirve para cualquier ciudad y cualquier temporada. Lo único que cambian son las referencias de vestuario.

Cuando llegue el próximo cliente, tú no escribes una campaña desde cero. Abres tu plantilla, le pides a Claude que le cambie el producto y generas. La primera pieza te toma una tarde. La quinta te toma una frase.

Ahí es donde esto deja de ser una habilidad y se convierte en un negocio.

Lista de verificación antes de publicar

  • La cara se parece a mí de verdad, no a una versión suavizada
  • La piel tiene textura visible
  • Las manos están bien o están escondidas
  • No hay letras ni rótulos deformes en el fondo
  • El fondo tiene movimiento si es video
  • La luz combina con el resto de mi feed
  • No hay marca de agua
  • Guardé el prompt que funcionó

Lo último, y es lo que más valeEsta tecnología cambia cada tres meses. Los nombres de los modelos que leíste aquí van a cambiar. Lo que no cambia es el método: entrenar bien tu identidad, describir la cámara y la luz con precisión, darle detalle a la foto y contención al video, y probar barato antes de producir caro. Aprende el método y vas a poder usar la herramienta que venga.

Si quieres ir más lejos

Una sesión uno a uno conmigo

Esta guía te da el método completo y los prompts que uso. Con eso ya puedes trabajar. Pero hay cosas que solo se resuelven mirándolas juntas, y para eso abro sesiones privadas por videollamada.

Qué hacemos en esa hora

Sales de la llamada con tu identidad entrenada, tu plantilla escrita y tu sistema funcionando. No con apuntes.

Sesiones disponibles los lunes y martes

$150

Reservar mi sesión

¿Dudas antes de reservar? Escríbeme por mensaje directo.