Revisada el 2026-10-02 · vigente hasta 2027-01-02

Método para pasar de una imagen aleatoria a una imagen controlada con herramientas de chat (Gemini, ChatGPT) y de apoyo.

La calidad sale de un prompt estructurado, referencias reales e iterar en pocos pasos. Cuando algo debe quedar exacto, se repite desde un chat limpio con la imagen buena como referencia. Todo lo que sigue sale de un único vídeo de 1 h 33 min1; los minutos entre corchetes remiten a él para ampliar. No está contrastado con pruebas propias ni con fuentes externas.

1. El prompt

  • Cuatro pilares mínimos: estilo, sujeto, entorno y formato. Escríbelos como bloques, no como un párrafo suelto [8:11].
  • Prompt negativo: di también lo que no quieres. No siempre se respeta, porque el modelo arrastra sesgos de su entrenamiento [9:54].
  • Estructura XML: pide a cualquier chat que convierta tu prompt a etiquetas (iluminación, paleta, especificaciones técnicas…). En la prueba del vídeo respetó mejor lo que el prompt negativo no había conseguido [11:33].
  • Aspect ratio: va dentro del bloque de formato (16:9, 9:16, etc.) [16:06].
  • Texto dentro de la imagen: pon las palabras entre comillas y define tipografía (nombre exacto, no «de palo»), color, alineación y márgenes. Mejor generar primero la imagen y añadir el texto en una segunda pasada [25:55].

2. Iterar sin perder consistencia

  • Chat nuevo para una variante desde cero: así no arrastras la imagen anterior.
  • Tras muchas iteraciones en el mismo chat se pierden detalles (en el ejemplo, un detalle de un zapato). Si el producto es real: descarga la imagen buena, abre un chat limpio, súbela y pide solo el cambio [15:00].
  • Añade siempre una frase de consistencia («mantén tipografías, posición y todo lo demás sin cambios»).

3. Edición (lo que antes se hacía en Photoshop)

QuéCómo
Profundidad de campoPide efecto blur o una apertura concreta (f/1.4…) [16:30]
Zoom in / zoom outIndica el efecto y dónde quieres el foco [17:00]
Traducir un cartel«Cambia el idioma a inglés» + consistencia en tipografía y posición [17:40]
Cambios complejos (inpainting)Dibuja sobre la imagen con colores o números y explica qué significa cada marca [18:30]. Si tu modelo no deja dibujar, hazlo en Canva
Rotar un objetoLenguaje 3D: «gira 180° en el eje X» [20:50]
Noche a día, iluminación, bokehSe piden en lenguaje natural

4. Calidad final

  • Upscaler (aumentar tamaño): herramientas gratuitas o de pago que escalan ×2 o ×4 [21:30].
  • Enhancer (reconstruye detalle): también como prompt, pidiendo piel natural, poros, luz cinematográfica y un tipo de lente de retrato [22:20].
  • Marca de agua de Gemini: se quita con borradores web gratuitos (limitados) o con el borrador mágico de Canva Pro [24:00].
  • Vectorizar logos y diseños (PNG/JPG a SVG) para ampliarlos sin pixelar [31:00].

5. Referencias (la mayor palanca de calidad)

  • Combinar dos imágenes: pide que el modelo «piense cómo integrarlas» y dale el estilo y el formato [32:30].
  • Límites citados en el vídeo (marzo de 2026, con Gemini): hasta 5 personas y 14 elementos de referencia por imagen [cita requerida: contrastar con la documentación oficial].
  • Referencia de estilo: sube una foto con la iluminación o el estilo que quieres, nómbrala si es de un artista conocido y aplícala a tu sujeto [35:30].
  • Producto: reinterpreta tu producto con una imagen de referencia. Si falla la profundidad (qué parte queda dentro o fuera), marca zonas con tres colores y explícalas en el prompt [36:30].

Fallos típicos del modelo (no son culpa tuya)

  • No ve lo que está oculto: cinco manzanas en un frutero salen sin la que debería estar debajo [39:30].
  • No cuenta bien: pides ocho personas y salen más. Un modelo razonador solo lo constata después de generar [40:30].

6. Personajes consistentes

De menos a más fiable:

  1. Describir con detalle (edad, pelo, pecas, ojos, complexión) [41:50].
  2. Ponerle nombre dentro de un único chat («Ana») y reutilizarlo [43:00].
  3. Subir una imagen de referencia del sujeto [44:00].
  4. Hoja de personaje: una imagen con cuatro vistas (frontal, perfil izquierdo, perfil derecho, tres cuartos), que subes al empezar un chat nuevo [45:00]. Añade «sin texto» en el negativo para que no ponga etiquetas.

7. Razonar paso a paso

  • Chain of thought: pide que primero analice la referencia, te haga preguntas y solo después genere [46:50].
  • Datos reales (gráficas, resultados): añade «busca información actualizada» para que consulte la web antes de dibujar, y verifica tú los datos [48:30].

8. Grid, storyboard y ángulos

  • Storyboard: de un fotograma inicial, pide una cuadrícula de nueve escenas con mismo estilo, luz y personaje, sin texto [50:00].
  • La cuadrícula pierde resolución: sube el grid a un chat nuevo y pide cada casilla (numerada) a alta calidad [51:30].
  • Sesión de fotos 3×3 con control: defines tú qué cambia en cada casilla (plano, distancia) y todo lo demás queda fijo [52:30].
  • Ángulos y planos: en un solo chat, primero pide que te explique los ángulos o planos y luego que genere el grid. Si solo quieres cambiar el ángulo, di que no varíe el plano [55:00].

9. Productividad

  • Análisis de estilo: sube 5 imágenes, pide a un chat que describa el estilo como experto y reutiliza esa descripción en tus prompts («sigue estrictamente este estilo: …») [57:30]. Sin estilo, el modelo tiende a cuadrar la foto a la altura de los ojos y de frente.
  • System instruction: ese estilo convertido en rol fijo, en Google AI Studio. Pide el texto en Markdown para pegarlo [59:50].
  • Gem o GPT: lo mismo más archivos de conocimiento (producto, paleta, manual de marca, guía oficial de prompts del modelo). Itera las instrucciones probando; el botón de «mejorar prompt» falla a menudo, mejor usar un chat aparte [65:00].
  • No copies las instrucciones de otra persona tal cual: dependen de su producto y de cómo habla al modelo.

10. Imágenes con tu cara

Tres niveles, de más fácil a más profesional [71:00]:

  1. Subir 2-3 fotos tuyas (primer plano y plano medio) al chat, o hacer face swap. La clave es iterar.
  2. Un Gem/GPT con tus fotos como conocimiento (cuantas más y mejor definidas, mejor). Si falla el pelo, añade la instrucción concreta.
  3. Plataforma especializada con personaje propio (mínimo 20 fotos), o un LoRA entrenado (por ejemplo en fal.ai, con coste de entrenamiento) que se usa con modelos que lo admiten [77:30].

Herramientas citadas

  • Generación y edición: Gemini (Nano Banana), ChatGPT, Canva, Ideogram (especialista en texto y logos).
  • Tiempo real: Krea. Documentación: fal.ai, Google DeepMind, OpenAI. Prompts de la comunidad: repositorios de GitHub sobre prompts de Nano Banana. Experimentos: Google Labs.
  • Qué modelo es mejor hoy: Arena (benchmark con votaciones anónimas, por categoría).

Cómo lo uso

Sin uso propio documentado todavía.

Véase también

Referencias

Footnotes

  1. «Crea imágenes con IA y ahorra +30 horas de trabajo (para marketing)». Lorena Bordonaba (Vibe Marketing OS), YouTube, publicado el 2026-03-12. Consultado el 2026-10-02 (transcripción). ↩