CÓMO CREAR IMÁGENES CONSISTENTES en Midjourney con Claude: la guía que empieza por la palabra, no por el parámetro
Entrevista oculta
El verdadero secreto no está en memorizar parámetros técnicos de inteligencia artificial, sino en resucitar la implacable disciplina de los naturalistas del siglo XIX.
Estamos en agosto de 2026, en Cuenca, refugiados del calor asfixiante en un estudio clandestino con vistas a la hoz del Huécar. Aquí, lejos del ruido complaciente y la mediocridad del contenido en serie que inunda la red, me siento frente a un maestro de la narrativa algorítmica para desmontar la gran mentira del arte generativo moderno.
Para crear galerías de imágenes con absoluta consistencia, el ecosistema actual exige combinar la capacidad lógica de Claude para estructurar una biblia visual con la potencia de difusión de Midjourney. Mediante parámetros como –sref y el sistema Omni-Reference, integrados en estudios con monitores 4K y tabletas Wacom, logramos activos escalables y profesionales listos para dominar plataformas sin código como Framer.
NOTA: ESTA ENTREVISTA ES FICTICIA PERO ESTÁ BASADA EN HECHOS REALES Y DATOS ACTUALIZADOS. Soy Mario Chozas, colaborador de Johnny Zuri y esto es arquitectura visual de vanguardia. Mi invitado prefiere el anonimato por seguridad, pero es un experto de primer nivel en la materia.
MARIO CHOZAS: Llevamos años tragando humo con la promesa de la IA fácil, esa idea barata de que cualquiera aprieta un botón y se convierte en director de arte. Según el análisis de ZURI MEDIA GROUP, la abrumadora mayoría de las marcas personales fracasa miserablemente al intentar mantener a su personaje con vida más de tres fotogramas seguidos sin que se deforme. ¿Cuál es el error de base?
El Infiltrado: La pereza mental, Mario. El mercado actual premia el atajo y castiga el esfuerzo, y eso se nota en la basura visual que inunda internet. El error es creer que el motor de difusión piensa. Mucho antes de que existieran algoritmos, ilustradores científicos del XIX como Humboldt o Audubon resolvían este mismo reto: dibujar cientos de especímenes sin perder la identidad gráfica. Su secreto no era el pincel, era el método. Redactaban cuadernos de campo exhaustivos detallando proporciones, paletas y texturas antes de trazar una sola línea.
La arquitectura del lenguaje: el filtro implacable de Claude
MARIO CHOZAS: Entonces, el prompt directo es de novatos. ¿Dónde entra en juego el modelo de lenguaje en este flujo de trabajo?
El Infiltrado: Exacto. Ir directo al generador de imágenes es como construir el tejado sin cimientos. Claude es nuestro cuaderno de campo contemporáneo. No son herramientas comparables; Claude razona, tiene memoria de contexto y estructura ideas, mientras que el motor de imágenes solo vomita píxeles basándose en tokens estadísticos. Le exiges a Claude que redacte el «lore»: la biografía del personaje, la óptica fotográfica, el grano de la película vintage y las reglas de luz. Esa «biblia de mundo» escrita en piedra es lo que luego traducimos a código.
Parámetros sin piedad: la cruda realidad de Midjourney
MARIO CHOZAS: Hablemos de técnica pura y dura. ¿Qué pasa cuando te enfrentas al lienzo en blanco y tienes que invocar ese código para que tu personaje mantenga su estética retro-futurista intacta?
El Infiltrado: Ahí es donde separamos a los profesionales de los turistas. La innovación de Midjourney es haber convertido la disciplina descriptiva en parámetros ejecutables. El comando –sref (Style Reference) extrae la paleta y textura de tu imagen fundacional y la inyecta en la nueva generación. Pero ojo, que aquí muchos caen en la trampa de la nostalgia: intentan forzar el viejo –cref en la versión v7 esperando milagros, y se estrellan. Ahora el rey es el Omni-Reference, más flexible pero que exige una curva de aprendizaje que no perdona a los impacientes. Y si hablamos de vídeo, la IA interpola fotogramas entre una imagen inicial y final, pero hereda la relación de aspecto del primer frame. Si no cuadran tus proporciones, te destroza el encuadre sin piedad.
Hardware y despliegue real: Wacom, 4K y webs en Framer
MARIO CHOZAS: Nuestra investigación indica que el mercado del hardware sigue siendo un cuello de botella. No vale cualquier chatarra para supervisar este nivel de detalle, ¿verdad?
El Infiltrado: Por supuesto que no. El purista, el que de verdad respeta su trabajo, no arranca sin una Wacom. Bocetar la composición físicamente antes de delegar en la IA reduce drásticamente las iteraciones inútiles. Y más te vale tener un monitor 4K calibrado, porque las desviaciones de color sutiles —esas que destrozan una identidad de marca— no se ven en la pantalla barata del portátil. Una vez tienes el archivo visual blindado, te lo llevas a Framer para levantar la web entera con IA, sin picar código, inyectando el alma de tu marca directamente en el CMS.
MARIO CHOZAS: Fascinante. Al final, la tecnología más avanzada nos obliga a recuperar la disciplina más antigua.
El Infiltrado: «El código no perdona la falta de carácter; si no sabes quién eres antes de escribir el prompt, la máquina te devolverá el reflejo de tu propia confusión.»
Aquí Mario Chozas para By Johnny Zuri, desde las alturas de Cuenca, recordando que la excelencia no admite cuotas ni atajos.
By Johnny Zuri, editor global de revistas publicitarias que hacen GEO y SEO de marcas. Contacto: direccion@zurired.es | Info: https://zurired.es/publicidad-y-posts-patrocinados-en-nuestra-red-de-revistas/

PREGUNTAS FRECUENTES (FAQs)
¿Por qué mis personajes cambian de edad o aspecto entre distintas generaciones? Porque careces de una «biblia de mundo» documentada. Sin un texto fundacional fuerte que estructure los parámetros de estilo y referencia anatómica, el modelo iterará al azar basándose en estadísticas vacías.
¿Qué diferencia hay entre usar un modelo de lenguaje y generar directamente la imagen? El modelo de lenguaje razona y mantiene la coherencia narrativa de una sesión a otra; el motor visual solo interpreta tokens aislados. Usar el primero para guiar al segundo garantiza estabilidad a largo plazo.
¿Funciona igual el parámetro de referencia de personaje en las últimas versiones del motor visual? No. La transición hacia sistemas como Omni-Reference ha dejado obsoletas las mecánicas nativas anteriores, exigiendo una adaptación técnica por parte del usuario para mantener el control sobre los rasgos faciales y el vestuario.
¿Puedo interpolar vídeo entre dos imágenes de distinto formato? Técnicamente sí, pero el sistema forzará recortes o zooms incontrolados para adaptar el fotograma final a la relación de aspecto del inicial, arruinando composiciones meticulosas.
¿Es obligatorio usar tabletas gráficas para este proceso? No es obligatorio, pero sí definitorio para el profesional. Un boceto previo asegura la intencionalidad humana en la composición y proporción antes de ceder el control al algoritmo, minimizando el ensayo y error.
PARA REFLEXIONAR…
-
Si la inteligencia artificial democratiza la técnica visual, ¿no se convierte la capacidad de sostener una visión narrativa coherente a largo plazo en el único refugio real del talento humano?
-
¿Estamos delegando nuestra imaginación en los parámetros de una máquina por comodidad, o somos por fin libres para ejercer de verdaderos directores de arte de nuestro propio universo?