Volver al LAB
Retrato emergiendo del ruido, ilustrando un modelo de difusión
Artículo

Cómo funciona la generación de imágenes con IA

Lo que expliqué a 130 arquitectos y diseñadores sobre GANs, difusión, ControlNet y los tres parámetros que explican casi todos los resultados raros.

En agosto de 2025 di una charla a más de 130 arquitectos y diseñadores sobre cómo funciona la generación de imágenes con IA. Un año después, casi todo lo que mostré sigue vigente. Esta es la versión escrita.

Cada semana sale un modelo nuevo y cada semana alguien me pregunta cuál usar. Mi respuesta no cambia: entiende los principios y la pregunta se contesta sola. Son pocos: redes que aprenden a transformar ruido en imágenes, tres parámetros que controlan qué tan literal es el resultado, y modelos auxiliares que cuidan la geometría. Saber eso separa pedirle “hazme un render bonito” a una IA y frustrarse, de saber exactamente qué pedir, con qué herramienta, y por qué falló cuando falla.

Escribo esto desde la práctica, no desde el laboratorio: estos son los conceptos que tuve que aprender para construir Kou, el asistente de Kouzee, y los que más me sirvieron para explicárselos a gente que diseña espacios y no quiere convertirse en ingeniera de prompts.

Para qué entenderlo si todo cambia cada semana

Porque la tecnología cambia y las bases permanecen. Los modelos nuevos se montan sobre los mismos principios que vienen acá abajo, igual que el BIM se montó sobre la lógica de los planos sin reemplazar al arquitecto. En cada salto del oficio —del tablero al CAD, del CAD al BIM— lo importante nunca fue la herramienta, sino cómo se usó.

Y hay una razón más práctica: el vocabulario. Cuando todos sabemos qué es una planta, un corte y una elevación, pedir cambios es fácil. Con la IA pasa lo mismo. Saber qué es una seed, un modelo de difusión o un ControlNet te permite pedir lo que quieres en vez de describir “el cosito que hace la cosa”, como en la ferretería.

Qué tipos de modelos generan imágenes

GANs: un pintor y un juez

Evolución de un rostro generado por una GAN: de una imagen difusa a un retrato cada vez más definido
Los primeros rostros generados: borrosos al principio, hiperrealistas después.

Las GANs (2014) fueron los primeros modelos que inventaron imágenes nuevas y coherentes. Funcionan con dos redes que compiten: una “pinta” a partir de ruido aleatorio y otra critica —“esa imagen es falsa”— hasta que la primera logra engañarla. Así nacieron los primeros rostros generados, chicos y borrosos al principio, hiperrealistas después con modelos como StyleGAN. El paper original de Goodfellow y su equipo es el punto de partida de todo lo que vino después.

Transformers: construir con LEGO

Rostro generado por parches: de bloques de píxeles gruesos a la imagen completa, como piezas de un puzzle

Usan la misma arquitectura que los modelos de texto como GPT o Claude, pero aplicada a imágenes: dividen la imagen en parches (tokens visuales) y la construyen pieza a pieza, prediciendo el siguiente parche como un puzzle. Durante años fueron menos comunes que la difusión para imagen fija, pero dominan en video y en los modelos multimodales que hoy generan imagen y texto desde el mismo lugar.

Difusión: sintonizar la TV

Un retrato emergiendo del ruido: el proceso de un modelo de difusión, de la estática a la imagen nítida
De puro ruido a imagen, paso a paso.

Los modelos de difusión —Stable Diffusion, Midjourney, DALL·E, Flux— son los más usados hoy. Se entrenan al revés: toman fotos reales y les agregan ruido hasta destruirlas; luego aprenden el proceso inverso. Al generar, parten de puro ruido y lo “limpian” paso a paso hasta que aparece la imagen, como mover la antena hasta que se sintoniza el canal. La idea viene del paper DDPM de 2020; el salto masivo llegó cuando Stable Diffusion la hizo correr en espacio latente, mucho más barato, y la liberó como código abierto. Eso explica la explosión creativa desde 2022.

Controladores: el libro para colorear

Seis mapas de control de ControlNet: profundidad, bordes, pose humana, segmentación, normales y líneas de perspectiva
Seis mapas de control: profundidad, bordes, pose, segmentación, normales y perspectiva.

ControlNet y LoRA no generan por sí solos: guían a los modelos grandes para que no se salgan de las líneas, como un libro para colorear. Son la razón de que una IA pueda respetar tu proyecto en vez de inventarse otro. Los mapas de control que más uso en interiorismo:

  1. Profundidad: qué va adelante y qué va atrás, clave para que luces y sombras caigan bien.
  2. Contornos y bordes: preservan geometría y escala; nada se deforma.
  3. Pose humana: un esqueleto de referencia para generar personas en la postura exacta.
  4. Segmentación: aísla zonas para cambiar un material sin tocar el resto.
  5. Normales: simulan cómo llega la luz según si la superficie es rugosa, lisa o brillante.
  6. Líneas de perspectiva (MLSD): el más importante para arquitectura interior. Mantiene el layout y la perspectiva del espacio.

Los LoRA, por su parte, se entrenan para volverse expertos en un objeto específico —tu silla, tu botella, tu luminaria— y cuidan que ese producto salga fiel mientras el modelo general resuelve la escena. Si quieres el detalle técnico: el paper de ControlNet (2023) y el de LoRA (2021), que nació para modelos de texto y se terminó usando en todo.

Seed, CFG y pasos: los tres parámetros que explican los resultados raros

Seed: pedir que te atienda Pedro

Dos retratos generados con el mismo prompt pero distinta seed: misma descripción, persona distinta
Mismo prompt, distinta seed: misma descripción, otra persona.

La seed es el número que define el punto de partida del ruido. Mismo prompt + misma seed = la misma imagen; cambias la seed y la “mujer de pelo castaño, retrato 50 mm” sigue cumpliendo la descripción, pero es otra persona. Si alguna vez pediste “la misma casa nórdica pero en otro paisaje” y te llegó una casa completamente distinta, fue esto: nadie controló la seed. Es como volver a una oficina y preguntar si está Pedro, porque Pedro ya sabe cómo atenderte.

CFG: el GPS de la creatividad

El mismo retrato con CFG 12 y CFG 3: a menor guidance, más libertad creativa del modelo
CFG 12 contra CFG 3: obediencia total o libertad creativa.

Controla qué tan literal es la IA con tu prompt. Bajo: más libertad creativa. Alto: obediencia total, con el riesgo del “genio de los deseos”: pides “un cuadro sobre la mesa” y te lo pone literalmente encima de la mesa en vez de colgarlo en la pared. El sentido común de la IA vive en este parámetro. La técnica se llama classifier-free guidance y es tan simple como elegante: el modelo genera con y sin tu prompt y exagera la diferencia.

Pasos: manos de pintura

El mismo retrato con 50 y 15 pasos de refinamiento: menos pasos, menos detalle y definición
50 pasos contra 15: menos pasos, menos detalle.

Cuántas iteraciones hace el modelo para refinar la imagen desde el ruido. Pocos pasos: rápido pero borroso —la oreja mal definida, la uña que falta—. Muchos: más detalle, más espera. Como pasar varias manos de pintura. Los modelos más nuevos necesitan muchos menos pasos que los de 2023, pero la lógica sigue siendo la misma.

Qué métodos vas a usar a diario

Sofá capitoné de cuero café generado desde texto sobre fondo blanco
Text-to-image: “un sofá capitoné de cuero café en fondo blanco”.
  1. Text-to-image: escribes y la IA genera. “Haz un sofá capitoné de cuero café en un fondo blanco” produce exactamente eso.
  2. Image-to-image: subes una imagen y pides modificarla. Es el método central del flujo de diseño.
  3. Inpainting / outpainting: con una máscara modificas solo un pedacito (cambiar la cortina sin que aparezca un sofá de la nada) o extiendes la imagen más allá de sus bordes.
  4. Imágenes de referencia y transferencia de estilo: “quiero mi render con este estilo” —acuarela, croquis, una pintura—.
  5. Multimodal: los modelos más nuevos entienden texto e imagen de forma nativa, sin traducir entre herramientas. Se sienten más como un colaborador que como una herramienta aislada.

El salto de calidad en interiorismo está en combinar estos métodos con los controladores. Un ejemplo real de la charla: un fotomontaje 2D hecho con productos del catálogo se convierte en fotografía con profundidad, luces y sombras, sin perder un solo producto ni un centímetro de geometría:

Comparación entre un fotomontaje 2D de un dormitorio y la fotografía realista generada preservando todos los productos
Del fotomontaje a la foto: mismos productos, misma geometría.

Por qué un chat generalista te cambia los productos

Porque genera una imagen completamente nueva, píxel por píxel, interpretando la anterior. En la charla hicimos la prueba: el mismo fotomontaje procesado por un chat generalista volvió con otra lámpara, un velador flotante convertido en mueble de piso y un espejo distinto. Para un diseñador eso es fatal: si le pasaste al cliente el link de compra, la imagen ya no corresponde al producto.

Un flujo especializado —modelo + segmentación + profundidad + perspectiva— preserva cada pieza, porque hay controladores dedicados a que nada se salga de los límites. Ese fue el problema que más tiempo me tomó en Kouzee, y lo cuento con más detalle en lo que aprendí construyendo Kou: cada botón lleva preconfigurados el modelo, los controladores y los parámetros correctos para cada tarea, para que nadie tenga que ajustar seeds ni CFG a mano.

Preguntas que me hacen siempre

¿Necesito un computador potente?

No necesariamente. Los modelos pueden descargarse y correr localmente, pero exigen tarjetas gráficas grandes; por eso casi todos los servicios generan en servidores externos y tú solo envías la petición. Para el uso profesional típico, basta cualquier computador con navegador.

¿Por qué la IA “inventa” cosas que no pedí?

Casi siempre es una combinación de CFG (qué tan literal es), falta de máscara (modificó más de lo que querías) o una seed sin controlar (cambió el punto de partida). Los agentes además interpretan de forma literal: si pones un banco flotando en el fotomontaje, saldrá un banco flotando.

¿Qué modelo debería usar?

Depende de la tarea, no de la moda: difusión para imágenes desde texto o referencia, controladores cuando la geometría importa, multimodales para flujos conversacionales. La estrategia sana es probar, comparar, y usar herramientas que ya traigan los ajustes correctos para tu caso.

Por dónde empezar

Toma una foto o un render de tu último proyecto y prueba tres cosas: cambiar un material con una máscara, borrar un objeto y pedir una variación controlando la referencia. Con esos tres ejercicios vas a entender más que con horas de tutoriales.

Newsletter

Ideas y aprendizajes, una vez al mes.