«La inteligencia artificial es la nueva electricidad» – Andrew Ng
Nos encontramos ante una revolución en el panorama creativo. El poder de la Inteligencia Artificial Generativa ha logrado una asociación perfecta y dinámica entre el ingenio humano y la gran capacidad de las máquinas.
Pero ¿a qué se debe este poder? A la arquitectura y funcionamiento de sus modelos.
En este post encontrarás una sencilla y accesible introducción a tres de los modelos de redes neuronales que están detrás de la IA Generativa: GAN, VAE y Transformer.
Tabla de Contenidos
¿Qué hace única a la Inteligencia Artificial Generativa?
La Inteligencia Artificial Generativa es una rama de la de IA que se enfoca en permitir que las máquinas produzcan contenido nuevo y completamente original. Para ello, emplea modelos de redes neuronales artificiales diseñados para aprender de enormes conjuntos de datos.
Pero vamos por partes. Primero debemos entender que los modelos de IA son programas computacionales que buscan replicar a la inteligencia humana. Existen modelos con diversas estructuras, una de ellas son las redes neuronales artificiales.
Los modelos de redes neuronales artificiales también son programas computacionales, pero con una estructura interna inspirada en el cerebro humano, que emulan cómo procesamos la información.
Así como nuestro cerebro cuenta con miles de millones de neuronas que procesan la información, estos modelos también cuentan con miles o millones de pequeñas unidades de procesamiento (nodos que simulan las neuronas) que se interconectan y se encuentran ordenadas por capas.
Esto lo puedes visualizar en la siguiente imagen, que es una representación simple de lo que es una red neuronal. Allí se observan que los nodos (círculos de colores) se encuentran ordenados en capas: la primera capa que recibe los datos (capa amarilla), la última capa de salida que produce la respuesta (capa verde).

Fuente: https://deeplizard.com/lesson/ddd1riadlz
Entre estas dos capas pueden existir una o muchas capas ocultas para el procesamiento de la información. Los datos de entrada fluyen desde la primera capa hasta la de salida, pasando por las capas ocultas.
Para esto, mediante operaciones matemáticas, cada nodo procesa internamente los datos que recibe de los nodos anteriores. Después, envía los resultados a los nodos siguientes. Como se ve gráficamente en la imagen siguiente.

Fuente: https://deeplizard.com/lesson/ddd1riadlz
¿Cómo aprenden estas redes? A través de un proceso de entrenamiento, en el que reciben una gran volumen de datos (input), que pueden ser textos, imágenes, archivos de voz, conjuntos de texto-imagen, etc. Después los analizan, detectan patrones y características y establecen relaciones entre dicho datos.
Todos estos patrones y relaciones son utilizados por los mismos modelos para generar contenido nuevo, original y completamente coherente con lo que solicite el usuario, como textos, música, imágenes y vídeos. Pero no imitan los patrones ni replican datos.
- Por ejemplo, un modelo de Inteligencia Artificial Generativa puede ser entrenado con fotografías de rostros humanos. El modelo analizará las imágenes e identificará las características, patrones, detalles y matices. Después, a petición del usuario, el modelo es capaz de producir una imagen con un rostro humano que no se parecerá a ninguna persona en este planeta.


Imágenes de rostros humanos creados con el modelo Dall-E 3 de Inteligencia Artificial Generativa
Algunos modelos que utiliza la IA Generativa
“La tecnología es importante, pero lo único que realmente importa es qué hacemos con ella” – Muhammad Yunus
Entre los modelos más utilizados por la Inteligencia Artificial Generativa para procesar la información y crear contenido diverso están: GAN, VAE y Transformer. Cada uno presenta un funcionamiento distinto para crear contenido nuevo y realista a partir de datos existentes y cada uno tiene un talento especial.
Es decir, que el rostro creado por el modelo no coincidirá con ninguna de las fotografías que sirvieron de entrenamiento. Esto es lo que hace única a la IA Generativa, el ir más allá de replicar datos y enfocarse en crear contenido único y novedoso.
Las redes generativas adversarias GANs (Generative Adversarial Networks)
Las redes generativas adversarias (GANs) conforman un modelo que basa su funcionamiento en dos redes neuronales que interactúan y compiten entre sí. Una red intenta crear nuevos resultados que parezcan reales (red denominada Generator), mientras la otra red neuronal controla esos resultados, intentando distinguir lo real de lo falso (red Discriminator).
Este funcionamiento es parecido a la relación entre un falsificador de arte y un perito conocedor de obras de arte que se encarga de distinguir lo auténtico de las imitaciones.
- La red generadora crea una muestra y se la envía a la red discriminadora.
- La red discriminadora, como buen perito de arte, intenta descubrir la falsificación. Para lograrlo, analiza el contenido que ha creado el generador y le otorga una puntuación que refleja cuán realista parece.
De este modo, las dos redes que conforman el modelo GANs se retroalimentan, van aprendiendo y mejorando sus capacidades. Así como la red Generator mejora su habilidad para generar contenido “realista”, la red Discriminator también incrementa su capacidad para detectar “falsificaciones”
Esta interacción se repite hasta que en el modelo se alcanza un punto de equilibrio, el generador produce un contenido tan realista que al discriminador se le hace imposible reconocerlo y duda el 50% sobre su veracidad.
Las aplicaciones más usuales de estas redes son las siguientes:
- Generar imágenes de rostros humanos falsos.
- Convertir una fotografía en dibujo o en otros estilos de imagen (traducción de imagen a imagen).
- Generar imágenes a partir de texto (traducción de texto imagen).
- Reconstruir imágenes borrosas o dañadas.
- Envejecer rostros.
- Generar un vídeo de una persona bailando a partir de una imagen estática.
- Generar objetos 3D a partir de imágenes 2D, como en los videojuegos.
También se aplican en la traducción o el resumen de textos y en la generación de historias. Aunque presentan algunos desafíos.

fuente: https://www.slideshare.net/ssuser5ac863/gan-77392547
Los Autocodificadores Variacionales VAE (Variational Autoencoders)
Los VAE también son modelos de redes neuronales que pueden partir de datos para generar textos, imágenes y sonidos. Estos modelos basan su funcionamiento en el concepto de que los datos tienen una distribución probabilística, es decir, que en un conjunto de datos hay ciertos valores más probables que otros.
Por ejemplo, en una pintura es más probable que aparezca un cielo azul que uno verde.
Los modelos VAE aprenden esta distribución probabilística a partir de los datos que se le proporcionan. Después, generan nuevo contenido siguiendo esa distribución. En esta operación también utilizan dos redes neuronales conectadas:
Una red codificadora que toma los datos, extrae los elementos esenciales y los codifica para construir un espacio con ellos (espacio latente). Además, una red decodificadora que, a partir del código, reconstruye los datos y los modifica, generando muestras que se asemejen a la información original.

fuente:https://www.mathworks.com/help/deeplearning/ug/train-a-variational-autoencoder-vae-to-generate-images.html
- Por ejemplo, si el modelo recibe un conjunto de imágenes de pinturas al óleo. Toda la información esencial de los datos es extraída y codificada, creando una distribución de datos que muestre las características posibles (como colores, estilos, temáticas, etc.).
- Después, el modelo utiliza el código para reconstruir los datos, tratando de que sean lo más fieles posibles a las pinturas originales. Así el modelo verifica que ha captado bien los rasgos distintivos de cada pintor.
- Finalmente, el modelo puede crear obras de arte que no existen, pero que se inspiran en las reales. Para esto sigue utilizando el código, pero modifica algunos aspectos al azar.
Entre las principales aplicaciones de estos modelos de Inteligencia Artificial Generativa se encuentra:
- La mejora de la calidad de imágenes.
- La generación de rostros.
- la generación de música original, a partir de una secuencia de notas.
Estos modelos también se utilizan en la traducción de texto, el resumen de contenido y en la narración de historias. Sin embargo, tienen problemas con la semántica compleja.
La arquitectura Transformer
La arquitectura Transformer también utiliza una red codificadora y una decodificadora. Cada una de estas redes se compone de una serie de capas. Las capas codificadores se encargan de extraer características de una secuencia de datos de entrada, mientras que las capas decodificadoras utilizan estas características para generar una secuencia de datos de salida.
Para hacer todo esto, la codificación y la descodificación, el Transformer emplea diversos mecanismos.
Por ejemplo, su arquitectura se basa en el mecanismo de atención. Lo que significa que el modelo asigna una mayor importancia a ciertas partes específicas de los datos de entrada, con el fin de extraer el significado del contexto.
De esa forma, el modelo puede comprender los diferentes significados de una palabra.
Por ejemplo, la palabra “planta” puede significar un organismo vegetal, una parte del cuerpo o una instalación industrial. Para distinguir entre cada uno de estos significados, el modelo Transformer enfoca su atención a las demás palabras que acompañan a “planta” en la oración.
- En “regué la planta del jardín”, el modelo asigna mayor peso de atención a la palabras “regué” y “jardín”, que le indican que la palabra “planta” se trata de un organismo vegetal.
- En “ella se lastimó la planta del pie”, el modelo asigna mayor peso de atención a los términos “lastimó” y “pie”, que le ayudan a comprender que la palabra “planta” se refiere a una parte del organismo.
Por supuesto, el modelo puede calcular diferentes pesos para un mismo elemento (palabra), según la cantidad de relaciones que guarde con otros términos. Esto ayuda al modelo a entender qué términos se relacionan con cada palabra.
- Por ejemplo, el modelo entiende que la palabra “río” puede estar relacionada con la corriente natural del agua (El río desciende hasta el valle) o con la forma conjugada del verbo reír (Yo me río con facilidad).

Fuente https://proceedings.neurips.cc/paper_files/paper/2017/file/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf
Las redes con arquitectura Transformers convierten las palabras del texto de entrada en vectores numéricos. Estos vectores se almacenan en un espacio multidimensional, donde los pesos asignados determinan su proximidad con otros vectores. De esta forma, el modelo identifica las relaciones entre las palabras.
Los modelos Transformadores evolucionaron el Procesamiento del Lenguaje Natural. Son los utilizados por los modelos GPT que impulsan a ChatGPT. Entre sus aplicaciones están la traducción automática de textos, la generación de texto creativo a partir de solo una pequeña frase y la traducción de códigos fuentes entre diversos lenguajes de programación.
La IA Generativa tiene un potencial inimaginable. Definitivamente, es un campo que trasciende los datos y se aventura a explorar los territorios de la creatividad y la originalidad.
Ahora queda una interrogante, ¿cómo podemos los seres humanos distinguir entre un contenido original y la imitación en las obras generadas por la Inteligencia Artificial Generativa? Déjanos tu comentario.
Otros artículos que te pueden interesar:
Los Grandes Modelos de Lenguaje: un mundo más allá de las palabras Procesamiento del Lenguaje Natural: La clave de la comunicación entre humanos y máquinas La magia de la Inteligencia Artificial Generativa: cómo transformar tus ideas en realidad La historia de OpenAI El secreto de ChatGPT: ¿cómo funciona? ¿Por qué entiende el lenguaje natural? ChatGPT: un potente modelo de lenguaje




