«Cualquier tecnología suficientemente avanzada es indistinguible de la magia.» – Arthur C. Clarke.
Te has preguntado alguna vez ¿cómo ChatGPT o el chat de Bing pueden crear textos que nos sorprendan, nos informen o nos diviertan? La respuesta la encuentras en los Grandes Modelos de Lenguaje.
En este post entraremos en el mundo de los Grandes Modelos de Lenguaje. Te explicamos qué son y cómo logran que las máquinas se comuniquen con las personas de manera natural y fluida. ¡Como un ser humano!
Tabla de Contenidos
¿Qué son los Grandes Modelos de Lenguaje?
Para responder a esta pregunta, primero definamos qué es un modelo. En el mundo de la tecnología, los modelos son algoritmos, sistemas o programas informáticos que permiten representar un comportamiento en particular.
Por ejemplo, los simuladores de vuelo son modelos impulsados por la Inteligencia Artificial para recrear el entorno de una aeronave durante su pilotaje. También hay modelos que emulan los patrones climáticos o los del tráfico.
De esta misma forma, hay modelos que recrean las distintas tareas que realizamos a diario mediante nuestro lenguaje, como comprender y resumir textos, responder a una pregunta, buscar palabras y generar contenido completamente original. A estos modelos se les denomina modelos de lenguaje.
¿Cómo aprenden a trabajar estos modelos? De manera general, aprenden a partir de conjuntos de datos. Son sometidos a una fase de entrenamiento en el que se les introduce una determinada cantidad de datos, para que el modelo extraiga parámetros e información y pueda recrear internamente toda la estructura del lenguaje.
Así, ante una nueva instrucción del usuario, el modelo se basa en todo lo que aprendió con los datos para generar contenido nuevo, traducir, resumir, analizar textos, etc. Por esto, los modelos de lenguaje son empleados en aplicaciones de Procesamiento del Lenguaje Natural, en el que el usuario realiza una pregunta y el programa responde.
Además, están los Grandes Modelos de Lenguaje, que son el objetivo de este artículo.
- Los Grandes Modelos de Lenguaje, o Large Language Models LLM, son modelos de lenguaje avanzados. También son programas impulsados por la Inteligencia Artificial, capaces de comprender, analizar y generar texto, entre otras tareas asociadas con el lenguaje. Pero su principal característica es que están entrenados con grandes conjuntos de datos en formato de texto. Por esto se denominan “grandes”.
Por lo tanto, en comparación con los modelos de lenguaje, los Grandes Modelos de Lenguaje han recibido mayor información para reconocer, comprender e interpretar el lenguaje humano. En consecuencia, están más capacitados para comunicarse con nosotros.
Por ejemplo, el modelo GPT-4 de OpenAI está entrenado con enormes volúmenes de datos recopilados de internet, bibliotecas y diversas plataformas, lo que equivale a 570 GB de datos en formato texto. Por eso, es capaz de generar contenido novedoso. Para muestra, la siguiente imagen.

¿Cómo funciona un Gran Modelo de Lenguaje?
«Lo que hace la nueva tecnología es crear nuevas oportunidades para realizar el trabajo que los clientes quieren que se haga«. – Tim O’Reilly
Como mencionamos, los Large Language Models LLM cuentan con una estructura interna que les permite comprender y generar texto. A esta arquitectura le llamamos, principalmente, redes neuronales Transformers. Es la que se esconde tras ChatGPT.
La arquitectura Transformer está compuesta por capas que trabajan en conjunto para procesar la información. Exactamente, descifran el texto que reciben y generan un flujo de texto de salida. Para esto, emplean y conjugan diversos métodos. Pero existen dos técnicas claves que impulsan a los Grandes Modelos de Lenguaje: la autoatención y la codificación posicional.
Mecanismo de autoatención
La autoatención es una técnica que permite a un modelo Transformer aprender las relaciones entre los elementos de una secuencia de datos de entrada. Por ejemplo, le ayuda a comprender al modelo las relaciones entre las palabras de una misma oración.

fuente: https://mark-riedl.medium.com/a-very-gentle-introduction-to-large-language-models-without-the-hype-5f67941fa59e
El modelo se enfoca en los términos más importantes de una frase y calcula sus relevancias (pesos), teniendo como base las posiciones y características de dichos términos dentro del texto. De esta forma, logra entender el contexto y establecer relaciones entre las palabras, para después utilizarlas correctamente en la generación de texto, en la traducción de idiomas, en el resumen de contenido, etc.
Por ejemplo,:
- En la frase “ella se puso el vestido que le gustaba hasta que se rompió”. El modelo comprender que “se” se refiere al vestido.:
Mientras que, en la oración
- “ella se puso el vestido que le gustaba hasta que se cansó”. El modelo entiende que “se” refiere a ella”.
Esta arquitectura Transformer emplea el mecanismo de autoatención en dos operaciones:
- En el procesamiento del texto de entrada, para representar cada palabra o fragmento de palabra (tokens) en vectores numéricos y establecer la relación entre cada uno. (ejecutado por el codificador del modelo).
- En la generación de texto de salida. Llevada a cabo por un decodificador. Éste toma los vectores creados por el codificador y los transforma en el texto de salida. Pero ¿cómo sabe qué palabras son las correctas para generar la salida? Utiliza el mecanismo de atención de dos formas:
- Para enfocarse sólo en el texto que ha generado hasta el momento, obviando el contenido que no ha creado aún. De esta forma, el modelo se puede concentrar en cómo se relaciona la palabra que está procesando, en ese momento, con el contenido que ya ha generado.
- Para detectar las palabras más relevantes del texto de entrada (que ha procesado el codificador), para el contenido que debe generar.

fuente: https://www.nvidia.com/en-us/glossary/data-science/large-language-models/
Codificación Posicional o Positional Encoding
Cuando un modelo con arquitectura Transformer procesa los datos de entrada, no lo hace de forma secuencial. Este modelo recibe todos los textos de entrada de una sola vez.
Por ejemplo, cuando lees un libro vas “absorbiendo” una palabra tras la otra. Ahora imagina que millones de palabras del libro entran juntas y súbitamente a tu cerebro. De igual forma, el modelo recibe al mismo tiempo millones de términos.
- Pero ¿cómo sabe la posición de cada término dentro del texto para poder comprender el contexto de los datos? Recuerda que es imprescindible que el modelo conozca la posición de cada término para enfocarse en los más importantes y establecer relaciones entre ellos. Aquí es donde emplea la Codificación Posicional, o Positional Encoding.
De manera formal, el Positional Encoding es una técnica que emplea el modelo para preservar el orden y la relación entre las palabras de un texto de entrada no secuencial.
Como dijimos, en la fase de entrada del texto, cada palabra o fragmento de palabra se convierte en un vector numérico. Pero como el texto se procesa todo en conjunto, el modelo genera un vector que representa la posición de cada palabra en la frase, pero empleando codificación binaria.
Por ejemplo, en la siguiente imagen se observa que la palabra “es” ocupa la posición 3 dentro de la frase.
- Pero, en lugar de agregar el vector [ 3 3 3 … 3 3 3 3], la Codificación Posicional genera el vector posicional [ 0 0 0 … 0 0 1 1]. (3 es 11 en números binarios).

fuente: https://www.youtube.com/watch?v=xi94v_jl26U
Después, en el conjunto ordenado de vectores posicionales se crean patrones que se asocian a diferentes frecuencias matemáticas, de senos y cosenos. Por lo tanto, el modelo puede emplear funciones sinusoidales para calcular la codificación que indica la posición de cada palabra en el texto de entrada.
Ahora, vale la pena preguntarnos ¿qué habilidades y competencias se requieren para aprovechar al máximo el potencial de los Grandes Modelos de Lenguaje en diferentes ámbitos profesionales?
Como prompt Engineer te guío paso a paso para utilizar esta tecnología en tus propios proyectos. Si deseas asesoría, rellena el formulario y hablemos.
Otros artículos que te pueden interesar:
3 modelos de redes neuronales que necesitas conocer para entender la IA Generativa Procesamiento del Lenguaje Natural: La clave de la comunicación entre humanos y máquinas La magia de la Inteligencia Artificial Generativa: cómo transformar tus ideas en realidad La historia de OpenAI El secreto de ChatGPT: ¿cómo funciona? ¿Por qué entiende el lenguaje natural? ChatGPT: un potente modelo de lenguaje




