Una máquina que asigna probabilidades al lenguaje
Un modelo de lenguaje estima qué unidades de texto son probables dado un contexto. En su forma generativa, recibe una secuencia y calcula una distribución para el siguiente token; añade uno, vuelve a calcular y continúa. Los tokens pueden ser palabras, partes de palabra, signos o espacios, según el vocabulario. Repetir esta operación produce párrafos que respetan muchas regularidades de gramática, estilo y conocimiento presentes en los datos. La fluidez no demuestra una mente humana detrás: el sistema aprende relaciones estadísticas de enorme complejidad y puede generar una frase plausible aunque su contenido sea falso.
Los modelos existen desde antes del aprendizaje profundo. Un modelo de n-gramas cuenta secuencias cercanas; las redes neuronales aprenden representaciones más flexibles. Los grandes modelos actuales amplían escala, datos y capacidad, pero mantienen la idea fundamental de estimar lenguaje condicionado por lo anterior y por instrucciones añadidas.
De fragmentos de texto a posiciones matemáticas
El tokenizador divide la entrada. Una palabra frecuente puede ocupar una unidad; otra rara, varias. Por eso el número de tokens no coincide con el de palabras y cambia entre idiomas. Cada token se convierte en un vector, una lista de números aprendida. En ese espacio, usos relacionados adquieren patrones parecidos sin que una coordenada aislada signifique «animal», «pasado» o «ironía».
El modelo combina esos vectores capa tras capa. También necesita información de posición, porque «el perro muerde al hombre» no equivale a invertir el orden. Las representaciones finales dependen del contexto: la misma palabra puede terminar con vectores distintos en «banco del parque» y «banco central». Esa contextualización es una de las ventajas frente a diccionarios estáticos.
Qué hace la atención de un Transformer
La arquitectura Transformer, presentada en 2017, permite que cada posición combine información de otras mediante atención. Para cada token se calculan consultas, claves y valores; la compatibilidad entre consultas y claves determina cuánto pesan los valores. Varias cabezas pueden captar relaciones distintas. No significa que la red «preste atención» con conciencia ni que cada cabeza tenga una interpretación humana estable.
La atención facilita procesar secuencias en paralelo durante el entrenamiento, pero su coste crece con la longitud en la versión completa. La ventana de contexto limita lo que el modelo puede considerar en una solicitud. Un contexto largo no es memoria permanente: al terminar la interacción, el sistema solo conservará datos si otra capa de la aplicación los guarda y vuelve a proporcionarlos.
Cómo pasa de completar texto a seguir instrucciones
En el preentrenamiento, el modelo procesa enormes corpus y ajusta parámetros para reducir errores de predicción. Así adquiere sintaxis, asociaciones y procedimientos que aparecen en los datos. El aprendizaje es comprimido y distribuido; no ofrece una lista transparente de documentos recordados. También puede memorizar fragmentos, especialmente si se repiten, lo que obliga a estudiar privacidad y reproducción.
Después se aplican ejemplos de instrucciones, preferencias humanas o criterios generados para orientar respuestas. El ajuste no reescribe todo el conocimiento de forma limpia: modifica tendencias. Las instrucciones del sistema, el mensaje del usuario y el contexto recuperado compiten dentro de la entrada. Ataques de inyección intentan introducir texto que el modelo trate como una orden de mayor prioridad.
Elegir el siguiente token no es consultar una enciclopedia
La salida puede tomar siempre el token más probable o muestrear alternativas. Temperatura y otros parámetros cambian diversidad, no conocimiento. Una opción menos determinista puede ayudar a idear; para hechos aumenta la necesidad de comprobar. El modelo no lleva un contador interno de certeza fiable: una probabilidad alta sobre una continuación lingüística no equivale a probabilidad alta de que la afirmación sea verdadera.
Las alucinaciones surgen cuando una continuación plausible carece de apoyo. También aparecen errores de razonamiento, fechas, negaciones o cálculo. Conectar documentos, herramientas y verificadores mejora tareas concretas, pero el resultado depende de recuperar bien y citar el fragmento correcto. La IA generativa debe evaluarse como sistema, no únicamente como red base.
Qué significa que un modelo sea grande
«Grande» suele aludir a parámetros, datos y cómputo, no a una frontera oficial. Aumentar escala ha mejorado muchas tareas y permite adaptar el mismo modelo mediante instrucciones, pero también concentra costes y defectos. Un modelo pequeño especializado puede superar a uno general en precisión, velocidad o privacidad. El tamaño tampoco garantiza datos recientes ni cobertura equilibrada de idiomas.
Estos modelos son herramientas de aprendizaje profundo capaces de transformar lenguaje con una flexibilidad extraordinaria. No comparten automáticamente experiencia corporal, objetivos propios ni responsabilidad. La forma más productiva de entenderlos es doble: predicen tokens, pero esa tarea a gran escala obliga a representar numerosas regularidades. Esa combinación explica tanto sus capacidades inesperadas como el error de atribuirles una comprensión idéntica a la humana.
El contexto disponible actúa como memoria de trabajo, no como archivo perfecto. Una ventana mayor admite más documentos, pero aumenta coste y no garantiza que el modelo use cada detalle. La posición de una instrucción, ejemplos contradictorios y texto irrelevante pueden cambiar la salida. Técnicas de recuperación seleccionan fragmentos antes de preguntar; deben evaluarse por si encontraron la evidencia correcta, no solo por la fluidez de la respuesta final.
Medir calidad requiere conjuntos separados del entrenamiento y tareas cercanas al uso real. Un modelo puede memorizar preguntas públicas, acertar una prueba y fallar cuando cambian nombres o formato. Además de exactitud se miden calibración, robustez, toxicidad, latencia y coste. Ningún marcador resume todos los riesgos. Comparar versiones exige conservar instrucciones, parámetros y fecha, porque proveedores pueden actualizar un sistema sin que cambie su nombre comercial.



