Los fundamentos: qué es un modelo de lenguaje, cómo lee el texto, cómo se entrena y por qué a veces se inventa cosas.

  1. Mapa de la IA generativa Recorrido por la IA generativa en seis capas, de cómo funciona un modelo a para qué lo uso, con enlace a cada ficha de esta wiki.
  2. Modelo de lenguaje (LLM) Un modelo de lenguaje grande (LLM) es una red neuronal entrenada con enormes cantidades de texto para predecir, token a token, cómo sigue una secuencia.
  3. Tokens Un token es la unidad mínima de texto que procesa un modelo de lenguaje: una palabra, un trozo de palabra, un carácter o incluso un byte.
  4. Transformer El Transformer es la arquitectura de red neuronal, presentada por investigadores de Google en 2017, sobre la que se construyen normalmente los grandes modelos de lenguaje.
  5. Cómo se entrena un LLM Un LLM se entrena en dos fases: primero aprende a predecir texto leyendo cantidades enormes (preentrenamiento) y luego se ajusta para seguir instrucciones y comportarse como asistente.
  6. Historia de los LLM Línea temporal de los modelos de lenguaje grandes, del Transformer de 2017 a hoy, con solo los modelos que marcaron un cambio.
  7. Alucinaciones Una alucinación es una respuesta falsa pero plausible que un modelo de lenguaje da con aparente seguridad, como una cita, un dato o una sentencia inventados.