Revisada el 2026-10-09

Un modelo de lenguaje grande (LLM) es una red neuronal entrenada con enormes cantidades de texto para predecir, token a token, cómo sigue una secuencia.12

Es la pieza que hay debajo de los chatbots actuales, Claude entre ellos.13 No consulta una base de datos ni busca en internet por sí solo: genera el texto más plausible a partir de lo que aprendió al entrenarse. Por eso escribe con fluidez y, a veces, se equivoca con total aplomo.4

Cómo funciona

  • Trocea el texto en tokens: palabras, trozos de palabra o caracteres.3
  • En el preentrenamiento aprende una sola tarea: predecir el siguiente token a partir de los anteriores, sobre un corpus enorme de texto sin etiquetar.32
  • Al generar, calcula la probabilidad de cada token posible del vocabulario, elige uno y lo añade al texto. Ese token pasa a formar parte de lo que usa para predecir el siguiente, y así hasta terminar.12
  • La temperatura regula cuánto se arriesga al elegir: alta da respuestas más variadas; baja, más previsibles. Ni con temperatura 0 la salida es idéntica en todas las llamadas.3
  • Lo habitual es que se base en la arquitectura transformer. Los modelos de tipo GPT usan solo su parte decodificadora.15
  • Un modelo recién preentrenado no sigue bien instrucciones. Después se ajusta (fine-tuning y RLHF, aprendizaje por refuerzo con valoraciones humanas) para que se comporte como asistente. Claude, por ejemplo, no es un modelo «en bruto».3 El proceso completo, en cómo se entrena un LLM.

Qué no es

  • No es una base de datos. No guarda hechos en fichas que luego consulte: aprende regularidades del texto. Si no puede distinguir una afirmación falsa de una cierta, se equivoca. Los datos arbitrarios que aparecen pocas veces en el entrenamiento, como el cumpleaños de alguien poco conocido, son justo los que tiende a inventar.4 Ver alucinaciones.
  • No busca en internet por sí solo. Su conocimiento llega hasta una fecha de corte propia de cada modelo.6 Para datos actuales necesita una herramienta de búsqueda que le da la aplicación o la API; con ella decide cuándo buscar y cita las fuentes.7 Esa capa de software que le añade memoria y herramientas es el arnés.1
  • No recuerda tus conversaciones. Lo que sabe del chat en curso es lo que cabe en su ventana de contexto, una memoria de trabajo distinta de lo aprendido al entrenarse.3

Por qué importa

  • Explica sus errores típicos. Está optimizado para continuar el texto de forma verosímil y, según un estudio de OpenAI, su entrenamiento y su evaluación premian adivinar antes que admitir que no sabe.4
  • Explica cómo se paga y dónde están los límites: entrada, salida y ventana se miden en tokens.
  • Explica por qué el mismo modelo rinde distinto según la herramienta. Memoria, búsqueda y acciones las añade el software que lo rodea, no el modelo.1
  • Da contexto histórico: el transformer se presentó en 2017, GPT-1 en 2018, y un chatbot lanzado a finales de 2022 (ChatGPT) llevó los LLM al gran público.1 La cronología completa, en historia de los LLM.

Cómo lo uso

  • Esta wiki la redacta un LLM (Claude, desde Claude Code) y la reviso yo, según el CLAUDE.md del proyecto.
  • A mi entender, la regla de la wiki «nada se afirma sin fuente enlazada» es la consecuencia práctica de esta ficha: si el modelo genera lo plausible y no consulta datos, cada afirmación necesita su fuente.

Véase también

Referencias

Footnotes

  1. Large language model. Wikipedia, revisión 1379150649. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7

  2. Foundations of Large Language Models. Tong Xiao y Jingbo Zhu, arXiv, v4 de 2026-10-08, capítulo 1 (apartados 1.1.2 y 1.2). Consultado el 2026-10-09. ↩ ↩2 ↩3

  3. Glossary. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  4. Why Language Models Hallucinate. Adam Tauman Kalai, Ofir Nachum y Edwin Zhang (OpenAI) y Santosh S. Vempala (Georgia Tech), 2025-09-04. Consultado el 2026-10-09. ↩ ↩2 ↩3

  5. Transformer (deep learning). Wikipedia, revisión 1379269363. Consultado el 2026-10-09. ↩

  6. Models overview. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩

  7. Web search tool. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩