Revisada el 2026-10-09

Un LLM se entrena en dos fases: primero aprende a predecir texto leyendo cantidades enormes (preentrenamiento) y luego se ajusta para seguir instrucciones y comportarse como asistente.

El preentrenamiento aporta el conocimiento y el dominio del lenguaje. El post-entrenamiento (ajuste por instrucciones, RLHF y sus alternativas) le da la forma de asistente. Un modelo solo preentrenado continúa texto: predecir la siguiente palabra de una web no es lo mismo que seguir las instrucciones del usuario de forma útil y segura.1

Cómo funciona

1. Preentrenamiento

  • Es aprendizaje autosupervisado: la señal de entrenamiento sale del propio texto, no de etiquetas puestas por personas.2
  • La tarea es predecir el siguiente token a partir de los anteriores.2
  • De aquí sale casi todo lo que el modelo de lenguaje sabe. Por eso cada modelo tiene una fecha de corte: Anthropic publica para cada Claude un «reliable knowledge cutoff», la fecha hasta la que su conocimiento es más amplio y fiable.3

2. Ajuste por instrucciones (SFT)

  • Se afina el modelo preentrenado con ejemplos de peticiones y de las respuestas deseadas, escritas por personas.1
  • Los datos etiquetados del ajuste fino son pocos comparados con los del preentrenamiento, así que esta fase es mucho más barata.2

3. Refuerzo con preferencias humanas (RLHF)

El esquema que popularizó InstructGPT (OpenAI, 2022) tiene tres pasos:1

  1. Demostraciones: un equipo de 40 contratistas escribe respuestas modelo y con ellas se afina GPT-3 (el SFT del apartado anterior).
  2. Modelo de recompensa: las personas ordenan varias respuestas del modelo de mejor a peor, y con esas comparaciones se entrena otro modelo que predice cuál preferirían.
  3. Refuerzo: el modelo se optimiza para maximizar esa recompensa con el algoritmo PPO.

Lo que consiguió:

  • Las respuestas del InstructGPT de 1.300 millones de parámetros se preferían a las de GPT-3 de 175.000 millones, con 100 veces menos parámetros.1
  • En tareas cerradas inventaba información ausente de la entrada la mitad de veces que GPT-3 (21 % frente a 41 %), aunque seguía cometiendo errores simples.1 Más en alucinaciones.
  • Límite que reconocen los autores: alinea el modelo con las preferencias de un grupo concreto (sobre todo sus etiquetadores e investigadores), no con unos «valores humanos» generales.1

Alternativas al RLHF clásico

  • Constitutional AI (Anthropic, 2022). La supervisión humana se reduce a una lista de principios: la «constitución». En una primera fase, el modelo critica y reescribe sus propias respuestas y se afina con las versiones corregidas. En la segunda, otro modelo elige la mejor de dos respuestas y esas preferencias generadas por IA sustituyen a las humanas (RLAIF). Busca un asistente inofensivo pero no evasivo, que explique por qué se niega, con muchas menos etiquetas humanas.4
  • La constitución de Claude hoy. En enero de 2026 Anthropic publicó una versión nueva con licencia CC0. La anterior era una lista de principios sueltos; la nueva explica el porqué, para que el modelo generalice a situaciones nuevas, y mantiene restricciones fijas para lo de mayor riesgo. Claude la usa para generar datos sintéticos de entrenamiento, entre ellos conversaciones y clasificaciones de respuestas.5
  • DPO (Direct Preference Optimization, 2023). Parte de que el RLHF es complejo y a menudo inestable, y resuelve el mismo problema con una función de pérdida de clasificación sencilla, sin muestrear del modelo durante el ajuste.6
  • Refuerzo para razonar. DeepSeek-R1 (2025) mostró que la capacidad de razonamiento puede reforzarse solo con aprendizaje por refuerzo, sin trayectorias de razonamiento escritas por personas, sobre todo en tareas con respuesta comprobable como matemáticas o programación.7 Es la base de los modelos de razonamiento.

Por qué importa

  • Explica la fecha de corte: lo ocurrido después del preentrenamiento el modelo no lo sabe, salvo que se lo des en la ventana de contexto o mediante RAG.3
  • Explica el carácter: el tono de asistente, las negativas razonadas y el cuidado con lo dañino salen del post-entrenamiento, no del conocimiento.14
  • Ayuda a leer anuncios: «más datos», «más refuerzo» o «nueva constitución» hablan de fases distintas del proceso.
  • El RLHF reduce los inventos, pero no los elimina: por eso esta wiki exige fuente para cada dato.1

Cómo lo uso

Sin uso propio documentado todavía.

Véase también

Referencias

Footnotes

  1. Training language models to follow instructions with human feedback. Long Ouyang et al. (OpenAI), arXiv, 2022-03-04. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8

  2. Foundations of Large Language Models. Tong Xiao y Jingbo Zhu, arXiv, 2025 (versión 4 del 2026-10-08), capítulo 1. Seis capítulos: preentrenamiento, modelos generativos, prompting, alineamiento, inferencia y razonamiento. Consultado el 2026-10-09. ↩ ↩2 ↩3

  3. Models overview. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2

  4. Constitutional AI: Harmlessness from AI Feedback. Yuntao Bai et al. (Anthropic), arXiv, 2022-12-15. Consultado el 2026-10-09. ↩ ↩2

  5. Claude’s new constitution. Anthropic, 2026-01-22. Texto completo en anthropic.com/constitution. Consultado el 2026-10-09. ↩

  6. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. Rafael Rafailov et al., arXiv, 2023-05-29. Consultado el 2026-10-09. ↩

  7. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. DeepSeek-AI, arXiv, 2025-01-22. Consultado el 2026-10-09. ↩