Revisada el 2026-10-09 · vigente hasta 2027-01-07

Un modelo de razonamiento genera pasos intermedios de pensamiento antes de responder; el nivel de esfuerzo regula cuánto piensa y, con ello, la calidad, la latencia y el coste.

Pensar antes de contestar mejora las tareas difíciles (matemáticas, código, agentes largos), pero esos tokens se pagan como salida aunque no se vean. Anthropic, OpenAI y Google lo controlan hoy con un parámetro de esfuerzo o de nivel de pensamiento, y en Claude Code se ajusta con /effort.1234

Cómo funciona

Del truco de prompt al entrenamiento

  • Chain-of-thought (2022): mostrar en el prompt unos pocos ejemplos con pasos intermedios mejoraba el razonamiento de los modelos suficientemente grandes. Con ocho ejemplos, un modelo de 540.000 millones de parámetros alcanzó el mejor resultado del momento en los problemas de matemáticas de GSM8K.5
  • o1 (OpenAI, septiembre de 2024): entrenado con refuerzo a gran escala para usar bien su cadena de pensamiento. Rinde más cuanto más refuerzo recibe al entrenarse y cuanto más tiempo piensa al responder.6
  • El refuerzo que lo hace posible se explica en cómo se entrena un LLM.

El pensamiento en Claude

  • El modelo escribe bloques thinking antes de la respuesta: replantea la pregunta, prueba enfoques, comprueba resultados intermedios y abandona lo que no funciona.1
  • Lo que se ve nunca es el razonamiento en bruto, sino como mucho un resumen hecho por otro modelo. En los modelos actuales, por defecto ni eso: el bloque llega vacío (display: "omitted").1
  • Todo el pensamiento se factura como salida, aunque no se devuelva, y cuenta dentro de max_tokens.1
  • Pensamiento adaptativo: el modelo decide cuándo y cuánto pensar. En Opus 5.5, Sonnet 5.5, Haiku 5.5 y Fable 5.1 viene activado sin configurar nada; el modo antiguo con presupuesto fijo (budget_tokens) ya no se acepta en ellos.1

El parámetro effort

  • Cinco niveles: low, medium, high, xhigh y max. Afecta a todos los tokens de la respuesta: texto, llamadas a herramientas y pensamiento.7
  • Es una señal de comportamiento, no un tope. Con poco esfuerzo el modelo sigue pensando ante problemas difíciles, pero menos. El límite duro es max_tokens.17
  • Valor por defecto en la API: high en casi todos los modelos; medium en Opus 5.5 y Haiku 5.5.7
  • Con menos esfuerzo hace menos llamadas a herramientas y más escuetas; con más, explica el plan y resume con detalle.7
  • Uso orientativo según Anthropic: low para tareas simples y subagentes; medium para agentes que equilibran velocidad y coste; high para razonamiento complejo; xhigh para trabajo agéntico de más de 30 minutos; max solo para lo más difícil.7
  • En Opus 5.5 el pensamiento no se puede desactivar, así que el esfuerzo es el control principal de cuánto razona y cuánto cuesta.7

En Claude Code

  • /effort abre un selector; /effort <nivel> lo fija; /effort auto borra el nivel guardado y /effort status muestra el vigente.2
  • Prioridad: primero CLAUDE_CODE_EFFORT_LEVEL, --effort o /effort; después el nivel guardado por modelo (modelSettings) o effortLevel; al final, el defecto del modelo en Claude Code (medium en Opus 5.5, Sonnet 5.5 y Haiku 5.5; ojo, en la API Sonnet 5.5 parte de high).72
  • Un effortLevel de primer nivel en los ajustes de usuario no cuenta para Opus 5.5: manda el guardado por modelo.2
  • Escribir ultrathink en el prompt pide más razonamiento en ese turno sin cambiar el nivel de la sesión. «Think hard» no es palabra clave.2
  • max se aplica solo a la sesión actual, y la documentación avisa de rendimientos decrecientes y de tendencia a pensar de más.2

Otros laboratorios

  • OpenAI: reasoning.effort (o reasoning_effort), con valores de none a max según el modelo. Los tokens de razonamiento se cobran como salida, ocupan contexto y no se ven por la API.3
  • Google: thinking_level (de minimal a high según el modelo), con pensamiento dinámico por defecto. Se cobra la suma de salida y pensamiento.4

Por qué importa

  • Coste y latencia: el pensamiento se paga aunque no se vea. Un esfuerzo alto en tareas mecánicas gasta tokens sin mejorar el resultado.17
  • Más no siempre es mejor: Anthropic avisa de que max puede pensar de más en tareas estructuradas o poco exigentes.7
  • Es el gran salto reciente: según Epoch AI, desde la llegada de los modelos de razonamiento (septiembre de 2024) la frontera de su índice de capacidades avanza unos 14 puntos al año, frente a 6 en los modelos sin razonamiento.8
  • La receta Acelerar Cline cuando va lento parte de esta misma idea (razonamiento alto, agente lento), aunque sus datos están sin contrastar.

Cómo lo uso

  • En mis ajustes de usuario de Claude Code el esfuerzo está guardado por modelo (modelSettings): xhigh en Opus 5.5 y medium en Opus 5 y Sonnet 5.
  • Mi CLAUDE.md global pide valorar, al empezar cada tarea, si el modelo y el esfuerzo encajan: bajar en tareas mecánicas y subir en las de diseño o con riesgo.
  • A mi entender, con xhigh fijo en Opus 5.5 (cuyo defecto es medium), conviene bajar con /effort en tareas pequeñas.

Véase también

Referencias

Footnotes

  1. Thinking. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7

  2. Model configuration. Anthropic, documentación de Claude Code. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  3. Reasoning models. OpenAI, documentación de la API. Consultado el 2026-10-09. ↩ ↩2

  4. Gemini thinking. Google, documentación de la Gemini API. Consultado el 2026-10-09. ↩ ↩2

  5. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Jason Wei et al., arXiv, 2022-01-28. Consultado el 2026-10-09. ↩

  6. Learning to reason with LLMs. OpenAI, 2024-09-12. La página devolvió 403 al abrirla; el dato procede del extracto que muestra el buscador. Consultado el 2026-10-09. ↩

  7. Effort. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9

  8. Trends in AI. Epoch AI. Consultado el 2026-10-09. ↩