Revisada el 2026-10-09 · vigente hasta 2027-01-07

La ventana de contexto es todo el texto que un modelo de lenguaje puede tener a la vista al generar una respuesta, incluida la respuesta misma. Se mide en tokens y funciona como memoria de trabajo, no como lo que el modelo aprendió al entrenarse.1

Que quepa más no significa que rinda mejor: al crecer el contexto, el modelo recuerda y razona peor lo que contiene.12

Datos clave

Ventana y salida máxima de los modelos Claude vigentes en la documentación oficial:3

ModeloVentana de contextoSalida máxima
Claude Fable 5.11M tokens128K tokens
Claude Opus 5.51M tokens128K tokens
Claude Sonnet 5.51M tokens128K tokens
Claude Haiku 5.51M tokens128K tokens
  • 1M tokens son unas 555.000 palabras con el tokenizador actual; 200K, unas 150.000.3 La equivalencia con palabras, en tokens.
  • Los modelos anteriores que siguen disponibles, como Haiku 4.5, tienen 200K.1
  • Otros laboratorios (OpenAI, Google): [cita requerida]. Pendiente de verificar en sus páginas oficiales.
  • Como referencia histórica, GPT-2 pequeño tenía una ventana de solo 1k tokens.4

Cómo funciona

  • Cuenta todo lo que viaja en la petición: el prompt de sistema, cada mensaje, los resultados de herramientas, las imágenes, los documentos y las definiciones de herramientas. La respuesta, con su razonamiento, también.1
  • Cada turno reenvía el historial completo más el mensaje nuevo, así que la conversación se acumula hasta el límite.1
  • Si la entrada sola ya supera la ventana, la API devuelve un error 400 («prompt is too long»). En los modelos 4.5 y posteriores, si la entrada más max_tokens supera la ventana, la API acepta la petición y la generación se corta al llegar al límite con stop_reason: "model_context_window_exceeded".1
  • Los chats como claude.ai pueden gestionar la ventana de forma rodante, descartando lo más antiguo primero.1
  • Coste de atención: en un transformer cada token atiende a todos los demás, lo que da n² relaciones para n tokens. Por eso el modelo reparte peor su atención cuanto más largo es el contexto.2

Por qué importa

  • Degradación (context rot): a más tokens, menos precisión y menos recuerdo. Afecta a todos los modelos, aunque unos degradan más despacio que otros.12
  • Posición: en pruebas con contextos largos, el rendimiento era mejor cuando la información relevante estaba al principio o al final, y empeoraba mucho si estaba en medio.5
  • Estrategias para no llenarla: compactación (resumir y reiniciar), notas fuera del contexto y subagentes que devuelven solo un resumen.2 Es el terreno de la ingeniería de contexto.
  • La compactación en el servidor está en beta para Claude 4.6 y posteriores.1
  • En los modelos con 1M, las peticiones largas se facturan a precio estándar, salvo en Haiku 5.5, donde los prompts de más de 100.000 tokens cuestan más.1

Ahorrar tokens: lo que dicen los manuales oficiales

Los tres laboratorios coinciden en dos palancas: mandar menos tokens y pagar menos por los que se repiten.

Claude Code (Anthropic)

  • Cada petición reenvía toda la conversación, así que el contexto viejo se paga en cada mensaje. /clear al cambiar de tarea (con /rename antes para poder volver con /resume).6
  • /compact admite instrucciones («Focus on code samples and API usage») y se pueden fijar en un apartado «Compact instructions» del CLAUDE.md. Compactar un contexto grande es en sí una petición grande; /clear no cuesta nada.6
  • Modelo ajustado: Sonnet para casi todo y Opus para decisiones de arquitectura o razonamiento largo. Los subagentes simples pueden ir en Haiku (model: haiku).6
  • El pensamiento extendido se factura como salida. Se baja con /effort; en Opus 5.5, Sonnet 5.5, Haiku 5.5 y los Fable no se puede desactivar.6
  • Subagentes para operaciones verbosas (tests, logs, documentación): solo vuelve el resumen al hilo principal.6
  • Hooks que filtran antes de que Claude lea (por ejemplo, un grep ERROR en vez de un log de 10.000 líneas) y skills en lugar de instrucciones largas en el CLAUDE.md, que se cargan siempre. Meta oficial: CLAUDE.md por debajo de 200 líneas.6
  • Herramientas de línea de comandos (gh, aws) antes que servidores MCP, y desactivar los MCP sin uso con /mcp. /context muestra qué ocupa espacio.6
  • Prompts concretos («valida la entrada en login de auth.ts», no «mejora el código»), modo plan antes de implementar (Shift+Tab) y Escape o /rewind si va por mal camino.6
  • Cuidado con la caché: tras una pausa mayor que su vida útil se reprocesa todo el contexto. Dura una hora en suscripción y cinco minutos con clave de API o con créditos de uso.6
  • Los equipos de agentes gastan en torno a 7 veces más tokens que una sesión normal cuando sus miembros trabajan en modo plan.6
  • Para medir: /usage, /context y la línea de estado.6

API de Claude

  • Caché de prompt: escribir cuesta 1,25× el precio de entrada (TTL de 5 minutos) o 2× (1 hora). Leer cuesta 0,1× con la mayoría de modelos (Haiku 5.5 incluido), 0,05× en Opus 5.5 y Sonnet 5.5, y 0,025× en Fable 5.1.7
  • Mínimo cacheable de 512 tokens en Opus 5.5, Sonnet 5.5, Haiku 5.5 y Fable 5.1; en modelos anteriores llega a 4.096 (Haiku 4.5). Por debajo no falla: simplemente no cachea.7
  • Se activa con cache_control y la respuesta informa de cache_read_input_tokens para comprobar que funciona.7
  • Message Batches API: un 50 % menos para trabajos que no necesitan respuesta inmediata; la mayoría acaba en menos de una hora.8

OpenAI

  • La caché es automática: se reutiliza el prefijo idéntico de la petición. Con GPT-5.6 y posteriores, el mínimo es de 1.024 tokens, leer cuesta 0,1× y escribir 1,25×, con 30 minutos de vida por defecto.9
  • Para acertar: contenido estable al principio (instrucciones, herramientas, referencias), mensajes nuevos al final, herramientas sin cambios entre peticiones.9
  • Otras vías de su guía de costes: menos peticiones, menos tokens de entrada y salida, modelos más pequeños, Batch API y Flex processing (más barato a cambio de más lentitud). Esa página no da porcentajes.10

Google (Gemini API)

  • Caché implícita activada por defecto desde Gemini 2.5; el ahorro se traslada solo si hay acierto. Mínimos de 2.048 tokens en 2.5 Flash y Pro, y de 4.096 en las series 3.x citadas. También hay caché explícita.11
  • Misma regla: lo grande y repetido, al principio; peticiones parecidas, seguidas en el tiempo.11
  • Precios: los tokens cacheados cuestan un 90 % menos (con almacenamiento facturado aparte), y Batch y Flex, un 50 % menos.12

Lo común

  • Un prefijo estable al principio y lo variable al final, en los tres.
  • Lo asíncrono es la mitad de precio (Batch, Flex).
  • Modelo pequeño y poco razonamiento para lo simple.
  • Medir antes de optimizar: los tres devuelven cuántos tokens salieron de caché.

Cómo lo uso

  • Un hook de Claude Code mide el contexto real de la sesión y me avisa al 60 % y al 80 % de la ventana (según mi configuración global). Cómo cuenta y su desajuste con las ventanas de 1M, en tokens.
  • Al llegar al 80 % escribo un handoff.md y sigo en un chat nuevo con /clear, o compacto con /compact si la tarea sigue abierta.
  • Para búsquedas amplias delego en subagentes, para que el hilo principal reciba solo el resumen.

Véase también

Referencias

Footnotes

  1. Context windows. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10

  2. Effective context engineering for AI agents. Anthropic, 2025-09-29. Consultado el 2026-10-02. ↩ ↩2 ↩3 ↩4

  3. Models overview. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2

  4. Large language model. Wikipedia, revisión 1377815095. Consultado el 2026-10-02. ↩

  5. Lost in the Middle: How Language Models Use Long Contexts. Liu et al., arXiv, 2023-07-06 (versión final 2023-11-20). Consultado el 2026-10-02. ↩

  6. Manage costs effectively. Anthropic, documentación de Claude Code. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11

  7. Prompt caching. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3

  8. Batch processing. Anthropic, documentación de la API. Consultado el 2026-10-03. ↩

  9. Prompt caching. OpenAI, documentación de la API. Consultado el 2026-10-03. ↩ ↩2

  10. Cost optimization. OpenAI, documentación de la API. Consultado el 2026-10-03. ↩

  11. Context caching. Google, documentación de la Gemini API. Consultado el 2026-10-03. ↩ ↩2

  12. Gemini Developer API pricing. Google. Consultado el 2026-10-03. ↩