Revisada el 2026-10-09 · vigente hasta 2027-01-07
La ventana de contexto es todo el texto que un modelo de lenguaje puede tener a la vista al generar una respuesta, incluida la respuesta misma. Se mide en tokens y funciona como memoria de trabajo, no como lo que el modelo aprendió al entrenarse.1
Que quepa más no significa que rinda mejor: al crecer el contexto, el modelo recuerda y razona peor lo que contiene.12
Datos clave
Ventana y salida máxima de los modelos Claude vigentes en la documentación oficial:3
| Modelo | Ventana de contexto | Salida máxima |
|---|---|---|
| Claude Fable 5.1 | 1M tokens | 128K tokens |
| Claude Opus 5.5 | 1M tokens | 128K tokens |
| Claude Sonnet 5.5 | 1M tokens | 128K tokens |
| Claude Haiku 5.5 | 1M tokens | 128K tokens |
- 1M tokens son unas 555.000 palabras con el tokenizador actual; 200K, unas 150.000.3 La equivalencia con palabras, en tokens.
- Los modelos anteriores que siguen disponibles, como Haiku 4.5, tienen 200K.1
- Otros laboratorios (OpenAI, Google): [cita requerida]. Pendiente de verificar en sus páginas oficiales.
- Como referencia histórica, GPT-2 pequeño tenía una ventana de solo 1k tokens.4
Cómo funciona
- Cuenta todo lo que viaja en la petición: el prompt de sistema, cada mensaje, los resultados de herramientas, las imágenes, los documentos y las definiciones de herramientas. La respuesta, con su razonamiento, también.1
- Cada turno reenvía el historial completo más el mensaje nuevo, así que la conversación se acumula hasta el límite.1
- Si la entrada sola ya supera la ventana, la API devuelve un error 400 («prompt is too long»). En los modelos 4.5 y posteriores, si la entrada más
max_tokenssupera la ventana, la API acepta la petición y la generación se corta al llegar al límite constop_reason: "model_context_window_exceeded".1 - Los chats como claude.ai pueden gestionar la ventana de forma rodante, descartando lo más antiguo primero.1
- Coste de atención: en un transformer cada token atiende a todos los demás, lo que da n² relaciones para n tokens. Por eso el modelo reparte peor su atención cuanto más largo es el contexto.2
Por qué importa
- Degradación (context rot): a más tokens, menos precisión y menos recuerdo. Afecta a todos los modelos, aunque unos degradan más despacio que otros.12
- Posición: en pruebas con contextos largos, el rendimiento era mejor cuando la información relevante estaba al principio o al final, y empeoraba mucho si estaba en medio.5
- Estrategias para no llenarla: compactación (resumir y reiniciar), notas fuera del contexto y subagentes que devuelven solo un resumen.2 Es el terreno de la ingeniería de contexto.
- La compactación en el servidor está en beta para Claude 4.6 y posteriores.1
- En los modelos con 1M, las peticiones largas se facturan a precio estándar, salvo en Haiku 5.5, donde los prompts de más de 100.000 tokens cuestan más.1
Ahorrar tokens: lo que dicen los manuales oficiales
Los tres laboratorios coinciden en dos palancas: mandar menos tokens y pagar menos por los que se repiten.
Claude Code (Anthropic)
- Cada petición reenvía toda la conversación, así que el contexto viejo se paga en cada mensaje.
/clearal cambiar de tarea (con/renameantes para poder volver con/resume).6 /compactadmite instrucciones («Focus on code samples and API usage») y se pueden fijar en un apartado «Compact instructions» del CLAUDE.md. Compactar un contexto grande es en sí una petición grande;/clearno cuesta nada.6- Modelo ajustado: Sonnet para casi todo y Opus para decisiones de arquitectura o razonamiento largo. Los subagentes simples pueden ir en Haiku (
model: haiku).6 - El pensamiento extendido se factura como salida. Se baja con
/effort; en Opus 5.5, Sonnet 5.5, Haiku 5.5 y los Fable no se puede desactivar.6 - Subagentes para operaciones verbosas (tests, logs, documentación): solo vuelve el resumen al hilo principal.6
- Hooks que filtran antes de que Claude lea (por ejemplo, un
grep ERRORen vez de un log de 10.000 líneas) y skills en lugar de instrucciones largas en el CLAUDE.md, que se cargan siempre. Meta oficial: CLAUDE.md por debajo de 200 líneas.6 - Herramientas de línea de comandos (
gh,aws) antes que servidores MCP, y desactivar los MCP sin uso con/mcp./contextmuestra qué ocupa espacio.6 - Prompts concretos («valida la entrada en
loginde auth.ts», no «mejora el código»), modo plan antes de implementar (Shift+Tab) y Escape o/rewindsi va por mal camino.6 - Cuidado con la caché: tras una pausa mayor que su vida útil se reprocesa todo el contexto. Dura una hora en suscripción y cinco minutos con clave de API o con créditos de uso.6
- Los equipos de agentes gastan en torno a 7 veces más tokens que una sesión normal cuando sus miembros trabajan en modo plan.6
- Para medir:
/usage,/contexty la línea de estado.6
API de Claude
- Caché de prompt: escribir cuesta 1,25× el precio de entrada (TTL de 5 minutos) o 2× (1 hora). Leer cuesta 0,1× con la mayoría de modelos (Haiku 5.5 incluido), 0,05× en Opus 5.5 y Sonnet 5.5, y 0,025× en Fable 5.1.7
- Mínimo cacheable de 512 tokens en Opus 5.5, Sonnet 5.5, Haiku 5.5 y Fable 5.1; en modelos anteriores llega a 4.096 (Haiku 4.5). Por debajo no falla: simplemente no cachea.7
- Se activa con
cache_controly la respuesta informa decache_read_input_tokenspara comprobar que funciona.7 - Message Batches API: un 50 % menos para trabajos que no necesitan respuesta inmediata; la mayoría acaba en menos de una hora.8
OpenAI
- La caché es automática: se reutiliza el prefijo idéntico de la petición. Con GPT-5.6 y posteriores, el mínimo es de 1.024 tokens, leer cuesta 0,1× y escribir 1,25×, con 30 minutos de vida por defecto.9
- Para acertar: contenido estable al principio (instrucciones, herramientas, referencias), mensajes nuevos al final, herramientas sin cambios entre peticiones.9
- Otras vías de su guía de costes: menos peticiones, menos tokens de entrada y salida, modelos más pequeños, Batch API y Flex processing (más barato a cambio de más lentitud). Esa página no da porcentajes.10
Google (Gemini API)
- Caché implícita activada por defecto desde Gemini 2.5; el ahorro se traslada solo si hay acierto. Mínimos de 2.048 tokens en 2.5 Flash y Pro, y de 4.096 en las series 3.x citadas. También hay caché explícita.11
- Misma regla: lo grande y repetido, al principio; peticiones parecidas, seguidas en el tiempo.11
- Precios: los tokens cacheados cuestan un 90 % menos (con almacenamiento facturado aparte), y Batch y Flex, un 50 % menos.12
Lo común
- Un prefijo estable al principio y lo variable al final, en los tres.
- Lo asíncrono es la mitad de precio (Batch, Flex).
- Modelo pequeño y poco razonamiento para lo simple.
- Medir antes de optimizar: los tres devuelven cuántos tokens salieron de caché.
Cómo lo uso
- Un hook de Claude Code mide el contexto real de la sesión y me avisa al 60 % y al 80 % de la ventana (según mi configuración global). Cómo cuenta y su desajuste con las ventanas de 1M, en tokens.
- Al llegar al 80 % escribo un
handoff.mdy sigo en un chat nuevo con/clear, o compacto con/compactsi la tarea sigue abierta. - Para búsquedas amplias delego en subagentes, para que el hilo principal reciba solo el resumen.
Véase también
Referencias
Footnotes
-
Context windows. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10
-
Effective context engineering for AI agents. Anthropic, 2025-09-29. Consultado el 2026-10-02. ↩ ↩2 ↩3 ↩4
-
Models overview. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2
-
Large language model. Wikipedia, revisión 1377815095. Consultado el 2026-10-02. ↩
-
Lost in the Middle: How Language Models Use Long Contexts. Liu et al., arXiv, 2023-07-06 (versión final 2023-11-20). Consultado el 2026-10-02. ↩
-
Manage costs effectively. Anthropic, documentación de Claude Code. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11
-
Prompt caching. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3
-
Batch processing. Anthropic, documentación de la API. Consultado el 2026-10-03. ↩
-
Prompt caching. OpenAI, documentación de la API. Consultado el 2026-10-03. ↩ ↩2
-
Cost optimization. OpenAI, documentación de la API. Consultado el 2026-10-03. ↩
-
Context caching. Google, documentación de la Gemini API. Consultado el 2026-10-03. ↩ ↩2
-
Gemini Developer API pricing. Google. Consultado el 2026-10-03. ↩