Iniciar sesiónEmpieza gratis
§Guía

¿Qué es la ventana de contexto, y por qué empeoran los chats largos?

Portada de la guía AgentPrep: ¿Qué es la ventana de contexto, y por qué empeoran los chats largos?

La ventana de contexto es todo el texto que un modelo de lenguaje puede referenciar al generar una respuesta — incluida la propia respuesta. No es lo mismo que los datos de entrenamiento del modelo; piénsala como la memoria de trabajo de esta conversación, no el conocimiento general que tiene el modelo.

Su tamaño importa menos que lo que hay dentro: más contexto no es automáticamente mejor, porque la precisión y la capacidad de recuperar información caen conforme crece el número de tokens — un patrón conocido como context rot. A continuación: qué llena la ventana sin que lo notes, cuál es su tamaño real según el modelo, qué pasa cuando la superas, y qué se gestiona automáticamente.

Qué llena realmente la ventana de contexto

Cada mensaje que envías y cada respuesta del modelo se acumulan dentro de la ventana a medida que avanza la conversación — los turnos anteriores no desaparecen ni se resumen solos, se conservan completos.

Por qué más contexto no es automáticamente mejor

Esta es la parte que más sorprende, y es la razón de ser de esta página: una ventana más grande no es simplemente una ventaja mayor.

La consecuencia práctica es que curar lo que entra en el contexto importa tanto como el espacio disponible. Una ventana con espacio de sobra puede seguir llena de lo que no toca.

“Más contexto no es automáticamente mejor. A medida que crece el número de tokens, la precisión y la capacidad de recuperar información caen — un fenómeno conocido como context rot.” (traducción nuestra, original en inglés)

Cuál es el tamaño real, y qué cuenta en su contra

El tamaño depende del modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 y Sonnet 4.6 tienen una ventana de 1M tokens en la Claude API, Amazon Bedrock, Google Cloud y Microsoft Foundry — igual que Claude Fable 5 y Mythos 5. Otros modelos, incluido Claude Sonnet 4.5, tienen 200 mil.

En los modelos de 1M, una sola solicitud puede generar hasta 128 mil tokens de salida, y puede incluir hasta 600 imágenes o páginas de PDF — 100 en los modelos de 200 mil.

Cada respuesta indica exactamente cuánto de la ventana usó, en un campo usage. Con el caché de prompts activado, ese conteo de entrada se divide en input_tokens, cache_read_input_tokens y cache_creation_input_tokens — y los tres siguen contando para la ventana. El caché cambia lo que esos tokens cuestan, no si ocupan espacio.

Qué pasa al superarla, y qué se gestiona por ti

Si solo la entrada ya es más grande que la ventana, la API rechaza la solicitud directamente con un error 400 invalid_request_error diciendo que el prompt es demasiado largo. En los modelos Claude 4.5 en adelante es menos tajante: si la entrada más el max_tokens pedido superaría la ventana, la solicitud se acepta igual, y la generación solo se detiene si realmente llega al límite, terminando con stop_reason: “model_context_window_exceeded”.

También existe una token counting API para estimar cuánto de la ventana va a usar una solicitud antes de enviarla. Y ocurren tres cosas para gestionar la ventana por ti, sin que lo pidas:

FAQ

¿Qué es la ventana de contexto?

Todo el texto que un modelo de lenguaje puede referenciar al generar una respuesta, incluida la propia respuesta — el system prompt, cada mensaje anterior, resultados de herramientas, definiciones de herramientas y la respuesta misma. Es distinto de los datos con los que se entrenó el modelo; piénsala como la memoria de trabajo de la conversación actual, no el conocimiento general.

¿Qué es el context rot?

El patrón detrás de por qué una ventana de contexto más grande no es automáticamente mejor: a medida que crece el número de tokens, la precisión y la capacidad de recuperar información caen. Por eso curar lo que entra en el contexto importa tanto como el espacio disponible.

¿Cuál es el tamaño de una ventana de contexto, en tokens?

Depende del modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6, Fable 5 y Mythos 5 tienen una ventana de 1M tokens en la Claude API, Amazon Bedrock, Google Cloud y Microsoft Foundry. Otros modelos, incluido Claude Sonnet 4.5, tienen 200 mil.

¿Qué pasa cuando una solicitud supera la ventana de contexto?

Si solo la entrada ya es más grande que la ventana, la API rechaza la solicitud con un error 400 invalid_request_error. En los modelos Claude 4.5 en adelante, entrada más max_tokens superando la ventana se acepta, y la generación solo se detiene con stop_reason: “model_context_window_exceeded” si de verdad llega al límite.

Lee a continuación

Gestionar el contexto es una destreza que se entrena

AgentPrep entrena el oficio que esta página describe — preguntas de escenario originales y dominio medido por área, en Telegram. Gratis para empezar en el navegador, sin tarjeta.

Empezar gratis
Fuentes