EntrarComece grátis
§Guia

O que é a janela de contexto, e por que conversas longas pioram?

Capa do guia AgentPrep: O que é a janela de contexto, e por que conversas longas pioram?

A janela de contexto é todo o texto que um modelo de linguagem consegue referenciar ao gerar uma resposta — incluindo a própria resposta. Não é o mesmo que os dados de treino do modelo; pense nela como a memória de trabalho desta conversa específica, não o conhecimento geral que o modelo tem.

O tamanho dela importa menos do que o que está dentro: mais contexto não é automaticamente melhor, porque a precisão e a capacidade de recuperar informação caem conforme o número de tokens cresce — um padrão conhecido como context rot. A seguir: o que preenche a janela sem você perceber, o tamanho real dela conforme o modelo, o que acontece quando você a estoura, e o que é gerenciado automaticamente.

O que preenche a janela de contexto, de fato

Cada mensagem que você envia e cada resposta do modelo se acumulam dentro da janela ao longo da conversa — os turnos anteriores não somem nem são resumidos sozinhos, ficam preservados por inteiro.

Por que mais contexto não é automaticamente melhor

Essa é a parte que surpreende a maioria das pessoas, e é o motivo desta página existir: uma janela maior não é simplesmente uma vantagem maior.

A consequência prática é que curar o que entra no contexto importa tanto quanto o espaço disponível. Uma janela com sobra de espaço ainda pode estar cheia da coisa errada.

“Mais contexto não é automaticamente melhor. Conforme o número de tokens cresce, a precisão e a capacidade de recuperar informação caem — um fenômeno conhecido como context rot.” (tradução nossa, original em inglês)

Qual é o tamanho real, e o que conta contra ele

O tamanho depende do modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 e Sonnet 4.6 têm janela de 1M tokens na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry — assim como Claude Fable 5 e Mythos 5. Outros modelos, incluindo o Claude Sonnet 4.5, têm 200 mil.

Nos modelos de 1M, uma única requisição pode gerar até 128 mil tokens de saída, e pode incluir até 600 imagens ou páginas de PDF — 100 nos modelos de 200 mil.

Toda resposta reporta exatamente quanto da janela foi usado, num campo usage. Com o cache de prompt ativado, essa contagem de entrada se divide em input_tokens, cache_read_input_tokens e cache_creation_input_tokens — e os três continuam contando para a janela. O cache muda o que esses tokens custam, não se eles ocupam espaço.

O que acontece ao estourar, e o que é gerenciado por você

Se só a entrada já é maior que a janela, a API recusa a requisição de cara, com um erro 400 invalid_request_error dizendo que o prompt é longo demais. Nos modelos Claude 4.5 em diante, é menos direto: se entrada mais o max_tokens pedido ultrapassaria a janela, a requisição é aceita mesmo assim, e a geração só para se realmente bater no limite, terminando com stop_reason: “model_context_window_exceeded”.

Também existe uma token counting API para estimar quanto da janela uma requisição vai usar antes de você enviar. E três coisas acontecem para gerenciar a janela por você, sem precisar pedir:

FAQ

O que é a janela de contexto?

Todo o texto que um modelo de linguagem consegue referenciar ao gerar uma resposta, incluindo a própria resposta — o system prompt, cada mensagem anterior, resultados de ferramentas, definições de ferramentas e a resposta em si. É diferente dos dados em que o modelo foi treinado; pense nela como a memória de trabalho da conversa atual, não o conhecimento geral.

O que é context rot?

O padrão por trás do motivo de uma janela de contexto maior não ser automaticamente melhor: conforme o número de tokens cresce, a precisão e a capacidade de recuperar informação caem. É por isso que curar o que entra no contexto importa tanto quanto o espaço disponível.

Qual é o tamanho de uma janela de contexto, em tokens?

Depende do modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6, Fable 5 e Mythos 5 têm janela de 1M tokens na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry. Outros modelos, incluindo o Claude Sonnet 4.5, têm 200 mil.

O que acontece quando uma requisição estoura a janela de contexto?

Se só a entrada já é maior que a janela, a API recusa a requisição com um erro 400 invalid_request_error. Nos modelos Claude 4.5 em diante, entrada mais max_tokens ultrapassando a janela é aceito, e a geração só para com stop_reason: “model_context_window_exceeded” se realmente bater no limite.

Leia em seguida

Gerenciar contexto é uma habilidade que se treina

O AgentPrep treina o ofício que esta página descreve — questões de cenário originais e domínio medido por área, em Telegram. Grátis para começar no navegador, sem cartão.

Começar grátis
Fontes