O que é a janela de contexto, e por que conversas longas pioram?
A janela de contexto é todo o texto que um modelo de linguagem consegue referenciar ao gerar uma resposta — incluindo a própria resposta. Não é o mesmo que os dados de treino do modelo; pense nela como a memória de trabalho desta conversa específica, não o conhecimento geral que o modelo tem.
O tamanho dela importa menos do que o que está dentro: mais contexto não é automaticamente melhor, porque a precisão e a capacidade de recuperar informação caem conforme o número de tokens cresce — um padrão conhecido como context rot. A seguir: o que preenche a janela sem você perceber, o tamanho real dela conforme o modelo, o que acontece quando você a estoura, e o que é gerenciado automaticamente.
O que preenche a janela de contexto, de fato
Cada mensagem que você envia e cada resposta do modelo se acumulam dentro da janela ao longo da conversa — os turnos anteriores não somem nem são resumidos sozinhos, ficam preservados por inteiro.
- O system prompt
- Toda mensagem da conversa, incluindo resultados de ferramentas, imagens e documentos
- As definições de cada ferramenta disponibilizada ao modelo
- A saída gerada naquele turno, incluindo o extended thinking
Por que mais contexto não é automaticamente melhor
Essa é a parte que surpreende a maioria das pessoas, e é o motivo desta página existir: uma janela maior não é simplesmente uma vantagem maior.
A consequência prática é que curar o que entra no contexto importa tanto quanto o espaço disponível. Uma janela com sobra de espaço ainda pode estar cheia da coisa errada.
Qual é o tamanho real, e o que conta contra ele
O tamanho depende do modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 e Sonnet 4.6 têm janela de 1M tokens na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry — assim como Claude Fable 5 e Mythos 5. Outros modelos, incluindo o Claude Sonnet 4.5, têm 200 mil.
Nos modelos de 1M, uma única requisição pode gerar até 128 mil tokens de saída, e pode incluir até 600 imagens ou páginas de PDF — 100 nos modelos de 200 mil.
Toda resposta reporta exatamente quanto da janela foi usado, num campo usage. Com o cache de prompt ativado, essa contagem de entrada se divide em input_tokens, cache_read_input_tokens e cache_creation_input_tokens — e os três continuam contando para a janela. O cache muda o que esses tokens custam, não se eles ocupam espaço.
O que acontece ao estourar, e o que é gerenciado por você
Se só a entrada já é maior que a janela, a API recusa a requisição de cara, com um erro 400 invalid_request_error dizendo que o prompt é longo demais. Nos modelos Claude 4.5 em diante, é menos direto: se entrada mais o max_tokens pedido ultrapassaria a janela, a requisição é aceita mesmo assim, e a geração só para se realmente bater no limite, terminando com stop_reason: “model_context_window_exceeded”.
Também existe uma token counting API para estimar quanto da janela uma requisição vai usar antes de você enviar. E três coisas acontecem para gerenciar a janela por você, sem precisar pedir:
- A compactação no servidor — em beta para os modelos Claude 4.6 em diante — resume as partes mais antigas de uma conversa longa no servidor da Anthropic, e é a estratégia principal para manter uma conversa indo além do que caberia de outro jeito.
- A edição de contexto oferece a limpeza de resultados de ferramentas e a limpeza de blocos de thinking — remove coisas específicas do contexto em vez de resumir tudo.
- A consciência de contexto, no Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5 e Haiku 4.5, deixa o modelo acompanhar o próprio orçamento restante — a API injeta essa informação automaticamente, então não há nada para ligar.
FAQ
O que é a janela de contexto?
Todo o texto que um modelo de linguagem consegue referenciar ao gerar uma resposta, incluindo a própria resposta — o system prompt, cada mensagem anterior, resultados de ferramentas, definições de ferramentas e a resposta em si. É diferente dos dados em que o modelo foi treinado; pense nela como a memória de trabalho da conversa atual, não o conhecimento geral.
O que é context rot?
O padrão por trás do motivo de uma janela de contexto maior não ser automaticamente melhor: conforme o número de tokens cresce, a precisão e a capacidade de recuperar informação caem. É por isso que curar o que entra no contexto importa tanto quanto o espaço disponível.
Qual é o tamanho de uma janela de contexto, em tokens?
Depende do modelo. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6, Fable 5 e Mythos 5 têm janela de 1M tokens na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry. Outros modelos, incluindo o Claude Sonnet 4.5, têm 200 mil.
O que acontece quando uma requisição estoura a janela de contexto?
Se só a entrada já é maior que a janela, a API recusa a requisição com um erro 400 invalid_request_error. Nos modelos Claude 4.5 em diante, entrada mais max_tokens ultrapassando a janela é aceito, e a geração só para com stop_reason: “model_context_window_exceeded” se realmente bater no limite.
Leia em seguida
- A certificação Claude vale a pena?O que uma certificação Claude realmente te dá, quanto custa mantê-la e os números que a Anthropic não publica — decida antes de pagar, não depois.
- Qual certificação Claude você deve fazer?Quatro certificações Claude comparadas: preço, número de domínios, pré-requisitos e status de Partner Network — uma recomendação honesta por perfil.
- Quem pode fazer a certificação Claude?As certificações Claude exigem e-mail de empresa do Claude Partner Network — e-mail pessoal não serve.
- Como é, de fato, o exame de certificação Claude120 minutos, nota de corte 720 numa escala de 100 a 1.
- Como se preparar para a certificação Claude — e quanto tempo levaComo se preparar para a certificação Claude: o que a Anthropic oferece, como planejar por peso de domínio, erros comuns e como estimar sua data de prontidão.
- Questões de prática da certificação Claude — onde achar as reaisOnde achar questões de prática reais para a certificação Claude, como é uma questão real do exame e como diferenciar uma questão útil de um dump decorado.
- Dia da prova da certificação Claude — o que realmente aconteceComo agendar a certificação Claude pela Pearson, a regra de 24 horas que faz você perder a taxa, o que fazer antes do dia e como o resultado chega até você.
- Claude Certified Associate — Foundations (CCAO-F)A certificação Claude de nível inicial: US$ 99, sete domínios, 120 minutos, corte de 720 — o que o CCAO-F cobre, quem pode fazer e o que ele não libera.
- Claude Certified Developer — Foundations (CCDV-F)A certificação Claude de quem constrói: US$ 125, oito domínios ponderados, 120 minutos, corte de 720 — e o domínio que sozinho é um terço da prova.
- Claude Certified Architect — Foundations (CCAR-F)A certificação Claude de nível arquiteto: US$ 125, 60 questões, cinco domínios ponderados e corte de 720 — o que a troca de CCA-F para CCAR-F mudou e não mudou.
- Claude Certified Architect — Professional (CCAR-P)A única certificação Claude de nível profissional: US$ 175, sete domínios e corte de 720 — o blueprint mais plano dos quatro, e o que soma ao Foundations.
- O que é o MCP (Model Context Protocol)?O MCP conecta aplicações de IA a ferramentas e dados externos por host, client e server.
- O que são os hooks do Claude Code, e quando usá-los?Hooks do Claude Code são comandos de shell que rodam automaticamente em pontos fixos da sessão, sem depender de o modelo lembrar de uma instrução.
Gerenciar contexto é uma habilidade que se treina
O AgentPrep treina o ofício que esta página descreve — questões de cenário originais e domínio medido por área, em Telegram. Grátis para começar no navegador, sem cartão.
Começar grátisTrês questões de treino, com as respostas explicadas
Deixe o seu e-mail e enviamos as três questões do nosso quiz com o gabarito comentado — cada uma escrita a partir de material público, nunca lembrada de um exame real.
Pronto — já está a caminho da sua caixa de entrada.
Não deu certo — confira a conexão e tente de novo.