Pular para o conteúdo

OpenAI reduz janela de contexto do Codex de 372k para 272k

Em 18 de julho de 2026, a OpenAI reduziu a janela de contexto reportada do Codex (modelo GPT-5.6) de 372 mil tokens pra 272 mil — uma queda de 27% documentada numa issue no próprio repositório oficial do Codex e discutida amplamente na comunidade. Diferente da maioria das atualizações, que ampliam capacidade, essa foi uma redução — e o motivo real surpreende.

Resumo rápido

  • A capacidade real do modelo não mudou (continua em ~1,05M tokens) — o que mudou foi o metadado de catálogo que o Codex usa pra gerenciar sessão, agora reportando 272k.
  • Passar de 272k tokens ativa cobrança 2x no input e 1,5x no output pra sessão inteira, segundo a própria documentação da OpenAI.
  • O motivo real, confirmado por Thibault Sottiaux (responsável pelo Codex na OpenAI): não é preço puro, é custo de cache-read — um agente como o Codex repete chamada de ferramenta várias vezes, relendo um contexto grande a cada vez, e isso consome uso mais rápido quanto maior o limite.

O Que é Janela de Contexto

É quanto texto (ou código) um modelo consegue “enxergar” e processar de uma vez. No caso do Codex, é a quantidade de código-fonte que ele consegue analisar pra gerar sugestão, completar função ou responder pergunta sobre uma base de código.

O Que Realmente Mudou

O detalhe que passou batido em boa parte da cobertura inicial: o modelo em si não ficou mais fraco. A capacidade real continua em torno de 1,05M tokens. O que a OpenAI mudou foi o metadado de catálogo — o número que o Codex usa internamente pra decidir quando cobrar diferente. Ultrapassar 272k tokens numa sessão ativa uma cobrança de 2x no input e 1,5x no output, válida pra sessão inteira.

Por Que a OpenAI Fez Isso

Segundo Thibault Sottiaux, responsável pelo Codex na OpenAI, o motivo principal não é o preço em si — é o custo de cache-read, que cresce junto com o contexto. Um agente como o Codex repete chamada de ferramenta várias vezes ao longo de uma tarefa, e cada repetição relê um contexto grande. Quanto maior o limite permitido, mais custo interno se acumula, e mais rápido o uso da sua cota é consumido.

Sottiaux também sinalizou que a equipe está ajustando o sistema pra poder subir o limite de novo sem que isso vire cobrança maior — mas sem prazo definido.

Impacto Prático pra Desenvolvedor

  • Projeto grande, monorepo: pode não caber mais inteiro nos 272k “de graça” — passar disso ativa a cobrança dobrada, não corta o acesso, mas encarece.
  • Refatoração em larga escala: tarefa que precisa entender vários arquivos relacionados ao mesmo tempo fica mais cara, não impossível.
  • Ferramenta/harness que assume 372k: se seu fluxo automatizado (RAG, agente customizado) foi configurado assumindo o limite antigo, você pode estar sendo cobrado em dobro sem perceber — vale checar a configuração de contexto explicitamente.

Como se Adaptar

  • Contexto seletivo: envie só os arquivos realmente relevantes pra tarefa, não o projeto inteiro por padrão.
  • Chunking inteligente: divida análise de código extenso em partes lógicas que caibam dentro de 272k, mantendo coesão funcional em cada parte.
  • Confira sua ferramenta: se você usa um harness de terceiros com Codex, confirme se ele já foi atualizado pra respeitar os 272k — muitos ainda assumiam 372k e geravam cobrança dobrada silenciosa.

Perguntas frequentes

O Codex ficou mais fraco de verdade? Não — a capacidade bruta do modelo não mudou. O que mudou é o ponto em que a cobrança dobra, uma decisão de custo operacional, não de capacidade técnica.

Isso é permanente? Sem confirmação. A própria OpenAI sinalizou que pode voltar a subir o limite assim que resolver o problema de custo de cache-read que motivou o corte.

Outros modelos de código estão seguindo essa tendência? Existe uma divergência interessante: modelos de linguagem geral seguem numa corrida por janela cada vez maior (alguns já passam de 1 milhão de tokens), enquanto modelos voltados a código parecem estar otimizando pro caso de uso mais comum — contexto preciso e resposta rápida — em vez do caso extremo.

Conclusão

A redução da janela do Codex é menos sobre “IA ficando pior” e mais sobre como custo operacional real (cache-read repetido por um agente) molda decisão de produto que parecem, à primeira vista, um corte de capacidade. Pra maioria dos devs o impacto é limitado — 272k ainda é bastante contexto — mas quem depende de análise de base de código grande deve conferir a configuração antes de levar susto na fatura.

Recomendação relacionada

Prompt Engineering for Generative AI

Um guia técnico sobre engenharia de prompt pra quem trabalha com modelos de linguagem no dia a dia.

Ver na Amazon →

Como Associado Amazon, Visão Binária pode ganhar uma comissão sobre compras qualificadas feitas através deste link, sem custo adicional pra você.