Tutorial de configuração do Codex para habilitar 1M de contexto no GPT-5.6 Sol: 3 linhas no `config.toml`
GPT-5.6 Sol suporta oficialmente contexto de 1,05 milhão de tokens. Basta adicionar 3 linhas de configuração no topo do config.toml do Codex para executar com janela de 1 milhão e compactar automaticamente o histórico em cerca de 900 mil tokens. Inclui configuração permanente, comando único, verificação e lembrete de custos.

A janela de contexto oficial do GPT-5.6 Sol é de 1.050.000 tokens, mas o Codex não usa toda a janela por padrão. Para que sessões muito longas sofram o mínimo de compactação possível, basta adicionar 3 linhas de configuração no topo do config.toml do Codex:
model = "gpt-5.6-sol"
model_context_window = 1000000
model_auto_compact_token_limit = 900000Depois de salvar, reinicie o Codex e abra uma nova sessão. A seguir, explicamos de uma vez só a localização do arquivo de configuração, a função de cada linha, como iniciar em uma única execução e os cuidados necessários.
Primeiro, a conclusão: o que essas 3 linhas fazem
| Configuração | Função |
|---|---|
model = "gpt-5.6-sol" |
Seleciona explicitamente o modelo topo de linha Sol da série GPT-5.6 |
model_context_window = 1000000 |
Informa ao Codex para alocar um orçamento de contexto de 1 milhão de tokens para o modelo atual |
model_auto_compact_token_limit = 900000 |
Quando o contexto ativo se aproxima de 900 mil tokens, compacta automaticamente o histórico antigo para evitar estourar o limite da janela |
A referência de configuração do Codex da OpenAI já lista oficialmente os dois itens de configuração model_context_window e model_auto_compact_token_limit; a página do modelo GPT-5.6 Sol indica que sua janela de contexto é de 1.050.000 tokens, com saída máxima de 128.000 tokens.
Aqui não usamos exatamente 1.050.000, mas sim 1.000.000, deixando uma margem para o prompt de sistema, resultados de ferramentas e diferenças de implementação; em seguida, colocamos o limite de compactação automática em 900.000, para que o Codex tenha espaço para compactar, em vez de esperar até a janela estar quase estourando.
Passo 1: Encontre o `config.toml` do Codex
O arquivo de configuração de nível de usuário do Codex fica em:
- macOS / Linux:
~/.codex/config.toml - Windows:
%USERPROFILE%\.codex\config.toml
Em macOS ou Linux, execute diretamente:
mkdir -p ~/.codex
nano ~/.codex/config.tomlEm Windows PowerShell, execute:
notepad $env:USERPROFILE\.codex\config.tomlSe o arquivo não existir, crie-o; se já existir, edite o arquivo original sem sobrescrever as configurações existentes de MCP, permissões ou projetos.
Passo 2: Coloque a configuração no topo do arquivo
Coloque as 3 linhas abaixo no início do config.toml:
model = "gpt-5.6-sol"
model_context_window = 1000000
model_auto_compact_token_limit = 900000Coloque-as antes do primeiro título [section]. Por exemplo, se o seu arquivo já contém:
[projects."/path/to/project"]
trust_level = "trusted"Então as 3 linhas de configuração do modelo devem ficar acima dele. Em TOML, chaves comuns escritas depois de [projects."..."] são tratadas como conteúdo dessa seção e não são mais configuração global.
Se o arquivo já tiver uma linha model = "...", altere-a para gpt-5.6-sol; não escreva dois model. As aspas também devem ser aspas duplas retas em inglês "; não copie aspas curvas de textos formatados.
Passo 3: Reinicie e abra uma nova sessão
Depois de salvar o arquivo:
- Saia do cliente ou CLI atual do Codex;
- Reinicie o Codex;
- Crie uma nova sessão.
Sessões antigas já abertas normalmente não trocam o orçamento de contexto durante a execução; portanto, recarregar a janela e continuar em um thread antigo não é confiável. O mais simples é criar uma nova sessão.
Você pode usar o comando de diagnóstico do Codex para verificar se a configuração foi carregada com sucesso:
codex doctor --jsonPreste atenção nestes itens:
overallStatuscomook;config.loadcomook;modelexibindogpt-5.6-sol.
Esse comando verifica se o arquivo de configuração pode ser analisado e carregado corretamente; ele não vai realmente consumir centenas de milhares de tokens para "testar 1M".
Sem alterar a configuração padrão: ative 1M apenas para a sessão CLI atual
Se você apenas ocasionalmente lida com repositórios enormes ou tarefas muito longas e não quer que todas as sessões usem 1M por padrão, pode sobrescrever temporariamente na inicialização:
codex -m gpt-5.6-sol \
-c model_context_window=1000000 \
-c model_auto_compact_token_limit=900000Esses parâmetros afetam apenas esta inicialização. Depois de fechar o Codex atual, a próxima execução voltará aos valores padrão do config.toml.
Em quais cenários o contexto de 1M é adequado
É mais adequado para estas tarefas:
- Modificar vários módulos consecutivamente em um repositório monolítico grande;
- Quando o agente precisa manter por muito tempo decisões de arquitetura, processos de depuração e resultados de testes;
- Inserir de uma vez muitos documentos de design, especificações de interface ou logs;
- Não querer que a tarefa sofra compactação automática frequente no meio do caminho, perdendo detalhes iniciais.
Se for apenas alterar um ou dois arquivos, corrigir bugs simples ou escrever scripts curtos, a janela padrão do Codex geralmente já é suficiente. Uma janela maior significa “cabe mais conteúdo”, não que todas as rodadas precisam ficar lotadas, nem que contextos mais longos garantem maior aproveitamento da atenção do modelo.
Custos e trade-offs de qualidade que você precisa conhecer antes de ativar
Contexto longo é muito útil, mas não é almoço grátis.
1. Acima de 272K, o contexto longo da API entra em uma faixa de preço mais alta
A página do modelo GPT-5.6 Sol da OpenAI afirma claramente: quando a entrada ultrapassa 272K tokens, o preço de entrada de toda a requisição é multiplicado por 2 e o preço de saída por 1,5.
Se você usa a cobrança via API, isso aparecerá diretamente na sua fatura; se você estiver logado por assinatura ChatGPT / Codex, o efeito pode ser um consumo mais rápido de cota; ainda assim, o que vale é a política de limites exibida no cliente.
2. Cada rodada carrega um histórico mais longo
Quanto mais longa a sessão, mais atenção você deve dar à latência, ao consumo de tokens e ao comportamento de cache. Se a maior parte de dezenas de milhares de tokens de logs antigos já não é útil, continuar carregando tudo do mesmo jeito nem sempre é melhor do que um resumo compactado de alta qualidade.
3. Suportar 1M não significa que a qualidade fica completamente inalterada em 1M
Contextos muito longos reduzem o truncamento de informações, mas o modelo ainda pode ter a atenção dispersa por muito ruído. Recomendo limpar prontamente logs de build, saídas repetidas de ferramentas e trilhas de depuração já inválidas; quando houver uma mudança clara de fase na tarefa, você também pode usar /compact proativamente.
Perguntas frequentes
Configurei tudo, por que a sessão atual não mudou?
O config.toml é carregado principalmente na inicialização e ao criar sessões. Reinicie o cliente e crie uma nova sessão; não valide continuando a sessão longa antiga.
O arquivo de configuração carrega, mas o modelo não é Sol?
Verifique se você usou codex -m ..., --profile e se também existe um .codex/config.toml no diretório do projeto. Os argumentos de linha de comando, a configuração do projeto e o profile do Codex podem sobrescrever a configuração de nível de usuário.
E se o Codex disser “não conheço esta opção de configuração”?
Primeiro verifique a versão:
codex --versionDepois atualize para a versão atual:
codex updateVersões mais antigas do Codex podem ainda não ter essas duas chaves de configuração.
E se eu quiser restaurar as configurações padrão?
Basta remover as duas linhas abaixo para restaurar o contexto padrão do modelo e a política de compactação automática:
model_context_window = 1000000
model_auto_compact_token_limit = 900000model = "gpt-5.6-sol" pode ser mantido ou você pode voltar para o modelo que usava antes.
Resumo
Para ativar permanentemente o contexto de 1M no GPT-5.6 Sol, basta colocar estas 3 linhas no topo do ~/.codex/config.toml:
model = "gpt-5.6-sol"
model_context_window = 1000000
model_auto_compact_token_limit = 9000001 milhão é o orçamento de contexto; 900 mil é o limite de compactação automática. Isso é ótimo para repositórios grandes e tarefas de agente de longa duração, mas para tarefas comuns continuar usando as configurações padrão do Codex geralmente economiza cota, é mais rápido e mais estável.
Se você pretende deixar o Codex executando tarefas por muito tempo na máquina de desenvolvimento e não quer ficar o tempo todo diante do computador, também pode usar o PandaNpc para visualizar sessões e interagir remotamente pelo navegador, desktop ou celular.
Guias relacionados

pandacode: Faça a experiência do Claude Code rodar em qualquer modelo
pandacode é um mecanismo de agente de codificação de código aberto incorporado no pandapaw, compatível com a experiência completa do Claude Code, mas o backend do modelo é decidido por você — DeepSeek, Qwen, vLLM/Ollama, proxy de rede interna da empresa podem ser conectados, suporta ambos os formatos de API da OpenAI e Anthropic. Instalação com um único comando, controle remoto normalmente pelo celular, navegador, desktop.
Ler artigo →
O histórico sumiu depois do `/compact` do Claude Code? Aprenda a recuperar a conversa completa
Depois do /compact do Claude Code, o histórico sumiu? Os dados não foram perdidos — o PandaNpc concatena todo o histórico ao longo da cadeia de compressão, recupera completamente no desktop/web, suporta múltiplas compressões e não afeta o contexto real.
Ler artigo →
Desligue este computador e controle seu Claude Code remotamente de qualquer lugar
Claude Code preso em uma única máquina? Deixe-o rodar na máquina de desenvolvimento, você troca de computador ou navegador para controle remoto — visualizar sessões, aprovar ferramentas, ver alterações de código, sem precisar ficar na frente da máquina o tempo todo.
Ler artigo →