Como economizar tokens e aproveitar melhor os limites do Claude Code

Assista ao vídeo completo acima e acompanhe o passo a passo escrito abaixo.

Você não vai aumentar de verdade os limites de uso do Claude Code — mas vai aprender estratégias para economizar tokens e fazer muito mais coisa dentro do mesmo limite. Reuni aqui 10 sacadas práticas, várias delas que eu nunca vi ninguém ensinar (nem em curso pago), todas voltadas para otimizar a sua janela de contexto e parar de bater no teto a cada 5 horas.

01Entenda tokens, limite de uso e janela de contexto

Antes das estratégias, dois conceitos precisam estar claros: o limite de uso e a janela de contexto. O limite de uso é quanto você pode conversar com o Claude dentro de cada sessão (a famosa janela de 5 horas, que você acompanha em porcentagem nas configurações de uso). Quando ele estoura, vem aquela mensagem chata pedindo para esperar mais algumas horas. A janela de contexto é a memória de trabalho do agente — tudo o que ele consegue lembrar do seu projeto.

As duas estão 100% ligadas, porque é a janela de contexto que consome o seu limite de uso. E tudo é medido em tokens, que são a unidade de texto da IA. Não há equivalência exata com letras ou palavras: às vezes uma letra é um token, às vezes uma palavra grande também é um token só. Uma boa aproximação é pensar que a cada 10 tokens existem cerca de 7 palavras. Para você ter referência, o limite do Sonnet é de 200.000 tokens, o que dá em torno de 150.000 palavras.

02Como o seu limite é consumido de verdade

Aqui está o ponto que muda tudo: você nunca paga só pela sua mensagem. Toda vez que você manda um prompt, a IA lê todo o contexto que já está na janela e soma a sua mensagem nova. Ou seja, se a sua janela tem 21.000 tokens e você manda um simples "oi, tudo bem", ele consome os 21.000 + a mensagem. Manda outra mensagem? Lê os 21.000 de novo. Vira algo praticamente exponencial.

O que ocupa essa janela? O system prompt e as system tools (instruções da própria Claude, que você não mexe, somando uns 18 a 20.000 tokens), os MCP Tools, as skills, as suas mensagens, as respostas dele, documentos lidos, o CLAUDE.md, hooks ativados — tudo entra ali. Logo no início da conversa você já começa gastando, antes mesmo de digitar a primeira mensagem.

A conclusão é simples: o segredo para otimizar o limite de uso é otimizar a janela de contexto. Quanto menor e mais enxuta ela estiver, menos tokens cada mensagem vai consumir. Praticamente todas as estratégias a seguir giram em torno disso.

03Use /clear ao trocar de tarefa

O comando /clear limpa a janela de contexto — é como começar uma conversa nova com o agente. Eu uso sempre que vou iniciar uma tarefa que não tem nada a ver com a anterior. Acabei de montar uma landing page e agora quero começar outra coisa? /clear e pronto: aquele projeto que estava com 45.000 tokens cai para uns 1.600 nas mensagens.

Você também pode simplesmente abrir uma nova sessão, que tem o mesmo efeito. Use e abuse disso quando começar tarefas independentes — é a forma mais rápida de zerar o gasto acumulado.

04Use /compact para resumir sem perder tudo

O /compact é parecido com o /clear, mas não apaga tudo: ele resume tudo o que foi conversado até o momento. Em vez de cair de 40.000 para uns 23.000, ele vai para uns 30.000 — reduz a quantidade de tokens, mas o agente continua entendendo o que foi feito, só que de forma resumida. Use quando você ainda precisa que ele lembre das informações da tarefa atual.

Vale conhecer também o auto compact buffer: um espaço (uns 33.000 tokens) que o Claude reserva na memória justamente para resumir a conversa automaticamente quando você se aproxima de 80% a 100% da janela. Não significa que está ocupado — é só um espaço reservado. Você pode disparar o resumo manualmente com o /compact a qualquer momento.

Regra prática: /clear ao iniciar tarefas que não têm relação com a anterior; /compact quando você precisa manter algumas informações da tarefa atual.

05Desconecte MCPs que você não usa

Assim que você inicia a conversa, o Claude já carrega todos os MCPs conectados — e cada um traz suas instruções, consumindo tokens. Se você não vai usar um MCP naquele projeto, desabilite. Basta acessar o menu de MCPs e desligar os que não fazem sentido ali.

Cada MCP sozinho às vezes consome pouquinho, mas a soma faz diferença. Economiza um pouco aqui, um pouco ali, e a janela de contexto vai ficando enxuta — exatamente a lógica que faz cada mensagem custar menos.

06Agrupe os prompts em blocos

Evite o envio fragmentado de instruções. Lembre-se da lógica: cada mensagem faz a IA reler todo o contexto. Se você manda "muda a cor", ele lê tudo; depois manda "muda a cópia", ele lê tudo de novo.

Em vez disso, mande tudo de uma vez só. Junte as instruções num único prompt — por exemplo: "mude a cor e a cópia da landing page". Uma leitura do contexto em vez de duas, três ou quatro. É simples e economiza bastante token ao longo do dia.

07Use o modo planejamento antes de executar

O plan mode gasta mais tokens no início do que uma mensagem comum, mas compensa muito. A ideia é planejar o que precisa ser feito antes de executar, para a IA não ficar testando, batendo cabeça e errando — e cada erro é mais token gasto em tentativa e erro.

Se você define o passo a passo primeiro e só depois manda executar, ele acerta de primeira com muito mais frequência. Você gasta um pouco mais para planejar, mas gasta bem menos na execução. Sem planejamento, é na execução que o dinheiro queima.

08Escolha o modelo certo para cada tarefa

Existem três modelos principais, e saber quando usar cada um economiza muito: Opus, Sonnet e Haiku.

O Opus é o mais inteligente, ideal para tarefas complexas e mudanças drásticas em que você não pode deixar ele errar — mas consome cerca de duas vezes mais que o Sonnet. Já deixei o Opus ligado por engano e ele bebeu todos os meus tokens de uma vez. O Sonnet é o padrão, equilibrado para tarefas de média dificuldade. O Haiku é o mais simples e leve, perfeito para coisas triviais, como trocar uma palavra X por Y, onde ele nem precisa "pensar" muito.

Além do modelo, ajuste a opção de thinking (se ele precisa raciocinar ou não — pensar gasta mais) e o nível de effort (a "potência" que você dá para ele executar; o padrão fica no médio). Dependendo da situação, suba ou baixe esse nível. Combinar modelo + thinking + effort corretos para cada situação faz uma diferença enorme no consumo. Para a maioria das coisas, deixe no padrão.

09Use o CLAUDE.md como memória manual

Toda vez que você dá um /clear, o agente esquece tudo. Como pedir para ele não esquecer o que é importante? Criando o arquivo CLAUDE.md — uma memória manual do projeto. Você mesmo cria, ou pede para ele criar, e ali ficam a visão do projeto, a arquitetura, o que já foi feito e quais skills existem.

O ganho é que o CLAUDE.md sempre é carregado na janela de contexto. Então, depois de um /clear, em vez de a IA ter que reler todo o seu sistema para se situar, ela lê só esse resumo geral e já se inteira de tudo. Use e abuse do CLAUDE.md: é um dos recursos que mais economiza leitura desnecessária.

10Modularize com skills e controle a autoinvocação

As skills entram em duas frentes. A primeira é modularizar regras em skills em vez de empilhar tudo dentro do CLAUDE.md. O CLAUDE.md é sempre carregado por inteiro; já a skill carrega só a descrição e abre o conteúdo completo apenas quando o agente percebe que precisa dela. Então, em vez de escrever toda a sua identidade visual no CLAUDE.md, crie uma skill de identidade visual e, no CLAUDE.md, diga apenas: "se precisar disso, chame aquela skill". O conteúdo pesado fica reservado e só é lido quando faz sentido.

A segunda frente é controlar a autoinvocação. Por padrão, cada skill fica habilitada para ser invocada automaticamente — e, para isso, o Claude sempre lê a descrição dela, o que consome tokens (no meu teste, habilitar uma skill subiu uns 3.000 tokens). Para skills que você sabe que não precisa que sejam chamadas sozinhas, desabilite a autoinvocação. Quando precisar, basta chamar a skill manualmente com o atalho de barra, e ela roda de forma obrigatória. Quanto mais skills você passa para o modo manual, menos tokens ficam ocupando a janela e menos cada mensagem custa.


Essas são as 10 estratégias. A lógica por trás de todas é a mesma: otimizar a janela de contexto. Economiza um pouco aqui, um pouco ali, e você passa a aproveitar muito mais o seu limite de uso do que aproveitava antes. Aplique tudo isso e você vai conseguir fazer bem mais coisa dentro do mesmo limite do Claude Code.

← Voltar para o blog