O que a sessão realmente gasta — e como manter o gasto na tarefa
Tokens bons vão para o trabalho. O resto é atrito.Defina modelo, effort e MCP no início da sessão — mid-session quebra o prefixo em cache.
Seja deliberado no que entra na conversa: harness, CLAUDE.md, skills e arquivos @ contam como input.
Uma tarefa por sessão: /clear entre trabalhos; /compact antes de pausar com cache ainda quente.
Quando você aperta Enter, o Claude Code não manda só a sua frase. O harness monta um pacote: system prompt, definições das tools, CLAUDE.md, skills e MCP carregados — e só no fim a mensagem.
Tudo isso vira tokens na context window. Cada turno reenvia a conversa até ali. Cada tool call acrescenta resultado. O barômetro da sessão cresce no loop request → tool → append.
Eficiência não é “usar menos tokens”. É garantir que os que entram vão para a tarefa pedida. Esse mental model — input, output, cache, com o modelo como multiplicador — continua válido quando o preço ou o produto mudam.
Assinatura (Team/Enterprise) e API medem a mesma coisa: tokens. Os preços absolutos mudam; os multiplicadores relativos são o que importa para decidir o hábito.
System, tools, CLAUDE.md, skills, MCP e a mensagem. No loop, a conversa acumulada volta a cada turno. Input é a base do custo — e o que o cache pode baratear.
Respostas e tool calls. Em regra, output custa cerca de ~5× o input. Menos rodadas desnecessárias e respostas mais curtas quando a tarefa permite: impacto direto.
Cache é o prefixo estável da request. Leitura de cache: ~0.1× do input. Escrita: 1,25× com TTL de 5 minutos, ou 2× com janela de 1 hora. A janela de 1h custa mais na escrita — vale quando você pausa e volta.
Assinatura (usage do plano): ~1 hora. API, credits e cloud: ~5 minutos. Subagents: ~5 minutos. Dá para ajustar com promptCacheTtl e subagentPromptCacheTtl nas managed settings.
Hábitos que empurram tokens para a tarefa — sem checklist que envelhece na próxima release.
Antes de empilhar mais contexto, veja o que já está na janela. O que não serve à tarefa atual é atrito pago.
Deixe no CLAUDE.md o que vale em toda sessão. Skills e MCP entram sob demanda. MCP idle não custa zero: descrições e wiring ainda ocupam o pacote.
Referenciar o arquivo certo evita tool calls extras. Quiet flags reduzem ruído de output quando você não precisa do log completo.
Uma sessão, um objetivo. Misturar trabalhos diferentes arrasta contexto morto para o próximo turno — input cheio, cache menos útil.
Se o cache ainda está quente e você vai voltar, compactar preserva o essencial e reduz o que precisa ser reenviado depois.
Subagent trabalha numa janela separada. Só a conclusão volta para a main — a exploração suja não infla a conversa principal.
Cache exige prefixo idêntico. Mudar /model ou /effort no meio da sessão invalida o cache — a documentação do Claude Code trata /effort como invalidação sempre.
/model ou /effort mid-session → prefixo quebra; doc diz que /effort sempre invalida/effort citada em workshopQuem administra Claude Code para o time tem alavancas que o hábito individual não alcança. Managed settings definem o default certo uma vez — e o mental model continua o mesmo.
promptCacheTtl / subagentPromptCacheTtl) alinhado ao ritmo real de pausaautoContinueAtUsageLimit para teto sem surpresaEscolha uma sessão real desta semana. Antes de começar: modelo, effort e MCP. No meio: /context e @arquivo. No fim: /clear ou /compact.
Se você configura o time, alinhe managed settings ao mesmo mental model — default certo, cache com TTL útil, MCP só o necessário. O resto é disciplina de sessão.