TEAVOXAI
Entrega · Consultoria em IA

Cada Token no Alvo

O que a sessão realmente gasta — e como manter o gasto na tarefa

Tokens bons vão para o trabalho. O resto é atrito.
Publicado em 13 set 2026 Versão v1.0 Entregue
Em três movimentos

Defina modelo, effort e MCP no início da sessão — mid-session quebra o prefixo em cache.

Seja deliberado no que entra na conversa: harness, CLAUDE.md, skills e arquivos @ contam como input.

Uma tarefa por sessão: /clear entre trabalhos; /compact antes de pausar com cache ainda quente.

01O prompt nunca é só o prompt

Quando você aperta Enter, o Claude Code não manda só a sua frase. O harness monta um pacote: system prompt, definições das tools, CLAUDE.md, skills e MCP carregados — e só no fim a mensagem.

Tudo isso vira tokens na context window. Cada turno reenvia a conversa até ali. Cada tool call acrescenta resultado. O barômetro da sessão cresce no loop request → tool → append.

Eficiência não é “usar menos tokens”. É garantir que os que entram vão para a tarefa pedida. Esse mental model — input, output, cache, com o modelo como multiplicador — continua válido quando o preço ou o produto mudam.

02O loop da sessão

HarnessMonta system + toolsCLAUDE.md · skills/MCP · msgContext windowPrefixo em cacheParte idêntica da requestleitura ~0,1×Append novomsg · tool resultsinput/output cheiojanela cresce →ModeloLê a janela · gera textoou tool call (~5× no output)Tool / harnessExecuta a tool e devolveresultado para o próximo turnorequest montadacache hit ~0,1×tokens novostool callresultado anexado

03Três tipos de token

Assinatura (Team/Enterprise) e API medem a mesma coisa: tokens. Os preços absolutos mudam; os multiplicadores relativos são o que importa para decidir o hábito.

Input

Tudo que entra no modelo

System, tools, CLAUDE.md, skills, MCP e a mensagem. No loop, a conversa acumulada volta a cada turno. Input é a base do custo — e o que o cache pode baratear.

Output

O que o modelo gera

Respostas e tool calls. Em regra, output custa cerca de ~5× o input. Menos rodadas desnecessárias e respostas mais curtas quando a tarefa permite: impacto direto.

Cache

Prefixo idêntico, leitura barata

Cache é o prefixo estável da request. Leitura de cache: ~0.1× do input. Escrita: 1,25× com TTL de 5 minutos, ou 2× com janela de 1 hora. A janela de 1h custa mais na escrita — vale quando você pausa e volta.

TTL

Quanto tempo o prefixo vive

Assinatura (usage do plano): ~1 hora. API, credits e cloud: ~5 minutos. Subagents: ~5 minutos. Dá para ajustar com promptCacheTtl e subagentPromptCacheTtl nas managed settings.

04Higiene de sessão

Hábitos que empurram tokens para a tarefa — sem checklist que envelhece na próxima release.

1
Ver

Abra com /context

Antes de empilhar mais contexto, veja o que já está na janela. O que não serve à tarefa atual é atrito pago.

2
Enxugar

CLAUDE.md só o universal

Deixe no CLAUDE.md o que vale em toda sessão. Skills e MCP entram sob demanda. MCP idle não custa zero: descrições e wiring ainda ocupam o pacote.

3
Apontar

@arquivo em vez de Read cego

Referenciar o arquivo certo evita tool calls extras. Quiet flags reduzem ruído de output quando você não precisa do log completo.

4
Focar

/clear entre tarefas

Uma sessão, um objetivo. Misturar trabalhos diferentes arrasta contexto morto para o próximo turno — input cheio, cache menos útil.

5
Pausar

/compact antes da pausa

Se o cache ainda está quente e você vai voltar, compactar preserva o essencial e reduz o que precisa ser reenviado depois.

6
Delegar

Subagent com contexto próprio

Subagent trabalha numa janela separada. Só a conclusão volta para a main — a exploração suja não infla a conversa principal.

05O que quebra o cache

Atenção

Cache exige prefixo idêntico. Mudar /model ou /effort no meio da sessão invalida o cache — a documentação do Claude Code trata /effort como invalidação sempre.

  • /model ou /effort mid-session → prefixo quebra; doc diz que /effort sempre invalida
  • Não apostar na exceção Fable 5.1 + /effort citada em workshop
  • Cache read ~0,1× no geral; 0,025× é exceção de modelo, não regra
  • Preços absolutos variam — decida com multiplicadores relativos
  • “CLI > MCP” é hábito de workshop, não política canônica

06Alavancas de time

Managed settings definem o default certo

Quem administra Claude Code para o time tem alavancas que o hábito individual não alcança. Managed settings definem o default certo uma vez — e o mental model continua o mesmo.

  • Modelo e effort padrão da org — menos troca mid-session
  • TTL de cache (promptCacheTtl / subagentPromptCacheTtl) alinhado ao ritmo real de pausa
  • Allowlist de MCP — só o que a equipe precisa
  • CLAUDE.md organizacional enxuto e universal
  • OpenTelemetry para ver onde a sessão gasta de verdade
  • Usage credits, spend limits e autoContinueAtUsageLimit para teto sem surpresa

07Referências

Comece na próxima sessão

Escolha uma sessão real desta semana. Antes de começar: modelo, effort e MCP. No meio: /context e @arquivo. No fim: /clear ou /compact.

Se você configura o time, alinhe managed settings ao mesmo mental model — default certo, cache com TTL útil, MCP só o necessário. O resto é disciplina de sessão.