De onde vem o custo:
Você paga pelo que entra (todo o contexto da conversa, de novo a cada mensagem) e pelo que sai. Conversa longa com arquivo grande dentro é a conta subindo em silêncio a cada turno.
- 1Contexto enxuto: aponte arquivos específicos, encerre sessão concluída, recomece limpo depois de erros (material CONTEXTO). É a alavanca gratuita que mais paga.
- 2Modelo certo por tarefa: tarefa mecânica em modelo leve, raciocínio pesado em modelo forte (material MODELO). Usar o topo de linha pra formatar texto é dinheiro no lixo.
- 3Cache de prompt: contexto repetido (instruções, base de conhecimento) pode custar fração do preço nas chamadas seguintes (material CACHE).
- 4Delegação com retorno curto: subagente que devolve relatório de uma página em vez de despejar tudo que leu no contexto principal.
Analisa como eu venho usando você nesta semana: onde o contexto ficou grande sem necessidade, que tarefas cabiam num modelo mais leve e que instrução repetida merecia virar arquivo permanente. Me devolve as 3 mudanças de maior impacto no custo.
O que NÃO fazer:
Cortar contexto necessário pra economizar. Resposta errada por falta de informação custa mais caro que os tokens que você poupou — retrabalho é o token mais caro que existe.