# Como melhorar seu Agente de IA e economizar créditos (cache e boas práticas)

Seu Agente de IA já está no ar? Este guia mostra como **melhorar as respostas** e, ao mesmo tempo, **reduzir o consumo de créditos de IA** — incluindo como funciona o **cache**, o mecanismo que faz a mesma conversa custar até metade.

## Como a cobrança funciona

O consumo de IA é medido em **créditos de IA**: **1 crédito equivale a 1 milhão de tokens no modelo padrão** (GPT-4.1 mini). Modelos mais avançados consomem créditos proporcionalmente ao custo deles:

| Modelo | Multiplicador | ≈ Conversas resolvidas por crédito |
| --- | --- | --- |
| GPT-4.1 mini (padrão) | 1× | ~25 |
| Haiku | 2,5× | ~10 |
| GPT-4.1 | 5× | ~5 |
| Sonnet | 7× | ~3 |

> 📘 **Tradução prática**: uma conta que resolve as mesmas conversas no modelo padrão gasta até 7× menos créditos do que no modelo mais avançado. Use modelos maiores apenas onde eles fazem diferença real.

**Onde acompanhar**: o saldo aparece no **topo da plataforma** (badge de créditos); o detalhamento fica em **Central IA > Análises** — créditos utilizados, uso ao longo do tempo, consumo por agente e exportação CSV com a coluna de créditos. Recargas ficam no **Marketplace, aba Créditos de IA**.

## O que é o cache (e por que ele economiza)

A cada resposta, o agente envia ao modelo de IA um "pacote" com duas partes:

1. **Parte fixa**: instruções, personalidade, regras e ferramentas do agente — igual em toda resposta.
2. **Parte variável**: a mensagem do cliente, o histórico recente e os trechos da base de conhecimento relevantes àquela pergunta.

Quando várias respostas acontecem em uma janela curta de tempo, a **parte fixa é reaproveitada pelo provedor de IA** (cache) — e o SimplesDesk **repassa esse desconto automaticamente**: tokens atendidos pelo cache são cobrados **pela metade** na sua cota de créditos. Em contas com fluxo contínuo de atendimento, o efeito é grande: operações com alto aproveitamento de cache chegam a reduzir o débito de créditos em **mais de 40%** — sem mudar nada na qualidade.

Você não precisa "ligar" o cache — ele é automático. Mas dá para **aumentar o aproveitamento**:

## Como aumentar o aproveitamento do cache

### 1. Não edite o agente em horário de pico

Cada alteração nas instruções, personalidade ou regras **invalida o cache** — a parte fixa muda e precisa ser reprocessada do zero. Agrupe os ajustes e aplique-os **fora do horário de movimento** (início da manhã, fim do dia). Evite o ciclo "editar → salvar → editar de novo" com o agente atendendo.

### 2. Mantenha fluxo contínuo no mesmo agente

O cache é reaproveitado entre respostas **próximas no tempo** do mesmo agente. Dez conversas em uma hora aproveitam muito mais cache do que dez conversas espalhadas no dia. Na prática:

- Se dois canais têm o mesmo escopo de atendimento, **use o mesmo agente nos dois** em vez de criar um agente clone para cada canal — o volume somado mantém o cache "quente".
- Reserve agentes separados para escopos realmente diferentes (vendas × suporte técnico).

### 3. Não fique trocando de modelo

Cada modelo tem o próprio cache. Trocar o modelo do agente no meio do dia zera o aproveitamento. Escolha o modelo com calma (comece sempre pelo padrão) e mantenha.

### 4. Instruções completas, base de conhecimento fatiada

Aqui há um detalhe que vale dinheiro: a **parte fixa** (instruções) é a que recebe desconto de cache; a **parte variável** (trechos da base recuperados por pergunta) é sempre preço cheio. Portanto:

- O que é **regra permanente** do atendimento (políticas, tom, limites, passos) pertence às **instruções** — texto estável, cacheável.
- O que é **conteúdo de consulta** (tabelas, especificações, catálogo) pertence à **base de conhecimento**, em documentos **objetivos e bem divididos** — o agente recupera só o trecho relevante, em vez de arrastar um manual inteiro a cada resposta.

> ⚠️ **Evite** colar um catálogo de 50 páginas dentro das instruções: além de piorar as respostas, infla a parte fixa desnecessariamente.

## Menos idas e vindas = menos tokens

Cada troca de mensagens custa créditos. As configurações que melhoram a qualidade também reduzem o custo, porque a conversa termina antes:

- **Respostas prontas** para as perguntas mais frequentes: resposta certa de primeira, sem o agente "raciocinar" à toa.
- **Base de conhecimento atualizada**: documento desatualizado gera resposta errada → cliente contesta → mais mensagens.
- **Manter no assunto** (em Regras): impede conversas improdutivas fora do escopo.
- **Máximo de tokens por resposta** (em Instruções & Modelo): respostas objetivas custam menos e funcionam melhor no WhatsApp.
- **Desistir após N tentativas + transferência bem configurada**: quando o agente não está resolvendo, insistir só queima créditos — transfira para um humano.
- **Follow-up com limite de tentativas e janela de horário**: retomadas automáticas são poderosas, mas configure o teto.

## Medindo o resultado

Em **Central IA > Análises** você acompanha:

- **Créditos utilizados** no período e o uso ao longo do tempo;
- **Consumo por agente** — identifique qual agente concentra o custo;
- **Tempo economizado pela IA** e conversas resolvidas sem humano;
- **Exportação CSV detalhada** (dia a dia, com créditos e tokens) para análise fina.

Revise mensalmente: se um agente consome muito e resolve pouco, o problema quase sempre está em base de conhecimento fraca ou escopo mal definido — não no modelo.

## Checklist de economia

- [ ] Modelo padrão (mini) nos agentes — modelos maiores só onde comprovadamente necessário
- [ ] Edições de configuração agrupadas e fora do pico
- [ ] Um agente por escopo (não um clone por canal)
- [ ] Regras permanentes nas instruções; conteúdo de consulta na base, em documentos fatiados
- [ ] Respostas prontas para o top 5 de perguntas
- [ ] Limite de tokens por resposta configurado
- [ ] Transferência para humano e "desistir após N" configurados
- [ ] Análises revisadas mensalmente

Ainda não criou seu agente? Comece pelo guia **[Agente de IA: guia completo de criação e configuração](https://chat.simplesdesk.com.br/hc/central-de-ajuda/articles/1786912670-agente-de-ia-guia-completo-de-criacao-e-configuracao)**.
