Seu Agente de IA já está no ar? Este guia mostra como melhorar as respostas e, ao mesmo tempo, reduzir o consumo de créditos de IA — incluindo como funciona o cache, o mecanismo que faz a mesma conversa custar até metade.
Como a cobrança funciona
O consumo de IA é medido em créditos de IA: 1 crédito equivale a 1 milhão de tokens no modelo padrão (GPT-4.1 mini). Modelos mais avançados consomem créditos proporcionalmente ao custo deles:
| Modelo | Multiplicador | ≈ Conversas resolvidas por crédito |
|---|---|---|
| GPT-4.1 mini (padrão) | 1× | ~25 |
| Haiku | 2,5× | ~10 |
| GPT-4.1 | 5× | ~5 |
| Sonnet | 7× | ~3 |
📘 Tradução prática: uma conta que resolve as mesmas conversas no modelo padrão gasta até 7× menos créditos do que no modelo mais avançado. Use modelos maiores apenas onde eles fazem diferença real.
Onde acompanhar: o saldo aparece no topo da plataforma (badge de créditos); o detalhamento fica em Central IA > Análises — créditos utilizados, uso ao longo do tempo, consumo por agente e exportação CSV com a coluna de créditos. Recargas ficam no Marketplace, aba Créditos de IA.
O que é o cache (e por que ele economiza)
A cada resposta, o agente envia ao modelo de IA um "pacote" com duas partes:
- Parte fixa: instruções, personalidade, regras e ferramentas do agente — igual em toda resposta.
- Parte variável: a mensagem do cliente, o histórico recente e os trechos da base de conhecimento relevantes àquela pergunta.
Quando várias respostas acontecem em uma janela curta de tempo, a parte fixa é reaproveitada pelo provedor de IA (cache) — e o SimplesDesk repassa esse desconto automaticamente: tokens atendidos pelo cache são cobrados pela metade na sua cota de créditos. Em contas com fluxo contínuo de atendimento, o efeito é grande: operações com alto aproveitamento de cache chegam a reduzir o débito de créditos em mais de 40% — sem mudar nada na qualidade.
Você não precisa "ligar" o cache — ele é automático. Mas dá para aumentar o aproveitamento:
Como aumentar o aproveitamento do cache
1. Não edite o agente em horário de pico
Cada alteração nas instruções, personalidade ou regras invalida o cache — a parte fixa muda e precisa ser reprocessada do zero. Agrupe os ajustes e aplique-os fora do horário de movimento (início da manhã, fim do dia). Evite o ciclo "editar → salvar → editar de novo" com o agente atendendo.
2. Mantenha fluxo contínuo no mesmo agente
O cache é reaproveitado entre respostas próximas no tempo do mesmo agente. Dez conversas em uma hora aproveitam muito mais cache do que dez conversas espalhadas no dia. Na prática:
- Se dois canais têm o mesmo escopo de atendimento, use o mesmo agente nos dois em vez de criar um agente clone para cada canal — o volume somado mantém o cache "quente".
- Reserve agentes separados para escopos realmente diferentes (vendas × suporte técnico).
3. Não fique trocando de modelo
Cada modelo tem o próprio cache. Trocar o modelo do agente no meio do dia zera o aproveitamento. Escolha o modelo com calma (comece sempre pelo padrão) e mantenha.
4. Instruções completas, base de conhecimento fatiada
Aqui há um detalhe que vale dinheiro: a parte fixa (instruções) é a que recebe desconto de cache; a parte variável (trechos da base recuperados por pergunta) é sempre preço cheio. Portanto:
- O que é regra permanente do atendimento (políticas, tom, limites, passos) pertence às instruções — texto estável, cacheável.
- O que é conteúdo de consulta (tabelas, especificações, catálogo) pertence à base de conhecimento, em documentos objetivos e bem divididos — o agente recupera só o trecho relevante, em vez de arrastar um manual inteiro a cada resposta.
⚠️ Evite colar um catálogo de 50 páginas dentro das instruções: além de piorar as respostas, infla a parte fixa desnecessariamente.
Menos idas e vindas = menos tokens
Cada troca de mensagens custa créditos. As configurações que melhoram a qualidade também reduzem o custo, porque a conversa termina antes:
- Respostas prontas para as perguntas mais frequentes: resposta certa de primeira, sem o agente "raciocinar" à toa.
- Base de conhecimento atualizada: documento desatualizado gera resposta errada → cliente contesta → mais mensagens.
- Manter no assunto (em Regras): impede conversas improdutivas fora do escopo.
- Máximo de tokens por resposta (em Instruções & Modelo): respostas objetivas custam menos e funcionam melhor no WhatsApp.
- Desistir após N tentativas + transferência bem configurada: quando o agente não está resolvendo, insistir só queima créditos — transfira para um humano.
- Follow-up com limite de tentativas e janela de horário: retomadas automáticas são poderosas, mas configure o teto.
Medindo o resultado
Em Central IA > Análises você acompanha:
- Créditos utilizados no período e o uso ao longo do tempo;
- Consumo por agente — identifique qual agente concentra o custo;
- Tempo economizado pela IA e conversas resolvidas sem humano;
- Exportação CSV detalhada (dia a dia, com créditos e tokens) para análise fina.
Revise mensalmente: se um agente consome muito e resolve pouco, o problema quase sempre está em base de conhecimento fraca ou escopo mal definido — não no modelo.
Checklist de economia
- [ ] Modelo padrão (mini) nos agentes — modelos maiores só onde comprovadamente necessário
- [ ] Edições de configuração agrupadas e fora do pico
- [ ] Um agente por escopo (não um clone por canal)
- [ ] Regras permanentes nas instruções; conteúdo de consulta na base, em documentos fatiados
- [ ] Respostas prontas para o top 5 de perguntas
- [ ] Limite de tokens por resposta configurado
- [ ] Transferência para humano e "desistir após N" configurados
- [ ] Análises revisadas mensalmente
Ainda não criou seu agente? Comece pelo guia Agente de IA: guia completo de criação e configuração.